「AI测试」共找到 10697 篇相关文章

产品应用8

今天,Claude入职了!

Anthropic官宣Claude Tag,这是团队协作用Claude的全新方式,像“AI同事”般出现在Slack会话栏,响应主动,完成65%代码编写。它是Claude Code升级版,与前两代AI交互方式不同,Anthropic已离不开它。

新智元
新闻资讯7

GitHub 推出 MCP 服务器集成,全面扩展机密扫描功能

GitHub宣布MCP Server全面支持机密扫描功能,将其扩展至AI辅助和代理驱动的开发工作流,可让外部工具和AI工作流访问安全洞察、自动化修复。这反映安全工具正从被动检测转向自动化治理。

InfoQ
推荐文章7

Harness Engineering又他妈是啥?

AI圈新词Harness Engineering引发关注。它类似给AI套缰绳,让其运转更高效。通过案例表明,模型非瓶颈,环境才关键。还介绍不同实现方式,指出命名有价值,最后探讨培养新人设计harness的问题。

花叔
算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
新闻资讯8

融资3100万美元,Atoms让全球70万普通人的「想法」直接变成「生意」

过去两年,AI生产力重心从帮人写代码转向帮人建业务。2026年1月13日,DeepWisdom旗下Atoms获3100万美元融资。Atoms让普通人想法变生意,提供全链路架构,用户跑通三种变现模式,未来将构建AI经济体。

AI科技评论
新闻资讯7

最高500万!6个项目签约!“决战紫金之巅”圆满收官 | Q推荐

12月12日,决战紫金之巅——云谷杯・2025人工智能应用创新创业大赛总决赛暨闭幕式在云谷中心举办。活动聚焦AI应用创新及“AI+”融合,现场有政策宣介、圆桌对谈等,6个项目签约,最高可获500万补贴。

InfoQ
新闻资讯7

突发!Gemini 3.8登顶,谷歌迈出RSI一大步

谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。

新智元
产品应用7

OpenAI推出免费的、LaTeX 原生科研写作神器Prism

OpenAI推出免费科研写作工具Prism,可理解为“AI增强版的Overleaf”,整合LaTeX编辑器、协作工具和AI助手。它原生支持LaTeX,能云端实时协作,内置GPT - 5.2,即日起ChatGPT个人账户用户可访问。

AI寒武纪
推荐文章7

ChatGPT 已经是新一代分发平台,创业公司该考虑怎么抓住增长红利了

文章指出ChatGPT已成新一代分发平台,创业公司应抓住增长红利。介绍了分发平台“开放 - 关闭”周期,分析ChatGPT最可能成最大消费平台,还给出创业公司选择平台标准及企业AI转型建议。

Founder Park
算法论文7

广义智能体理论:智能时代通向「万物理论」的新路径?

源自AI的「广义智能体理论」为探索「万物理论」提供新视角。它将物理、生命、AI系统纳入标准智能体框架,提出四大基本作用力或源于「智能场」,还为经典、相对、量子力学差异提供新诠释。

新智元