智能测试平台」共找到 5772 篇相关文章

新闻资讯8

UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资

谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。

DeepTech深科技
产品应用8

这个 Agent Team,终于不是"角色扮演"了

作者测试了 MiniMax 新出的 Agent Team,通过深度研究公司、整理会议逐字稿、做直播数据分析三个测试,展现其优势。指出 Agent Team 核心是对抗式质量门禁,是复杂任务兜底系统,而非简单 prompt 编排。

AI产品黄叔
产品应用8

Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。

Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。

数字生命卡兹克
新闻资讯7

发生在CES的六场对话:来自深圳的 AI 硬件“外卷”

2026年CES上,中国硬件力量涌向全球。虽有地缘政治摩擦、签证障碍,但全球市场仍看好中国AI硬件。大厂将边缘硬件定义为AI生态入口,初创公司从数据、场景、交互寻生存之道,机器人应用场景也更明确。

AI前线
推荐文章7

Learn to Reason _ The way of Baichuan-M1-ClinicReasoning

前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。

InfoQ
新闻资讯7

AI大模型重塑学习硬件:从工具到伙伴 | 网易有道孟旭

网易有道词典笔产品负责人孟旭在AICon大会分享,以有道AI答疑笔为例,阐述智能学习硬件在大模型催化下从“学习工具”进化为“智能伙伴”,其发展呈“需求牵引 - 技术支撑 - 体验升级”螺旋路径。

AI前线
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
算法论文8

伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景

伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。

深度学习自然语言处理
算法论文7

BeyondSWE:AI编程80分是真的强,还是考卷太简单?

前沿模型在SWE - bench Verified测试中得分超80%,但该测试像开卷填空。中国人民大学提出BeyondSWE重新设计评测,规模是前者18倍,模型得分全跌破45%。还提出SearchSWE框架,结果显示搜索与编码能力融合待提升。

PaperAgent
算法论文7

姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪