「规模化评测」共找到 768 篇相关文章
GPT-5败下阵,这款中国AI拿下全球第一,众多医生已在用它做诊断
国家卫健委推进“人工智能+基层应用”,基层医生需实用AI助手。未来医生AI工作室的MedGPT在临床“安全”与“有效性”评测击败国际知名大模型夺冠,其两款助手获医生认可,被视为AI赋能基层医疗最佳实践。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
一个Skill让DeepSeek V4 Pro超越Fable 5?热门插件被锤了
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。
对话 XYZ-Aquila丨Deep Search SOTA 背后 AI 到底怎么参与改进 AI?
近日,XYZ AI Lab发布两款面向Deep Search的Agent,在评测中领先。其采用AI4AI方法,让AI参与研发判断。团队接受采访,探讨AI4AI含义、与RSI关系、工作范式等,还分享了改进案例和未来方向。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
李飞飞、Jim Fan和徐丹飞联合重磅论文:机器人灵巧手,可能走错了路
李飞飞等学者联合发表论文,分析当前触觉融合方案缺陷,提出 T - Rex 架构。它改变触觉输入方式,使用新编码方法和数据集,经三阶段训练,在 12 项任务评测中平均领先 30 个百分点,也指出了局限与未来方向。
GLM-5登顶开源模型No.1!智力指数首破50大关,打平Opus 4.5
在Artificial Analysis评测中,GLM - 5成开源权重模型智力排名第一,是首个智力指数破50的开源模型,除代码能力外各方面表现出色。它集成DeepSeek稀疏注意力,参数规模大,擅长“搞钱”任务,幻觉率低且输出精简。
2026 奇点智能技术大会上海站来袭,解码AI Agent、世界模型与氛围编程等新范式
2026奇点智能技术大会·上海站4月17 - 18日召开。AI正成变革性力量,此次大会升级聚焦AI规模化落地,设十二大专题,有多位出品人与演讲嘉宾带来实践经验与技术洞察,还开放合作与分享者申请。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。