「推理质量评估」共找到 3139 篇相关文章
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
整整21个月,豆包大模型正式进入2.0时代!
时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。
视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26
清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。
拿着做数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!
目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。
参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。
Groq被收购,失去梦想的员工,人均拿到英伟达的500万美元
2025年末,英伟达以200亿美元对价、“资产收购 + 人才招募”方式将AI推理芯片对手Groq收入麾下,避免反垄断。交易溢价近3倍,款项分阶段支付,员工获丰厚补偿,此模式成硅谷AI生态“新常态”。
罗福莉执掌小米大模型首秀!定调下一代模型,全新MiMo-V2开源还横扫Agent第一梯队
在2025小米人车家全生态合作伙伴大会上,罗福莉首秀解读全新大模型MiMo - V2 - Flash,该模型已开源,采用MoE架构和MTP技术,在多方面表现出色,罗福莉还阐述其设计逻辑与对下一代智能体的看法。
谷歌发布智能体Scaling Law:180组实验打破传统炼金术
谷歌新论文通过180组实验找到智能体的Scaling Law(定量扩展原则),在四个基准测试评估,推导预测模型,实验结果颠覆直觉,还量化阻碍因素,发现不同模型协作性格,为智能体部署决策提供支撑。
突发!英伟达H200对华解禁,老黄赢麻了
特朗普拍板允许英伟达向中国出售H200,美确保“代差优势”,还抽25%分成。H200性能是H20的6倍,虽落后最新架构,但适合训练推理,此决定或为英伟达带来巨额销售额。