大模型评估」共找到 9359 篇相关文章

算法论文8

ICLR 2026 Oral|模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的型推理模型存在过度思考问题,造成量冗余计算。复旦学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。

机器之心
算法论文8

无需训练,直接「算出」最强AI!理想汽车发现端侧Scaling Law

理想汽车基座模型MindVLA团队与国创决策智能技术研究所联合发布论文,提出面向端侧语言模型的「硬件协同设计扩展定律」,解决模型部署在端侧设备的难题,实现软硬协同设计,提升模型性能和研发效率。

新智元
开源动态7

GPT-5得分不到0.4!法律+金融最规模基准:1.9万+专家评估准则

新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最公开基准。顶尖模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。

新智元
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究型行为模型(LBM),在近1700小时机器人数据上训练并量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用模型或到来。

机器之心
推荐文章8

Anthropic 再发长文:首次详细揭秘Agent的评估全过程「Claude code开发过程的经验总结」

Anthropic在Claude Code等开发及与客户合作中总结出AI Agent评估方法。文章介绍评估基本结构、构建原因、评分器类型、不同Agent评估法、应对不确定性指标、构建路线图及与其他方法协同方式。

AI寒武纪
新闻资讯7

世界模型混战,Momenta率先冲刺IPO

当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。

量子位
算法论文8

谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分

纽约学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类师级水平差距明显。

机器之心
开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交×SII开源高难度复杂疾病诊断测评集

上海交与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位
开源动态9

刚刚,Kimi K3开源!3万亿模型权重全球开放

2026年7月27日,Moonshot AI开源全球首个3万亿参数级模型Kimi K3。它不仅参数量,还在多领域表现出色,能与顶尖闭源模型媲美。其架构创新、训练独特、推理成本低,有望改变全球模型格局。

新智元
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位