「基准评测」共找到 1324 篇相关文章
标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估
Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。
首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽
南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。
首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了
ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。
Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点
上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的
有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
MoE不够看了,腾讯推出MoT:2B具身模型22项评测16项最佳
腾讯混元团队联合Robotics X实验室推出HY - Embodied - 0.5系列基础模型,含MoT - 2B和MoE - 32B两款主力模型。在22项评测中,MoT - 2B获16项最佳,其架构、数据和训练有创新,能应用于机器人控制。
横扫八大数学竞赛:清华微软联合提出STAR-PólyaMath,Apex基准超GPT-5.5 13.5%
清华大学与微软亚洲研究院团队提出推理多智能体系统 STAR - PólyaMath,构建探索 - 推理 - 验证框架,解决大模型长程数学推理瓶颈,在八大数学竞赛基准获最优成绩,还可泛化到其他推理场景。