基准榜单」共找到 1481 篇相关文章

开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
算法论文8

同时监督和强化的阶段大模型微调,告别“先背书再刷题”,推理泛化双提升|中科院&美团等

中国科学院自动化研究所联合美团提出阶段监督 - 强化微调方法 SRFT,结合监督微调与强化微调,解决传统两阶段方法的不足,在多任务中提升推理和泛化能力。

量子位
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
7

奥特曼「一张脸」引爆全球狂欢!Sora 2冲上APP第三,邀请码炒到1250元

Sora 2上线不到24小时冲上苹果商店前三,其「1换4」邀请码机制和「Cameo自我上传」玩法引发社交传播热潮,邀请码被黄牛炒作。同时,它也引发OpenAI内部争议,CEO奥特曼为其辩护。

新智元
算法论文8

大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!

随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。

深度学习自然语言处理
算法论文8

CVPR 2025 Award Candidate | 英伟达等Difix3D+:用步扩散模型修复 3D 重建伪影

3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,步去伪影,效率高、有泛化力,实验效果领先。

机器之心
算法论文7

基于大模型的领域场景开发:从智能体到多智能体的React框架设计与实现

作者团队经历从提示词工程到流程编排模式各阶段,现设计架构升级,选用层级指挥模式的React框架,实现智能体对工具调用的反思规划,后续还将迭代实现多智能体协作,同时提及技术选型、系统架构等内容。

阿里云开发者
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。

力学与人工智能
开源动态8

智源RoboBrain 2.0+RoboOS 2.0双发:问鼎评测基准最强具身大脑,刷新跨本体多机协作技术范式

近日,智源研究院发布具身大脑 RoboBrain 2.0 32B 版与跨本体大小脑协同框架 RoboOS 2.0 机版。前者突破能力瓶颈,在多项基准测试表现优异;后者性能提升,实现轻量化部署。二者双擎联动推动机器人迈向群体智能,且已全面开源。

机器之心