双轨评估体系」共找到 1250 篇相关文章

新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
算法论文8

字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选

字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。

量子位
产品应用8

X-Era蝉联双榜单冠军,引领世界模型未来方向

X-Era的EonWorld在WorldScore和WorldArena两个榜单上连续霸榜。它来自X-Era的VWA原生世界动作模型体系,本职是帮机器人预判世界变化。这为“可用于行动的世界模型”竖起能力线,也揭示行业正进入新阶段。

AI科技评论
开源动态8

AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白

多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。

机器之心
新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元
新闻资讯8

5Y News|首形科技完成Pre-A轮融资

6月26日首形科技宣布完成Pre - A轮融资,由招商局创投、深创投领投。创始人胡宇航长期研究机器人相关方向,其成果构成产品技术起点。公司有三大技术体系,还提出类人共情价值,欲引领机器人情感觉醒时代。

五源资本 5Y Capital
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
新闻资讯7

新赋能•创生态 | 首钢园“产业跃升计划”发布会举办

在数字浪潮下,新质生产力成核心变量。5月28日,首钢园“产业跃升计划”发布会召开。其正构建“1+3+X”产业体系,园区已聚800余家科创企业。会上多位专家分享,还签约伙伴构建企业全生命周期服务体系

首钢园
推荐文章7

如何将 AI 代码采纳率从30%提升到80%?

文章指出AI编码采纳率低,原因在于信息不对称、任务粒度过大等。提出通过规范化文档体系和Issue管理规范解决前两个问题,还介绍了未来扩展方向及多种开发实践技巧,最后分享项目实战效果。

阿里云开发者