算法论文8
清华 WorldArena:为世界模型设‘行动考试’
AI科技评论
AI 摘要
清华商宇团队提出 WorldArena 评测框架,指出当前世界模型评测不能只看视频质量,还应关注功能。该框架从视觉和功能两维度评估,推动模型从‘生成’走向‘使用’,并组织了 CVPR 2026 挑战赛。
阅读原文 · AI科技评论
对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准
文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
李飞飞押注空间智能,破局之路在哪?
李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。
AI科技评论
产品应用8
鹿明发布NexCore助力具身智能落地
8月19日鹿明机器人发布具身智能进化引擎Lumos NexCore,试图在数据、模型等与机器人间建立生产与运行链路,让机器人能力成可复用‘技能资产’,解决具身智能技能生产效率问题。
机器之心
新闻资讯8
王兴兴:宇树上市,“非共识”创业路迎挑战
2026年宇树科技成功上市,创始人王兴兴创业十年有诸多“非共识”观点。如高性能机器人不意味昂贵,堆数据难带来具身智能,AI强对硬件要求或降低。如今宇树成行业共识,也面临新挑战。
甲子光年
开源动态7
多机构发布HarnessEval开启评测新时代
8月13日,DeepSeek开源Agent Harness dsh引发行业对“Harness”的关注。近日,MirroS联合多机构发布HarnessEval,将其概念引入评测系统。它使评测从Metric到Harness,形成可执行评测系统,已落地于交互式世界模型。
机器之心