世界模型评测」共找到 8079 篇相关文章

算法论文8

ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心

ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心
算法论文8

首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025

淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。

量子位
新闻资讯8

领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%

Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。

机器之心
开源动态8

爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌

腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。

PaperAgent
新闻资讯8

波士顿动力 | 人形机器人Atlas ,最新研究进展!

世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。

AINLPer
开源动态8

2026 AI 大模型技术体系综合开源影响力榜单发布,中国开源实力领跑全球

2026年全球AI产业迈入新阶段,开源生态影响力成关键。4月17日CSDN联合多家机构发布《2026大模型技术体系综合开源影响力榜单》,从四大维度、53项细分指标评估,呈现开源生态地图,助力中国AI开源跨越。

AI科技大本营
新闻资讯8

Alex Wang“没资格接替我”!Yann LeCun揭露Meta AI“内斗”真相,直言AGI是“彻头彻尾的胡扯”

图灵奖得主 Yann LeCun 在访谈中,尖锐评价当前 AI 发展路径,认为规模化大模型是死胡同。他正通过新公司 AMI 推动“世界模型”技术路线,还谈到 AI 关键要素、安全等问题,与主流观点分歧明显。

InfoQ
新闻资讯7

李飞飞一年前究竟说了啥?怎么又火了

AI教母李飞飞一年前访谈再引关注,她指出大语言模型或许并非真正智能,其基于一维语言信号训练,在理解三维物理世界存在局限。相关实验也证实大模型在物理任务表现差,不过也有人提出不同观点。

量子位
开源动态8

标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型

量子位
算法论文8

NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图

NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。

新智元