「跨形态动作对齐」共找到 685 篇相关文章
腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」
腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。
Sora关停背后:为啥它没跑成“视频版ChatGPT”?
OpenAI Sora 宣布关停,评论区评价两极分化。其未成为“视频版 ChatGPT”,主要因踩中生成式 AI 最难的三件事:使用频率、成本结构和产品形态。关停或与 OpenAI 筹备 IPO 有关,未来 Sora 团队将推进世界模拟研究。
大事不好!机器人学会预测未来了
蚂蚁灵波连续四天开源,此次推出全球首个用于通用机器人控制的因果视频 - 动作世界模型LingBot - VA。它能脑补未来,有记忆不丢失、高效泛化等亮点,架构设计独特,实验效果出色,推动通用机器人走向视频时代。
刚刚,Opus 5来了:性能不输 Fable 5、价格砍半
Anthropic 发布新一代模型 Claude Opus 5,其智能接近 Claude Fable 5 但价格减半。它在编程、知识工作等评测中表现出色,科研能力进步大,自主性与严谨性更强,安全对齐度高,防护兼顾安全与可用。
具身智能稀缺的数据,可能藏在这个游戏手柄里?
游戏录屏平台Medal掌握的玩家操作记录成机器人模型训练核心数据。其创始人皮姆创办General Intuition获高额融资,该公司用游戏录像预训练动作模型,但也面临数据多元性、任务表现及合作模式等问题。
Claude Design连夜突袭,Figma市值瞬间蒸发!或抢走全球UI设计师饭碗
Claude实验室推出Claude Design功能,只需输入一句话就能生成可交互完整原型,让Figma等设计公司股价跳水。它或让画图动作消失,引发对设计师职业是否会被取代的思考,Anthropic还在下更大的棋。
音画同步视频生成重磅开源!Character AI和耶鲁大学推出Ovi,让音、画在一个大脑里思考
Character AI和耶鲁大学团队推出开源模型OVI,它采用双骨干交叉模态融合架构,让音视频同步生成。其架构对称,用旋转位置嵌入技术对齐时间,训练策略分步进行,生成效果佳,为开源音视频生成提供新路径。
当前关于 Vibe Engineering 的所有认知都会在 1 个月内严重过时
作者分享 Vibe Engineering 实践体会,指出当前认知很快过时,因 AI 编程工具和模型进步大。还对比了 Opus 4.5、GPT - 5.2 等模型,阐述人在开发各阶段角色,介绍多 Agent 协同实践及未来软件公司组织形态变化。
开源模型首超Opus4.6!智谱GLM-5.1登场,14小时后CUDA专家被冲了
智谱开源模型GLM - 5.1带来重大突破,14小时完成CUDA Kernel优化,加速比大幅提升。它解锁与顶尖闭源模型Claude Opus 4.6全面对齐,在多测试中表现优异,展现长程任务能力,改写行业叙事逻辑。
首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025
淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。