「世界动作模型」共找到 8183 篇相关文章
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统
现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。
Meta万引强化学习大佬跑路!用小扎原话作为离别寄语,扎心了
Meta万引强化学习大佬Rishabh Agarwal即将离职,用小扎原话“在这个瞬息万变的世界里,最大的风险就是不去冒险”作为离别寄语。他曾参与谷歌、Meta重要模型工作,下一站未明,Meta还有老员工出逃。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
豆包上可以体验 Seedance 2.0 了,我已经试了一下。
Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。
AI开始“动手”了,全世界第一个带头的是阿里千问
阿里千问App上线400多项新功能,依托Qwen模型和阿里生态,在全新Agent架构下提升AI能力。它能在购物、旅游、办公等场景帮用户办事,使AI具备现实世界落地能力,推动人机交互跃迁。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
Figure机器人分拣快递新视频曝光,网友:太像人类
Figure 02机器人开启打工模式,创始人放出其分拣快递新视频,它动作流畅像人类,由端到端通用控制模型Helix自主驱动。此前它还在宝马生产线连续20小时轮班作业,Figure与OpenAI分道扬镳后推出Helix。
“技术迭代速度是唯一护城河!”李彦宏把百度 AI 秀了个遍,还称芯片拿大部分钱的 AI 生态不健康
李彦宏在百度世界大会指出,AI产业结构正从‘正金字塔’向‘倒金字塔’转变,健康生态中应用应创造最大价值。百度展示多项成果,如数字人、AI搜索等,还发布文心大模型5.0和百度伐谋。