「动作潜分布」共找到 365 篇相关文章
抽象小视频秒变特效大片:原视频精髓不变角色环境任意换,Luma出品
Luma AI推出Modify Video玩法,能将抽象小视频爆改为特效大片,可对角色、场景等任意换,还保留原视频动作运镜。能进行视频动捕、风格迁移、单个元素编辑,性能超越同行Runway。
SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案
文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。
腾讯频繁发大招,这次轮到企业微信了
腾讯近期动作频繁,企业微信迎来大版本更新,有智能助理大圆、记录面聊等功能,还升级了智能“服务总结”和智能文档。这些功能实用性强,解决社群管理痛点,AI 能无缝融入工作流。
分享2篇最新Harness论文,一篇谷歌,一篇微软
在LLM Agent迅速发展的当下,如何为其设计合适的Harness成关键问题。本文分享微软M⋆和谷歌AutoHarness两篇论文,分别从记忆系统和动作约束维度提出自动化的Harness进化方法,并介绍了实验结果。
DeepAgent:能够自主找工具的深度思考智能体,工具&任务随心配
现有智能体框架自主性差、工具使用受限。中国人民大学等机构研究者提出DeepAgent,能自主思考、发现工具并执行动作。它在多基准测试中表现出色,为构建更强真实世界智能体迈进重要一步。
全球AI视频大战升级!「中国版Sora」Vidu Q2参考生月底发布,能力对标Sora 2
OpenAI的Sora 2引发全球AI视频狂欢,而国产AI视频Vidu将在本月底升级Vidu Q2参考生功能。Vidu起步更早、覆盖广,在一致性、运镜理解、动作连贯等维度优势明显,月底升级值得期待。
人形机器人终于学会洗碗了
Figure机器人学会洗碗,用的是叠毛巾和分包裹同款Helix架构,无新算法和特殊工程,仅增加新数据。该架构是端到端“视觉 - 语言 - 动作”模型,同一系统增数据就能学新技能。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」
OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。
RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill
新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。