「运动线索」共找到 106 篇相关文章
换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26
扩散策略成机器人控制热门路线,但真实世界动力学多变,策略易失灵。UC Berkeley等联合提出DADP,训练统一策略,在零样本跨域控制任务表现强,尤其在OOD场景优势明显,还给出工程补充结果。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025
视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决长跨度帧运动处理和参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。
JanusVLN:双重隐式记忆解耦语义与空间,开创视觉语言导航记忆新范式
视觉 - 语言导航(VLN)现有主流方法依赖显式记忆面临挑战,未充分利用3D线索。JanusVLN框架引入双重隐式神经记忆,解耦语义与空间信息,实验验证其性能、效率和泛化能力出色。
波士顿动力 | 人形机器人Atlas ,最新研究进展!
世界人形机器人运动会引发对自主机器人的讨论。波士顿动力与丰田研究院合作为 Atlas 开发大型行为模型(LBM),使其能自主完成复杂任务,研究团队展示成果并介绍模型构建流程、实践成果及研发原则。
精准复刻!字节推出X-UniMotion实现高精度动作模仿合成
字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然流畅角色动作,还介绍了其技术原理、演示对比等内容。
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26
AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调多层证据耦合与可解释性,还分析评测指标与数据集。
刚刚,霸榜神秘视频模型身份揭晓,原来它就是「David」
几天前登上Artificial Analysis榜首的神秘视频模型揭晓,是Runway最新发布的Gen - 4.5。它树立行业新标杆,在多方面表现出色,但也存在一些视频模型常见的局限性,Runway正探索解决办法。
AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025
最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。