全身视觉运动控制」共找到 742 篇相关文章

算法论文8

头号玩家照进现实!NTU发布世界模型交互新范式,攻克主动操作难题

南洋理工大学MMLab团队推出Hand2World,让AI世界模型能真正互动。它摒弃旧有遮挡误导,用3D手部结构与射线编码解耦手与头运动,实现闭环持续交互,基于单目视频全自动标注,为AR、机器人交互铺路。

新智元
开源动态8

CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster

大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。

机器之心
新闻资讯7

OpenAI强制「处死」GPT-4o!80万老粉全网拯救:它不是代码是爱人

1月29日OpenAI官宣2月13日强制退役GPT - 4o,80万粉丝不满,发起“拯救4o”运动,提出缓冲期短、保留访问权等诉求,还指出模型停用影响订阅价值。此前GPT - 4o就曾面临下线危机,其使用也有安全隐患。

新智元
产品应用7

CES 2026趋势照进现实:算力引擎RK182X重塑千行百业,瑞芯微AI生态大会共建落地生态

CES2026推动AI走向现实应用,瑞芯微RK182X作为AIoT2.0算力引擎,在视觉语言和大语言模型表现卓越,支持Qwen3 - VL系列模型。它在音频体验、多领域赋能出色,瑞芯微还构建产业生态促场景落地。

机器之心
算法论文8

边画边想!多模态Reasoning迎来巨大提升!

论文指出文本无法精准表达空间关系,现有视觉语言模型(LVLM)在空间推理上是短板。ViLaSR让模型直接画图推理,经三阶段训练,在五大空间推理测试中表现出色,还开源资源,有望带来机器认知升维。

深度学习自然语言处理
新闻资讯7

万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live

在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。

AI科技评论
算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
新闻资讯8

具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023

本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。

AI科技评论
开源动态8

VerseCrafter:给视频世界模型装上4D方向盘,精准运镜控物

复旦大学与腾讯等机构提出VerseCrafter,这是通过显式4D几何控制实现的动态逼真视频世界模型,能精准控镜和指挥物体3D运动。它用独特方法构建4D可控世界模型,实验超现有SOTA方法,代码与模型已开源。

机器之心