「视觉机器人」共找到 1494 篇相关文章
李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真
李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从零训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。
开源·开放·开创,2025张江具身智能开发者大会暨国际人形机器人技能大赛即将启幕
5月29日,2025张江具身智能开发者大会暨国际人形机器人技能大赛将在张江科学会堂启幕,集“峰会+大赛+展览”于一体。现场将发布政策、成立联盟、启动平台与基金,推动产业发展。大赛设五大赛道,展示创新活力。
“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将大淘汰,拼的是世界模型?
本文是《2025 年度盘点与趋势洞察》系列之一,InfoQ 采访真机智能刘智勇,探讨具身智能。涉及 VLN 技术进展、世界模型作用、落地瓶颈等,还提及商业模式创新,认为 2026 年本体厂商将收缩。
Nature丨告别「炼丹」!AI+机器人闭环搞光伏:效率27.18%,可重复性直接拉高5倍
香港城市大学朱宗龙、曾晓成团队首创AI驱动的自动化闭环研发平台,从分子筛选到制备、反馈调整全程自动化。刷出27.18%稳态认证效率,可重复性提升5倍,是AI for Science +机器人制造在光伏领域的重大突破。
Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死
当Ilya断言大模型未来在于架构创新时,中国团队推出全球首个可大规模落地的开源原生多模态架构NEO。它颠覆传统拼接模式,从根上融合视觉与语言,以简洁架构证明架构聪明才是下一代AI竞争力。
哈工大系闯出人形机器人黑马:成立不到一年,全栈开源3m/s原型机,小米商汤都投了
1月15日,萝博派对在GitHub全栈开源双足人形机器人“萝博头原型机”,其跑步速度达3m/s。该开源含硬件、软件等多方面,直击开发痛点,还启动共创计划,已获小米等投资,目标降低具身智能开发成本。
WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务
星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确
纽约大学研究团队用QSVD新方法让视觉语言模型(VLM)效率飞跃,在普通GPU上实现13.1倍加速。它将Q、K、V矩阵捆绑处理,设计秩分配策略,引入量化方案,经多模型评估,展现出低硬件成本、高精度优势。