机器人视觉」共找到 1494 篇相关文章

算法论文8

“最强具身VLA大模型”,究竟强在哪儿?

机器人基础模型π*0.6刷屏,能让机器人高效完成多项任务。它引入Recap学习法,突破传统模仿模式。其核心方法RECAP让VLA用奖励反馈和人类介入训练,还能从异构数据学习,实现自我进化。

量子位
算法论文8

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交大同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。

机器之心
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
新闻资讯7

王田苗三问具身大牛:大模型还在「拨号上网」,机器人靠什么拿下真实订单?| WRC 2026

在2026世界机器人大会的圆桌论坛上,王田苗向具身智能头部企业CXO抛出尖锐问题。嘉宾围绕量产卡点、大模型应对物理世界不确定性及产业终局生态展开讨论,并就商业化落地节奏达成共识。

AI科技评论
开源动态8

让VLA真正跑上机器人:北大团队开源Jetson-PI,Jetson Orin控制频率提升8.66倍

文章聚焦让VLA模型在机器人上高效运行难题。北大等团队提出Jetson - PI方案,从异步推理算法等三层面优化,在Jetson Orin上控制频率提升8.66倍,推动具身智能向工业应用跃迁。

机器之心
新闻资讯8

20亿砸向00后创业机器人公司!估值一年暴涨7倍,国家级资本重仓

近日,灵初智能完成约20亿元天使轮及Pre - A轮融资,资金将用于物流场景落地与数据采集体系建设。其团队互补,突围逻辑是All in人类原生数据,自研采集方案,走“模型驱动数据”路径,定位“大脑驱动公司”。

量子位
8

大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间

随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。

腾讯技术工程
算法论文8

SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃

文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。

机器之心
产品应用8

CES深思考:没做人形机器人的石头,如何抢占家庭具身智能第一入口?|甲子光年

2026年CES上,石头科技推出全球首款能扫楼梯的轮足扫地机器人G - Rover,它重新定义空间维度,可在台阶稳定作业。石头科技以场景需求定义形态,研发围绕用户需求,在全球市场表现出色。

甲子光年
开源动态8

清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座

清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。

AIGC开放社区