「像素级视觉世界模型」共找到 1534 篇相关文章
登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。
看完智平方创始人郭彦东的这场演讲,我对 VLA 又有信心了
2026年具身智能赛道技术路线引争论,“VLA时代终结”论调扩散。智平方创始人郭彦东演讲回应,称VLA时代未终结,世界模型汇入VLA,关键变量是类脑架构,智平方技术成果和开源平台也证明VLA有生命力。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
刚刚,林俊旸官宣创业公司Pragmatik Labs!
原阿里千问技术负责人林俊旸官宣在上海创办新AI公司Pragmatik Labs,研究横跨数字与物理世界的下一代Agent。其获高榕创投、红杉中国领投,腾讯等支持,投后估值约20亿美元。
00后女生躲进房间造梦:我想让1000个焦虑的人,变成一只轻盈的蝴蝶
00后女孩陈栩乐是深耕VR交互领域的创作者。她以蝴蝶为具身载体,打造VR疗愈作品《Crossing the Senses》,用点云视觉呈现自然能量交换。创作中AI助力破技术难题,她追求轻交互疗愈。
LeCun出局,Meta变天!Llama 4翻车大清洗,「学院派」大败退
LeCun宣布年底离开效力12年的Meta,创立专注「世界模型」的AI公司。Llama 4翻车成其离职导火索,他的离去意味着学院派在Meta的AI战略中被边缘化,也预示硅谷AI路线之争进入新阶段。
哇塞,今天北京被机器人人人人人塞满了!
世界机器人大会在北京开幕,100多个新机器人亮相。智平方的爱宝机器人人气爆棚,它能用一个基座模型完成多任务。其搭载的GOVLA大模型有四大核心能力,且已在多行业商业化落地。
全球首个,连续时间具身世界模型!任意帧率自由生成
来自清华AIR与UC Berkeley BAIR的团队提出全球首个连续时间具身世界模型ODEWorld。它学习世界在每个时刻的变化方向与速度,能任意帧率自由生成,统一了离散模型分散的生成能力。
黄仁勋抢吃龙虾:英伟达新核弹10倍算力提升,OpenClaw自由了
北京时间凌晨,英伟达GTC大会召开。CEO黄仁勋称正处新平台变革开端,算力需求爆发。推出Vera Rubin系统,性能提升显著,还有新推理芯片LPU。上线NemoClaw保障安全,AI在物理世界也加速落地。