交互式世界模拟」共找到 1173 篇相关文章

新闻资讯7

章鱼动力再获5000万美元融资,以世界模型驱动「手脑一体」的物理 AI 基础设施

AI科技评论获悉,物理AI基础设施公司章鱼动力近日完成5000万美元融资,过去3个月累计融资近10亿。本轮由锦秋基金等领投,下轮5亿融资也接近完成。公司以SYNTH架构构建闭环,目标推动物理AI进阶。

AI科技评论
新闻资讯8

炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影

谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。

AI寒武纪
算法论文8

破解机器人「慢半拍」难题:南洋理工解决VLA致命短板,动态世界断层领先

南洋理工大学NTU S-Lab团队提出DynamicVLA,解决主流VLA模型在动态场景下反应迟缓等问题。它从多层面设计,构建自动化数据体系和DOM Benchmark,在实验中多维度领先。

机器之心
开源动态8

英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来

英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。

机器之心
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
新闻资讯8

首个转型AI公司的新势力,在全球AI顶会展示下一代自动驾驶模型

上周,小鹏 G7 亮相,首发自研芯片与 VLA - OL、VLM 模型。同时,小鹏在 CVPR 2025 分享研发进展。其世界基座模型展现高智能,还将结合世界模型迭代。此外,小鹏验证 Scaling Laws,转型 AI 公司,全链路优化技术。

机器之心
开源动态8

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。

机器之心
新闻资讯7

大模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点

加州大学伯克利分校副教授、强化学习大牛Sergey Levine在博客指出,当前大语言模型(LLM)只是对人类大脑和思维的间接「扫描」,如同被困洞穴看人类智慧「投影」,无法代替真正思维。

机器之心
开源动态8

刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界

蚂蚁灵波发布并开源了面向机器人真实任务的空间原生视觉基模 LingBot-Vision 及空间感知模型 LingBot-Depth 2.0,能让机器人更精准地感知世界,解决透明反光材质、小目标和远距离目标等视觉难题。

量子位
算法论文8

通向世界模型关键一步:EX-4D来了,实现单目视频到自由视角生成

去年Sora等模型革新视频生成领域,相机可控的视频生成技术是构建世界模型核心。但从单视角生成极端视角视频是难题,PICO - MR团队提出EX - 4D,能从单目视频生成新视角视频,多方面表现出色。

机器之心