4D世界模型」共找到 8472 篇相关文章

开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
新闻资讯7

爆冷!首届大模型争霸,Grok 4下出「神之一手」?DeepSeek、Kimi惨遭淘汰

谷歌Kaggle举办首届全球AI象棋争霸赛,八款顶级语言模型正面对抗。首战8进4淘汰战中,Gemini 2.5 Pro、o4 - mini、Grok 4、o3晋级,Claude 4 Opus、DeepSeek R1、Gemini 2.5 Flash和Kimi K2出局。比赛考验AI整体理解能力。

新智元
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。

InfoQ
产品应用7

世界模型的新用途:不做选手,去当裁判

眼下具身赛道都在抢着做机器人的“大脑”,而地瓜机器人发布的世界模型Uranus却剑走偏锋,做机器人开发的基础设施。它能更客观地评测VLA和世界模型,还能做机器人训练的“场地”。

量子位
开源动态8

Meta开源首个320亿参数代码世界模型CWM

Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。

AI工程化
算法论文8

阿里新研究:统一了VLA和世界模型

阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。

量子位
新闻资讯8

李飞飞3D世界模型公测,网友已经玩疯了

今日李飞飞创立的World Lab推出全新3D世界生成模型Marble并开启公测。普通人能靠文本等生成专属3D世界,还能在VR体验。它功能强大,未来将重点发力交互性。

量子位
开源动态8

腾讯混元世界模型HY-World 1.5开源,24 FPS的实时交互世界建模

腾讯混元世界模型HY - World 1.5开源,实现24 FPS实时交互世界生成。它采用双重动作表征等技术,解决了长程生成问题,还通过强化学习等优化,在多方面表现出色,为具身智能场景模拟奠基。

AIGC开放社区
新闻资讯7

GAIR Live 预告|世界模型——通向通用智能的关键拼图

随着AGI议题升温,‘世界模型’成前沿焦点。GAIR Live将邀顶尖学者与专家,探讨其定义、趋势等问题,还有直播议题如Lecun观点看法、不同领域世界模型差异等。

AI科技评论
开源动态8

超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型

现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。

机器之心