3D世界构建」共找到 4382 篇相关文章

开源动态8

大事不好!机器人学会预测未来了

蚂蚁灵波连续四天开源,此次推出全球首个用于通用机器人控制的因果视频 - 动作世界模型LingBot - VA。它能脑补未来,有记忆不丢失、高效泛化等亮点,架构设计独特,实验效果出色,推动通用机器人走向视频时代。

量子位
算法论文8

CMU朱俊彦等上新LEGOGPT,一句话就能搭乐高,网友:复杂零件行不行?

近日,CMU助理教授朱俊彦团队带来基于文本生成3D乐高的大模型LEGOGPT,输入文本即可快速拼好乐高,生成的乐高还有纹理和颜色。研究人员让机器臂组装模型,结果完美。该模型仍有局限,团队正努力扩展能力。

机器之心
开源动态8

特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了

特斯拉开源硬件专利后,智平方于4月22日发布AlphaBrain Platform开源社区,拿出含具身前沿技术等的“顶配全家桶”。介绍了世界模型、RL Token等5大技术亮点,还说明其用途及智平方过往开源成果与公司实力。

量子位
算法论文8

压缩即是全部 —— 菲尔兹奖得主给数学和 AI 的一封信

2026年3月,菲尔兹奖得主Michael Freedman发表论文《Compression is all you need》,用代数模型回答人类构建数学、人类与形式数学区别、人类数学家与AI协作三个问题,答案是“压缩”。文章还探讨了压缩在多领域的体现及对AI的意义。

力学与人工智能
算法论文8

CVPR2026 | Streamo:让大模型变成实时流式交互助手

香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。

机器之心
产品应用7

The Batch: 922 | 面向智能体的管理系统

OpenAI 发布 Frontier 平台,用于编排和管理企业级 AI 智能体团队。它支持智能体构建、信息共享等,Cisco 等已试点,未来将更广泛开放。与 Microsoft 的 Agent 365 有不同侧重,企业对智能体集中管理需求渐显。

DeeplearningAI
开源动态8

比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎

谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。

AIGC开放社区
算法论文8

大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力

空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。

量子位
开源动态8

告别VAE压缩损耗,南京大学用DiP让扩散模型回归像素空间,实现10倍加速与SOTA级画质

南京大学、腾讯优图实验室和新加坡国立大学发布DiP框架,即将开源。该框架不依赖VAE,仅增0.3%参数量,推理提效10倍,在ImageNet获1.79的FID分数,解决扩散模型在像素空间难兼顾质效的问题。

AIGC开放社区
产品应用7

实测完“灵光”,我意识到人类对 AI 助手的开发不足1%

作者实测蚂蚁集团的AI应用「灵光」,它是面向普通人的零门槛全模态AI助手,能30秒生成可互动小应用。作者测试其三大功能,认为人类对它的开发不足1%,它或成探索世界的伙伴。

AI科技评论