「空间生成模型」共找到 8767 篇相关文章
世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源
国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。
李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?
李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。
李飞飞团队新作:简单调整生成顺序,大幅提升像素级图像生成质量
长期以来,AI生图面临潜空间模型细节损耗、像素空间模型结构混乱速度慢的矛盾。李飞飞团队最新论文提出Latent Forcing方法,通过重排生成轨迹,让像素扩散模型找回效率并刷新SOTA。
太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗
火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。
Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention
这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。
VEGA-3D:释放视频生成模型中的隐式3D知识,重塑3D场景理解与具身交互
华中科技大学与百度联合提出VEGA - 3D,释放视频生成模型隐式3D知识。它将视频生成模型作‘潜在世界模拟器’,用自适应门控融合机制,提升场景理解等任务表现,无需额外3D标注数据。
OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!
现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。
ICCV 2025 | 港科、牛津大学发布AlignGuard,文图生成模型可规模化安全对齐框架
随着文图生成模型广泛应用,其安全防护机制有限。ICCV 2025上,港科、牛津大学推出AlignGuard,是文图生成模型可规模化安全对齐框架,通过生成CoProV2数据集等实现安全对齐,实验效果佳。