全模态生成」共找到 3839 篇相关文章

算法论文8

Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转

Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。

机器之心
开源动态8

从VLA到RoboOmni,模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现面领先。

机器之心
产品应用7

6个Agent组团Vibe Gaming:自己生成、试玩、修Bug

过去大模型生成的游戏虽代码能跑,但常陷入“可玩性黑洞”。Spellcaster让多个专用Agent协同处理,形成“生成—运行—检查—修复”循环。目前能快速生成多种游戏原型,未来将用世界模型直接生成画面。

量子位
产品应用8

Google Omni首发「AI视频编辑」功能,AI视频的下一种形态终于来了!

Google Omni首发模态AI视频编辑功能,是继Banana后AI圈重大技术进步。它能改变视频内容、重绘风格、多轮修改,支持模态输入,精通物理概念,让AI视频更逼真。

开源AI项目落地
开源动态8

国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式

上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用离散扩散架构。它解决传统多模态架构问题,有离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。

AIGC开放社区
新闻资讯8

新一代文心大模型5.0正式发布,百度推高智能天花板

在2025百度世界大会上,新一代文心大模型5.0发布,采用模态统一建模技术。它在LMArena榜单成绩优异,能力达世界第一梯队,有原生模态、基础能力强等优势,还强化智能体能力。

深度学习自然语言处理
产品应用8

0成本升级,快手OneSearch-V2量上线,生成式搜索进入「懂你」时代

快手技术团队在 OneSearch 基础上推出 OneSearch-V2 框架,解决电商搜索复杂查询理解不足等问题。该系统量上线,不增成本与时延,业务收益显著,还缓解信息茧房与长尾稀疏问题。

机器之心
新闻资讯8

Veo 3逼真脱口秀爆火网,网友:彻底超越恐怖谷!Sora已被完爆

Veo 3生成的脱口秀视频网爆火,人物、场景真实,声音和嘴型能对上,已超越恐怖谷。它或让人类进入‘模糊时代’,还会颠覆游戏、电影、广告等行业,未来AI生成内容或远超非AI内容。

新智元
产品应用8

AI视频生成走向「演技生成」时代,生数科技Vidu球发布Vidu Q2

9月25日,生数科技球上线新一代图生视频大模型Vidu Q2,打破AI生成表情假、动作飘忽等问题,实现从“视频生成”到“演技生成”跨越,有AI演技生动、镜头语言丰富等亮点,已多端上线。

机器之心
开源动态8

抖音SAIL团队联合港中文MMLab推出SAIL-Embedding:打通「视、文、音」的模态嵌入

字节跳动抖音SAIL团队联合港中文MMLab提出SAIL - Embedding,专为大规模推荐场景设计,实现视、文、音统一表征,解决传统多模态模型局限,在抖音业务场景效果显著,相关技术报告已公开。

机器之心