「动作生成大模型」共找到 8712 篇相关文章
腾讯祭出开源核弹!LeVo音乐生成模型,媲美Suno,支持零样本风格迁移,歌词完美匹配
音乐生成领域有重大突破,腾讯AI Lab开源高保真音乐生成模型LeVo。它由LeLM和音乐编解码器组成,能解决现有方法在音质、音乐性等方面的局限,实验显示其优于现有方法,功能强大且适用场景多。
114B参数、6B激活,Sand.ai刚刚把全球首个千亿MoE视频生成模型开源了
Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。
VEGA-3D:释放视频生成模型中的隐式3D知识,重塑3D场景理解与具身交互
华中科技大学与百度联合提出VEGA - 3D,释放视频生成模型隐式3D知识。它将视频生成模型作‘潜在世界模拟器’,用自适应门控融合机制,提升场景理解等任务表现,无需额外3D标注数据。
Suno最强开源对手来了!ACE Studio和阶跃星辰联合开源了一款音乐模型,20秒即可生成4分钟神曲!
ACE Studio和阶跃星辰联合开源音乐模型ACE - Step,参数量3.5B,结合多种技术,支持多语言多风格音乐生成。20秒可生成4分钟歌曲,比传统模型快15倍,有多种功能亮点,还介绍了上手步骤和应用场景。
腾讯发布混元3D世界模型1.0:首个支持物理仿真的开源世界生成系统
在2025年世界人工智能大会上,腾讯发布混元3D世界模型1.0,它是首个开源且兼容传统CG管线的可漫游世界生成模型。可通过文图生成3D世界,支持编辑、仿真,有360°沉浸、工业兼容、原子级交互优势。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖
当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
本文是对IDEA研究院张磊的深度访谈。张磊在计算机视觉领域成就斐然,他指出具身智能落地需攻克成功率、泛化性等挑战,大脑比本体更关键。还阐述了世界模型概念及应用,定义其应具备动作依赖等内容。
12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看
谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成
过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。