视频到音乐」共找到 2960 篇相关文章

推荐文章7

从金融本位物理本位,真正的范式转移开始了

过去几十年,人们认为增长可由货币政策调控,但如今瓶颈转移。马斯克描述的闭环体现从“金融本位”“物理本位”的范式转移,科技巨头已按此逻辑行动,锁定物理资源。

newtype AI
开源动态8

腾讯重磅开源!端视频音效生成模型HunyuanVideo-Foley

腾讯混元正式开源端视频音效生成模型 HunyuanVideo-Foley,适用于多场景。它采用新型框架结合 REPA 策略,有三大核心优势,能适配多种场景,抑制底噪,保证音频保真度。

带你学AI
开源动态8

MiniMax海螺视频团队首次开源:Tokenizer也具备明确的Scaling Law

MiniMax海螺视频团队首次开源,揭晓视觉分词器难题答案。其推出的VTP框架可提升模型性能,解决传统Tokenizer缺陷,还展示了Tokenizer的Scaling Law,为行业提供新路径。

量子位
开源动态8

智谱联合清华开源多图参考视频生成模型,带来主体一致性新高度

合肥工业大学、清华大学和智谱开源多主体参考视频生成模型Kaleido。它用全新数据构建法和精巧架构,解决主角与背景混淆难题,实验显示其在多维度表现优异,超越现有开源模型。

AIGC开放社区
算法论文8

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
开源动态7

OVI:统一的音视频生成模型,声音与画面同步诞生

视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。

带你学AI
开源动态8

机器人看29s视频学会一个新技能,自变量开源HOST框架

自变量机器人开源的HOST框架,让机器人看29s人类示范视频就能学会新技能,原技能不受影响。它通过自定位级联预测,解决了人和机器人动作节奏、身体结构不同的问题,效率远超主流微调方案,推动机器人进家庭。

PaperAgent
产品应用7

低延时、可交互的音频驱动肖像视频生成框架LLIA

美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建超100小时数据集,在多方面有出色表现。

带你学AI
推荐文章8

从 Rule、Spec Harness:AI Coding 的渐进式建设路径

作者分享帮团队落地AI Coding经验,指出试点易但推广难,瓶颈在接收端。介绍从Rule、Spec、LoopHarness的渐进式建设路径,各层前后相依,逐层收紧控制面,助AI在工程体系稳定交付。

phodal
开源动态8

LeCun预言成真!790年长视频,炼出最强开源「世界模型」

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元