视频到音乐」共找到 2960 篇相关文章

算法论文8

CVPR 2026 | 给扩散模型装上「物理引擎」: 北大彭宇新团队提出NS-Diff,使扩散模型学会流体与刚体力学

北大彭宇新团队提出 NS - Diff,将物理约束与强化学习结合,解决视频生成物理失真问题。它通过多模块提升视频物理真实感,实验表明在多数据集上超现有方法,降低物理运动误差。

机器之心
新闻资讯8

从“卷模型”“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026

WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘看能力’‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。

InfoQ
新闻资讯7

智能体工程的演进:从“是否”“如何” | 2025年AI智能体状态调查报告【PPT】

进入2026年,企业对AI Agent关注点从构建尝试转向规模化稳定部署。LangChain公司年底发布《AI Agent现状报告》,基于对超1300位相关人员调研,展示智能体工程化图景与趋势,本文拆解报告精华。

AI大模型应用实践
算法论文8

ICCV 2025 | 小红书AIGC团队提出图像和视频换脸新算法DynamicFace

小红书AIGC团队提出图像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。

机器之心
新闻资讯8

张益唐孪生素数猜想,被GPT-6破新纪录! 北大数学07级苏炜杰:很震撼

2026年9月3日,OpenAI宣布GPT - 6将孪生素数问题最好上界推进186,打破陶哲轩保持十二年的纪录。此前Julia Stadlmann推240,Axiom Math压至212。GPT - 6展现数学直觉,证明经Lean 4验证。

新智元
开源动态8

大事不好!机器人学会预测未来了

蚂蚁灵波连续四天开源,此次推出全球首个用于通用机器人控制的因果视频 - 动作世界模型LingBot - VA。它能脑补未来,有记忆不丢失、高效泛化等亮点,架构设计独特,实验效果出色,推动通用机器人走向视频时代。

量子位
新闻资讯8

豆包19亿次互动背后的技术真相:春晚级体验是如何炼成的?

2026 年春晚 AI 元素亮眼,豆包 AI 互动达 19 亿次。火山引擎作为独家 AI 云合作伙伴,用智能视频云等技术打造节目效果,解决视频画质、空间逻辑、机器人互动延迟等难题,还保障全民互动和实时字幕。

InfoQ
开源动态8

Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!

自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。

开源星探
开源动态8

新型开源端端 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!

Maitrix团队发布开源AI端端语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强大,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。

开源星探
推荐文章8

有手就行,教你从01快速手搓搭建个GUI Agent

随着通用大模型发展,搭建GUI Agent难度降低。文章介绍如何用通用大模型API,从01搭建PC GUI Agent,包括原理、代码实现等,该Agent能跨应用操作,未来可强化功能。

腾讯技术工程