长视频编辑」共找到 1686 篇相关文章

产品应用7

ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。

ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。

AI进修生
开源动态8

Claude 终于能“看”视频了!这个开源项目让我刷视频效率翻倍

平时找视频信息效率低,而开源项目让Claude等大模型 “看懂” 视频,能提取画面、音频并理解内容。介绍了其工作原理、帧预算、去重、细节模式等,安装使用门槛低,还给出了应用场景和项目地址。

GitHubStore
产品应用8

刚刚,美团推出 136 亿参数视频生成模型

美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频视频续写三类任务,能生成分钟级视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。

AGI Hunt
算法论文8

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。

新智元
算法论文8

EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案

近年来,扩散模型在视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,在多模型实验中实现大幅提速且视频质量几乎无损,为技术落地提供基础。

机器之心
产品应用8

真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」

谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时和使用门槛限制,但已足够震撼。

机器之心
产品应用8

用“蒸汽机”生成视频,还能音视频一体化交付?

8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。

AI产品黄叔
新闻资讯8

人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”转变。

新智元
产品应用8

中文版Nano Banana来了?Qwen-Image-2.0炸场:1K文本硬吃,中文生图彻底不拧巴了

AI生图曾有文本易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。

量子位
算法论文8

超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025

视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决跨度帧运动处理和参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。

机器之心