长视频编辑」共找到 1689 篇相关文章

开源动态8

万帧实时!流式3D重建天花板,被国产开源模型打破了

蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。

机器之心
产品应用7

nano-banana已登陆AI studio 和 Gemini ?果真是谷歌的gemini-2.5-flash图像预览版。。

作者分享玩AI视频创作的经历,介绍神秘AI图像生成和编辑模型Nano - Banana,它在LMArena平台出现,被猜测与谷歌新一代图像模型相关,功能出色。还体验了谷歌aistudio更新的gemini - 2.5 - flash - image - preview,认为其不如nano - banana。

AI进修生
产品应用8

一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?

3月18日,LiblibAI旗下AI视频创作平台LibTV上线,它从设计之初就兼顾人类创作者和Agent。创作者端工作流画布可控;Agent端可通过Skill接口创作,交付可编辑项目。该产品还针对两者差异做了设计,价格也便宜。

Founder Park
算法论文8

通向世界模型关键一步:EX-4D来了,实现单目视频到自由视角生成

去年Sora等模型革新视频生成领域,相机可控的视频生成技术是构建世界模型核心。但从单视角生成极端视角视频是难题,PICO - MR团队提出EX - 4D,能从单目视频生成新视角视频,多方面表现出色。

机器之心
产品应用8

“参考生”之王回归:Vidu Q3持续进化,剧张力拉满|甲子光年

近期,AI视频公司生数科技的Vidu Q3正式上线参考生视频并全面升级。它能解决视频内容创作痛点,让爆款人设等稳定复现。在榜单上表现出色,经测试在多场景降本增效,提升了视频“剧张力”。

甲子光年
开源动态8

腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容

腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。

量子位
算法论文7

InfiniteTalk:音频驱动的从口型到全身动作同步方法

近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。

带你学AI
算法论文8

ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE

文本能力对语言模型重要,但现有模型训练窗有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升文本泛化能力,实验表现超RoPE。

机器之心
新闻资讯8

Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了

主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。

机器之心
开源动态7

Wan2.2-Animate又火了,5分钟让抠脚大汉秒变高冷女神。

阿里开源模型Wan2.2 Animate又火了,用照片和视频就能生成换脸视频,表情动作复刻佳。它上限高,还能变声,可用于舞蹈视频、影视二创等,但手指易崩坏。模型开源,有积极意义也有风险。

数字生命卡兹克