素材生视频」共找到 1076 篇相关文章

产品应用8

32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉成和长视频

字节发布InfinityStar框架,将5秒720p视频成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。

AIGC开放社区
算法论文8

大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026

阿里巴巴未来活实验室团队解决多模态大模型视频推理难题,推出ReWatch数据集和ReWatch - R1模型。数据集克服现有训练数据痛点,模型用SFT + RL范式及创新奖励机制,实验成绩SOTA。

量子位
开源动态7

实时交互式长视频

文章提出用于实时交互式长视频成的帧级自回归框架 LongLive,解决了长视频成在效率和质量方面的挑战,具备长视频成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。

GitHubStore
算法论文8

SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”

北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。

AI前线
算法论文8

视频成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键

自回归视频成模型存在训推不一致导致的误差累积问题,使视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化成。

量子位
产品应用8

刚刚,美团推出 136 亿参数视频成模型

美团推出 136 亿参数视频成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像视频视频续写三类任务,能成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。

AGI Hunt
产品应用8

当搜索遇见 AIGC:京东零售的“千人千面”素材成实践

在 AIGC 浪潮下,视觉成技术重构电商态。京东零售李岩介绍“千人千面”商品素材成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。

InfoQ
产品应用8

全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考」之王归来

这个月初谷歌免费开放Veo 3.1视频成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。

新智元
新闻资讯8

刚刚,全球视频模型新王诞了!

天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频成从‘成片段’走向完整视频产,还应用于短剧平台DramaWave。

量子位
新闻资讯8

人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”转变。

新智元