自回归视频生成模型」共找到 2839 篇相关文章

算法论文8

免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频

Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。

新智元
算法论文8

合成数据≠生成模型:一文读懂合成数据的全新范式

最新研究提出合成数据全新分类框架,突破‘生成模型=合成数据’传统认知,涵盖多种方法。还按应用层次划分场景,指出合成数据面临模型坍塌等挑战,正成新型基础设施。

新智元
开源动态8

效果非常不错!阿里昨开源图形海报生成模型Qwen-Image

阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重大突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。

GitHubStore
新闻资讯7

Figure机器人分拣快递新视频曝光,网友:太像人类

Figure 02机器人开启打工模式,创始人放出其分拣快递新视频,它动作流畅像人类,由端到端通用控制模型Helix自主驱动。此前它还在宝马生产线连续20小时轮班作业,Figure与OpenAI分道扬镳后推出Helix。

量子位
开源动态7

一句话生成可上线的动效,这个项目真不错!

Github上的`Text-to-lottie`是开源Skill框架,可让Claude Code或Codex当动效设计师,按Lottie规范生成标准`lottie.json`。它有Coding Agent直出Lottie JSON、内置预览播放器等特色,助开发者快速产出合规Lottie资产。

开源先锋
产品应用8

不止剪辑!剪映的未来是一站式AI视频平台

剪映产品负责人宣布,其野心是成为一站式AI成片的创意伙伴。今年对AI文字成片功能系统性升级,整合豆包、DeepSeek模型,新增多种功能,还推出剪小映应用,要打造一站式AI视频编辑平台。

量子位
产品应用8

实测LibTV团队版:AI视频的工作室时代来了!

作者实测LibTV团队版,分享用其制作皮克斯风格3D动画片段的过程,介绍团队版核心功能,如团队主体库、共享积分池、权限管理等,还提及新功能,指出AI视频走向工业化,而该团队版是首个专注团队协作的工具。

花叔
产品应用7

谷歌照片新增AI功能,可将不同风格照片变成视频

谷歌在官网宣布,谷歌照片推出新AI功能,可将照片转换为视频或重新混合成不同风格,如动漫、漫画等。操作简单,还推出新创建标签页集中工具,且添加水印和安全措施。

AIGC开放社区
开源动态8

腾讯重磅开源!端到端视频音效生成模型HunyuanVideo-Foley

腾讯混元正式开源端到端视频音效生成模型 HunyuanVideo-Foley,适用于多场景。它采用新型框架结合 REPA 策略,有三大核心优势,能适配多种场景,抑制底噪,保证音频保真度。

带你学AI
算法论文8

模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理

具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。

机器之心