通用视频生成模型」共找到 3280 篇相关文章

开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。

机器之心
推荐文章7

最新豆包、deepseek、元宝、夸克、千问、百度、文心、Kimi、微信搜一搜、抖音、小红书等AI搜索生成内容引用来自哪些地方?【干货】

作者白杨SEO指出,生成式人工智能发展快,AI搜索优化GEO受关注。介绍了豆包、DeepSeek等多个AI搜索生成内容引用来源,如豆包引用抖音、头条等,DeepSeek用开源数据等,还提及各平台优化要点。

白杨SEO优化教程
产品应用8

腾讯发布Hunyuan-GameCraft!从静图进入动态游戏世界

近年来,现有方法难满足游戏视频生成需求。腾讯推出Hunyuan - GameCraft,可基于一张图像和提示词生成游戏交互视频,能精准响应交互信号,保留历史场景信息,不过动作空间待丰富。

带你学AI
新闻资讯8

王小川:医疗行业对大模型有三大刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗大模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用大模型用于医疗有问题,医疗对大模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。

Founder Park
开源动态7

SGLang|SGLang Diffusion

来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。

GiantPandaLLM
产品应用8

通用级PixVerse P1的技术突破,揣着进入平行世界的密码

PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。

机器之心
产品应用8

首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」

4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。

AI科技评论
产品应用8

灭霸带着复联放烟花!16秒,让手搓 AI 视频拥有大片即视感

生数科技的Vidu Q3超越Sora 2,位居全球第二、中国第一。它能16秒声画同出、叙事能力强、镜头和文字渲染出色,还降低了视频制作门槛,可用于漫剧、短剧、影视剧制作。

AI科技评论
开源动态8

开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布

随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。

机器之心
产品应用8

谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”

谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。

AI寒武纪