「实时生成」共找到 2421 篇相关文章
理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)
文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。
低延时、可交互的音频驱动肖像视频生成框架LLIA
美团提出新型音频驱动肖像视频生成框架LLIA,是低延迟、可实时交互的虚拟形象生成技术。它提出四项核心技术,引入三大核心模块,构建超100小时数据集,在多方面有出色表现。
6个Agent组团Vibe Gaming:自己生成、试玩、修Bug
过去大模型生成的游戏虽代码能跑,但常陷入“可玩性黑洞”。Spellcaster让多个专用Agent协同处理,形成“生成—运行—检查—修复”循环。目前能快速生成多种游戏原型,未来将用世界模型直接生成画面。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。
MIDAS:快手可灵发布实时交互式数字人生成框架
近年来交互式数字人视频生成受关注,但实时处理多模态输入有挑战。快手可灵团队提出MIDAS框架,基于LLM驱动的自回归模型,结合轻量级扩散头,实现低延迟、交互式多模态控制,还构建大规模数据集等。
AI视频生成走向「演技生成」时代,生数科技Vidu全球发布Vidu Q2
9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,打破AI生成表情假、动作飘忽等问题,实现从“视频生成”到“演技生成”跨越,有AI演技生动、镜头语言丰富等亮点,已多端上线。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
仅需0.7秒单图像实时3D重建,开源扩散模型
单图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。