可交互音视频」共找到 5019 篇相关文章

开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型跟随操作实时渲染、动态生成世界。目前Noiz AI联合多机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
产品应用7

快手灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了

ChatGPT发布三周年,快手灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。

量子位
开源动态8

HeyGen 开源了一个"用 HTML 写视频"的框架,我研究了一下,发现事情没那么简单

HeyGen 开源了 Hyperframes 项目,让 AI 用 HTML 写视频。文章从其定义、上手教程、竞品对比等方面展开,指出它虽有短板,但代表视频制作新范式,建议相关从业者关注尝试。

AI Reading Hub
产品应用8

太强了 Yan!腾讯打造的全能交互视频生成引擎

腾讯提出的面向交互视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供行路径,但也面临长时视频视觉一致性不足等问题。

带你学AI
新闻资讯8

每秒生成超30帧视频,支持实时交互!自回归视频生成新框架刷新生成效率

微软研究院与北大联合发布Next - Frame Diffusion (NFD)新框架,通过帧内并行采样、帧间自回归等方式,让视频生成在保持高质量的同时,效率大幅提升,还采用多项技术进一步优化。

量子位
开源动态8

还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!

文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。

小华同学ai
算法论文8

SIGCOMM 2026 | 从「人眼看视频」到「AI理解视频」:北大提出面向AI的实时通信框架Artic

AI 正从「文字聊天」走向「边看边聊」,传统实时视频通信难以满足需求。北大团队提出 Artic 框架,重构码率自适应等,实验显示其能显著提升准确率、降低延迟。

机器之心
产品应用7

谷歌照片新增AI功能,将不同风格照片变成视频

谷歌在官网宣布,谷歌照片推出新AI功能,将照片转换为视频或重新混合成不同风格,如动漫、漫画等。操作简单,还推出新创建标签页集中工具,且添加水印和安全措施。

AIGC开放社区
产品应用8

Midjourney正式推出 V1 视频模型:美学细节无敌

Midjourney推出视频生成模型V1,主打高性价比、易上手。采用“图像转视频”工作方式,有两种动画和运动幅度设置。入门价每月10美元,任务成本低,未来一月或调价格,目标是实现实时交互开放世界模拟系统。

AI寒武纪
开源动态7

实测丨HeyGen开源HyperFrames,让AI Agent用HTML做视频

复杂视频剪辑工具对非专业人士和AI Agent不友好,HeyGen开源的HyperFrames是视频渲染框架,让AI Agent用HTML做视频。该项目更新频繁,有HTML原生、为AI设计等特点,文末附项目链接。

开源AI项目落地