图像到视频」共找到 3220 篇相关文章

算法论文8

CVPR2026 | Streamo:让大模型变成实时流式交互助手

香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。

机器之心
产品应用8

全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来

这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。

新智元
算法论文8

AI问答,直接「拍」给你看!来自快手可灵&香港城市大学

来自快手可灵团队和香港城市大学的研究者提出「视频作为答案」任务范式,发布VANS模型。它由视觉语言和视频扩散模型构成,通过联合分组相对策略优化算法协同优化,在教学和预测应用上效果超现有模型。

量子位
产品应用8

MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV

上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。

AIGC开放社区
产品应用7

500万次围观,1X把「世界模型」真正用在了机器人NEO身上

1X公司为机器人NEO引入1X World Model,使其学会‘想象’。该模型借助视频预训练,不依赖大规模机器人数据和遥操作演示,能泛化新场景。实验显示其在多任务上表现不错,但精细操作有挑战。

机器之心
新闻资讯7

小扎新AI,凉得彻底?

9月25日,Meta推出嵌入Meta AI应用的AI视频流Vibes,可浏览、二创和分享AI视频,改写短视频玩法。它降低创作门槛,融入Meta生态,野心勃勃,但也带来版权等争议,还将与硬件结合,AI视频或成新全民入口。

新智元
产品应用8

马斯克AI女友直播「一秒变身」,Karpathy看完立刻投钱

世界首个支持直播推流的「实时」扩散AI视频模型MirageLSD诞生,大神Karpathy亲自站台。它能理解真实视频后同步生成AI视频,实现零延迟、无限时长、每秒24帧不卡顿,给视频娱乐和直播互动带来丰富想象。

新智元
7

从哲库小米,从造芯之“死”造芯之生

文章回顾华为、小米、OPPO造芯历程,分析OPPO哲库夭折与小米重启造芯的原因。指出小米重启造芯有财务、组织架构、经验等优势,且赶上制裁“窗口期”,AI时代也需自研芯片。

芯师爷
新闻资讯7

谷歌也要「AI抖音」了!新Veo 3.1原生支持竖屏,4K分辨率高画质

谷歌Veo 3.1升级,全方位提升视频生成质量,新增竖屏和4K两大特性。它还提升创意、一致性和元素融合能力。谷歌借此进军AI短视频,结合自身优势推动“AI视频竖屏化”趋势。

量子位
产品应用8

谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了

谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。

机器之心