「扩散视频模型」共找到 8088 篇相关文章
只需一次指令微调,大模型变身全能专家天团,8B模型性能反超全微调基线 | ACL25 Oral
预训练大模型适应专业领域需高昂微调成本,稀疏混合专家架构虽能提升推理效率,但从头训练耗资源。浙大与Thomson Reuters团队提出SIMoE,单阶段微调就能升级大模型,还解决传统方法两大局限,在性能和效率上双突破。
OVI:统一的音视频生成模型,声音与画面同步诞生
音视频生成领域以往多阶段架构易致音画不同步等问题。耶鲁大学团队提出 OVI 统一范式,采用双塔 DiT 架构与分块式跨模态融合机制,实现音画同步生成,不过目前有计算开销大、音频有局限等问题。
昆仑万维多模态视频生成开源,影音图文全统一
昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。
CVPR 2026 | 1000万段驾驶视频,教会模型如何估计相机位姿
Wayve的LA - Pose研究,不依赖百万级3D标注,从约1000万段未标注驾驶视频自监督学习‘潜在动作’,再用少量3D标注微调,转化为相机位姿估计能力,在多基准上提升精度且泛化能力强。
世界模型混战,蚂蚁炸出开源牌
蚂蚁集团旗下蚂蚁灵波发布并开源通用世界模型 LingBot-World,全面开源代码和权重,不绑定硬件或平台。它在多维度有突破,虽有细节瑕疵,但单次生成近 10 分钟连贯视频或刷新纪录,还在 VBench 测试领先。
吴恩达来信:开放模型,开放执行框架,开放安全
吴恩达团队用闭源模型做安全审查遇阻,后改用 OpenWorker 框架结合开源权重模型 Kimi K3 和 GLM 5.2 取得进展。他认为开放模型和执行框架能带来更安全系统,开源权重模型舆论战虽胜,但立法层面未胜。
仅需0.7秒单图像实时3D重建,开源扩散模型
单图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。
黄仁勋CES最新演讲:Rubin 今年上市,计算能力是 Blackwell 5 倍、Cursor 彻底改变英伟达软件开发方式、开源模型落后于先进模型约6个月
英伟达CEO黄仁勋在CES 2026演讲宣告AI从理解语言走向改造物理世界。他提及开源模型发展,还发布多款新品,如AlpaSim仿真框架、GROOT 1.6机器人模型、AI超算Vera Rubin等,凸显英伟达在AI领域的布局与野心。
单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地
3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方面表现出色,超越部分千亿级大模型,还推出“大模型+小模型”协同架构释放企业算力价值。
把短视频做成流水线的AI剪辑神器
Pixelle-Video是一款AI剪辑神器,输入主题就能自动完成视频创作,零门槛。它采用模块化设计,流程清晰,各环节可灵活定制。支持多种AI模型、TTS方案,有丰富功能亮点。