开源动态8
滑铁卢大学联合推出多模态视频模型 UniVideo
机器之心
AI 摘要
滑铁卢大学和快手可灵团队:推出 UniVideo 多模态模型,用双流架构统一视频理解、生成与编辑任务,实验超现有方法,还能泛化到新指令和任务组合,统一建模扩展性强。
阅读原文 · 机器之心
ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态
滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
智谱「牛来」模型:国产开源多模态利器
神秘模型「牛来」真身曝光,是智谱刚开源的 GLM - 5.3 Flash,为 5 系列首个原生多模态模型。它尺寸小能力强、价格低,用国产卡,实测多模态和 Coding 能力出色,架构全新,开源后将模型、算力和生态结合。
量子位
开源动态8
智谱、阿里新模型亮相,性能屠榜!
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
AI寒武纪
产品应用8
Qwen3.8-Flash:全新架构模型发布
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
千问大模型
算法论文8
V-RAE:革新视频生成与预测潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。
机器之心