新闻资讯7
谷歌新模型:多模态图像视频创作无缝衔接
量子位
AI 摘要
谷歌开放Gemini Omni Flash API,结合多模态与视频生成。Nano Banana 2 Lite出图快又便宜。二者结合能让图像视频创作无缝衔接,在电商等场景潜力大。
阅读原文 · 量子位
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
智谱「牛来」模型:国产开源多模态利器
神秘模型「牛来」真身曝光,是智谱刚开源的 GLM - 5.3 Flash,为 5 系列首个原生多模态模型。它尺寸小能力强、价格低,用国产卡,实测多模态和 Coding 能力出色,架构全新,开源后将模型、算力和生态结合。
量子位
开源动态8
智谱、阿里新模型亮相,性能屠榜!
智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。
AI寒武纪
产品应用8
Qwen3.8-Flash:全新架构模型发布
本文介绍了 Qwen3.8-Flash 多模态 MoE 模型,它原生支持 262,144 token 上下文。该模型在 Attention、Residual、Embedding 与 Optimization 四个方面系统升级,降低训练与推理成本,即将上线千问 AI 平台。还发布了 Qwen3.8-Flash-Next 开源权重。
千问大模型
算法论文8
V-RAE:革新视频生成与预测潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。
机器之心