「Nano Banana模型」共找到 7783 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
谷歌最强AI,被港科大开源超了?让海外创作者喊出「King Bomb」的P图大杀器来了
图像编辑与生成模型爆发,冲击Photoshop地位。港科大贾佳亚团队开源DreamOmni2,优化升级多模态指令编辑与生成能力,效果获海外创作者认可,还在实测中表现出色,其采用创新技术方案构建多模态生成体系。
OpenAI深夜祭出GPT-5,所有人能免费用!Altman:像和博士级专家对话
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推GPT - 5 - mini和GPT - 5 - nano两款新模型,免费用户可使用部分版本。它在编程和健康领域测试表现出色,引发各界热议。
与Gemini Diffusion共振!首个扩散式「发散思维链」来了
西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。
英伟达护城河又宽了!低调收购开源算力调度王牌工具,全球过半顶级超算在用,Thinking Machines也离不开它
英伟达低调收购SchedMD,其为Slurm系统核心开发商,该系统被全球超半数TOP500超级计算机等使用。收购整合成本低、战略价值高,英伟达承诺保持Slurm开源,但相关项目开发受关注。此外,英伟达还推出Nemotron 3系列开源模型。
Pixel 10『打样』AI手机:苹果、华为、三星差几年?
谷歌发布被称为“全球最AI的手机”Pixel 10系列,全新Tensor G5+端侧Gemini Nano带来AI领先。文章将其与苹果、华为、三星手机对比,分析各品牌AI功能优劣势,指出未来手机竞争是硬件、系统与大模型的综合较量。
NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了
大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。
Meta「分割一切」进入3D时代!图像分割结果直出3D,有遮挡也能复原
Meta MSL实验室发布三维重建模型SAM 3D,其家族的两个新模型能将2D图像转为3D重建模型,性能优异。同时,此前投稿ICLR 2026的SAM 3也亮相,可克服传统模型局限,在多项任务中刷新SOTA。