新闻资讯8
Gemini负责人揭秘多模态技术亮点
量子位
AI 摘要
Gemini模型行为产品负责人Ani Baddepudi爆料,Gemini因构建AGI需多模态能力,设计为原生多模态。Gemini 2.5解决视频理解鲁棒性问题,有正向迁移和能力整合,团队还关注产品自然交互性。
阅读原文 · 量子位
Gemini负责人爆料!多模态统一token表示,视觉至关重要
Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Meta 开源本地运行智能体模型 Muse Glimmer
Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。
AI前线
算法论文7
Gemini、GPT进《我的世界》评测,新框架破瓶颈
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
AI科技评论
开源动态8
阿里开源Qwen3.8-27B,性能直逼顶尖模型
阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。
AIGC开放社区
开源动态8
Genspark开源免费AI办公套件GenOffice
Genspark团队开源AI办公套件GenOffice,全平台免费无广告。它界面类似微软Office,零成本上手,AI能直接编辑文档。虽处Alpha阶段,但可切换多种模型,还给出了配置第三方模型的方法。
CourseAI