「多模态专家混合」共找到 1549 篇相关文章
谷歌成立AI基金,为初创公司提供技术、资金
谷歌宣布推出AI Futures Fund,旨在投资运用DeepMind AI工具的初创企业,提供技术、资金支持,如提前接触模型、专家指导、云服务积分和直接投资等,未透露基金规模。
商汤新模型 SenseNova-U1 Pro 曝光,对标 GPT-Image-2,瞄准「设计」赛道
商汤科技在股东大会预告下一代旗舰多模态基座模型 SenseNova-U1 Pro,预计 2026 年 7 月邀测,对标 GPT-Image-2,瞄准「设计」赛道,具备多核心能力,还支持 8K 分辨率输出。
SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%
文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。
2025 AI赋能流体力学国际研讨会暨第五届全国智能流体力学研讨会于香港顺利召开
2025年11月29日至12月1日,2025 AI赋能流体力学国际研讨会暨第五届全国智能流体力学研讨会在香港理工大学举行。会议汇聚全球专家,设3个主题分会场,还组织圆桌研讨,推动了智能流体力学发展。
谷歌放大招了,开源命令行AI编程Agent,每天1000次免费调用,编程只是基础功能。
Google推出开源命令行AI编程Agent——Gemini CLI,基于Gemini 2.5 Pro模型,免费提供每日1000次调用额度。它不仅能编程,还具备多模态能力、实时信息整合等功能,支持定制与自动化。
8.9K Star!号称 Notebook LM 开源平替,支持 16+AI 模型,一键部署!
Google Notebook LM 虽方便,但有数据泄露风险且被平台绑定。开源工具 `open-notebook` 是其平替,支持 16 + 家 AI 模型提供商,可处理多模态内容,能本地部署保障数据安全,还具备多种实用功能。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
Chroma创始人「Context Engineering」5 步杀疯全网
文章聚焦Chroma创始人提出的「Context Engineering」,指出RAG已死,上下文工程崛起,还给出实用建议,如聚焦检索、混合召回等,介绍了上下文工程包含的数据摄入、查询等内容。
为什么你的 Agent 总是出故障?从算力基建到可信熔断的架构生死线 | 直播预告
本次直播集结值得买、商汤、明略三位技术专家,拆解可信 Agent 构建之道。将探讨大模型基础设施、可信 Agent 架构、MCP 协议实战等问题,还会解答观众提问。
最新研究!大模型“角色扮演”无效了?
沃顿商学院研究测试6个主流AI模型,进行超25000次测试,发现告诉AI扮演专家角色,不会让其回答更准确,反向设定‘低知识’角色有时表现更好,角色扮演不是提高准确性的万能钥匙。