「多模态搜索智能体」共找到 4427 篇相关文章
感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义
伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。
仅10行代码,轻松打通你的AI应用与DB:谷歌开源数据库MCP,Star突破4.6k
谷歌开源面向数据库的MCP Toolbox,位于应用编排框架和数据库间,处理连接池等复杂问题,简化工具管理。它能助开发者构建让智能体访问数据库的Gen AI工具,有开发简便等优势。
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。
告别工具焦虑:2026年真正值得用的8款AI效率外挂
文章指出2026年是‘AI深度融合’元年,工具使用进入‘重塑工作流’阶段。作者筛选出Gemini全家桶、OpenCode等8款‘硬核’AI工具,介绍其特点和优势,如多模态、不设限、易用等。
OpenAI 直播摘要:AI 将推动科学进步,个人 AGI 即将到来,未来将非常光明
OpenAI 直播中,Sam Altman 和 Jakub Pachocki 透露重磅信息,称个人 AGI 即将到来,未来光明。公布通向超级智能时间表,对深度学习有信心,谈及基础设施扩张、公司架构变化等,还预测科学发现进程。
OpenAI的新浏览器实测被吐槽疯了?走“乔布斯风”、挖谷歌骨干,奥特曼就“复制”出个ChatGPT版Chrome?
OpenAI发布全新网页浏览器ChatGPT Atlas,战略上欲让浏览器成操作系统演进形态。它整合ChatGPT,有诸多创新功能,虽对谷歌构成威胁,但实测被吐槽,且智能代理浏览器带来新安全风险。
深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?
昨天,Meta发布约30B参数的多模态Agent模型Muse Glimmer,支持128K级上下文。它采用Apache 2.0许可证开放,有量化版本等。其技术设计围绕显存、上下文管理等问题展开,在多方面做了取舍。
科研数据不再碎片化!一张可计算图,连起整个科研世界
UIUC研究团队打造ResearchArcade,将ArXiv论文、OpenReview评审等碎片数据连接成动态知识图谱。它有多源、多模态等特征,支持多种格式数据导入导出,定义了六个任务,验证了图结构在科研数据处理中的作用。
谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果
Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用多平台多语言,谷歌期待用户反馈以优化体验。
鹅厂实习生血泪贴:Agent/RAG黑科技,真相竟是这样!
腾讯实习生分享鹅厂项目实战经验,介绍Agent/RAG黑科技。先讲RAG原理、优化方法及评估流程,还提及文档解析;再阐述智能体定义、历史、原理、分类、评估框架与实践案例,助读者快速入门。