「多模态智能检索」共找到 4283 篇相关文章
ICLR 2026 Oral|多模态知识图谱对齐难:破解噪声关联至为关键
在数据多元化时代,多模态知识图谱能为下游应用提供数据支撑,实体对齐是构建知识图谱的核心技术。但大规模知识图谱关联与融合面临噪声和潜隐关联挑战。四川大学团队提出 RULE 方法,缓解了这些影响,论文被 ICLR 2026 接收为 Oral。
AI竟会「自己认错」?破解多智能体协作「罗生门」,斩获ICML 2025 Spotlight
多智能体AI系统任务失败后,开发者常难定位问题。PSU、杜克大学与谷歌DeepMind等机构提出「自动化失败归因」,发布Who&When数据集,探索三种归因方法,虽目前效果欠佳,但为打造可靠系统提供方向。
再见Bug!谷歌超级编码智能体Jules上线,免费使用直连GitHub
谷歌推出编程智能体Jules,进入全球测试阶段,有Google账户的开发者可免费试用每日5次。它基于Gemini 2.5 Pro模型,能写代码、修Bug等,还可连GitHub简化流程,预计今年晚些时候推更多功能和企业版。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
360安全云架构全解,AI智能体如何开启「主驾」新时代?
AI发展加速,网络安全危机加剧。360安全云在ISC.AI 2025大会发布新产品,提出“安全即服务”理念,打造AI驱动的四层架构,发布三大类智能体,为企业提供全生命周期价值交付的安全服务。
《AI 2027》揭秘:人类会被超级智能取代吗?等等,还有另一个结局!
《AI 2027》由Daniel Cocotal团队发布,精准预测了多项AI发展。报告推演2025 - 2027年AI智能体发展,不同阶段影响各异,还给出两种结局,一是AI重塑世界,二是人类控制住AI并发展安全系统。
微软推出深度视频探索智能体,登顶多个长视频理解基准
尽管LLMs和VLMs在视频分析和长语境处理有进展,但处理数小时长视频有局限。微软提出智能体Deep Video Discovery (DVD),以简洁框架在LVBench取得高准确率,将以MCP Server形式开源。
一场机器人黑客松,让具身智能的差距与机会同时显形
作者参加深圳机器人黑客松,这是全球最大规模线下具身智能开发者大赛之一。3天内参赛队伍可完成从数据采集到真机部署闭环。比赛让行业差距与机会显形,凸显基模重要性,自变量也给出新方向。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
当代码遇上大模型:智能编程助手的架构设计与工程实践
在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。