「多模态向量检索」共找到 1202 篇相关文章
Correlations:氛围测试你的向量模型
Jina AI分享内部调试可视化向量小工具Correlations,它能生成交互式热图展示内容间余弦相似度,提供多种交互方式。工具已在GitHub开源,适用于内容去重、验证引文等场景。
多模态技术爆发元年,行业应用如何落地?
InfoQ《极客有约》X AICon 直播栏目,邀上海交大赵波、快手高欢、腾讯邵帅探讨多模态大模型。谈及技术挑战、开源闭源、行业落地等,还分享精彩观点,如先大后小蒸馏提效,垂直模型现阶段更优。
智源悟界·RoboBrain Orca:多模态表征世界模型
智源研究院悟界·RoboBrain Orca团队发布技术报告,探索让模型学习世界表征,从‘预测下一个词’走向‘预测下一状态’。它通过多模态数据学习,经实验验证有效,虽处早期阶段,但提出值得扩展的方向。
一篇多模态大模型推理技术最新综述
华东师大&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态大模型推理多方面内容。
750篇论文,彻底把统一多模态模型摸清了
未来迈向AGI需多模态AI系统。南大等联合发表综述,涵盖754篇文献。分析传统路线痛点,介绍统一多模态模型定义、技术路线、训练方法等,还提及应用场景及未来方向。
多模态Deep Research,终于有了「可核验」的评测标准
俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
图谱检索全面 or 效率?蚂蚁&浙大Deep GraphRAG:全都要
传统 RAG 遇复杂 Query 易失效,GraphRAG 带来新三难。蚂蚁与浙大提出 Deep GraphRAG,有层次化检索、Beam - Search 重排、DW - GRPO 强化学习三板斧,实验显示其性能优、延迟低。
探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践
本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。
参数砍到 1B,这个小钢炮拿下多模态第一
面壁智能发布并开源参数量仅 1.3B 的 MiniCPM-V 4.6,虽小但多模态综合能力在 1B 级别中夺冠。它推理快,效率高,靠两大架构创新实现,还为开发者提供完整工具链。