「多模态向量检索」共找到 1202 篇相关文章
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
Jina Embeddings v4 的量化感知训练
文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
幻觉终结者,PoG给大模型“打补丁”
传统检索方式易给大语言模型带入噪声,知识图谱虽能提供可靠知识,但处理多跳和多实体问题有局限。Paths-over-Graph(PoG)方法通过多跳路径探索、路径剪枝等提高LLMs在复杂任务中的表现,减少幻觉。
763亿港元,大模型公司最大规模IPO!MiniMax登陆港交所,开盘前大涨50%
MiniMax正式在港交所主板挂牌上市,股票代码“00100”。此次全球发售约3358万股,募资约55.4亿港元。市场认购热烈,早盘一度涨幅超50%,市值突破763亿港元。其技术多模态齐发,组织高效,为行业提供新样本。
315曝光的“AI投毒”原理:GEO这样操控大模型推荐
央视3·15晚会揭开AI“投毒”灰色产业链,利用GEO操控大模型推荐。介绍了训练数据污染、检索上下文劫持、提示注入诱导攻击三种“投毒”技术,还阐述了内容生产、渠道投放、效果强化的产业链运转流程。
低延迟、高吞吐,LLM优化与高效推理引擎综述
LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
Turso:用 Rust 重写 SQLite,让数据库跑在每一个边缘节点
Turso用Rust重写SQLite内核,解决其单写者限制和缺乏网络同步能力的短板。它有嵌入式副本、边缘同步和向量搜索等特性,适用于AI Agent、多租户SaaS等场景,与竞品相比优势独特。
模型即 Agent 的含金量:Kimi深度研究功能详评
作者分享Kimi深度研究功能体验。其基于端到端自主强化学习技术,会开源模型。在测试中,分析Labubu爆火原因、检索小米发布会内容,展现出强逻辑分析、搜索准确性和数据处理能力,可视化网页也出色。