「图像检索」共找到 709 篇相关文章
社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型
Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。
大模型之外,向量存储如何支撑 Agent 的检索链路
文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。
ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解
OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。
开源RAG又添新军!港大开源多模态RAG神器,多文档格式统一解析、知识图谱索引与混合检索!
在AI信息检索领域,传统RAG系统难处理复杂文档。港大数据智能实验室开源RAG - Anything,可提供端到端解决方案,能多格式解析、构建知识图谱和混合检索,优势显著。
nano-banana已登陆AI studio 和 Gemini ?果真是谷歌的gemini-2.5-flash图像预览版。。
作者分享玩AI视频创作的经历,介绍神秘AI图像生成和编辑模型Nano - Banana,它在LMArena平台出现,被猜测与谷歌新一代图像模型相关,功能出色。还体验了谷歌aistudio更新的gemini - 2.5 - flash - image - preview,认为其不如nano - banana。
SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”
北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。
美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破
美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越大模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。
阿里WebDancer:训练类DeepReaserch的Agentic Model
来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。
谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了
谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。
大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”
多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。