视觉文档检索」共找到 1171 篇相关文章

开源动态8

用视频存储文本的黑科技!

memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。

GitHubStore
产品应用8

全球首款!Claude引发的数据恐慌,被这家中国黑马补上了

威努特作为网络安全公司跨界推出AI桌面助手WinClaw。它能读懂各类文件并进行向量化处理,有多种检索方式,还能跨文档归纳、关系推理。具备安全的三层防护,支持双平台,注册即可用。

新智元
开源动态8

刚刚,DeepSeek又探索新架构了,开源OCR 2

DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。

机器之心
产品应用8

DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了

DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。

AIGC开放社区
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
8

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。

量子位
产品应用7

腾讯发布WeKnora知识库,无缝链接微信生态

微信团队推出基于大模型的文档理解检索框架WeKnora,应用于复杂异构文档场景。它采用多模态预处理等设计,有文档解析、意图识别等特点,可本地私有化,还能与微信生态无缝衔接。

CourseAI
算法论文8

OpenVision 2:大道至简的生成式预训练视觉编码器

多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。

机器之心
算法论文7

3D-R1重塑三维视觉语言推理!让三维交互更智能

近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。

带你学AI