「文档OCR」共找到 386 篇相关文章
代码库的AI觉醒!GitMCP开源神器:实时文档中心秒级搭建,终结代码幻觉!
AI助手处理项目文档常“幻觉”频发,GitMCP这款开源工具通过MCP将GitHub仓库转变为实时文档中心,让AI直接访问最新文档和代码,消除“代码幻觉”。它功能强大,配置简单,应用场景广泛。
ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点
Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。
最新原生端到端OCR开源项目!
腾讯开源最新原生端到端OCR:HunyuanOCR,仅1B参数,OmniDocBench得分94.1超竞品,功能覆盖全场景。还介绍了DeepSeek - OCR的桌面客户端,支持拖拽识别、导出文件等。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
你奶奶也能看懂:DeepSeek-OCR的秘密。
本文介绍DeepSeek-OCR,它并非普通OCR工具,而是用“上下文光学压缩”将大量文本信息转为少量视觉Token。其架构含编码器和解码器,压缩效果惊人,重新定义AI“记忆”,或改变AI认知方式。
字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?
文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。
250份文档“毒晕”大模型!无论规模大小统统中招
Claude母公司Anthropic联合两大机构研究发现,仅250份恶意文档就能在不同规模大模型植入“后门”漏洞,打破以往对大模型数据中毒的认知,给厂商防御敲响警钟。
全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%
MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。
把任何文档变成Claude的新技能,这个开源工具火了。
Claude新出Skills,类似插件让其有自定义可调用功能。开源工具Skill Seekers能把网站文档转换成可使用技能。介绍了Skills特点及Skill Seekers功能原理、特点等,效率提升显著。
55.9K star!微软硬核开源文档转换神器,LLM最佳拍档!
介绍微软开源的轻量级Python文档转换工具MarkItDown,它支持20+格式智能转换为结构化Markdown,专为LLM文本分析场景优化,解决开发者处理多格式文档痛点,还阐述其功能、技术架构等内容。