端到端文档OCR」共找到 844 篇相关文章

开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
开源动态7

可从表复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档

LandingAI的Agentic文档提取API可从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能可视化调试。

GitHubStore
推荐文章8

语音模型:从语音表征到模型架构

本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。

InfoQ
新闻资讯8

何恺明CVPR最新讲座PPT上线:走向生成建模

今年CVPR闭幕,何恺明现身会场并做了主题为‘走向生成建模’的分享,近日其个人网页上传了该分享PPT。PPT回顾识别模型演进,探讨生成模型能否重演历史,还介绍了MeanFlow方法及成果。

机器之心
产品应用8

verify-data:一个的数据验数 Agent Skill

本文介绍数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。

阿里云开发者
开源动态7

一键式训练Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
算法论文8

效果、性能双突破,快手OneSug生成式框架入选AAAI 2026

查询推荐是电商搜索关键功能,传统方法有局限。快手提出OneSug生成式框架,统一多阶段,提升效果与效率,成果入选AAAI 2026,已在快手电商全量推广,显著提升多项指标。

机器之心
开源动态7

PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc

Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持多种格式,有可扩展性等优势,还能处理扫描文档,可用于多个系统,介绍了安装方法。

GitHubStore
算法论文8

推荐大模型来了?OneRec论文解读:训练如何同时吃掉效果与成本

随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双服务用户,也有需完善之处。

机器之心
算法论文8

NVIDIA港大MIT联合推出Fast-dLLM v2:吞吐量提升2.5倍

自回归大语言模型推理效率受限,Fast - dLLM v2 由 NVIDIA、港大、MIT 联合推出。它将预训练 AR 模型适配为能并行解码的 Block - dLLM,用约 1B tokens 微调,吞吐量最高提升 2.5 倍,精度相当。

机器之心