PDF解析器」共找到 498 篇相关文章

算法论文8

BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序

传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。

PaperAgent
产品应用7

AI版Chrome终于来了

Google正式推出Gemini in Chrome功能,将Gemini整合进Chrome浏览。Chrome从‘内容展示’变为‘内容理解’,有多标签页处理等功能,提升效率,还推动浏览形态演进,未来或能替用户操作。

newtype AI
新闻资讯7

Langchain回应OpenAI:为什么我们不做拖拉拽工作流

OpenAI发布可视化工作流构建AgentKit,LangChain创始人Harrison Chase写文解释为何不做。他指出工作流与智能体不同,可视化工作流构建有门槛高、难管理等问题,还给出不同复杂度问题的解决方案。

AI工程化
开源动态8

这款OCR神绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!

开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将多种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。

开源先锋
推荐文章8

一文全解析:AI 智能体 8 种常见的记忆(Memory)策略与技术实现

本文剖析8种常见AI记忆方案,如全量记忆、滑动窗口等,分析其原理、特点和适用场景,还给出模拟代码助理解。不同策略各有优劣,适用不同对话场景,能为项目评估、选择和实现Memory方案提供参考。

AI大模型应用实践
推荐文章7

深度解析LLM Wiki / Obsidian-Wiki / GBrain:Agent时代知识的“自组织”与“自进化”

文章深度解析LLM Wiki、Obsidian - Wiki和GBrain项目,探讨Agent时代知识的“自组织”与“自进化”。指出传统知识管理有短板,而这些项目通过不同方式解决知识结构化、沉淀和更新问题,各有优劣。

阿里云开发者
开源动态8

全球最强开源「定理证明」出世!十位华人核心,8B暴击671B DeepSeek

八大顶尖机构推出开源定理证明Goedel - Prover - V2,有32B和8B两版本。它在多个基准测试击败671B的DeepSeek - Prover,采用创新技术,以少算力刷爆SOTA,十位华人是核心贡献者。

新智元
开源动态8

斩获20K星!再见PDF排版噩梦,这个开源神让文档处理爽到飞起!

MinerU是上海人工智能实验室推出的开源数据提取工具,能将多模态文档解析为Markdown,支持精准提取图片、表格、公式,具有多语言支持、高性能等特点,应用场景广泛,还开源免费。

小华同学ai
开源动态8

支持30种语言,多种中文方言 [四川话、粤语等]的颠覆性无分词TTS系统

VoxCPM是无离散音频分词的语音合成系统。VoxCPM2基于MiniCPM - 4构建,有20亿参数,支持30种语言和9种中文方言,具备音色设计、可控声音克隆等特性,还完全开源,商用就绪。

GitHubStore
推荐文章8

深度解析大模型技术演进脉络:RAG、Agent与多模态的实战经验与未来图景

大模型作为产业变革核心引擎,RAG、Agent与多模态技术重塑AI与现实交互边界。本文解析技术演进脉络、实战经验与未来图景,介绍三者在各领域应用及面临挑战,为产业升级提供指引。

腾讯技术工程