「结构化文档识别」共找到 997 篇相关文章
3.9K Star!Inkeep 把 AI 原生 Markdown 编辑器做成了开源项目!
Inkeep 团队开源 OpenKnowledge,这是真正为 AI 设计的知识库工具,已获 3.9K Star。它有所见即所得、AI 协作等亮点,还基于 Git 同步,保障数据安全,值得 Markdown 工具使用者关注。
像原始人一样和AI对话,费用可直接砍掉40%
开源项目‘caveman-compression’能帮使用ChatGPT API或其他大模型的用户省钱。原理是删废话留关键信息,有调用OpenAI和本地NLP两种压缩方式,不同场景省钱效果不同,还介绍了使用方法。
开源版AlphaXIV
开源版AlphaXIV可实现与arXiv论文智能对话,打破传统文献阅读壁垒。它利用微软Markitdown转换PDF,用MiniRAG索引内容,借助Google的Gemini API对话,还介绍了功能、问答流程、安装使用等。
Hermes Agent 终于有入门指南了
Hermes Agent 是 Nous Research 推出的开源 Agent 框架,功能强大但开发者不知如何使用。4 月 8 号,Kevin Simback 整理出 Hermes 生态全景图,另一人推出《Hermes Agent: The Complete Guide》,48 小时获 568 星。
科研写作神器,超越Mathpix的科学公式提取工具已开源
LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。
夯,开源 LiteParse,没有对手的 PDF 解析工具,知道的太晚了!
LlamaIndex团队开源独立工具LiteParse,用Rust打造,可本地运行、零成本、高精度解析PDF。它能提取文本及精确位置,有多种输出格式,支持多格式输入,还介绍了安装、使用、OCR配置等内容及应用场景。
3天狂揽23.1k星!把代码库变成知识图谱,AI编程成本降低35%
CodeGraph是开源本地代码知识图谱工具,提前为项目建索引,组织代码信息,让Agent直接查询。能减少token消耗与工具调用、提高响应速度,数据本地保存,还具备多语言支持等特点。
终于敢把真实地址、银行卡、种子词直接扔给大模型了
作者将真实个人信息扔给多个大模型测试,结果模型收到的是脱敏后的占位符,OneAIFW 能自动完成敏感信息的占位和还原,本地完成操作,不留日志不上云,还介绍了使用方法和项目地址。
庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境
苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。
工作流的 Skill 怎么写?从 7 个顶级 Skill 中提炼的模式与最佳实践
文章介绍工作流 Skill 写法,涵盖定义、Frontmatter 写法、5 种核心设计模式、通用写作技巧、模式选择决策树、快速上手模板及参考资源,还给出 7 个 Skill 速查表。