「OCR 和知识学习范式」共找到 1882 篇相关文章
LeRobot v0.4.0 正式发布:全面提升开源机器人的学习能力
LeRobot v0.4.0 正式发布,带来多方面重大升级。有可扩展的 Datasets v3.0、新 VLA 模型、全新插件系统;支持 LIBERO 和 Meta - World 仿真;还有数据处理 Pipeline、多 GPU 训练简化等特性,上线了机器人学习课程。
10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本
处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。
AutoDev 预上下文引擎:预生成代码语义化信息,构建 AI 编程的知识基座
文章介绍 AutoDev 预上下文引擎,指出向量化代码检索性价比低,提出用预生成上下文提升 RAG 效果。Context Worker 能深度解析代码,支持多语言,使用简单,还可结合 MCP 服务获取上下文知识。
机器人也有“Aha Moment”!Zetta ζ 闭环物理智能体在线学习
端到端策略模型在物理世界失灵,现有在线学习路径未走通。清华 AIR 与域变换联合推出 Zetta ζ,通过三个闭环实现闭环物理智能体在线学习,实验显示其任务成功率高,还让机器人出现‘Aha Moment’。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
强化学习的两个「大坑」,终于被两篇ICLR论文给解决了
现有强化学习算法基于理想化交互模式,难应对真实环境。Mila 实验室两篇 ICLR 2025 论文提出实时强化学习框架,分别解决推理延迟和动作缺失问题,还可结合使用,对关键领域意义重大。
Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率
Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
强化学习+大模型记忆:Mem-α,让智能体第一次学会“如何记忆”
在大语言模型发展中,‘记忆’是智能体具备长期智能的关键。现有外部记忆系统有局限,Mem-α将强化学习引入大模型记忆管理体系,解决记忆难题,在性能、泛化等多方面表现出色。
这款OCR神器绝了,PDF、表格、手写体通吃,20+文档支持,9.4K Star!
开源君在Github发现开源OCR工具Zerox,由Omni - AI团队开发,利用AI视觉模型“阅读”文档,将多种格式文档转Markdown。它功能强大,处理复杂文档优势明显,在Github获9.4K Star。