开源动态8
华中科大&小红书MOCR:图形重建超Gemini 3 Pro
量子位
AI 摘要
华中科大与小红书推出MOCR,3B小模型在文档解析上打败开源大模型,图形重建超Gemini 3 Pro。它重新定义文档解析,开辟新数据源,范式可扩展,评估方法也有创新。
阅读原文 · 量子位
全新OCR将图片变代码无损重绘!华中科大&小红书发布3B模型,图形重建超越Gemini 3 Pro
华中科技大学与小红书联合推出MOCR,提出「解析一切」新范式,将文档图形升级为「一等解析目标」。它解决传统OCR短板,在文档解析和图形重建表现出色,还革新评估方法,代码和模型已开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
百度HPD - Parsing:文档解析速度暴涨3倍
百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。
CourseAI
Product Application7
Claude无需越狱就能操作iPhone
LLM操作手机以往方案有局限,phone - harness利用macOS Sequoia的iPhone镜像功能,通过截取镜像窗口、注入操作、截屏验证实现Claude操作iPhone,还介绍安装步骤、踩坑及已知限制。
AI工程化
开源动态8
Firecrawl开源神器,降低PDF解析的OCR成本
处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。
开源AI项目落地
开源动态8
codex-vision-proxy让DeepSeek开启看图技能
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
CourseAI