开源动态8
MonkeyOCRv2:0.7B参数反超3B称霸文档OCR
量子位
AI 摘要
MonkeyOCRv2团队:文档OCR进入小模型时代,0.7B、0.6B的MonkeyOCRv2超越3B模型夺冠。它重新分工,用预训练目标保留细节,开源数据,视觉编码器迁移多任务表现优,“重建即视觉记忆”或是关键。
阅读原文 · 量子位
一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一
文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
Meta推编码框架,低价换开发者数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
DeeplearningAI
开源动态8
南北阁实验室:Nanbeige4.2 - 3B小模型挑战大任务
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
AIGC开放社区
算法论文8
MonkeyOCRv2:重建即文档视觉记忆
文档视觉编码器对LLM理解和推理很重要。MonkeyOCRv2提出‘重建即文档视觉记忆’,通过多组实验验证其有效性,还发布MonkeyDoc v2数据集,推动公平比较的研究文化。
机器之心
开源动态8
微博开源3B小模型,性能逼近大模型
微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。
AIGC开放社区