OCR评测」共找到 723 篇相关文章

新闻资讯7

Show me《指环王》!卡帕西强推大模型评测新基准

大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。

量子位
推荐文章7

2025,大模型文档解析(OCR)年终盘点

2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。

PaperAgent
开源动态8

刚刚,DeepSeek又探索新架构了,开源OCR 2

DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。

机器之心
开源动态8

Gaia2 与 ARE:赋能社区的智能体评测

文章介绍 Gaia2 与 ARE,Gaia2 是智能体基准 GAIA 升级版,能分析复杂行为,与 ARE 框架一同发布。ARE 可模拟复杂真实条件,支持定制。文中对比多款模型,指出当前模型挑战,并说明评测步骤和 ARE 使用场景。

Hugging Face
新闻资讯7

Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2

Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。

新智元
新闻资讯8

2025 智能体元年,Agent 开发平台深度评测报告解读

2025 年 AI 产业两大核心趋势并行,AI Agent 产业化落地提速。国家工业信息安全发展研究中心赛昇实验室发布评测报告,对阿里云百炼等四大 Agent 开发平台从 RAG、工作流能力、Agent 工具调用三大维度测试,为行业选型提供参考。

特工宇宙
开源动态7

「看」能否取代「读」,为何DeepSeek-OCR 爆火的重点不在性能?

DeepSeek近期开源的DeepSeek - OCR在AI社区引发热议。它提出‘上下文光学压缩’理念,以视觉方式压缩文本。社区关注重点在其研究思路对NTP范式的影响,有望解决长上下文经济性难题等。

机器之心
算法论文7

视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。

深度学习自然语言处理
开源动态7

Rust版本的DeepSeek-OCR来了,告别python原版的繁琐配置

网友用Rust重写DeepSeek - OCR推理栈,解决原版Python依赖复杂问题。此版本无Python依赖,可离线运行,兼容OpenAI API,还支持苹果芯片Metal加速,介绍了技术实现、使用方法和场景。

AI工程化
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区