OCR项目」共找到 1307 篇相关文章

产品应用8

自媒体误读了 DeepSeek-OCR:一图胜千言

近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。

MacTalk
新闻资讯7

GitHub Star明码标价5毛/颗,AI项目刷假星最猛

卡内基梅隆大学研究发现,GitHub约600万颗假星,18617个仓库涉假,AI/LLM项目是重灾区。造假产业化,有分层定价、售后保障。买星为融资,形成恶性闭环,判断项目好坏还得看硬指标。

量子位
开源动态8

挖到 9 个 Claude Skills 宝藏开源项目,AI 能力直接拉满!

Claude Skills 热度高,作者梳理分享 9 个值得关注的开源项目。涵盖官方与生态合集、任务规划与技能探索、Agent 与工程化实践等类别,展示不同场景应用,助读者找适合项目

开源先锋
新闻资讯8

DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建

昨晚 DeepSeek V4 Pro 发布,欲迈向“工业级 Agent 生产线”。网上爆出 DeepSeek Harness 内测入选项目名单,筛选重实用功能,多集中在 MCP 插件、Coding Agent 等赛道,还介绍了部分入选项目及战略意图。

AI科技评论
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
产品应用7

不只是聊天:Gemini Agent Mode 深度集成 Android Studio,可直接修改项目

谷歌为 Android Studio 推出集成 Gemini 的 Agent Mode,在最新预览版上线。它以整个项目为上下文,能直接修改项目、执行多步骤任务,可通过 MCP 与外部工具交互,但预览版有不足,谷歌正解决。

InfoQ
开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。

开源星探
产品应用7

Claude Code 更长更快!Agent能自己管项目了!从 Todo 升级到 Task

上周Claude Code团队更新任务清单系统,从「记事本」升级为「项目管理系统」。因模型能力增强,需求变复杂,原TodoWrite无法满足,新Task系统解决了任务依赖协调问题,支持复杂项目

AI产品自由
产品应用8

大模型虽好,但恕我直言:在OCR面前,开源小模型更香

作者所在公司项目需处理大量纸质文档,起初考虑云端大模型API调用和开源大模型本地化部署,却因成本高、硬件要求高受阻。后经推荐调研PaddleOCR,其功能全、成本低、易用性强,最终被选为项目核心方案。

PaperAgent