「OCR项目」共找到 1311 篇相关文章
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?
凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。
23.6K star!微软AI项目硬核开源,带飞你的电脑!
微软开源项目 `OmniParser` 是超级智能“数字助手”,能像人一样“看懂”屏幕元素并操作。它精准识别小图标、响应快、开发便捷、兼容大模型且跨平台,目前在Github获23.6K star。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
基于 AI 的机器人攻陷微软、DataDog 和 CNCF 项目中的 GitHub Actions 工作流
近期,一个基于AI的机器人利用GitHub Actions工作流,在2026年2月21 - 28日对微软、DataDog等项目发起攻击,成功在多个代码库实现远程代码执行并窃取凭证,还出现AI对AI攻击,组织需加强安全审计。
不增加人手,项目效率飙升45%,OpenAI公开了一套AI实战经验
OpenAI公开基于大语言模型和专属Skill包的开源仓库维护方法论,将重复工作自动化,使项目代码合并吞吐量飙升45%。该方法由AGENTS.md、Skill包和GitHub Actions构成,还涉及任务分配、验证策略等。
闲置手机装OpenClaw:三个不走寻常路的OpenClaw端侧部署项目
文章介绍了三个不走寻常路的OpenClaw端侧部署项目,如在25美元手机、5美元芯片运行OpenClaw,还有安卓手机变AI主机。展示新思路,也指出端侧部署有局限,云+端协同才是最佳。
Google悄悄下了一盘大棋:一天三个端侧AI项目同时爆发
Google 一天内三个端侧 AI 项目爆发,包括离线听写 App Eloquent、端侧 AI 示例集 AI Edge Gallery 和端侧大模型推理运行时 LiteRT-LM。云端大模型竞争趋同,端侧 AI 是差异化战场,Google 全栈布局有优势。
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。