文档图像解析」共找到 944 篇相关文章

推荐文章8

AI 原生研发范式:从“代码中心”到“文档驱动”的演进

文章讲述AI编程时代,用SDD解决上下文腐烂、审查瘫痪、维护断层问题,并提供人机协作SOP。介绍SDD理念、实操流程、团队协作方式,还提及资产沉淀、风险防范和常见问题解答,助力研发高效转型。

阿里云开发者
算法论文8

北大、字节、中科院自动化研究所等提出图像并行生成新范式

北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优化后在测试中击败Bagel。

AIGC开放社区
算法论文7

Waver:面向统一图像与视频生成的高性能基础模型

字节提出的Waver是面向统一图像与视频生成的高性能基础模型,支持T2V、I2V、T2I。它引入新架构、结合筛选流程与质量模型。虽有局限,但表现出色,架构设计独特,功能多样。

带你学AI
开源动态8

社区供稿丨揭秘端到端文档OCR模型 POINTS-Reader

腾讯开源端到端文档OCR模型POINTS-Reader,论文被EMNLP 2025主会录取。它提出可扩展数据生成方案,具简洁、性能好、高吞吐量等特点,通过两阶段训练方案解决依赖蒸馏数据问题,在多基准测试表现佳。

Hugging Face
产品应用8

跑通AI Agent「最后一公里」:iMeanAI的WebAgent后训练技术全解析

文章深入解析iMeanAI的WebAgent后训练技术,指出当前AI Agent落地存在从‘理解’到‘执行’的困境。通过两个极限任务展示其能力,介绍核心技术架构和后训练进化引擎,还提及该技术带来的自由体验,其1.0版本已公测。

AGI Hunt
推荐文章8

深度解析 Claude Code 在 Prompt / Context / Harness 的设计与实践

本文深度解析Claude Code在Prompt、Context、Harness三方面的设计与实践。介绍了Prompt动态组装过程,探讨CLAUDE.md项目说明、上下文压缩体系和记忆系统,还阐述了系统级提醒、多Agent及安全体系等内容,文末分享了项目有趣彩蛋。

阿里云开发者
开源动态8

10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本

处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理。

开源AI项目落地
推荐文章8

KV-Cache 实战策略:生产环境中的分页、固定与复用技术解析

在大语言模型推理场景中,KV - Cache 是平衡性能与成本的核心技术,但生产环境中面临诸多问题。本文聚焦其分页、固定与复用三大战术,结合原理、实践与案例,为开发者提供解决方案,还探讨了未来演进方向。

CourseAI
推荐文章8

CUTE DSL学习笔记一 CUTLASS 4.3.5 CuTe DSL 文档翻译

本文是 CuTe DSL 4.3.5 文档翻译,介绍了其核心概念、使用方法、与 CUTLASS C++ 关系等。它通过 Python DSL 降低 CUDA Kernel 开发门槛,支持 JIT 编译、多种架构,还说明了当前限制与未来计划。

GiantPandaLLM
算法论文8

击败Meta登榜首:推理增强的文档排序模型ReasonRank来了

本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。

机器之心