端到端文档转换」共找到 862 篇相关文章

开源动态8

最新原生OCR开源项目!

腾讯开源最新原生OCR:HunyuanOCR,仅1B参数,OmniDocBench得分94.1超竞品,功能覆盖全场景。还介绍了DeepSeek - OCR的桌面客户,支持拖拽识别、导出文件等。

GitHubStore
新闻资讯7

大模型低价趋势延续!智象未来姚霆:B、C界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态大模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
开源动态8

LangExtract:用LLM 一键完成长文档信息抽取与可视化

在2025年大语言模型迅猛发展时,信息抽取成了NLP场景里的“硬骨头”。Google在7月30日开源的LangExtract利用多种LLM,实现“按指令抽取+源文对齐 + 一键可视化”的完整闭环,还给出使用步骤和进阶操作。

机器学习AI算法工程
推荐文章8

AI 原生研发范式:从“代码中心”到“文档驱动”的演进

文章讲述AI编程时代,用SDD解决上下文腐烂、审查瘫痪、维护断层问题,并提供人机协作SOP。介绍SDD理念、实操流程、团队协作方式,还提及资产沉淀、风险防范和常见问题解答,助力研发高效转型。

阿里云开发者
开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
算法论文7

手机上实现AI视频实时生成,DiT模型上移动

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
推荐文章7

网站GEO技术优化指南:案例+工具+免费检查清单【转推】

文章指出当前处于传统搜索到AI搜索转型期,Google仍是主流。介绍Google和ChatGPT流程差异,给出抓取、索引、曝光优化建议,还列了该做与不该做之事,并有免费检查清单。

白杨SEO优化教程
算法论文8

击败Meta登榜首:推理增强的文档排序模型ReasonRank来了

本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。

机器之心
开源动态7

Alibaba开源WebDancer解决DeepResearch复杂信息检索难题

Alibaba开源WebDancer,从数据和训练阶段出发提出自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。

CourseAI
开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench榜单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现自动化。

机器之心