智能文档处理」共找到 4377 篇相关文章

开源动态8

阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!

在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。

开源星探
产品应用8

Visual Studio 重磅更新!擅长处理复杂任务的 GitHub Copilot “智能体模式”预览版上线

微软 Visual Studio 官方宣布,GitHub Copilot 智能体模式登陆 17.14 预览版。此模式可自主处理开发全流程,有确定上下文、建议命令等功能。还引入 MCP 服务器,支持连接外部工具,且更新将更频繁。

AI科技大本营
开源动态8

开源RAG又添新军!港大开源多模态RAG神器,多文档格式统一解析、知识图谱索引与混合检索!

在AI信息检索领域,传统RAG系统难处理复杂文档。港大数据智能实验室开源RAG - Anything,可提供端到端解决方案,能多格式解析、构建知识图谱和混合检索,优势显著。

开源星探
开源动态7

全球首个多智能体Eigent开源!内置200+MCP,支持SSO企业级

OWL团队开源多智能体Manus类工具Eigent,能多智能体协作处理复杂任务。它可整合工具和数据,处理任务时清晰拆解执行。有多种预定义智能体,内置200+MCP工具,还支持人工干预。

CourseAI
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。

CourseAI
开源动态7

二创党福音!基于AI的开源智能视频切片处理系统

AutoClip是基于AI的开源智能视频切片处理系统,能自动从多平台下载视频、提取精彩片段并生成合集。适合UP主、内容创作者等,有多平台支持、AI智能分析等特性,部署方式简单。

GitHubStore
开源动态8

腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!

腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。

开源星探
开源动态8

IBM推出轻量多模态文档神器!OCR与QA超GPT-4o,识别率高达98%!

日常文档处理麻烦,现有工具或体积大、算力消耗高,或识别精度不够。IBM 开源轻量多模态文档处理模型 Granite - Docling,仅258M参数,性能超 GPT - 4o,适用于多场景。

开源星探
开源动态7

离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完

百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理文档的问题,有多种应用方向,但也有边界。

小华同学ai
产品应用8

斑马智能进化论:从一家智能座舱供应商,到重新定义“汽车智能”的AI公司|甲子光年

2026北京车展,智能化从“配置竞争”走向“系统竞争”,AI Agent成智能座舱主流。斑马智能完成两次身份转换,推出元神AI汽车机器人大脑等,还与支付宝合作,试图重新定义“汽车智能”。

甲子光年