「文档视觉编码器」共找到 1289 篇相关文章
最新视觉大模型 DINOv3论文精读(逐段解析)
DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。
Copilot 创始工程师:大多数 AI 编码“就像开着法拉利去买牛奶一样”
GitHub Copilot 创始工程师 Neel Sundaresan 正构建智能编码工具 IBM Bob,已有 8 万 IBM 开发者使用。他认为多数 AI 编码像开法拉利买牛奶,Bob 会按需调度模型,他还谈及智能体市场变化与风险。
GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式
随着AI生图能力提升,如何让AI进入创作流程成新问题。兔展智能基于UniWorld - Design视觉AI大模型推出RabbitVis,推动视觉AI从图片生成走向可编辑、可交付的创作流程,解决创作流程断点问题。
Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率
Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。
视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆
2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。
中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考
上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。
无需 OCR 就能从各类文档中提取结构化信息的本地化开源工具docext
docext是无需OCR的本地化开源工具,能从发票、护照等文档图像提取结构化信息。智能文档处理排行榜评估VLMs在多任务表现,docext有灵活提取、表格提取等功能。
Copilot 创始工程师:大多数 AI 编码“就像开着法拉利去买牛奶一样
GitHub Copilot 创始工程师 Neel Sundaresan 正在构建 IBM Bob 智能编码工具,已有 8 万 IBM 开发者使用。他认为多数 AI 编码成本高,Bob 会按需调度模型。他还对智能体 AI 市场发表了看法,指出其有价值也有风险。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。