「复杂图表理解」共找到 1672 篇相关文章
字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?
文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。
一个运行了80年的算法,我们现在才真正理解它?
近80岁的单纯形法是优化领域基石,广泛用于包裹配送、飞机航线规划等,但此前没人能从理论上完美解释其高效原因。现在,Huiberts和Bach找到了谜题的最后一块拼图,不仅让算法更快,还从理论上解释了现象。
一个人,40 款应用、百万级用户,验证 MVP 这事,没那么复杂
AI独立开发者Hassan El Mghari 4年开发40多款AI应用,部分达百万级用户量。他分享开发全流程经验,指出开发者常犯发布慢、过度复杂化问题,强调用低成本验证MVP,从多渠道找需求。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
CVPR 2026|DROID-W:复杂室外动态场景,也能稳定SLAM
苏黎世联邦理工与微软团队提出 DROID - W 动态 SLAM 框架,即将发表于 CVPR 2026。它不预设动态物体,从多视角观测识别不可靠区域,还提出交替优化方案,在多个数据集表现优。
测完阿里的Accio Work,我理解了「一人跨国公司」为什么可能
作者体验阿里Accio Work后认为,它作为面向全球中小企业和创业者的企业级Agent,像出厂就懂做生意的团队,能让电商小白从零搭Shopify店,通用Agent难以做到,体现数据和场景壁垒。
智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析
智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。
Nature Computational Science | 香港城市大学韦业等:复杂系统深度主动优化
本文通过集成深度神经网络和树探索能力,提出神经网络代理模型引导树探索的主动优化方法。该方法在超2000维数值优化问题中找到全局最优,在多领域表现优于现有方法,为小样本、高维优化难题提供通用技术。
ICLR 2026惊现SAM 3,分割一切的下一步:让模型理解「概念」
9月12日,匿名论文‘SAM 3: SEGMENT ANYTHING WITH CONCEPTS’登陆ICLR 2026,外界猜测出自Meta。SAM 3定义了可提示概念分割任务,性能比之前系统提升至少2倍,在多基准测试获SOTA成绩,但也有人质疑是旧概念包装。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。