文档推理」共找到 2339 篇相关文章

算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位
开源动态8

智谱GLM-OCR,0.9B开源即巅峰,复杂文档精准解析

智谱发布并开源GLM - OCR,以0.9B轻量级参数在多项基准取得SOTA。它解决视觉感知难题,具备视觉编码与语言解码协作架构,还可端侧与高并发部署,成本低,推动文档智能化处理升级。

AIGC开放社区
推荐文章8

无问芯穹曾书霖谈 AI 2.0 时代的大模型推理:从模型到硬件的协同优化

本文整理自无问芯穹总经理曾书霖博士在 2025 年 QCon 全球软件开发大会演讲。他介绍软硬件协同优化提升智能系统能效成果,结合华为昇腾集群实践,探讨 AI 推理系统演进趋势,还从云、端维度分享大模型推理实践与挑战。

InfoQ
开源动态8

通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%

文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。

GiantPandaLLM
产品应用8

马斯克挖不动的清华学霸,一年造出 “反内卷 AI”!0.027B 参数硬刚思维链模型,推理完爆 o3-mini-high

新加坡 Sapient Intelligence 推出小型模型 HRM,参数仅 2700 万却能解决复杂推理难题,其不依赖“思维链”,借鉴人类大脑工作方式。该模型准确率超先进思维链模型,推理能力强,具经济性,可提升任务效率。

InfoQ
开源动态8

DeepSeek倒逼vLLM升级!芯片内卷、MoE横扫千模,vLLM核心维护者独家回应:如何凭PyTorch坐稳推理“铁王座”

本文介绍了vLLM的发展,自开源后成科技公司首选推理引擎。因DeepSeek发布,团队转向其模型特性优化;还参与各芯片支持工作。vLLM靠PyTorch支持多硬件,同时拓展到多模态推理,面临竞争仍保持优势。

InfoQ
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
算法论文8

AAAI 2026 Oral | 大模型「爱你在心口难开」?深度隐藏认知让推理更可靠

合肥工业大学团队提出大模型存在‘隐藏的真伪认知’,论文让模型用此给推理‘打分’,过滤错误推理链。通过多层注意力头探测、构建预测器和新推理扩展策略,提升了推理链稳定性,实验效果优异。

机器之心
算法论文8

32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗

现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。

量子位
开源动态8

「百万级」视频推理数据集!30+顶尖高校联合发布

AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。

新智元