「文档图像质量评估」共找到 1317 篇相关文章
BIGAI & 中科大团队提出 MILR: 测试时隐空间推理,让图像生成学会「边想边改」丨ICLR 2026
BIGAI与中科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化图文表示,提升复杂图像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究
大语言模型驱动的搜索智能体有能力但效率低。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟降低,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。
DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro
DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。
谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束
消费级3DGS应用走向普通用户,但需精确位姿约束,过去靠LiDAR,成本高。如视Argus入选ECCV 2026,能从图像预测位姿等,为3DGS提供精准约束,推动其走向低成本采集时代。
一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一
文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。
OpenAI新Agent遭中国24人初创团队碾压!实测成本、质量全输惨,海外用户:中国Agent代差领先
今日凌晨,OpenAI 推出 ChatGPT Agent 新功能,能让 AI 助手完成多步骤任务。虽官方称其性能先进,但实际效果有局限。海外用户将其与中国团队产品对比,发现中国 24 人初创团队产品成本、质量更优。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
5B参数+4060Ti,10秒出图,全流程开源可复现!补齐统一多模态生成编辑的开源版图,让高质量图像生成真正变得更轻量、更普及
近日,多机构联合发布统一多模态生成编辑模型DeepGen 1.0,仅5B参数,集成五大能力,4060ti 16G上10秒出图,多项指标超大4倍工业级模型。团队开源全流程代码与数据,可从零复现。
4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25
扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。