文档图像质量评估」共找到 1317 篇相关文章

算法论文8

EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案

近年来,扩散模型在视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,在多模型实验中实现大幅提速且视频质量几乎无损,为技术落地提供基础。

机器之心
新闻资讯8

独家解读|2025年AI五大趋势与底层数据革命

2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。

机器之心
推荐文章8

评论送书 | Code Agent实战案例——用Pywen Agent、Claude Agent和Codex Agent从零开始构建一款网页游戏

本文展示用三大Code Agent依斯特鲁普效应构建网页游戏,对比其表现,还介绍让AI做测试方案、写文档,体现Code Agent在快速原型开发全生命周期的应用,还推荐相关书籍解答不同人群疑问。

AIGC开放社区
产品应用7

我玩过的所有龙虾里,和飞书结合最好的就是它了,没有之一

作者分享ArkClaw使用体验,它与飞书结合佳,配置快。能读飞书文档、查日程,联网搜索用字节搜索引擎,还可装Skill生成报告等。虽有不足,但对中文用户实用,Coding Plan用户可免费体验。

AI产品黄叔
开源动态7

OCR又出宠OpenDoc,速度超MinerU6倍

复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是超轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。

CourseAI
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
开源动态8

自回归因果注意力也能并行解码?上交联合UCSD突破LLM推理瓶颈,模型代码全开源

大语言模型推理速度是应用瓶颈,传统方法各有弊端。上交和UCSD团队提出Jacobi Forcing方案,无需重构架构,将AR模型转为并行解码器,提速显著且质量损失小,核心优势多,技术路线全链路优化,实测表现优。

机器之心
新闻资讯7

跑分第一,实战拉胯!GPT Image 1.5被骂惨,奥特曼这波悬了

OpenAI推出新一代旗舰图像模型GPT Image 1.5,生图能力强,免费用户可上手,开发者能调用API。它在跑分榜单成绩优异,但网友实测发现是‘高分低能’,引发吐槽。此外,其API价格降20%,此次更新是回击谷歌。

新智元
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
新闻资讯7

哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型

GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。

机器之心