文档图像解析」共找到 944 篇相关文章

算法论文8

ICCV 2025 | 小红书AIGC团队提出图像和视频换脸新算法DynamicFace

小红书AIGC团队提出图像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。

机器之心
产品应用7

Cursor就是最强知识库应用,没有之一

作者认为最好用的知识库应用是Cursor,它有RAG能力,能处理代码和纯文本,可创建修改文档,具备搜索能力且会及时支持先进模型。作者还分享用Cursor配合文档工作的规则及使用示例。

newtype AI
算法论文8

TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法

北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。

机器之心
开源动态8

训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO

混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。

量子位
开源动态8

不堆参数堆架构,这个8B开源模型把图像理解和生成统一了

商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在多项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构。

量子位
新闻资讯8

谷歌「最强图像模型」横扫一切!3毛钱P图打懵OpenAI,PS要不存在了

谷歌发布顶级图像模型Gemini 2.5 Flash Image,化身nano - banana在LMArena盲测夺冠。它有四大能力,价格低至每张图不到3毛钱,冲击传统P图工具,虽有小瑕疵但应用前景广。

新智元
推荐文章8

深度解析大模型技术演进脉络:RAG、Agent与多模态的实战经验与未来图景

大模型作为产业变革核心引擎,RAG、Agent与多模态技术重塑AI与现实交互边界。本文解析技术演进脉络、实战经验与未来图景,介绍三者在各领域应用及面临挑战,为产业升级提供指引。

腾讯技术工程
产品应用8

代码智能体占领GitHub!自动修bug、加功能、写文档,一台手机就能指挥

GitHub上新代码智能体Copilot Coding Agent,可自动修bug、加功能、写文档,开发者评价很棒。在手机APP就能操作,还能同时分配多任务。微软宣布VSCode中GitHub Copilot将开源,还发布多项新功能。

量子位
新闻资讯8

AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入

AI生图有新突破,新模型FLUX.1 Kontext用流匹配架构,与此前技术不同,能接受文本和图像输入。其来自Black Forest Labs,有编辑和生成能力,还具备4个特性,第三方测试也给出提示词使用技巧。

量子位
产品应用8

jina-reranker-v3刷新全球重排榜,效率狂飙4.79%

jina-reranker-v3作为LLM时代向量模型,提出“最后但不晚”交互机制,解决文档检索效率与效果权衡、多语言文档重排性能与效率平衡、模型泛化能力和适应性等问题,架构与训练方案有创新。

CourseAI