「图像处理」共找到 1383 篇相关文章
全球首个多智能体Eigent开源!内置200+MCP,支持SSO企业级
OWL团队开源多智能体Manus类工具Eigent,能多智能体协作处理复杂任务。它可整合工具和数据,处理任务时清晰拆解执行。有多种预定义智能体,内置200+MCP工具,还支持人工干预。
一块画板,Nano Banana,无限创意:谷歌新工具实测
谷歌Labs推出AI概念板Mixboard,由Nano Banana图像模型驱动,整合Gemini 2.5 Flash模型。可上传个人图像混合编辑,适合设计师等。现仅在美国公开测试,速度快,操作便捷,能高效验证想法。
把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱
作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。
NVIDIA 推出Rubin CPX,专为AI推理设计的GPU
NVIDIA发布专为大规模上下文AI推理设计的Rubin CPX GPU,性能提升显著,集成视频编解码器和长文本推理处理。新平台算力强,适用于代码生成与视频处理,多家公司将采用,2026年底上市。
The Batch:927|极速扩散学习
研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
SFT+RL双管齐下:ReasonGen-R1如何破解文生图「指令不遵」难题?
上海科技大学等机构提出 ReasonGen-R1 框架,结合链式推理监督微调与强化学习,提升自回归图像生成模型推理和创作能力,已全面开源。介绍了其训练阶段、实验结果及推理链模式。
离谱!我以为 OCR 还在一页页抠字,结果百度 1.2 万 Star Unlimited-OCR 直接把长文档一口气读完
百度开源的Unlimited - OCR项目目标是处理图片、长文档等资料,将其转化为Markdown等结构化结果。它提供多入口,解决传统OCR处理长文档的问题,有多种应用方向,但也有边界。
多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案
上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像到图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。
性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令
现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。