高保真图像处理」共找到 1416 篇相关文章

产品应用8

字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?

文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。

CourseAI
新闻资讯8

12秒生成1万token!谷歌推出文本「扩散模型」Gemini Diffusion,研究员:演示都得降速看

谷歌将图像生成常用的“扩散技术”引入语言模型,推出Gemini Diffusion,12秒能生成1万tokens,速度比Gemini 2.0 Flash - Lite更快。它通过逐步优化噪声学习生成输出,目前是实验性演示,可申请体验。

量子位
算法论文8

RAG 2.0 深入解读

文章深入解读RAG 2.0,指出其虽在多行业落地,但面临多模态处理、检索质量等挑战。还介绍架构升级,阐述检索、重排序等关键技术,最后探讨统一多模态大模型、安全等发展方向及挑战。

阿里云开发者
新闻资讯7

OpenAI发布GPT‑6 Astra:百万级上下文,主攻编程和复杂办公

9月3日,OpenAI发布GPT - 6 Astra,重点提升电脑操作、软件开发和复杂工作处理能力。它有诸多更新,如电脑操作提速、支持异步工具调用等,但也存在监测难、价格高的问题,实际效果待验证。

AIGC开放社区
产品应用8

全球首款!Claude引发的数据恐慌,被这家中国黑马补上了

威努特作为网络安全公司跨界推出AI桌面助手WinClaw。它能读懂各类文件并进行向量化处理,有多种检索方式,还能跨文档归纳、关系推理。具备安全的三层防护,支持双平台,注册即可用。

新智元
新闻资讯7

告别传统存算分离,AI时代数据底座迎来全新底层逻辑

文章围绕AI时代数据底座变革展开。指出传统大数据平台难适配AI,存在数据够不着、模型用不好等问题。阐述AI时代基础设施变化,如数据形态、计算模式等。还探讨底座升级条件、存储挑战、算子价值及未来标准层等内容。

AI前线
新闻资讯7

DeepSeek多模态真的来了?识图模式已开始小范围灰度

4月29日,DeepSeek多模态团队负责人陈小康在X发布动态暗示多模态进展。部分用户在DeepSeek官方App灰度到“识图模式”,这是其主线产品首次有图像理解能力模式,此前多模态人才有流失,官方未说明开放细节。

DeepTech深科技
算法论文8

CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情

多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。

机器之心
算法论文8

4步生图封神,GenEval从61%狂拉到92%,全面超越GPT-4o的TDM-R1模型来了

香港科技大学唐靖团队等提出全新通用强化学习框架 TDM - R1,仅 4 步采样就让组合式生成指标 GenEval 从 61% 升至 92%,超越 GPT - 4o。它解决少步扩散模型痛点,实现多方面性能提升,为少步生图发展带来新方向。

机器之心
产品应用7

Meta发布Muse Spark,MSL的首份答卷!Alexandr Wang通过了吗?

Meta发布Muse Spark,是MSL首个模型,经九个月技术栈重构,效率优先。它有原生多模态推理能力,Contemplating模式处理复杂查询,安全评估突出,产品功能升级,商业化转向明显,正逐步在Meta应用推出。

AI工程化