高保真图像处理」共找到 1416 篇相关文章

开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理长音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
开源动态8

10.2k星!Firecrawl开源PDF解析神器,大幅降低OCR成本

处理PDF时,若全用OCR成本和延迟会增加,直接提取文本又易遇乱序、乱码等问题。Firecrawl开源的pdf - inspector工具能智能区分扫描版和文本版PDF,按需使用OCR,精准处理

开源AI项目落地
开源动态8

PDF解剖大师来了!LandingAI开源神器,这个Python库让百页文档秒变结构化数据!

复杂文档处理是数据分析痛点,传统方法常因布局复杂失准。LandingAI团队在GitHub开源Python库Agentic - Doc,可从复杂文档提取结构化数据,支持多格式,新增多项功能,提升处理效率和准确性。

开源星探
开源动态8

最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频

今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。

量子位
开源动态8

仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!

剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。

PaperAgent
产品应用7

GPT-Image2提示词:瞬间拥有顶级字体美学

文章介绍了利用GPT - Image2生成顶级字体美学图像的提示词。创意源于博主「小小东」,作者也打磨了自己的提示词。详细阐述了提示词使用方法、生成图像的各项要求,如文字突出、风格自适应等。

AI寒武纪
产品应用7

The Batch:834 | 更一致的人物与风格

德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。

DeeplearningAI
算法论文8

CVPR 2026 ReSAM:每个目标只标1个点,SAM就能学会分割遥感图像

CVPR 2026收录论文《ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Images》,提出让SAM每个目标只标1个点,通过R³循环自己生成高质量伪标签训练。在WHU建筑数据集上,1点标注与全监督差距仅1.3%,省99%标注成本。

机器学习AI算法工程
算法论文8

任意图像+视频=无限创意!港科大BiCo:AI视频进入组合时代,随意换角

BiCo是创新AI视觉内容生成方法,能灵活组合图像和视频视觉概念实现可控编辑。它解决现有方法在概念提取和组合上的问题,在多方面表现优异,可用于视频制作、艺术创作等领域。

新智元