「单图像3D重建」共找到 1059 篇相关文章
4K超分Agent修图师来了!一键救活所有模糊照片
传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。
LangChain官方实测:多智能体架构怎么选?
构建AI Agent时,单智能体应对复杂场景易“变笨”且难维护。LangChain官方评测主流多智能体架构,在复杂零售场景实验,对比单智能体、Swarm、Supervisor架构的性能、成本,还给出优化Supervisor架构的方法。
字节跳动开源超强USO模型,AI绘图六边形战士来了
在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,化解此难题,且已全面开源。
重磅开源!240亿参数力压Nano Banana 2
4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体化图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。
好玩!AI模仿人类‘空像错觉’,开启想象力之旅
越南国立大学提出Shape2Animal框架,模仿人类‘空想性错觉’,将自然物体轮廓转化为动物图像。该框架经多阶段流程,结合多种技术生成画面,但也继承了基础模型的一些局限性。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
从聊天窗口到多 Agent 控制台:一次 AI 编程协作范式的转移
作者分享了从单 Agent 协作到多 Agent 协作的编程范式转变。当前主流 AI 开发多为单 Agent 协作,效率低,作者设计了 Mexus 工具,解决多 Agent 协作、观测、Review 等问题,重塑人与 AI 协作关系。
Qwen新开源,把AI生图里的文字SOTA拉爆了
通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在多基准测试达SOTA。
Kimi K3设计榜登顶焚诀公开:就藏在思维链里
Kimi K3在Design Arena单次生成前端榜单中夺冠。它做前端设计审美一流,靠独特思维链反复迭代优化方案,还具备强大数据索引能力。不过上线48小时因算力不足叫停新订阅。
The Batch: 948 | GLM 5.1:面向长时任务的能力提升
Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。