视觉外观编辑」共找到 874 篇相关文章

算法论文7

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。

机器之心
开源动态8

微软开源2周狂赚7.2K star!!轻量好用命令行编辑利器,程序员力荐!

微软开源命令行文本编辑器`Edit`,专为Windows Terminal设计,支持多系统。它轻量高效,功能丰富,兼容Windows生态,还有鼠标模式。开源半月获7.2K+ star,提供多种安装方式。

开源先锋
开源动态8

Meta刚刚开源DINOv3,横扫60+任务,无标注封神!

今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。

AIGC开放社区
开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
算法论文8

细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈

香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。

量子位
算法论文8

StereoAdapter:北大首提自监督,适配水下双目深度估计

水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。

新智元
算法论文8

ICCV 2025 | FDAM:告别模糊视界,源自电路理论的即插即用方法让视觉Transformer重获高清细节

针对视觉 Transformer(ViT)‘低通滤波’特性致细节丢失问题,北京理工大学等团队提出即插即用的 FDAM 模块。它受电路理论启发,能提升模型在分割、检测等任务性能,取得 SOTA 效果,有巨大应用潜力。

机器之心
算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
开源动态8

MeshCoder:以大语言模型驱动,从点云到可编辑结构化物体代码的革新

生成式AI在三维空间面临挑战,传统3D生成成果粗糙难编辑。团队推出MeshCoder,将三维输入翻译成结构化代码,有分部件生成等优势。介绍其实现路径、实验性能,也指出局限并展望未来。

机器之心
开源动态8

这个项目专治建模手残党,给张图就能转变可编辑能转动的3D模型

img2threejs上线11天获4.8k Star,专治建模手残党。给它一张图,它让AI写代码把物体“搭”出来,不重建几何,也不下素材包,还省Token、零依赖,有严格质量门控。

GitHubStore