「图像理解」共找到 1169 篇相关文章
每一幕皆可控!字节发布多主体视频生成神器,人人皆主角
字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。
扣子 Agent 创作者榜单 - 2025.4
2025 年大模型和 Agent 渐入大众视野,虽大家对 Agent 理解有别,但它落地效果和想象空间大。扣子用户达百万级,此次发布最新创作者榜单,后续还将发相关内容。
当AI让答案唾手可得,学而思想把学习过程找回来
AI让答案不再稀缺,学生面临新挑战。7月3日学而思发布2026旗舰新品,提出学习机应陪孩子理解、练习、进步,将诊断、学习等环节连成路径,强调不替孩子学,保护学习过程。
4.3亿听障人士的福音,哥大团队研发脑控助听器,最高增益12分贝
哥伦比亚大学等机构团队研发实时闭环脑控听力系统,发表于Nature Neuroscience。该系统解码大脑注意力信号,放大目标人声、压制杂音,打破传统助听器瓶颈。经多项测试,效果显著,临床应用潜力大。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
AI能改10万行代码,却让你走路去洗车!Karpathy戳破「锯齿状智能」
Karpathy在Sequoia AI Ascent 2026炉边谈话指出,AI能力呈锯齿状,背后是经济学问题。他还提及软件新地平线,认为Vibe Coding抬高编程地板,专业开发需智能体工程,人类在智能体时代是工程导演。
第 4 章 Agent 开发实战
本章面向理解大模型、会 Python 但未系统搭建过 Agent 的工程师,采用「概念 → 最小示例 → 可运行项目」结构,介绍 Agent 开发实战,涵盖 LCEL 拼装、工具暴露等内容,还说明了开发环境搭建方法。
不会拍照有招了!北大彭宇新团队开源首个美学指导大模型Venus,帮你拍好照|CVPR 2026
北大彭宇新教授团队针对现有大模型在摄影指导上的不足,定义美学指导任务,构建数据集AesGuide,提出美学指导大模型Venus。相关论文被CVPR 2026接收并已开源,Venus在多项评测中优于现有方法。