「图像自动着色模型」共找到 1015 篇相关文章
最低仅需2G显存,谷歌开源端侧模型刷新竞技场纪录,原生支持图像视频
今天凌晨,谷歌官宣Gemma 3n,原生支持多模态。它在大模型竞技场超1300分,是首个超此分数的10B以下模型。其VRAM占用低,最低2GB,已在谷歌AI Studio等可用,还公开了技术细节。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
GPT-Image2提示词:瞬间拥有顶级字体美学
文章介绍了利用GPT - Image2生成顶级字体美学图像的提示词。创意源于博主「小小东」,作者也打磨了自己的提示词。详细阐述了提示词使用方法、生成图像的各项要求,如文字突出、风格自适应等。
The Batch:834 | 更一致的人物与风格
德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。
CVPR 2026 ReSAM:每个目标只标1个点,SAM就能学会分割遥感图像
CVPR 2026收录论文《ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Images》,提出让SAM每个目标只标1个点,通过R³循环自己生成高质量伪标签训练。在WHU建筑数据集上,1点标注与全监督差距仅1.3%,省99%标注成本。
任意图像+视频=无限创意!港科大BiCo:AI视频进入组合时代,随意换角
BiCo是创新AI视觉内容生成方法,能灵活组合图像和视频视觉概念实现可控编辑。它解决现有方法在概念提取和组合上的问题,在多方面表现优异,可用于视频制作、艺术创作等领域。
破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩
影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。
让图像生成告别 AI 味!清华 + 港中大 + 腾讯混元联手推出SRPO
腾讯混元联合港中大、清华推出SRPO,解决文生图技术痛点。它结合Direct - Align和SRPO,提升图像审美等,训练时间缩至十分钟,在测试中碾压主流方法,不过对冷门风格控制和机制可解释性待提升。
1.1K Star!告别单打独斗!让 AI 自己组建开发团队,自动分工、沟通、合并成果!
当前单个AI Agent编程有局限,遇到复杂项目力不从心。开源项目ClawTeam-OpenClaw是多智能体群智协作框架,让AI团队协作,解决了单个AI上下文窗口有限等问题,还具备自组织、工作区隔离等亮点。
登上 GitHub 日榜 TOP5,收获 1.2 万标星的自动剪辑视频开源工具。
video-use是browser-use团队开源的自动剪视频项目,登上GitHub日榜TOP5、获1.2万标星。它改变剪辑交互方式,让用户描述意图,有智能剪辑、调色等功能。技术亮点是双层读取系统,成本和效率更优。