「生成式过程监督」共找到 2594 篇相关文章
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
CVPR 2025 | 如何稳定且高效地生成个性化的多人图像?ID-Patch带来新解法
本文围绕个性化多人图像生成展开,指出其面临身份特征泄露等挑战。介绍了早期方法的不足,提出全新的ID-Patch方案,阐述其设计思路、实验效果等,还探讨了提升空间与未来方向,该方案在多人物图像生成中有突破式提升。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?
AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据集、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。
太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗
火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。
标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估
Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。
监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力
清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。
业界首个高质量原生3D组件生成模型来了!来自腾讯混元团队
腾讯混元3D团队推出业界首个高质量原生3D组件生成模型Hunyuan3D - Part。现有3D生成算法有局限,该模型提出新范式,含P3 - SAM和X - Part,在多数据集评估中超越现有工作,还给出体验地址和论文地址。
Alibaba力作:Ovis-U1 融合理解、生成与编辑,解锁无限可能
OpenAI 2025 年推出的 GPT - 4o 结合图像与语言能力,但引发视觉解码器设计及统一模型训练问题。Alibaba 力作 Ovis - U1 单一模型能完成理解、生成与编辑任务,介绍了其架构、训练过程和应用。
GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画
上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。