图像定制化」共找到 1345 篇相关文章

算法论文7

The Batch:927|极速扩散学习

研究表明扩散图像生成器学习重建预训练编码器嵌入可加快训练,Apple团队提出的FAE,通过缩小嵌入再重建解决了因嵌入尺寸大导致的训练受阻问题,性能与先进模型相当且训练更快。

DeeplearningAI
开源动态8

SFT+RL双管齐下:ReasonGen-R1如何破解文生图「指令不遵」难题?

上海科技大学等机构提出 ReasonGen-R1 框架,结合链式推理监督微调与强学习,提升自回归图像生成模型推理和创作能力,已全面开源。介绍了其训练阶段、实验结果及推理链模式。

机器之心
算法论文8

AI Agent组团搞事:在你常刷的App里,舆论操纵、电商欺诈正悄然上演

上海交大和上海人工智能实验室研究发现,多Agent系统中AI有群体恶意共谋风险。其开发MultiAgent4Collusion框架模拟作恶,发现去中心团伙作案效果更好,还能应对现有防御体系。研究为研发防御策略提供工具。

机器之心
算法论文8

多模态推理新范式!DiffThinker:用扩散模型「画」出推理和答案

上海人工智能实验室等团队提出全新生成式多模态推理范式,发布模型 DiffThinker。它打破传统定式,以图像图像生成任务重构推理过程,在多项复杂任务中表现优于顶尖闭源模型,有四大核心特性。

机器之心
算法论文8

拒绝Reward Hacking!港科联合快手可灵提出高效强学习后训练扩散模型新范式

使用强学习微调扩散模型时,常面临Reward Hacking和KL正则阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则和多样性感知优,解决痛点且全面开源。

机器之心
推荐文章7

中国ToB软件公司想赚钱,先对AI Coding祛魅

文章指出AI Coding产品虽对专业开发者提效,但服务公民开发者时存在问题。对比‘Code + GenAI’与‘No Code + GenAI’,认为无代码平台更适配公民开发者,虽面临挑战,但短期内是企业软件定制最优解。

InfoQ
推荐文章7

第十一章 Deep Agents 实战——数据分析与报告生成

本章介绍构建营销内容 Agent,能分析产品数据、生成营销文案等。核心技术有结构输出、多 Skill 水平组合、模拟数据分析。还对比传统营销与 Agent 流程,展示结构输出优势及数据驱动决策方法。

CourseAI
开源动态8

字节跳动开源超强USO模型,AI绘图六边形战士来了

在AI图像生成领域,风格和主题驱动的图像生成一直脱节。字节跳动智能创作实验室推出USO模型,构建海量数据集,设计两阶段训练法,引入风格奖励学习范式,解此难题,且已全面开源。

AIGC开放社区
开源动态8

重磅开源!240亿参数力压Nano Banana 2

4月初,京东探索研究院开源JoyAI - Image - Edit图像模型。它是业内首个将「空间智能」写进底层的开源一体图像模型,能让模型「理解空间,编辑空间」,在电商和具身智能场景极具价值。

新智元
开源动态8

狂涨 36.9K star!!看看人家的开源微信机器人多优雅,微信、飞书、钉钉支持,效率飙升!

开源君介绍超火的开源项目`chatgpt-on-wechat`(CoW),它结合大模型与社交、办公平台,可定制。能接入多平台,支持多模型,处理多模态消息,有丰富插件,还能记忆会话、定制知识库。给出安装步骤。

开源先锋