「文本转图像」共找到 940 篇相关文章
“看懂”指令并做动作!Motion-R1结合COT让角色动起来
大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。
Liblib AI上线Kontext,门槛大幅降低!藏师傅手把手教你用它解决图片问题
FLUX的Kontext是强大的图像编辑应用,除不能写中文外近乎全能。Liblib AI上线FLUX Kontext,支持Web UI和Comfyui,无需本地跑Comfyui,还能结合Liblib生态处理图片。作者给出保姆级使用教程。
DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!
昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。
2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高
高分辨率航空图像小目标检测难,传统检测器表现差。2026年4月都灵理工大学团队提出ASAHI,用自适应切片框架,在VisDrone2019上mAP50达56.8%,推理速度比SAHI提升20 - 25%,还介绍了实战代码等。
国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab
现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。
MMX-CLI给AI Agent装上七种感官,内容创作更方便
MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。
一张图生成任意场景3D模型,部分遮挡也不怕|IDEA x 光影焕像联合开源
IDEA研究院张磊团队与香港科技大学谭平团队联合推出SceneMaker框架,以DINO - X与Triverse为基础,实现从任意开放世界图像到带Mesh的3D场景完整重建,解决遮挡难题,有多项创新,应用场景广泛。
西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速
扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。
利用Loop语言模型扩展隐式推理 | 直播预约
当前大语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。
从CLI原理出发,如何做好AI Coding
文章从CLI原理出发探讨AI Coding,介绍CLI产品美学、技术原理,比较Single Agent与Multi Agent,还给出用好CLI写代码的建议,如正确认识AI、学习Prompt工程等,最后提及利用通义万相AIGC实现图像生成。