「文本提示图像分割」共找到 1241 篇相关文章
AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型
文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。
Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨
2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。
AI开始玩乐高了?我拼一小时的乐高,它几秒就搭好,LegoGPT开源了!
卡内基梅隆大学提出LegoGPT,是首个依文本提示生成物理稳定乐高积木模型的方法。构建了StableText2Lego数据集,训练自回归大模型生成设计,还开发纹理生成法,设计能手动或机器人组装。
英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来
英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。
Being-VL的视觉BPE路线:把「看」和「说」真正统一起来
北大、UC San Diego 和 BeingBeyond 联合提出 Being-VL 的视觉 BPE 路线,先将图像离散化并「分词」,再与文本统一建模,能缩短跨模态链路、保留视觉结构先验,还介绍了实现步骤、训练方式等。
Meta再推WorldGen,简单一句话,竟「盖」出50×50米一座城
Meta推出WorldGen,可根据文本提示生成可探索的3D世界。它融合多项技术,能生成50×50米完整纹理化场景,保持风格与几何一致。虽处于研究阶段,但成果可兼容主流游戏引擎,有降本增效潜力。
震撼,世界模型第一次超真实地模拟了真实世界:谷歌Genie 3昨晚抢了OpenAI风头
昨晚谷歌DeepMind宣布Genie世界模型到第3代,能通过单个文本提示词创建交互式、可玩环境。它在多方面优于前代及其他模型,具备构建完整世界能力,但也存在动作空间有限等局限,未来应用值得期待。
CVPR 2026 | 谷歌DeepMind重磅开源多模态TIPSv2:实现Patch-Text对齐的最优表现
谷歌DeepMind推出多模态TIPSv2,解决图像块与文本嵌入对齐难题。它有三大核心技术创新,在9项任务和20个数据集表现出色,特征图优势显著,且配套生态完善,为AGI预训练指明方向。
GPT-image-2十大最强玩法实操:夯到爆炸
OpenAI全量上线GPT Image 2,其表现远超其他模型。它优势明显,如真实感与细节强、文本渲染准确、自带“思考”能力。文章还给出其十大玩法实操及提示词,涵盖图文组合、海报生成等。
实测惊艳全球的Veo3!音画同步无敌,贵是有原因的
谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。