「生成式推理」共找到 4258 篇相关文章
ICCV 2025 | 基于时序增强关系敏感知识迁移的弱监督动态场景图生成
北大王选所团队发表论文 TRKT,针对弱监督动态场景图生成任务目标检测质量瓶颈,提出时序增强关系敏感知识迁移方法,含关系敏感知识挖掘和双流融合模块,实验证明能提升场景图生成质量。
简单即强大:全新生成模型「离散分布网络DDN」是如何做到原理简单,性质独特?
本文作者杨磊介绍全新生成模型离散分布网络DDN,它建模目标分布机制简洁独特,有零样本条件生成等特性。文中详述其原理、网络结构、损失函数,还展示实验效果,最后给出未来研究方向。
思维链推理是一种脆弱的‘海市蜃楼’,一旦超出训练分布,它便会消失。| 直播预约
思维链提示能提升LLM在多任务上的表现,让人感觉模型在深思熟虑。但研究从数据分布角度剖析,发现思维链推理是脆弱的‘海市蜃楼’,超出训练分布就会消失,强调实现通用推理能力挑战大。
Qwen3-Next:迈向更极致的训练推理性价比
文章发布Qwen3-Next架构及Qwen3-Next-80B-A3B系列模型,通过混合注意力等改进提升训练推理效率。介绍模型结构、性能优势,还说明使用方法,包括在多平台部署及处理超长上下文,展望持续优化架构。
机器人「看片」自学新技能:NovaFlow从生成视频中提取动作流,实现零样本操控
布朗大学和机器人与人工智能研究所团队提出 NovaFlow 框架,利用视频生成模型常识知识,让机器人“看片”自学。它将任务理解与控制解耦,通过生成视频提取动作流,实现零样本操控,为通用机器人提供新路径。
海外华人15人团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑
海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,在多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华人团队打造。
西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026
AI 视频生成目前存在长视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升长视频生成质量,且具跨模型通用性,还揭示了问题机制,降低算力成本。
边打字边出片,交互式生成长视频!英伟达联合MIT开源新SOTA
AI拍长视频不再难!英伟达联合MIT推出LongLive,可实时交互生成流畅画面,解决传统方法卡顿、不连贯等痛点。它能生成15秒到240秒视频,性能达SOTA,还靠三把“钥匙”解决长、顺、快难题。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
谷歌一篇论文引爆存储芯片崩盘!AI内存需求暴降6倍,推理狂飙8倍
谷歌发布TurboQuant算法,将缓存压到3 - bit,内存占用降为1/6,推理速度提升8倍。该算法冲击存储巨头,引发股价下跌,虽目前未改变采购量,但改写推理成本,且从论文到落地的路在缩短。