「自回归扩散框架」共找到 1996 篇相关文章
启发学习:让大模型认知从外化到内生
当下大模型能力多靠人为框架,能力上限受限。文章提出“启发学习”,将其集成到推理侧成Isaac框架,通过Prompt与网络层注入复用旧经验,实验显示能大幅提升大模型任务性能。
人类创造力的核心机制,AI已经开始掌握了 | 北大CogSci 2025(Oral)
北大团队论文揭示AI开始掌握人类创造力核心机制,提出IEI框架量化评估AI组合创造力。研究发现GPT - 4等在创意理解超普通人,框架优化可提升AI创意输出质量,论文被CogSci 2025收录。
首个完整开源的生成式推荐框架MiniOneRec,轻量复现工业级OneRec!
中科大LDS实验室与Alpha Lab团队联合开源MiniOneRec,是生成式推荐首个完整端到端开源框架。它验证生成式推荐Scaling Law,可轻量复现OneRec,提供一站式训练与研究平台,技术优势明显。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。
蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得
蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。
上交大 × 华为小艺推出LoPA:7B扩散语言模型单样例1000+ tokens/s!
上海交通大学DENG Lab联合华为小艺团队提出无需训练的解码算法LoPA,配合自研的LoPA - Dist分布式推理系统,显著提升扩散大语言模型(dLLMs)的推理并行度和吞吐量,将推理效率推向新高度。
深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?
本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架问世
北京航空航天大学团队发布面向通用遥感目标检测的大规模数据集与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据集,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。
博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究
西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。
「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型
它石智航联合六大顶尖机构推出OmniVTA视触觉操作框架和OmniViTac大规模视触觉数据集。该框架核心是从被动感知到主动预测触觉,通过多模块协同让机器人有预测、理解和修正能力,实验表现优。