语境学习能力」共找到 4248 篇相关文章

算法论文8

免训练加速61倍!陈怡然团队新作DPad:仅关注「彩票token」

杜克大学陈怡然团队新作DPad,发现扩散大语言模型关注少量「中奖」token,推理速度可提61 - 97倍,还增强模型语境学习能力。DPad免训练零成本挑关键信息,实现「少算多准」。

新智元
开源动态8

让AI自己“炼数据”!DataChef开源:用强化学习自动生成LLM数据配方

上海人工智能实验室联合复旦大学开源DataChef,它能通过在线强化学习自动生成LLM数据配方。实验显示其能力逼近Gemini - 3 - Pro,超越人类专家设计算法,解决传统数据工程难题,推动大模型数据工程迈向新范式。

OpenMMLab
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
算法论文8

监督学习未死,一题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用一题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
推荐文章7

刘润没说透的:AI时代,你要迁徙的不是产品,是能力

刘润年度演讲刷屏,讲了企业的大迁徙,但作者认为普通人更关键的是能力迁徙。纯执行类能力在AI时代贬值,而判断力、提问力、审校力等新能力变得重要,各领域能力正从‘执行者’向‘判断者’转变。

花叔
算法论文8

量化噪声竟是RL秘钥?QeRL:高效强化学习新范式,一场噪声引发的性能革命

近年来,大语言模型在复杂推理任务中面临挑战,强化学习虽更接近人类推理过程,但训练“烧资源”。论文《QeRL》提出量化不仅能压缩模型、节省资源,还能增强模型探索能力,QeRL框架实现训练速度提升、内存占用减半。

深度学习自然语言处理
推荐文章7

假设 AI 未来真的能在写代码和系统设计上超过人类,那还有必要学习编程和系统设计吗?

文章围绕AI未来在编程和系统设计上能否超人类展开探讨。分析AI编程效率未达预期的原因,指出短期内不会有完全面向AI的软件架构,还强调学习编程和系统设计知识可培养解决问题的能力

宝玉AI
算法论文8

强化学习大本营新作:如何破解「学新忘旧」困局

阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。

AI科技评论
算法论文8

经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning

该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。

深度学习自然语言处理
算法论文8

AI已迷失方向?强化学习教父Sutton最新发布OaK架构,挑战当前AI范式,提出超级智能新构想

强化学习教父理查德·萨顿认为人工智能发展已迷失方向,提出OaK架构回应探寻真正智能的需求。该架构是基于模型的强化学习架构,具备组件持续学习等特点,为通用人工智能指明路径,但面临持续学习和特征生成挑战。

AI科技大本营