学习提升」共找到 3893 篇相关文章

算法论文8

PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器

本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。

力学与人工智能
算法论文8

ICML26 | 浙江理工大学马啸讲师和南京大学李武军教授课题组联合提出EMCES:为强化学习合成更有价值的样本

强化学习获取高质量样本成本高、风险大,现有基于扩散模型的样本增强方法有局限。浙江理工大学马啸讲师和南京大学李武军教授课题组提出 EMCES,将情景记忆机制引入可控扩散模型,提升下游强化学习算法表现,论文已被 ICML2026 录用。

机器之心
算法论文7

逆强化学习全新视角的大模型对齐技术

文章从逆强化学习(IRL)视角回顾LLM对齐进展。先介绍强化学习基础及挑战,将LLM生成过程化为MDP,探讨无奖励函数的MDP,说明需神经奖励模型,还阐述通过奖励建模实现IRL及多种优化方法。

PaperAgent
算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型。

量子位
新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
推荐文章8

刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升

翁荔新博客聚焦Harness Engineering,梳理围绕‘Harness自我优化’的研究,探讨递归式自我提升发生层面,还指出自动化研究和自我提升系统面临的瓶颈,如评估标准模糊、奖励作弊等。

机器之心
算法论文8

微调已死?Google 和斯坦福论文指出AI 学习新范式

Google的ReasoningBank和斯坦福的ACE两篇新论文引发热议,二者都在解决让AI系统真正学会学习的问题。前者是经验管理系统,后者让输入上下文进化,都绕开微调探索AI持续学习与自我改进能力。

AI工程化
推荐文章7

科学进步实际上很大程度依赖于实打实的实验结果,而不仅仅是理论智力|AI 自我提升不会突然“起飞”,而是逐渐加速的过程

如今未实现AI自我提升,一旦实现将是重大突破。但它不会突然飞跃,而是缓慢持续的过程。不同领域提升难度有别,科学进步受现实实验速度限制,AI自我提升更可能是缓慢加速进程。

宝玉AI
新闻资讯7

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界

9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习后训练发展。

AI前线
推荐文章7

“老程序员”为啥不迷信 AI 带来的效率提升?聊聊 AI 编码的局限与现实

开发经验丰富的人对AI编码提升效率更保守,因现有开发模式下,AI编程效率提升有限。特定场景AI给力,但项目复杂时提升迅速下降,还分析了原因,最后提到微服务架构或在AI编程时代重新火起来。

宝玉AI