机器学习建模」共找到 1771 篇相关文章

算法论文8

奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”

强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。

OpenMMLab
新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
算法论文8

微调已死?Google 和斯坦福论文指出AI 学习新范式

Google的ReasoningBank和斯坦福的ACE两篇新论文引发热议,二者都在解决让AI系统真正学会学习的问题。前者是经验管理系统,后者让输入上下文进化,都绕开微调探索AI持续学习与自我改进能力。

AI工程化
新闻资讯7

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界

9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习后训练发展。

AI前线
算法论文8

PRF | 宾州州立、南科大杨翔、张雯等:粗糙壁湍流的低维建模新范式

传统粗糙壁湍流低维建模依赖经验参数,泛化与精度不足。该研究提出新思路,将粗糙面形貌压缩到低维流形,用自动编码器和前馈神经网络建模,重构效果好、预测准,有生成与泛化性。

力学与人工智能
算法论文8

奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式

上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。

量子位
算法论文8

DeepMind 颠覆机器学习范式:让机器像人一样 “自由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段后训练方法,含监督微调与自我提升。实验显示该方法让机器人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论
新闻资讯7

ChatGPT大更新推出学习模式!“一夜之间1000个套壳应用又死了”

ChatGPT大更新,推出学习模式,像老师般引导思考,对多类用户开放。它由OpenAI与多方合作打造,结合学习科学成果。目前用提示词实现,未来会训练进模型,还将多方面改进,或重塑教育模式。

量子位
产品应用7

当AI让答案唾手可得,学而思想把学习过程找回来

AI让答案不再稀缺,学生面临新挑战。7月3日学而思发布2026旗舰新品,提出学习机应陪孩子理解、练习、进步,将诊断、学习等环节连成路径,强调不替孩子学,保护学习过程。

机器之心
开源动态8

手把手带你入门机器学习,HuggingFace联合牛津大学新教程开源SOTA资源库

HuggingFace与牛津大学研究者推出机器学习教程,附带开源数据集、模型等的LeRobot库。教程从经典机器人学讲起,介绍强化、模仿学习及通用策略,还提及解决现实瓶颈的技术与前沿模型。

机器之心