偏好强化微调」共找到 953 篇相关文章

新闻资讯8

演讲 | 强化学习之父 Sutton 隔空回应 Hinton:目前的 AI “理解不足,调参有余”

强化学习之父 Rich Sutton 在 UCLA 演讲《AI 的未来》,指出当下 AI“理解不足,调参有余”,是“脆弱的心智”。他定义智能,倡导建立统一心智科学,认为应从“人类数据时代”进入“经验时代”,还谈及 AI 政治与哲学。

AI科技大本营
算法论文8

4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法

大语言模型幻觉问题是部署难题,CMU等研究人员提出行为校准强化学习新方法,重新设计奖励函数。经训练,40亿参数模型幻觉抑制力超GPT - 5,实验证明该方法效果显著,还带来理论洞察。

机器之心
产品应用7

Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调

由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。

机器之心
新闻资讯7

前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA

Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。

AIGC开放社区
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化
新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键

Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。

Founder Park
新闻资讯7

大模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点

加州大学伯克利分校副教授、强化学习大牛Sergey Levine在博客指出,当前大语言模型(LLM)只是对人类大脑和思维的间接「扫描」,如同被困洞穴看人类智慧「投影」,无法代替真正思维。

机器之心
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
新闻资讯8

人脑细胞做成芯片打Doom!20万活体神经元自己探路杀敌,学习效率碾压深度强化学习

20万人类脑细胞组成“脑PU”学会玩《毁灭战士》,代码已开源。研究将活体神经元与三大强化学习算法对比,发现生物培养物学习效率全面超越算法。实验运行在Cortical Labs的CL1生物计算机上,团队邀开发者探索更多可能。

量子位
算法论文8

ICLR 2026 Oral|中科院团队提出新框架「SparseRL」,深度强化学习可自动生成高性能CUDA代码

中科院计算所团队提出 SparseRL 框架,将深度强化学习引入稀疏 CUDA 代码生成任务。实验显示,在 SpMV 任务上编译成功率提升 20%,执行速度提升 30%。该成果已入选 ICLR 2026 Oral。

机器之心