「示教与策略学习」共找到 2104 篇相关文章
0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级
MIT提出新强化学习框架SEAL,可让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。
突发!OpenAI停止强化学习训练两周
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
Anthropic 研究员:强化学习将推动 Transformer 实现 AGI
在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。
Karpathy:强化学习「有点问题」,突破还需新算法
前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。
世界经济论坛:AI、机器学习专家,成增长最快职业
世界经济论坛《2025年全球未来就业报告》分析未来五年劳动力市场转型。AI成重塑核心,技术岗位增长,传统岗位衰退。各地区情况有别,报告给出政策与企业应对建议。
一篇200+文献的视觉强化学习技术最新综述
NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。
深度学习中Batch Size对训练过程如何影响?
文章分析深度学习中batch size对训练过程的影响,探讨超大batch优缺点及应对方法。用面试、通俗、科学三种方式解答问题,还通过MNIST实验,从迭代速度、梯度平滑程度、收敛速度等指标对比不同batch size情况。
ROLL:面向大规模语言模型的高效强化学习框架
本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。
Manus:3大核心策略,破解AI Agent上下文膨胀难题
当AI Agent调用工具结果大量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三大策略及模型选择等方法,还提炼出6条实践启示。