「预测一致性学习」共找到 1881 篇相关文章
训练数据量降低1万倍,谷歌提出超高质量数据主动学习方法
将大模型应用于特定领域需数据微调,但筛选高保真训练数据难度大、成本高。谷歌提出新主动学习筛选流程,能将训练数据规模降1万倍,还提升模型与人类专家一致性。经实验验证,该方法效果显著。
游戏教父 John Carmack:LLM 不是游戏的未来
游戏教父 John Carmack 认为 LLM 不是游戏未来,强调交互式体验学习重要性。他分析游戏学习现状,指出 Atari 游戏研究虽有成果但仍存问题,还探讨强化学习多方面挑战及应对思路。
Sutton 的批评与反思:AGI 的下一步是什么?
文章是对 Richard Sutton 采访的反思,指出 LLM 训练效率低、依赖人类数据,未实现有机自主学习。作者与 Sutton 有分歧,认为模仿学习与强化学习互补,还探讨持续学习,称 Sutton 批评有启发性。
毕树超入职Meta后首发声:十年前怀疑AGI,如今深信AGI已至!
Meta超级智能团队成员毕树超回溯70年AI进化,称多数人低估AI影响,从怀疑到深信AGI已至。他阐述技术进展、难题与趋势,分享研究心路,回顾自监督学习、强化学习等发展,打破诸多机器学习误解。
微软副总裁X上「开课」,连更关于RL的一切,LLM从业者必读
微软副总裁 Nando de Freitas 在 X 上「开课」,分享人工智能教育帖子,从 LLM 的强化学习讲起。内容涵盖无监督、监督、强化学习定论,分布式强化学习系统构建,RL 用于后训练 LLM 等,还介绍单步强化学习与策略梯度及相关技巧。
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法
大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。
ChatGPT会让大脑退化?OpenAI高管用它救下自己「读写障碍」的女儿
OpenAI将ChatGPT视为学习平台,致力于弥合教育鸿沟。其学习模式把ChatGPT变为引导学生找答案的导师,能实现平等学习机会。在教育中,如何使用AI很重要,它还拯救了高管读写障碍的女儿。
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
小扎又开源了:7B实现自监督学习SOTA
Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。