人类反馈强化学习」共找到 1980 篇相关文章

推荐文章8

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。

机器之心
新闻资讯7

OpenAI史上最大失误:放走这位MIT学霸!美国AI「三朝元老」,现实韦小宝

AI时代算力竞赛正酣,Anthropic联合创始人Tom Brown称其规模超阿波罗与曼哈顿计划。他曾在OpenAI参与打造GPT - 3,后与团队决裂创立Anthropic,推出Claude并获市场认可,还分享了对年轻人的建议。

新智元
产品应用7

6K星 Qwen围绕Web AI,打造Agent Search新生态

自Manus带火深度研究代理后,新兴方向面临多模态代理推理能力不足等问题。千问2025年推出系列工具完成web智能搜索生态闭合,本文分享WebWatcher训练及解决问题的方法。

CourseAI
开源动态8

6小时复刻AI IMO金牌成果,蚂蚁多智能体新进展已开源

2025年IMO赛场,顶尖大模型起初表现不佳后有突破。蚂蚁AWorld项目团队6小时复现并开源DeepMind解题结果,给出可一键运行系统。AWorld证明多智能体协同优势,还介绍复现思路、核心优势及体验方式。

量子位
推荐文章8

Claude code:下一个千亿级软件市场的蓝图

LATE CHECKOUT CEO认为Claude Code将带来软件行业变革,它驯服终端,让自然交互成趋势,会催生新机遇和超级用户,未来软件易用性价值更高,技术将适应人类语言。

AI寒武纪
算法论文8

数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法

天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。

新智元
推荐文章8

深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训

作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。

宝玉AI
新闻资讯7

马斯克的Neuralink梦想成真?意识连续谱理论震惊科学界!

美国发育生物学家Michael Levin探讨意识与自我组装关系,强调意识是连续谱系。他从生物自我组装过程、意识与身份特性等多方面阐述,还呼吁用开放视角理解意识本质,并提出研究方向。

新智元
新闻资讯7

倒反天罡:ChatGPT教人说话?36万视频+77万播客已证实!

最新研究警告,ChatGPT正改变英语表达方式,植入自身偏好。研究人员分析超36万视频和77万播客,发现GPT词汇使用率显著攀升。但研究有局限,且AI沟通还引发信任危机等问题。

新智元
开源动态8

公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族

英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。

机器之心