推荐文章7
微软副总裁 X 上开 RL 课
机器之心
AI 摘要
微软副总裁 Nando de Freitas 在 X 上分享 AI 教育内容。指出无监督、监督、强化学习定论未形成,介绍分布式强化学习系统,强调 RL 用于 LLM 的难点及解决方法,还讲解单步强化学习等知识。
阅读原文 · 机器之心
微软副总裁X上「开课」,连更关于RL的一切,LLM从业者必读
微软副总裁 Nando de Freitas 在 X 上「开课」,分享人工智能教育帖子,从 LLM 的强化学习讲起。内容涵盖无监督、监督、强化学习定论,分布式强化学习系统构建,RL 用于后训练 LLM 等,还介绍单步强化学习与策略梯度及相关技巧。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
阿里云平台完成 DeepSeek Harness 评测
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
阿里云开发者
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心
开源动态7
HarnessEval开启RSI时代新评测范式
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
特工宇宙