新闻资讯7
Karpathy:强化学习神话被戳破!
新智元
AI 摘要
Karpathy:强化学习并非通往AGI的最优策略,效率随任务时长下降,与人类学习机制差异大,提出复盘式进化范式;Kevin Lu:放弃无效RL研究,转投产品开发。
阅读原文 · 新智元
Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死
AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增长曲线待发现。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
腾讯开源框架,一句话造3D世界
香港科技大学(广州)和腾讯团队开源VibeWorlding框架,实现说句话造3D世界。它由VWE - Bench和VibeWorlding - Gym组成,开源模型经强化学习训练后成绩逆袭,证明强化学习解锁3D推理潜力巨大。
AIGC开放社区
新闻资讯7
OpenAI:暂停前沿模型强化学习训练
OpenAI发文称暂停最新模型强化学习训练两周,加固研究环境、进行红队测试等。部分低风险训练已恢复,最大规模前沿模型训练仍暂停。此举源于Hugging Face安全事故及Astra模型潜在风险。
机器之心
开源动态7
DeepSeek Harness:AGI自进化有“后悔药”?
8月13日,DeepSeek开放DeepSeek Harness v0.1开发者预览版,在Github获4.5万星。它提出“一切皆插件”概念,核心组件可插拔。还联合北大提出Cordis框架,解决组件插拔问题,但面临价格与组件膨胀挑战。
AI科技评论
开源动态8
OpenMOSS开源WCM,让VLA强化学习起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
机器之心