带可验证奖励的强化学习」共找到 1547 篇相关文章

新闻资讯7

AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!

近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。Claude自查称执行了含“~/”的灾难性命令。类似“删库”事故并非个例,开发者需强化安全意识。

AI前线
开源动态7

全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它

全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四大关键组件,还获Karpathy等投资,未来有多项计划。

量子位
新闻资讯8

AI 性格失控等诡异现象,终于有了科学解释

Anthropic新研究发现控制语言模型「性格特征」的人格向量,解释AI恶意、谄媚等现象。研究开发自动化流程生成向量,通过实验验证其对模型行为的控制,还有监控、防护等功能,不过也引发争议。

AGI Hunt
算法论文8

强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法

大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。

AI寒武纪
算法论文8

ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena

当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。

机器之心
算法论文8

EvoSkills:自进化的skill,是好skill

文章分享两项Agent Skill最新研究论文,指出智能体技能从手工制作向自动进化转变。介绍EvoSkills和EvoSkill两种自动化Skill进化方案,对比其机制、验证方式等,还提及未来研究方向。

PaperAgent
算法论文8

微软OEL框架:大模型一次部署,终身进化

微软最新论文Online Experiential Learning (OEL)提出让LLM在真实部署后持续自我进化的框架,无需人工标注等。介绍了在线体验学习的必要性、OEL方法论及实验验证,揭示关键洞察与启示。

PaperAgent
产品应用7

Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。

量子位
开源动态8

单卡跑出集群效率!Hugging Face TRL 与 RapidFire AI 的超并行革命

Hugging Face宣布其核心微调库TRL集成RapidFire AI,重构大模型后训练阶段工作流。RapidFire引入超并行实验引擎,提升实验验证速度,解决算力受限团队的调参难题,带来效能质变。

AIGC开放社区
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔