「人类反馈强化学习」共找到 1980 篇相关文章
一篇19种自进化Agent Skill框架最新综述
这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。
Anthropic CEO承认了!成立公司,因为看不惯奥特曼说谎
Anthropic CEO Dario Amodei在采访中自曝,成立公司不是为拯救人类,而是看不惯奥特曼说谎。这撕下了Anthropic恪守伦理的滤镜,揭示出其与OpenAI的纷争是团队内讧,如今已演变成万亿美元商战。
Anthropic智能体大会:Agent也会精神分裂,我们发现了多Agent协作的本质解法。
Anthropic开发者大会聚焦Agent,分享多智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。
社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。
6 天、96 万行 Rust、直接合并?Claude Code 被 Bun 的内存泄漏拖垮后,Bun 让 Claude 亲手重写了自己
2026 年 5 月,Bun 创始人 Jarred Sumner 宣布将合并 Rust 重写版本,终结 Zig 版。此次迁移仅用六天,涉及 96 万行代码。此前,Bun 内存泄漏影响 Claude Code,促使 Anthropic 让 Claude 重写 Bun。不过,AI 重写也引发对代码质量和流程的争议。
“我不会被 AI 吞噬”!菲尔兹奖得主、scikit-learn 守护者与全球顶尖 AI 专家巴黎共话 AI Vision | GOSIM Paris 2026
2026年5月4日,GOSIM Paris 2026 AI Vision Forum在巴黎举行。菲尔兹奖得主、scikit - learn守护者等全球顶尖AI专家共话AI。全天议程涵盖智能体AI系统、AI教育应用等四大核心议题,强调面对AI浪潮,开放才能让人类居核心。
Pipeline MinerU真快不行了
文章聚焦Infinity-Parser,指出它把OCR从‘做识别’推进到‘做结构’。它采用layoutRL强化学习框架,结合真实与合成数据构建Infinity-Doc。跑分强且复杂结构表现优,透露Document AI向结构化生成转变趋势。
OpenAI 也把工程师经验“蒸馏”进 skill 了!Harness 爆文作者曝内部玩法:一个百万行代码系统,全程零人工编码和审核
OpenAI的Ryan Lopopolo分享Frontier团队工作方式,他们维护超百万行代码库,零人工编码和审核。实验产出Symphony,推动coding agent成“队友”。还探讨模型使用、构建速度、人类角色等问题,认为人成瓶颈,软件要适配模型。
设计流程已死:Anthropic 设计负责人 Jenny Wen 谈 AI 时代的设计变革
Anthropic的Claude设计负责人Jenny Wen在Lenny's Podcast中谈AI时代设计变革。她指出传统设计流程被工程速度倒逼走向尽头,还分享在AI实验室做设计的感受、Co - work开发故事等,给出招聘设计师的标准。
首次!AI智能体破解「纳什均衡」,大模型学会博弈论|Cell子刊
多所高校研究团队开发出PrimeNash大语言模型智能体框架,能自动推导纳什均衡闭式解析解并生成证明。它模拟人类科研路径,分三模块求解,经经典博弈验证,还在碳市场博弈展现应用潜力。