「最大似然强化学习」共找到 901 篇相关文章
强化学习教父重出江湖, 生成式AI的时代要结束了?
新智元报道,强化学习之父Richard Sutton称GenAI时代正结束。他加入ExperienceFlow.AI,要让AI靠「经验」觉醒。该公司定位打造「经验驱动的去中心化超级智能」,认为AI下一阶段应从世界中学习。
1.3亿美元!LiblibAI拿下国内AI应用赛道年度最大融资
2025年,AI应用公司LiblibAI完成1.3亿美元B轮融资,由红杉中国等联合领投,老股东超额增持。这是今年国内AI应用赛道最大融资,标志投资热点转向应用层。该平台有独特生态,还将加速全球化布局。
Andrej Karpathy回应强化学习之父Sutton最新观点「LLM是“死路一条”」
图灵奖获得者、强化学习之父Richard Sutton认为当前热门的大语言模型是“死路一条”,因其缺乏从实际互动中学习的能力。AI大神Andrej Karpathy认同其批评,认为当前LLM是向现实妥协的产物,还提出了“幽灵”比喻。
RLPT:腾讯混元在预训练数据上实现自主强化学习
腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。
马斯克:Optimus 将成为有史以来最大的产品,比第二大10倍!
马斯克演讲称Optimus将成有史以来最大产品,比第二大产品大10倍,还展示其家务能力。网友反应多样,有技术疑问、应用幻想,也有价格质疑,Tesla股东很兴奋,激起全网讨论。
MCP•RL 开源:让 AI 通过强化学习,自己学会怎么用 MCP 服务器
MCP•RL 是 Agent Reinforcement Trainer (ART) 框架一部分,能让 AI 模型通过强化学习学会高效使用 MCP 服务器,解决工具调用痛点。ART 无需标注数据、通用性强,提供便捷集成方式,项目开源。
让龙虾越用越聪明!普林斯顿大学为OpenClaw搞了个强化学习框架
普林斯顿大学研究团队发布强化学习框架OpenClaw - RL,能捕捉用户反馈与环境结果信号,有独立解耦异步机制,融合打分与文本指导,经真实场景验证效果良好,蹚出自我进化新路径。
强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神
2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。
超越对数似然:模型能力连续体下的监督微调新范式
论文挑战监督微调(SFT)用负对数似然(NLL)作训练目标的默认设定,提出基于概率的目标家族,引入“模型能力连续体”概念,分析不同目标在不同模型能力下的表现,为模型后训练提供新优化方向。
马斯克野心升级:再投千亿建地球最大发射场,星舰要一天发30次
当地时间8月25日,SpaceX宣布投资千亿美元在路易斯安那州建巨型太空发射基地,最终成全球最大发射场,具备年支持数千次星舰飞行能力,马斯克称一天能执行超30次飞行。