强化方案」共找到 1482 篇相关文章

新闻资讯8

卡帕西:强化学习很糟糕,但其他所有方法都更糟

卡帕西在近两小时访谈中解答诸多问题。他认为AGI成熟约需十年,现有的LLM有认知缺陷,强化学习糟糕但其他方法更差,AGI将延续2%GDP增长趋势,还谈及自动驾驶、教育等方面看法。

量子位
算法论文8

AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型

文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。

机器之心
算法论文8

让思考更准更长!强化学习新算法FIPO来了

阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。

千问大模型
新闻资讯8

强化学习教父重出江湖, 生成式AI的时代要结束了?

新智元报道,强化学习之父Richard Sutton称GenAI时代正结束。他加入ExperienceFlow.AI,要让AI靠「经验」觉醒。该公司定位打造「经验驱动的去中心化超级智能」,认为AI下一阶段应从世界中学习。

新智元
新闻资讯7

Andrej Karpathy回应强化学习之父Sutton最新观点「LLM是“死路一条”」

图灵奖获得者、强化学习之父Richard Sutton认为当前热门的大语言模型是“死路一条”,因其缺乏从实际互动中学习的能力。AI大神Andrej Karpathy认同其批评,认为当前LLM是向现实妥协的产物,还提出了“幽灵”比喻。

AI寒武纪
算法论文8

RLPT:腾讯混元在预训练数据上实现自主强化学习

腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。

AI工程化
开源动态8

MCP•RL 开源:让 AI 通过强化学习,自己学会怎么用 MCP 服务器

MCP•RL 是 Agent Reinforcement Trainer (ART) 框架一部分,能让 AI 模型通过强化学习学会高效使用 MCP 服务器,解决工具调用痛点。ART 无需标注数据、通用性强,提供便捷集成方式,项目开源。

AI进修生
开源动态7

让龙虾越用越聪明!普林斯顿大学为OpenClaw搞了个强化学习框架

普林斯顿大学研究团队发布强化学习框架OpenClaw - RL,能捕捉用户反馈与环境结果信号,有独立解耦异步机制,融合打分与文本指导,经真实场景验证效果良好,蹚出自我进化新路径。

AIGC开放社区
新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
新闻资讯7

中国算力方案:如何用有限资源做出无限可能?|甲子引力

2025年12月3日,「甲子光年」举办年终盛典,在算力产业专场,分析师王艺对话多位嘉宾,探讨中国算力方案。面对算力困境,嘉宾分享突破策略,还就关键瓶颈、技术路径等展开交流,认为具备场景洞察等优势才能持续突破。

甲子光年