「强化学习范式」共找到 2270 篇相关文章
2025 年 InfoQ 趋势报告:云计算和 DevOps 篇
InfoQ 2025 年云计算和 DevOps 趋势报告展示技术采用阶段趋势图,介绍新增或更新技术。涉及 AI Agent、MCP、平台工程等趋势,指出云 DevOps 生态成熟有新挑战,新阶段需整合多种要素。
Chrome已死,AI浏览器当立!认知革命比技术成熟来得更快。
文章指出AI浏览器重新定义底层逻辑,从导航工具变为执行意图的引擎,有持续意图记忆等核心能力。即便成功率不高,用户也易完成认知转变,还总结了AI产品团队应知道的规律及失败类型。
具身智能能力狂飙,安全却严重滞后?首个安全可信EAI框架与路线图出炉!
具身人工智能发展迅速,但能力与安全出现“脱钩”。上海人工智能实验室和华东师范大学团队撰写论文,为“安全可信具身智能”建立理论框架与蓝图,提出成熟度模型、分析框架等。
Learn to Reason _ The way of Baichuan-M1-ClinicReasoning
前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
我潜伏进了"年入百万"的AI自习室,发现了一些灰色的秘密。
作者潜伏进AI自习室,发现其生意火热。AI学习机功能普通,价格却高,主要卖点是内置课程。AI督学职责是托管和销售。AI自习室盈利宣传有水分,实则钻政策空子赚教育焦虑的钱。
“都什么年代了程序员还在手搓代码,连小白都能写 Prompt 生成代码了”
现在很多人标榜用 AI 写代码高效,贬低手搓代码。作者认为两者都是写代码的手段,不是目的,不能对立。并从多方面分析适合 AI 或手搓代码的场景,强调二者搭配使用能事半功倍。
具身智能体主动迎战对抗攻击,清华团队提出主动防御框架
面对对抗攻击,现有防御方法多为‘被动防守’,遇上未知或自适应攻击时效果衰减。清华朱军团队在TPMAI 2025中提出主动防御框架REIN-EAD,通过与环境交互实现‘感知—决策—行动’一体化,实验效果佳。
告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜
DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。
机器人顶会RSS 2025奖项公布!大牛Pieter Abbeel领衔研究获杰出Demo奖
机器人顶会 RSS 2025 于 6 月 21 - 25 日在美国洛杉矶举行,公布多个奖项。如杰出 Demo 奖论文提出 MuJoCo Playground 开源机器人学习框架,简化全流程,可分钟级训练策略。