「带可验证奖励的强化学习」共找到 1547 篇相关文章
荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!
人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。
大模型终于能“听懂”云操作了?
本文介绍通过MCP Server和大模型结合实现云产品管理的自然语言操作。作者分享上手体验、探究原理、进行代码验证,解决使用问题,还提出后续优化方向和未来展望,如拆分MCP Server、建立云产品Agent等。
阿里巴巴新论文:让LLM学会管理记忆,告别人工规则
大型语言模型处理长对话或复杂任务时,记忆管理靠人工规则,效果有限。阿里巴巴团队新论文提出把记忆管理变为可学习的强化学习策略,AgeMem框架统一长短期记忆管理,经三阶段训练,效果显著。
AI4S回归白盒符号主义,清华等联合发布SR-LLM:自主发现科学知识
清华大学等多所高校联合发布SR - LLM,这是融合大语言模型与深度强化学习的符号回归框架。它从数据生成可解释数学模型,在跟车行为建模等任务表现优,为机器自主科学发现开辟新路径。
具身智能算法哪家强?RoboChallenge见真章!全球首个大规模真机算法评测平台来了
Dexmal原力灵机联合Hugging Face推出RoboChallenge项目,它是全球首个大规模、多任务的真实物理机器人基准评测平台。该平台创新采用‘远程机器人’架构,有30项真实任务基准集等,已验证多种算法表现。
安全噩梦:Docker 警告 MCP 工具链中存在的风险
Docker 博文警告,基于 MCP 构建的 AI 开发工具引入安全漏洞,如凭证泄露等。MCP 发展迅猛但部分实现有隐患,Docker 分析发现广泛漏洞,还提出强化方法应对风险,其他厂商也有类似担忧。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
从工具到生命形式:OpenClaw 引发的 Agent 再思考
InfoQ《极客有约》X QCon 直播聚焦 OpenClaw 落地难点。嘉宾探讨其验证的价值、生产级形态、落地难题等,还谈及 AI 与人类共生关系、记忆系统问题及解决方案,最后分享企业落地经验和会议信息。
人形机器人「网球运动员」来了!不靠预编程,银河通用×清华破解长程打网球难题
银河通用与清华联合提出LATENT研究,使人形机器人通过深度强化学习自主习得网球对打能力,实现从“机械复刻”到“智能决策”跨越。该研究提出新运动学习方法,构建“运动小脑”等,经实验验证性能优越。
阿里开源创新AI Agent:媲美Deep Research,Github每日增长第一
人类信息检索能力受限,OpenAI的Deep Research虽能解决难题但闭源。阿里巴巴通义实验室开源AI Agent框架WebSailor,在多基准测试表现出色,核心技术围绕复杂任务生成和强化学习模块展开,在Github成绩亮眼。