规模化RL」共找到 409 篇相关文章

开源动态8

从 Serverless 到 Agent:Cube 系统的一些设计思考

本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、高并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。

InfoQ
推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区
新闻资讯7

营收67亿、净利8.7亿,这家上海芯片公司再冲刺港股

4月12日,晶晨半导体向港交所主板重新递交H股上市申请,这是其第二次冲击港股。该公司有“硅谷基因、国内运营、全球销售”独特身份,产品覆盖多领域,业绩创新高,但也有客户集中、存货激增等风险。

芯师爷
产品应用7

老黄呼吁所有企业「养虾」当天,阿里正规军入场,「悟空」把路铺平了

2026年初,OpenClaw火了,黄仁勋呼吁企业制定相关战略,但它存在环境依赖复杂等问题,企业不敢用。阿里发布企业级AI原生工作平台「悟空」,解决企业安全、工作流耦合和规模化等问题,被阿里重点布局。

机器之心
新闻资讯8

「OS产业报告」解读:国产操作系统的技术突围与生态跃迁之路

2025 龙蜥操作系统大会发布《国产服务器操作系统发展报告(2025)》,预测未来三年国产 OS 国产化率将升至 65%、市场规模破 300 亿元。「AI 进化论」第七期邀请专家解读报告,探讨国产 OS 的发展逻辑、技术突破与生态建设。

InfoQ
算法论文8

经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%

现有的 RL 驱动的深度思考大模型系统面临准确率与效率的「跷跷板」困境,北邮百家 AI 团队提出 LightSearcher 框架,解决了这一痛点,在保持准确率的同时,显著提升了工具调用效率。

机器之心
产品应用8

全球首个「导航大脑」上线!一句话让机器人自己找路回家

银河通用联合多所大学发布全球首个跨本体全域环视导航基座大模型NavFoM,让机器人能自主导航。它全场景、多任务、跨本体,重新定义导航逻辑,有技术创新和庞大训练数据,还衍生应用模型推动具身智能商业落地。

新智元
算法论文7

苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!

苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。

新智元
算法论文7

少说‘Wait’,多做题:NoWait重塑大模型推理路径

现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。

深度学习自然语言处理
算法论文8

揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路

上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。

量子位