RL训练」共找到 2217 篇相关文章

产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
算法论文8

语言反思>强化学习:伯克利新架构碾压传统RL

大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。

深度学习自然语言处理
算法论文7

阿里、南开大学发布免训练,视频大模型创新压缩方法

视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。

AIGC开放社区
算法论文8

无需验证器的RLRLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。

量子位
算法论文8

真机RL杀疯了!机器人自学20分钟100分,数字孪生封神

至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。

新智元
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。

带你学AI
算法论文7

63页的面向AI搜索范式:Multi-agent、MCP、DAG、RL

百度搜索发布63页《迈向人工智能搜索范式》Paper,介绍模块化、多智能体框架,新范式协调四个专门LLM代理处理搜索事务,还提及新内容及重要性,为下一代AI搜索系统提供基础。

PaperAgent
算法论文8

强化学习新发现:无需数学样本,仅游戏训练AI推理大增

莱斯大学、约翰斯・霍普金斯大学和英伟达研究团队有颠覆性发现,让多模态大语言模型玩简单游戏,无需数学样本,就能显著提升其多模态推理能力。提出的ViGaL方法在多个基准测试中表现出色。

机器之心
算法论文8

长程 Agent 越跑越乱?ContextPilot 用细粒度 RL 教会模型主动管理上下文

长程 Agent 推理时,传统方法使上下文臃肿、推理成本高。清华、腾讯等团队提出 ContextPilot 框架,扩展管理工具集、采用新采样和信用分配方法。实验显示其用短上下文获高分,降低推理开销。

深度学习自然语言处理