「Self - GRPO」共找到 99 篇相关文章
华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了
华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。
比Transformer更强的架构来了?浙大新作Translution,一统卷积和自注意力
随着大模型发展遇瓶颈,浙大等校学者提出神经网络基础操作Translution,实现自注意力与卷积的融合统一,构建更普适神经计算机制。它性能超Self - attention,为新一代神经网络发展开辟新方向。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案
腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。
类R1训练不再只看结果对错!港中文推出SophiaVL-R1模型
DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。
GPT-6 或有"生命"!MIT新作实现LLM自我进化,冻结权重时代终结
MIT新作《Self-Adapting Language Models》实现LLM自我进化,SEAL框架让模型自己生成“自编辑”微调自身。它能实时学新数据、修复知识、形成记忆。经两种场景验证,小模型也能超越GPT - 4.1等。
港中文联手美团开源“视觉推理通才”!图像视频10类任务一网打尽
香港中文大学MMLab与美团研究团队开源OneThinker模型,它可覆盖图像与视频十类核心视觉任务,在31项测试中表现出色,还展现泛化能力。研究团队搭建数据集,并引入EMA - GRPO算法提升训练稳定性。
一篇最新自演化AI Agents全新范式系统性综述
传统LLM Agent工作流固化,面对动态环境只能人工硬编码,成本高、迭代慢。此55页综述提出“Self - Evolving AI Agents”新范式,让Agent自主优化自身结构,还给出三定律、统一框架及各类优化方法。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存
消费级显卡跑大模型训练门槛再降,Unsloth AI的FP8精度强化学习方案让Qwen3 - 1.7B的GRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。