双重高斯奖励机制」共找到 316 篇相关文章

算法论文8

别等GPT-5了!普林斯顿万字综述揭秘:我们要做自进化Agents!

普林斯顿大学联合多顶尖机构发表“自进化智能体”综述,描绘AI从静态工具演变成自我学习迭代智能体的过程,拆解其进化核心维度,介绍触发进化机制的时机、修炼方式及应用方向。

探索AGI
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
算法论文8

Meta这两篇最新Agent Learning论文,有些意思!

分享Meta SuperLabs两篇Agent Learning论文,从‘如何低成本获得高质量经验’出发,形成技术链,为语言智能体进入‘规模化RL时代’提供路线图,还分析了Agent RL问题及两论文成果、对比。

PaperAgent
算法论文8

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。

机器之心
算法论文8

GUI定位还在玩「非黑即白」?浙大团队提出GUI-G²,显著提升GUI智能体定位性能

在人工智能领域,GUI 智能体成技术风口,但现有 GUI Grounding 方法有缺陷。浙大团队提出 GUI - G²,将 GUI 交互转变为连续空间建模,在三个主流 GUI 定位基准测试中表现亮眼,重新定义了 GUI 交互本质。

机器之心
算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
算法论文8

推荐大模型来了?OneRec论文解读:端到端训练如何同时吃掉效果与成本

随着AI发展,推荐系统面临诸多问题,快手技术团队提出OneRec,以端到端生成式架构重构推荐系统全链路,在效果与成本上实现突破,已在快手双端服务用户,也有需完善之处。

机器之心
算法论文8

微软 & UT Dallas 联手揭秘:从 SFT 到 RL 的进阶之路

微软与 UT Dallas 合作论文揭秘大模型做漏洞检测从 SFT 到 RL 的后训练流程,构建 C/C++ 漏洞数据集跑通全流程,总结六大‘避坑’指南,还开源整套框架、数据集和模型。

深度学习自然语言处理
推荐文章7

MoltBot(Clawdbot)之父的20条AI哲学

MoltBot(Clawdbot)爆火,其开发者分享20条AI哲学,涵盖心态、学习、闭环验证等方面,指出AI改变编程体验,强调系统性思维、prompt技能等重要性,还提及对未来程序员的影响。

AI工程化
算法论文8

字节跳动李航博士新作:AI智能体的通用框架

字节跳动李航博士在JCST发表观点论文,提出涵盖软件和硬件智能体的通用框架。该框架以完成任务为目标,依赖LLM,用强化学习构建。文章还探讨了与大脑机制关联、未来研究方向等。

机器之心