「S - GRPO」共找到 231 篇相关文章
图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?
图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。
AI编程界炸出新黑马!吊打Cursor、叫板Claude Code,工程师曝:逆袭全靠AI自己死磕
近期,AI编程黑马AmpCode崛起,与Claude Code并列S级,吊打Cursor。Sourcegraph工程师分享其研发理念,认为应放权给模型。此外,还探讨了企业对AI工具的分歧、编程工具变革及AI对开源的影响。
谷歌Ironwood架构TPU v7:用AI造AI,撼动英伟达芯片帝国
11月25日谷歌云发布第七代定制芯片Ironwood,由AlphaChip设计。它以9.6 Tb/s光互联带宽和1.77 PB共享显存池重构大模型推理硬件基准,挑战英伟达芯片地位,展现AI算力竞争新趋势。
下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务
IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。
强化学习 AI 系统的设计实现及未来发展
本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。
RL在Agentic Reasoning中的作用:拨开迷雾,看清本质
近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。
苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到
近日苹果发布重磅论文,提出 RL4HS 方法,用强化学习训练模型,能准确标出答案中幻觉部分,还使用片段级奖励和类别感知的 GRPO,在片段级幻觉检测任务上超 GPT - 5 和 o3。
OpenAI和DeepMind大佬离职联手,誓用AI科学家实现室温超导!已融3亿美元
OpenAI后训练负责人和DeepMind的AI4S大佬离职成立Periodic Labs,专注用AI Agent改造科研,攻克室温超导等难题,已获3亿美元融资。团队目标是培养AI科学家,构建自主实验室,还将应用于产业。
小米小爱同学:资源受限下,实现端侧大模型的高性能推理
InfoQ对话小米小爱同学端侧AI负责人杨永杰,探讨大模型端侧部署难题。团队自研推理框架,实现180 tokens/s推理速度,采用共享基座架构支持多业务。未来端侧大模型突破依赖硬件提升与架构演进。
时隔九年,中国超级计算机重登世界榜首
当地时间6月23日,第67届TOP500超级计算机排行榜发布,国家超级计算深圳中心的‘灵晟’(LineShine)夺冠,运算速度达2.198 ExaFLOP/S。它仅用CPU,性能超美国El Capitan超20%,引发对未来计算架构思考。