RL token」共找到 901 篇相关文章

算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。

深度学习自然语言处理
算法论文8

奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式

在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。

机器之心
开源动态8

10% KV Cache实现无损数学推理!这个开源方法解决推理大模型「记忆过载」难题

推理大模型推理时易现冗余问题,R-KV开源方法登场,显存降90%、吞吐提6.6倍、准确率达100%。它通过实时对token排序解决冗余,还经多步骤压缩KV缓存,性能测试表现出色,适用多场景。

量子位
开源动态7

全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它

全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四大关键组件,还获Karpathy等投资,未来有多项计划。

量子位
新闻资讯8

百年黎曼猜想被Claude破了新纪录!是个未公开新模型

A社官宣未公开的Claude研究模型在黎曼猜想取得重大进展,将满足猜想的黎曼ζ函数零点比例下界从41.6%提高到67.2%。它靠60个智能体、3100万输出Token完成研究,几乎走完科研流程。

量子位
产品应用7

调高一档推理强度,成本可能翻几倍:大模型思考原理讲清楚

文章详细讲解推理强度原理,指出其不改模型,只改草稿长度。还说明模型多思考能提高答题准确率的原因,剖析贵和慢的原因,介绍三种控制形态,并给出判断推理强度档位的框架。

AI Reading Hub
产品应用8

AI 产业终于等来了自己的“支付宝时刻”

本周支付宝发布面向 AI Agentic Commerce 的全栈支付解决方案。该方案含信任基座、收付引擎、AI 钱包助手和 Token Pay,解决支付安全、收付款及管控等问题,推动 AI 产业从工具走向商业循环。

MacTalk
产品应用8

Claude Opus 4.7 发布!留给人类的时间,不多了

Anthropic 发布 Claude Opus 4.7,核心升级是让 AI 跑长且复杂任务,还能自我验证结果。它视觉能力超强,编程能力提升,新增 /ultrareview 功能,API 多了调节档,不过 token 数量或增加,成本可能上浮。

AGI Hunt
开源动态7

知名产品工程师开源「一整套编程skill」,每个人都能有顶级的工程习惯

现在用AI写代码存在效率低、浪费token等问题,知名开发者tw93发起开源AI编程skill库Waza,将顶尖工程师习惯转化为Claude Code可运行技能,推出8实用技能,还提供两个小脚本。

开源AI项目落地
新闻资讯8

Karpathy 亲手终结了RAG的草莽时代

Andrej Karpathy分享“LLM Wiki”工作流,将多数Token用于构建“可演化知识库”。此方法不依赖复杂架构,在中等规模数据集上展现出强大能力,引发“LLM Wiki杀死RAG”的讨论,在技术社区和企业级市场反响热烈。

InfoQ