算法论文8
Qwen&清华:20%token训练大模型更佳
量子位
AI 摘要
Qwen与清华团队:大模型强化学习用20%高熵token,效果超全量token,还发现RLVR是微调,高熵token或与泛化能力有关,clip - higher方法更优。
阅读原文 · 量子位
Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好
Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
林俊旸创业做Agent,腾讯已投估值20亿美元
前Qwen一号位林俊旸官宣创业公司Pragmatik Labs,方向为做横跨数字与物理世界的下一代Agent。公司获高榕、红杉、腾讯等投资,投后估值达20亿美元。虽无产品模型,但凭借林俊旸过往成绩受关注。
量子位
新闻资讯8
清华团队:让天眸芯成AI视觉新选择
清华大学类脑计算研究中心团队成果三年两登Nature封面。晰见科技承接天眸芯技术产业化,重新做AI的眼睛。天眸芯拆解视觉信息,构建互补通路,团队还研究算法融合信息,目前芯片进展良好。
DeepTech深科技
算法论文8
清华团队:相机自运动让空间音频标注零成本
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
量子位
产品应用8
Claude Opus 5:低价高编码能力之选
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。
AI工程化