开源动态8
清华团队:简单 RL 配方让 1.5B 模型达顶尖性能
机器之心
AI 摘要
清华团队推出 JustRL,用简单 RL 配方训练 1.5B 模型。单阶段训练、固定超参达 SOTA 性能,省算力且训练平稳。提醒先验证简单方法极限,再考虑增加复杂度。
阅读原文 · 机器之心
清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能
清华团队用两个 1.5B 模型证明,用最基础的 RL 配方可达到小模型数学推理能力 SOTA。单阶段训练加固定超参数实现 SOTA 性能且省一半算力,训练曲线还很平滑。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
清华团队22年让机器人学会踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。
机器之心
新闻资讯8
清华团队:让天眸芯成AI视觉新选择
清华大学类脑计算研究中心团队成果三年两登Nature封面。晰见科技承接天眸芯技术产业化,重新做AI的眼睛。天眸芯拆解视觉信息,构建互补通路,团队还研究算法融合信息,目前芯片进展良好。
DeepTech深科技
算法论文8
清华团队:相机自运动让空间音频标注零成本
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
量子位
算法论文8
人大DelTA算法提升强化学习推理正确率
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
量子位