算法论文7
斯坦福:AdamW 预训练稳健,矩阵法特定场景优
机器之心
AI 摘要
斯坦福团队研究十一种深度学习优化器,发现独立调优至关重要,短期评估易误导,矩阵方法性能领先。不过,AdamW 仍稳健,最优选择依场景而定,如标准比例下 Muon 佳,高数据比例 Soap 优。
阅读原文 · 机器之心
斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出
斯坦福大学 Percy Liang 团队研究指出,虽有不少声称能显著加速的优化器替代方案,AdamW 仍为预训练稳健首选,但矩阵型方法在特定数据–模型比例下优势明显。研究还揭示了现有研究的方法论缺陷。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
GCEA - YOLO:油田抽烟检测精度提升20.8%
油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。
机器学习AI算法工程
推荐文章8
系统了解AI,这四件事得搞清楚
文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。
AIGC开放社区
算法论文8
RDA - YOLO:极端天气下绝缘子缺陷检测利器
文章指出传统绝缘子检测方法面临人工巡检效率低、小目标检测难等挑战,现有YOLO系列算法也有局限。为此提出RDA - YOLO网络,在YOLOv8基础上有三项创新,实验显示其精度、速度和极端天气鲁棒性表现出色。
机器学习AI算法工程
推荐文章8
翁荔:谨慎对待 Scaling Law
翁荔新作《谨慎对待 Scaling Law》上线,文章涵盖 Scaling Law 预测内容、计算最优分配原理等。介绍了早期对机器学习损失可预测性的研究,还对比了 Kaplan 等人与 Chinchilla 的 Scaling Law,分析了两者分歧原因。
机器之心