算法论文8
Kimi论文或改写大模型训练方式
AI寒武纪
AI 摘要
Kimi论文指出大模型残差连接有PreNorm稀释问题,提出Attention Residuals方案,用注意力机制让层按需选信息。工程上用Block AttnRes,实验表明能省算力、提升效果。
阅读原文 · AI寒武纪
省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式
大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文7
研究揭开大模型加密推理块漏洞及风格影响
研究者发现,将 Opus 等强模型返回的加密推理块交给同家族弱模型,弱模型可能转写出隐藏内容。如用 Haiku 读取 Opus 的加密信息。此外,公开的 Agent 轨迹存在隐私泄露风险,部分开源模型易受 Opus 风格影响。
深度学习自然语言处理
开源动态7
爆火开源AI画布PenEcho来袭
文章推荐开源AI画布PenEcho,它是个超智能黑板,适合学习场景,让手写与AI共生。能理解内容及空间关系,把回答放回画布,支持多模型,还具备多种功能。
开源AI项目落地
推荐文章8
翁荔:揭秘大模型训练Scaling law
北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。
PaperAgent
算法论文7
deepseek V4算法工程技术大揭秘
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
Agent的潜意识