算法论文8
清华联手千问,SiameseNorm让Transformer深度学习
机器之心
AI 摘要
清华黄高Leap Lab团队联合千问C端团队:提出SiameseNorm架构,解耦Pre - Norm与Post - Norm,在不增计算开销下实现稳定训练,在多项测试中提升模型性能,让Transformer回归‘深度’学习。
阅读原文 · 机器之心
清华联手千问重塑归一化范式,让 Transformer 回归「深度」学习
Pre - Norm和Post - Norm是Transformer架构中稳定信号流的关键范式,但面临权衡取舍。近日,清华黄高团队联合千问团队提出SiameseNorm,构建参数共享的平行通路,实现稳定训练并提升性能。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
前英伟达工程师:AI 终局是后台 Agent
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
AI科技大本营
算法论文8
COLM三篇论文暴击Transformer祖传设计
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
量子位
新闻资讯8
2026奇点大会北京将办,Łukasz Kaiser将演讲
2026年,Sam Altman等四位AI界大佬称已进入奇点。11月20 - 21日,奇点智能大会北京站将举行,两大核心会议同期举办。OpenAI资深科学家Łukasz Kaiser将演讲,会议汇聚专家探讨AI前沿与底层技术。
AI科技大本营
算法论文7
Mobius能否颠覆Transformer架构?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
机器之心