算法论文8
17岁高中生一作论文让马斯克叹服
量子位
AI 摘要
Kimi团队提出Attention Residuals技术,让模型计算时能“回头看”,在Kimi Linear 48B大模型上验证,训练效率提升。17岁高中生陈广宇作为共同一作,从兴趣出发投身大模型研发。
阅读原文 · 量子位
Kimi新架构让马斯克叹服!17岁高中生作者一战成名
17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
Anthropic营收反超OpenAI,IPO占优
IPO前夕,Anthropic最新年化营收达650亿美元,8个月翻超7倍,反超OpenAI。双方在资本市场竞争激烈,A社在起跑时间、财务、商业模式上占优,但OpenAI用户规模和产品生态占优,目前A社牌面更好。
量子位
新闻资讯8
菲尔兹奖得主:AI数学优势在‘输得起’
OpenAI发布内部版模型Astra的十项成果,引发数学界震动。菲尔兹奖得主Timothy Gowers分析其成果,指出AI优势在‘输得起’,还探讨找例方法、模型短板,给出训练建议与衡量跨越门槛的标准。
新智元
算法论文8
COLM三篇论文暴击Transformer祖传设计
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
量子位
算法论文8
北大等提出 TensorCast,推理首字延迟最高降 93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
机器之心