算法论文7
循环模型500步后训练突破256k长度泛化极限
机器之心
AI 摘要
CMU、Cartesia AI研究者指出,循环模型处理长序列时遇未探索状态致泛化失败。提出未探索状态假说,用SP、TBTT等干预方法,经500步后训练,让模型突破256k长度泛化极限。
阅读原文 · 机器之心
Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限
线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
COLM三篇论文暴击Transformer祖传设计
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
量子位
新闻资讯8
2026奇点大会北京将办,Łukasz Kaiser将演讲
2026年,Sam Altman等四位AI界大佬称已进入奇点。11月20 - 21日,奇点智能大会北京站将举行,两大核心会议同期举办。OpenAI资深科学家Łukasz Kaiser将演讲,会议汇聚专家探讨AI前沿与底层技术。
AI科技大本营
算法论文7
Mobius能否颠覆Transformer架构?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
机器之心
新闻资讯7
前大厂负责人创业,探索AGI新架构
曾是OpenAI的「强化学习最大主义者」Jerry Tworek,与谷歌Gemini预训练负责人Rohan Anil,共同创办Core Automation。他们探讨当前AI路线问题,认为下一代架构要能持续学习,还计划打造自动化AI实验室。
机器之心