后Transformer架构」共找到 3675 篇相关文章

新闻资讯7

Anthropic 研究员:强化学习将推动 Transformer 实现 AGI

在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。

AGI Hunt
新闻资讯8

Transformer论文作者之一Noam Shazeer宣布离开Google,加入OpenAI

6月18日,Google DeepMind工程副总裁、Gemini模型联合负责人Noam Shazeer宣布离开Google加入OpenAI。他是Transformer架构提出者之一,技术实力强。Google曾花27亿美元请他回归,仍没留住。

DeepTech深科技
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。

量子位
算法论文8

清华联手千问重塑归一化范式,让 Transformer 回归「深度」学习

Pre - Norm和Post - Norm是Transformer架构中稳定信号流的关键范式,但面临权衡取舍。近日,清华黄高团队联合千问团队提出SiameseNorm,构建参数共享的平行通路,实现稳定训练并提升性能。

机器之心
开源动态8

告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生

上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。

机器之心
7

看懂这篇,你就能秒懂 LLM底层秘密—Transformer原理解析

文章由浅入深介绍LLM基础知识,着重解析Transformer原理,结合案例讲解其工作流程,还介绍当前开源旗舰LLM架构变化,如DeepSeek V3等模型的创新,最强调模型能力与应用形态的关系。

腾讯技术工程
推荐文章7

Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起

知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。

机器之心
算法论文8

VLA统一架构新突破:自回归世界模型引领具身智能

北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。

机器之心
开源动态7

马斯克刚刚真把 𝕏 平台推荐算法给开源了,核心也是Transformer

𝕏平台(原Twitter)将全新推荐算法开源,由与xAI的Grok模型相同的Transformer架构驱动。该算法预测用户行为对帖子排序。此前平台因算法问题被调查和罚款,开源或有此原因。

机器之心
产品应用8

在WAIC现场,全球首个拥有「原生记忆力」的大模型亮相,但不是Transformer

在WAIC上,RockAI推出基于非Transformer架构Yan 2.0 Preview的多模态大模型,有原生记忆能力。它在性能指标上优势明显,其记忆机制接近生物方式,团队秉持理念推动离线智能,获硬件厂商关注。

机器之心