「Transformer网络」共找到 510 篇相关文章
科学家发现大脑中的“旋转风暴”,其结构竟类似Transformer注意力机制
2026年6月18日,叶智文团队关于大脑旋转波的研究成果发表于《科学》。他们借助先进设备发现小鼠脑中旋转波,总结特征、验证其与全脑及行为关联,还指出其类似Transformer注意力机制,未来将继续深入研究。
谷歌Transformer过时了?清华姚班校友等三连击,爆改注意力!
谷歌提出新架构,参数减少40%,训练速度较RNN提升5 - 8倍,某些任务性能超Transformer 7.2%。新架构引入注意力偏向策略,用「保留」取代「遗忘」,还提出Moneta、Yaad、Memora三个新模型,在多任务上表现卓越。
Linux 基金会推出 Akrites 项目,防护核心开源软件免受 AI 网络威胁侵害
Linux 基金会发起 Akrites 项目,获超 20 家机构支持,旨在保护关键开源软件免受 AI 网络威胁。它建立协调框架,改进漏洞处理方式,补充现有工作,反映网络安全理念转变。
Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了
KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。
重构线性视觉Transformer,精度与效率双平衡 | CVPR'25
南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。
看懂这篇,你就能秒懂 LLM底层秘密—Transformer原理解析
文章由浅入深介绍LLM基础知识,着重解析Transformer原理,结合案例讲解其工作流程,还介绍当前开源旗舰LLM架构变化,如DeepSeek V3等模型的创新,最后强调模型能力与应用形态的关系。
Sebastian Raschka 2026预测:Transformer统治依旧,但扩散模型正悄然崛起
知名AI研究员Sebastian Raschka预测2026年,Transformer架构在未来至少一到几年仍占统治地位,但会在效率和混合上微调。同时,扩散语言模型虽有工具调用缺陷,但在数据稀缺时或成更好的学习者。
谷歌创始人布林:当年发完Transformer论文,我们太不当回事了
在斯坦福大学工程学院百年庆典活动上,谷歌联合创始人谢尔盖・布林与校长、工程学院院长对谈。他回顾谷歌发展,称曾对Transformer论文未足够重视,还分享对专业选择、大学模式、学术与产业等方面的看法。
微软 Build 2025:AI 智能体时代与开放智能体网络的构建
微软 Build 2025 大会展示迈向 AI 智能体时代路径,如发布新功能助力开发者,让 AI 智能体更强大安全,支持开放智能体网络,还推出平台加速科学发现。
告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生
上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。