并行循环Transformer」共找到 615 篇相关文章

新闻资讯8

Transformer作者:DeepSeek才有搞头,OpenAI指望不上了

Transformer发明者Ashish Vaswani认为OpenAI等闭源厂商被商业化冲昏头脑,没心思做基础研究。他All in基础研究,坚持开源路线,想打造西方世界的DeepSeek。其团队论文提出颠覆性观点,或降低训练成本。

量子位
算法论文8

欲取代transformer的SSA(次平方稀疏注意力)解读

文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。

Agent的潜意识
推荐文章7

「Memory as a Context」是否将重新定义 Transformer 的 「记忆模式」?

本期机器之心PRO会员通讯解读3个AI业内要事,包括「Memory as a Context」能否重新定义Transformer记忆模式、世界模型发展情况,以及OpenRouter联合a16z发布的《State of AI》报告。详细探讨了谷歌Titans架构及其理论框架MIRAS,还提及业界对LLM记忆力的改进方案。

机器之心
新闻资讯8

Transformer论文作者之一Noam Shazeer宣布离开Google,加入OpenAI

6月18日,Google DeepMind工程副总裁、Gemini模型联合负责人Noam Shazeer宣布离开Google加入OpenAI。他是Transformer架构提出者之一,技术实力强。Google曾花27亿美元请他回归,仍没留住。

DeepTech深科技
开源动态8

一个For循环就是全部:BU开源了它的Agent框架

Browser Use团队开源bu - agent - sdk,设计理念简单,Agent就是一个for循环。它减少抽象、最大化模型自由度,解决了传统框架行动空间不完整等问题,支持多模型,开发者可自由选模型。

AI工程化
新闻资讯7

布林坦承谷歌低估Transformer,“还被OpenAI挖走了Ilya”

谷歌创始人谢尔盖・布林回母校演讲,复盘谷歌发展,承认曾低估Transformer,让机会给OpenAI。还回顾谷歌诞生、AI掉队又靠Gemini 3翻盘的历程,给出对大学生、创业者建议,反思退休决定。

量子位
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。

量子位
开源动态7

Container Use:一种用于独立的并行编码代理的新工具

Dagger团队发布开源工具Container Use,为AI编码代理提供容器化沙箱和Git工作树,实现无冲突并行工作流。它能创建隔离开发环境,让开发者在同一代码库安全运行多代理。不过该工具尚处早期,有不足。此外还介绍了其他类似工具。

InfoQ
算法论文8

Tokenization谢幕?H-Net登场:Mamba作者新作正面硬刚Transformer

「Mamba」作者之一Albert Gu在新Paper提出新技术,实现动态分块机制,嵌入H - Net可替代传统流水线。在多方面实验中,H - Net性能优于基于BPE token的Transformer模型。

PaperAgent
新闻资讯8

Transformer传奇作者加入OpenAI!谷歌27亿美元也没留住

Transformer核心作者Noam Shazeer宣布加入OpenAI,他曾因谷歌拒绝发布聊天机器人出走创业,2024年谷歌花27亿美元请回,如今再次离开。他贡献巨大,引发AI界争抢。

量子位