Mamba-Transformer」共找到 240 篇相关文章

开源动态8

英伟达开源全新大模型:黄仁勋不想只「卖铲子」

2025年底英伟达宣布开源全新模型家族Nemotron 3,含Nano、Super和Ultra。它融合MambaTransformer和MoE技术,有诸多创新。这不仅是产品更新,更是战略突袭,标志着英伟达想构建AI闭环开放生态。

新智元
开源动态7

Meta没做的,英伟达做了!全新架构吞吐量狂飙6倍,20万亿Token训练

英伟达发布全新架构9B模型NVIDIA Nemotron Nano 2,以Mamba - Transformer混合架构实现推理吞吐量最高提升6倍,对标Qwen3 - 8B并在多任务中表现持平或更优,还开源模型及大部分预训练数据。

新智元
开源动态8

钢铁版OpenClaw,Transformer作者用Rust打造,告别数据裸奔

OpenClaw开源后虽发展迅速,但存在严重安全问题,如数据明文处理、隐私保护缺失、恶意组件等。Transformer论文作者Illia Polosukhin用Rust打造IronClaw,重构底层架构,升级记忆引擎,还指向去中心化经济。

AIGC开放社区
新闻资讯8

一句话生成任务专属LoRA!Transformer作者创业公司颠覆LLM微调

Transformer作者之一创立的SakanaAI推出Text-to-LoRA(T2L),简化模型适配流程,省却繁琐微调。T2L参数压缩率达80%仅降1.2%准确率,零样本场景平均准确率78.3%超现有SOTA方法,开启“一句话定制模型”时代。

量子位
开源动态7

用Rust重写OpenClaw,Transformer作者下场造了安全版「龙虾」

Transformer八子之一Illia Polosukhin用Rust构建安全版OpenClaw——IronClaw。他指出OpenClaw有数据和资金安全风险,IronClaw以安全为核心,有多项安全设计,未来还会增加策略验证等能力。

机器之心
新闻资讯7

27亿美元天价回归!谷歌最贵「叛徒」、Transformer作者揭秘AGI下一步

在Hot Chips 2025上,Transformer发明者之一、谷歌Gemini联合负责人Noam Shazeer指出LLM发展需更多算力、内存等硬件支持。微软AI的CEO Mustafa Suleyman预测2026年底前LLM或成“行动型AI”,还提及失业潮等问题。

新智元
算法论文8

Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造

Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。

量子位
算法论文7

Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限

线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。

机器之心
新闻资讯7

13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%

一款基于SSA架构的AI模型SubQ横空出世,其上下文高达1200万Token,计算量比Transformer暴减1000倍,成本不到Claude Opus的5%。打造它的Subquadratic公司仅13人,产品发布后引发AI社区不同反应。

新智元
算法论文8

注意力机制大变革?Bengio团队找到了一种超越Transformer的硬件对齐方案

Transformer虽改变世界但不完美,线性递归等新方法理论有优势,实际在GPU表现不佳。Bengio团队提出硬件对齐算法框架,用滑动窗口循环和B2P算法,实验显示有速度与质量双重突破。

机器之心