「循环式架构」共找到 2536 篇相关文章
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练
字节Seed和北大研究团队提出In - Place TTT方案,让大模型能“原地改参数”。它复用Transformer的MLP模块,解决现有TTT架构不兼容、计算效率低和优化目标不匹配问题,实验证明可提升模型长文本任务表现。
748GB内存、20P算力,英伟达把数据中心塞进了桌子底下,第一台已经送到Karpathy家里
英伟达DGX Station GB300首批系统交付开发者,首台给了Andrej Karpathy。它有748GB内存、20P算力,用GB300芯片架构。背后是长时运行自主智能体开发需本地算力,英伟达从软硬层面推进。
清华开源一批「学习虾」,免费的「AI 私教团」来了
清华大学开源全球首个多智能体生成式学习AI技术框架OpenMAIC。它能将技术文档转化为学习课堂,还能解锁多种学习解法。其前身MAIC是重要学习平台,应用不断迭代,OpenMAIC功能强大,边界不止于课堂。
Yann LeCun非生成世界模型前瞻:开年三篇论文展示JEPA工程化拐点
2026年Yann LeCun团队3篇论文展示基于JEPA框架的非生成世界模型工程化拐点。Rectified LpJEPA让表示更省力,GRASP将长时域规划并行求解,EB - JEPA把方法写成代码,为非生成式世界模型提供技术路线。
美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局
近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。
Token洪流的转向:当AI Agent成为Token消耗的主宰,什么样的推理服务基础设施才是刚需
Token消耗量转移,AI Agent成Token消耗主宰,大模型推理服务底层逻辑重塑。文章介绍AI Agent时代范式转变、对推理基础设施的需求,还阐述了为其打造的AI Serving Stack架构及优势,它获2025年度相关卓越奖。
MCP 和 Skills 到底什么区别?一篇文章说清楚
文章解释了 MCP 和 Skills 的区别。MCP 是 AI 世界的 USB 协议,可降低开发成本,但会吃掉上下文窗口;Skills 采用渐进式披露设计,自带脚本,能减少上下文消耗。未来 Skills 或承担多数工作,MCP 用于远程连接。
马斯克罕见低头:开源𝕏推荐算法,自嘲“很烂”不过未来月更
马斯克开源𝕏推荐算法系统,这是几乎全由AI模型驱动的系统。它基于Grok - 1同款Transformer架构,通过学习用户历史互动行为推荐内容。虽获社区称赞,但算法有缺陷,马斯克也承认‘很烂’,未来将月更。
仅需一个混频器的无线射频机器学习推理,登上Science Advances!
杜克大学和MIT教授团队提出广播模型并在射频上完成计算的分离式计算方案,在边缘端混频器模拟计算中完成推理,解决传统方案问题,还在测试平台验证,能耗低且能完成多项机器学习任务。
SGLang Hierarchical Sparse Attention 技术深度解析
阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。