「知识绝缘机制」共找到 1319 篇相关文章
科学家发现大脑中的“旋转风暴”,其结构竟类似Transformer注意力机制
2026年6月18日,叶智文团队关于大脑旋转波的研究成果发表于《科学》。他们借助先进设备发现小鼠脑中旋转波,总结特征、验证其与全脑及行为关联,还指出其类似Transformer注意力机制,未来将继续深入研究。
借鉴人脑「海马体-皮层」机制,红熊AI重做了一个「记忆系统」
记忆成AI进化关键,Google Research新论文提出「嵌套学习」范式。红熊AI受业务难题启发,推出「记忆熊」,借鉴人脑机制重构记忆系统,在多场景应用落地,提升了服务质量和效率。
直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?
为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。
为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体
LinkedIn推出认知记忆智能体(CMA),作为生成式AI技术栈一部分,解决大语言模型缺乏状态记忆问题。CMA有三层记忆,集成多种机制,在多智能体系统中作用关键,还将人工校验融入招聘应用。
时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8
在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。
重塑注意力机制:GTA登场,KV缓存缩减70%、计算量削减62.5%
GTA由多所高校联合研发,提出大模型框架,解决传统多头注意力机制弊端。通过分组共享注意力矩阵和压缩潜在值表示,削减计算量、缩减KV缓存,实验验证其性能优、效率高,虽有局限但前景好。
2年内AI生成世界90%知识!老黄2小时重磅访谈「剧透」未来
新智元报道黄仁勋2.5小时访谈,他透露2 - 3年内90%知识或由AI生成,强调AI尽头是能源,提出通用高收入概念,还分享英伟达危机、童年经历,解答AI意识、失控等问题。
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。