自注意力层」共找到 1525 篇相关文章

推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【九】| 归一化:神经网络的稳定器

本文是系列文章第九篇,介绍了神经网络中的归一化。先回顾标准差、标准分概念,指出其可使差异可控稳定。接着说明归一化将原思想用在神经网络,还加入可学习参数,最后总结其作用与应用位置。

AI大模型应用实践
新闻资讯7

OpenAI研芯片270天光速成功!谷歌TPU大将主导,老黄一夜大客户变对手

OpenAI发布研推理加速芯片Jalapeño,与博通和Celestica合作打造,专为大模型优化,9个月就流片。操刀者是前谷歌TPU核心成员Richard Ho,计划2026年底部署。此前谷歌、微软等已研芯片,英伟达客户变对手。

量子位
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
推荐文章8

必看!Sebastian Raschka新博客盘点了所有主要注意力机制

著名AI技术作家Sebastian Raschka发布博客《现代LLM中注意力变体的可视化指南》,回顾近年开发并用于开放权重架构的注意力变体,包括多头、分组查询、多头潜在等注意力机制,还分析各机制特点、应用场景及优劣势。

机器之心
推荐文章7

深度解析LLM Wiki / Obsidian-Wiki / GBrain:Agent时代知识的“组织”与“进化”

文章深度解析LLM Wiki、Obsidian - Wiki和GBrain项目,探讨Agent时代知识的“组织”与“进化”。指出传统知识管理有短板,而这些项目通过不同方式解决知识结构化、沉淀和更新问题,各有优劣。

阿里云开发者
产品应用7

Figma 研了 Redis 代理,实现六个 9 可用性

Figma发布研Redis代理服务FigCache详细实践,替换旧缓存栈。2025年下半年上线,实现六个9可用性。它基于ResPC构建,分离前后端,配置灵活,处理Redis Cluster问题,迁移策略可回退。

InfoQ
开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
新闻资讯7

谷歌Dreamer大神离职!「辛顿门徒」曝错过Transformer

谷歌世界模型大牛Danijar Hafner宣布离任,他2016年起在谷歌相关团队工作近十年,曾获辛顿指导,主导开发Dreamer系列。他还曝曾错过Transformer,当时未在意其优势。

新智元
开源动态8

“OpenClaw 类”进化智能体代表项目介绍

文章指出传统 Agent 存在记忆短暂、能力固定的瓶颈,介绍了 OpenClaw 生态中“进化”的不同形态,还列举了 Nanobot、AutoResearchClaw 等多个代表性项目,阐述其特点和应用场景,最后抽象出进化智能体的共同要素和工程模式。

AIGC开放社区
算法论文8

一篇进化Agents技术最新综述:迈向人工超级智能

LLMs有局限性,研究者关注进化Agents系统,其范式转变为人工超级智能铺路。文章回顾进化智能体研究进展,围绕‘什么要进化’‘何时进化’‘如何进化’展开,提供理论和实践指导。

PaperAgent