自注意力层」共找到 1525 篇相关文章

8

"将注意力旋转90°":深入浅出解读 Kimi 最新出圈成果

Kimi论文‘ATTENTION RESIDUALS’引发AI圈热议,马斯克等大佬高度评价。该论文由17岁高中生陈广宇参与,提出‘注意力残差’机制,解决标准残差问题,分全、分块注意力残差,权衡开销与效果。

腾讯技术工程
算法论文8

欲取代transformer的SSA(次平方稀疏注意力)解读

文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。

Agent的潜意识
产品应用7

AI生的图能分图,Agent控制能力进入下半场

Lovart上线Layered Image Editing功能,可动识别图片里的文字、主体、背景并拆成独立图,每个图能单独编辑。其还有快速模式,模型库更新快,能降低AI生图门槛。

探索AGI
开源动态8

AGI 新技术路线:下一代稀疏注意力机制 Monte Carlo Attention 开源

超对称技术公司在新版基座模型 BigBang - Proton 中使用的 Monte Carlo 注意力开源。它基于二进制块编码技术,用块间代表交流机制实现线性复杂度,兼具多种注意力机制优点,可满足宇宙尺度建模的上下文长度需求。

AI科技大本营
开源动态8

为训推加速!全新FlashQLA注意力算子库开源

Qwen3-Next发布,GDN成Qwen主力注意力,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。

千问大模型
推荐文章8

翁荔新博客提出「进化先从Harness开始」,DeepSeek崔添翼转发附议

前OpenAI安全副总裁翁荔新博客探讨AI进化,提出从Harness开始的现实路径。DeepSeek崔添翼转发附议,认为Harness方向进化很可能出成果。翁荔梳理研究,展示优化递进趋势,也指出实现递归我改进存在的瓶颈。

量子位
新闻资讯8

未来1-5年半数白领或失业?Anthropic联创曝:内部工程师已不写代码,下一代AI大多是Claude己写的

在2025年Axios AI+华盛顿峰会上,Anthropic联创接受访谈,称未来1到5年,多达一半白领工作或消失,失业率或飙升至20%。Anthropic内部工程师工作已巨变,Claude能写代码设计下一代AI。此外,AI还出现作弊等情况。

AI科技大本营
开源动态8

全球首个AI智能体「进化」开源框架来了!一次部署,终生可用

英国格拉斯哥大学团队发布全球首个AI智能体进化开源框架EvoAgentX,打破传统多智能体系统构建与优化限制。它有动化构建、进化机制和系统性评估亮点,实验验证其性能提升显著。

新智元
产品应用8

模型换个Harness就「变笨」?EverMind把进化从研究推向产品,让AI「越用越聪明」

同一模型换 Harness 表现或大幅波动,暴露进化走向产品的两个关键问题。EverMind 用 HarnessBank、Raven 与 EverMe 解决,将进化从研究推向产品,让 AI「越用越聪明」。

机器之心
产品应用7

一家智能眼镜公司,为什么非要研AI大模型系统?|甲子光年

智能眼镜要么不够智能,要么不像眼镜,李未可科技CEO茹忆认为AI要成第一响应者。该公司推三款AI眼镜,搭载研系统。其研AI大模型系统,是为交付难复制AI体验闭环,解决通用API不足等问题。

甲子光年