模块化双工注意力机制」共找到 301 篇相关文章

算法论文8

ACL 2026 | LCA:DeepSeek 长文本加速神器,90% KV 缓存缩减 + 2.5 倍推理提速

琶洲实验室等团队提出潜在空间压缩注意力(LCA),入选 ACL 2026。LCA 突破传统注意力机制瓶颈,适配不同大模型,降低硬件门槛与成本,提升推理效率。论文与代码已开源。

机器之心
算法论文8

治好多模态近视和走神!上海大学去偏干预显著提升模型性能

多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。

AIGC开放社区
产品应用8

灵码+Qwen3-Coder——使用Skill机制实现代码审核

本文探讨在灵码内使用Claude Skills能力,介绍其实现机制、灵码适配方案。还以代码审核场景为例,展示自定义Skill的创建方法,总结Claude Skills优势及应用场景,展望其与MCP的发展前景。

阿里云开发者
产品应用8

一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后

DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。

AI寒武纪
新闻资讯7

FlashAttention-4震撼来袭,原生支持Blackwell GPU,英伟达的护城河更深了?

在 Hot Chips 2025 上,TogetherAI 首席科学家 Tri Dao 公布 FlashAttention-4,其在 Backwell 上比英伟达 cuDNN 库中的注意力核实现快 22%,还实现两项算法改进。该技术一直迭代升级,提升了注意力计算效率。

机器之心
新闻资讯8

领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%

Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。

机器之心
算法论文8

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破

近日,浙大与新加坡国立大学提出新型深度神经网络基础操作Translution,融合Self - Attention与Convolution优势,实现二者统一。基于它构建的网络在ViT和GPT架构下性能提升,但对算力要求更高。

AI科技大本营
推荐文章8

Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?

Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。

Founder Park
产品应用8

开会最怕那一声尖叫,被腾讯会议用声链干掉了

开会时多人用多台设备入会常出现啸叫、回声问题,以往解决方法成本高或体验差。腾讯会议‘声链’以纯软件方案解决此问题,让设备自由开麦,声音更自然稳定,体现技术价值。

MacTalk
算法论文8

省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式

大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。

AI寒武纪