注意力算法」共找到 756 篇相关文章

产品应用8

告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒

大模型参数规模大,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。

新智元
开源动态8

DeepSeek-V3.2正式版发布,将开源模型的能力推向极致

DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。

AIGC开放社区
新闻资讯7

谷歌迎来“DeepSeek时刻”!TurboQuant引爆AI圈、全球开发者疯狂复现:6倍无损压缩,内存股集体暴跌

谷歌研究院发布 TurboQuant 压缩算法,能在提升速度、保持准确性的同时,降低大语言模型内存占用,可将键值缓存压缩至少 6 倍,速度最高提升 8 倍。该技术无需额外训练,精度零损失。目前虽未大规模部署,但已引发内存股下跌。

AI前线
推荐文章8

为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘

文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。

阿里云开发者
推荐文章8

上交博士最新思考:仅用两个问题讲清强化学习

上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。

AI科技评论
新闻资讯7

智能流体力学专题研讨会特邀报告1|潘翀:复杂流动智能测量方法——物理约束、数据同化与应用

2026年8月,第十四届全国流体力学学术会议在青岛举行。智能流体力学专题研讨会展示了AI与流体力学交叉研究进展。本次分享潘翀报告《复杂流动智能测量方法:物理约束、数据同化与应用》,含多种算法等内容。

力学与人工智能
算法论文8

Kimi新论文太硬核了!马斯克和Karpathy相继点赞~

马斯克和Karpathy点赞Kimi新论文《Attention Residuals》。该论文由杨植麟带队、苏剑林等参与,提出注意力残差(AttnRes),解决深层网络信息稀释问题,还通过工程折中降低成本,实验效果良好。

PaperAgent
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
新闻资讯7

谷歌创始人罕见反思:低估 Transformer,也低估了 AI 编程的风险,“代码错了,代价更高”

谷歌创始人 Sergey Brin 在斯坦福公开对话中反思,谷歌曾低估 Transformer 和 AI 编程风险。他认为 AI 写代码易出错,更适合创意类工作。还回顾谷歌发展,指出虽有研发积累,但曾投入不足,强调算法比算力更关键。

InfoQ
算法论文8

融资 1200亿后 Kimi 再扔王牌,新架构爆改 Transformer 老配件,比 DeepSeek 同款还省钱

Kimi 发布新论文,提出“注意力残差”架构改进 Transformer 残差连接,解决“稀释问题”,让 AI 更聪明、更省钱,还推出“分块注意力残差”优化成本。与 DeepSeek 方案对比,Kimi 方案性价比更高。

AI前线