双并行注意力机制」共找到 1185 篇相关文章

开源动态7

Sglang 源码学习笔记(三)- 分布式和并行(以deepseek 为例)(WIP)

文章是 sglang 源码学习笔记,聚焦分布式和并行,以 deepseek 为例。介绍通信域类型,分析 ZMQ 和 torch.dist 通信,阐述 TP、DP、EP 实现,包括初始化、使用等,还涉及不同 Linear 层 TP 及 MoE 不同实现情况。

GiantPandaLLM
产品应用7

Cursor 2.0 来了!自研模型 Composer1,更禅的界面,多代理并行,Browser调试更强大

Cursor 2.0 发布,有诸多升级。它有自研编码模型 Composer1,速度快且适合 Agent 模式;界面更清爽禅意;支持多代理并行,能提升编码效率;浏览器可嵌入编辑器,沙盒终端在 macOS 正式发布等。

AI进修生
推荐文章8

每天审200个PR、每月3000个Issue?智能体开始并行写代码,人类可能成最薄弱环节

本文是对微软 VS Code 团队工程经理 Kai Maetzel 的访谈。他回顾了 VS Code 发展历程,分享 AI 编程、智能体开发及开发者工具设计的实践思考,如 AI 补全体验优化、智能体开发权衡、与 IDE 交互机制等,还探讨了未来发展挑战与趋势。

InfoQ
新闻资讯7

AI 唱得比顶流歌手还精准!周亚辉盛赞百倍跃进,高晓松直言:AI 和我不是一个创作机制

近日昆仑天工发布 Mureka V8 音乐大模型,昆仑天工董事长周亚辉称其标志 AI 音乐达大规模工业化应用成熟度。高晓松认为 AI 与自己创作机制不同,但也肯定其能力,当前 AI 音乐正重塑产业权益结构。

AI前线
8

刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%

月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。

AI寒武纪
开源动态8

加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁

清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。

AIGC开放社区
算法论文8

太巅了!MIT老哥在Transformer里造了台计算机,LLM从此不需要调用外部工具?

LLM在数学推理表现佳,但纯计算是短板。MIT的Christos Tzamos团队在Transformer内造计算机,实现WebAssembly解释器,解决数独难题,还突破注意力机制瓶颈,打开软件与神经网络新接口。

AI寒武纪
算法论文8

7篇顶会NeurIPS 2025最佳论文都说了什么?

NeurIPS 2025七篇获奖论文揭示大模型思维同质化、推理能力虚幻边界等隐忧,也在注意力机制、神经扩展定律等方面取得物理学层面突破,为AI建立更严谨科学地基。

AIGC开放社区
算法论文8

Communications Engineering | 西湖大学&女王大学:面向阵风气动建模的表面压力时空动力学关联研究

西湖大学联合女王大学团队提出 Graph Transformer 框架用于阵风气动建模,融合图神经网络与注意力机制,从表面压力信号学时空关联,实现气动力准确预测,为AI在复杂气动建模提供新思路。

力学与人工智能
算法论文8

快9倍还更清晰?Direct3D-S2一键解锁高效3D生成

在高分辨率三维形状生成中,传统方式有计算与内存瓶颈。南京大学提出Direct3D - S2框架,基于稀疏体积构建,有空间稀疏注意力机制,加速计算,还引入统一格式VAE,生成质量领先,训练成本更低。

带你学AI