「DAG并行执行」共找到 737 篇相关文章
LightLLM中DeepSeek V3/R1 Two MicroBatch Overlap 实现解析
文章围绕LightLLM中DeepSeek V3/R1的Two MicroBatch Overlap实现展开。介绍了该技术原理,通过拆分推理过程、精心设计执行顺序实现计算与通信重叠。还阐述了数据结构设计、预处理、核心执行流程,以及优化策略和配置启用方式。
Transformer 中的专家混合模型 (MoE)
文章介绍Transformer中专家混合模型(MoE),它能解决稠密模型扩展瓶颈。阐述其优势,如计算高效、适合并行等,还介绍在transformers库中支持稀疏架构的演进,包括权重加载重构、专家执行后端、专家并行及训练方案。
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
高性能全闪并行文件系统的设计和实践
焱融科技 CTO 张文涛在 QCon 大会分享‘高性能全闪并行文件系统的设计和实践’,介绍了焱融全闪文件存储架构和 YRCloudFile 技术细节,分享其解决 AI 训练存储难题的方案。
ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法
扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。
如何判断 AI 将优先自动化哪些任务?
思考AI优先自动化哪些任务,可从‘描述 - 执行鸿沟’视角出发。‘描述 - 执行鸿沟’大的任务是自动化沃土,反之自动化价值有限且创建训练数据难,它与‘判别器 - 生成器鸿沟’相似又不同。
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
Marvis 实测:6 个 AI“牛马”扎根桌面之后
作者实测腾讯 Marvis,它能实现终端调度、多 Agent 协同、跨模态任务链执行等。虽在编码、审美等方面有不足,但定位安全实用,适合普通用户,体现 AI 助手从对话工具向执行系统转变。
7.3K Star!用 Orca 组建 AI 舰队:让 Claude Code 和 Codex 同时开工!
Claude Code 大火后,多家大厂推出自家 Code CLI,多终端操作上下文切换成本高。Orca 是开源 AI 编排器,可让多个 AI 编程助手并行工作,集中查看结果,有并行工作区、统一管理界面等亮点。
Cloudflare 发布 Dynamic Workers 公开测试版:基于 Isolates 的沙箱环境执行 AI 智能体代码
Cloudflare 推出 Dynamic Worker 公开测试版,面向付费用户。它用 V8 Isolates 运行代码,启动快、内存效率高,基于 Code Mode 理念,用 TypeScript 接口定义 API,有多种防护策略,还发布配套库,已用于生产。