「软件栈优化」共找到 2052 篇相关文章
全球首个完全AI编写的训练框架来了,速度反超英伟达:面壁要用 AI 把国产算力软件重写一遍
面壁智能发布全球首个全由AI编写的训练框架ForgeTrain,在华为昇腾系列上验证,速度超英伟达Megatron 10%。其构建分三阶段,目标是为不同需求“现场锻造”软件,还为国产算力软件生态赶超提供新思路。
蚂蚁开源 x SGLang Meetup技术回放解读系列之面向DeepSeek系列模型的深度优化与实践
文章是对蚂蚁开源x SGLang Meetup中「蚂蚁Theta面向DeepSeek系列模型的深度优化和实践」分享的解读,详细介绍了在H20-96G上对DeepSeek系列模型推理的优化方案,包括Prefill和Decode阶段的优化、通信优化、观测诊断等,并给出了评测结果。
合理利用应用商店ASO优化工具,提升APP产品权重和转化率(工具篇)
应用商店优化(ASO)是提升App曝光和下载转化率的关键过程,涉及榜单排名、关键词搜索、转化率及其他展位优化。图标、截图、宣传文本、关键词设置等都是影响用户感知和下载决策的重要因素。
关键技术详解|腾讯一念 LLM 分布式推理优化实践
InfoQ 邀请袁镱分享《一念 LLM 分布式推理优化实践》。介绍了“一念 LLM”设计思路、推理优化挑战与突破等,还对比不同框架,指出优化方向,如先实现 PP,再推进 EP 与 PD 分离。
软件正在吞噬劳动力:直接取代人类,捕获前所未有的经济价值
a16z 普通合伙人 Alex Rampell 演讲指出,软件正从辅助人类转向直接取代劳动。过去软件是将文件柜数字化,如今正从记录工具变为任务执行者,这将催生新商业模式,捕获巨大经济价值。
一行命令,让任何软件秒变AI神器!这个GitHub项目杀疯了
AI智能体推理强但使用专业软件能力差,现有解决方案不佳。CLI - Anything自动化框架打破困境,能让AI通过命令行控制软件,为13款软件生成CLI,有7阶段流水线,多场景适用,介绍了使用方法和项目地址。
Nature Computational Science | 香港城市大学韦业等:复杂系统深度主动优化
本文通过集成深度神经网络和树探索能力,提出神经网络代理模型引导树探索的主动优化方法。该方法在超2000维数值优化问题中找到全局最优,在多领域表现优于现有方法,为小样本、高维优化难题提供通用技术。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
单机H200最快DeepSeek V3和R1推理系统优化秘籍
作者从开源技术分享角度,盘点SGLang对单机规模推理的大量工程优化技巧,涉及FP8 Block GEMM演进、FusedMoE模块优化、Attention Backend优化等,助于提升DeepSeek V3/R1在单机H200上的推理性能。
Karpathy最新预言:不开放、不脚本化的软件将在AI时代“灭绝”
Andrej Karpathy预言,不开放、不脚本化的传统软件在AI时代将‘灭绝’,他点名Adobe全家桶等软件风险高,认为未来赢家是‘天生文本化、可脚本化’产品,软件‘可AI协作性’将成生死分水岭。