「GPU内核优化」共找到 1624 篇相关文章
大模型推理加速全链路:内存管理、编译优化、量化与并行策略
本文整理自金煜阳博士在QCon大会分享。介绍大模型推理挑战,如规模增大、架构复杂。阐述算子优化、内存管理、量化、异构调度和并行优化方法,还介绍开源推理引擎赤兔在国产芯片的实践成果。
PD 分离推理的加速大招,百度智能云网络基础设施和通信组件的优化实践
为适应PD分离式推理部署架构,百度智能云从物理网络、网络流量、通信组件和算子层面优化,提升上层推理服务性能,展现了网络、组件与业务特征融合的重要性。
重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析
上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。
北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练
北大彭一杰教授课题组提出 RiskPO,解决大模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集上表现超越 GRPO 等。
6.6K标星!微软开源Agent自我优化框架,为智能体注入持续学习能力!
开发AI Agent常面临部署后难自动优化的问题。微软开源的Agent Lightning,加几行代码就能让Agent自动学习、持续优化,有事件追踪等核心能力,安装简单,应用场景丰富。
豆包背后的“超算大脑”:字节ByteRobust系统跑20多万张GPU,性能刷新SOTA
字节跳动自研的ByteRobust系统登上SOSP 2025,部署于超20万张GPU平台,9600张GPU训练三个月ETTR达97%。该系统应对LLM训练故障,由控制和数据平面构成,能自动发现修复故障,提升训练效率与稳定性。
揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon
在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。
阿里云秘密武器亮相顶会:狂砍82%英伟达含量,213块GPU干了1192块的活
阿里云与北大合作,由CTO周靖人带队的研究提出GPU池化系统Aegaeon,亮相顶会SOSP。它用token级自动扩缩容技术,将GPU使用量从1192个减到213个,提升了资源利用率,还在百炼平台测试成功。
无问芯穹曾书霖谈 AI 2.0 时代的大模型推理:从模型到硬件的协同优化
本文整理自无问芯穹总经理曾书霖博士在 2025 年 QCon 全球软件开发大会演讲。他介绍软硬件协同优化提升智能系统能效成果,结合华为昇腾集群实践,探讨 AI 推理系统演进趋势,还从云、端维度分享大模型推理实践与挑战。
刚刚,国产GPU赛道又跑出一个 2700 亿估值独角兽!“中国AMD”沐曦股份完成 IPO,开盘大涨超 500%
2025年12月沐曦登陆科创板,股价达679元/股,估值破2700亿。其定位全栈GPU提供商,产品覆盖多领域。2022 - 2024年营收三年复合增长率超4000%,但累计净亏损超30亿。核心团队多来自AMD。