产品应用8
软件优化让PCIe显卡吞吐翻近7倍
量子位
AI 摘要
是石科技自研Meta-Infer推理引擎,通过内核补齐、通信重构等纯软件优化,无需修改模型结构,让PCIe显卡DeepSeek推理吞吐提近7倍,可适配国产GPU,缩小与高端显卡性能差距。
阅读原文 · 量子位
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍
当前大模型算力需求攀升,高端GPU供给紧成本高,大量PCIe长尾GPU算力因框架适配不足被禁锢。是石科技自研Meta-Infer推理引擎,通过纯软件优化挖掘硬件潜力,让DeepSeek推理吞吐提升近7倍,方法也适配国产GPU。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文9
对错之外,推理轨迹暗藏训练价值
本文结合EchoRL、ReflectRL两项最新研究,重新解读推理轨迹的训练价值,解决全答对无强化信号、错题全丢弃的训练痛点,梳理方法设计、实验结果与适用边界,为大模型推理训练提供新参考。
深度学习自然语言处理
新闻资讯8
代码生成提速,软件交付瓶颈转移
本文整理了2026云栖大会AI Native研发实践论坛的嘉宾分享,围绕代码生成提速后软件交付的新瓶颈问题,展示了阿里各业务线与学界的最新实践,探讨AI Native研发新方向。
机器之心
推荐文章9
数据比模型成共识,接下来拼什么
本文为数势科技创始人黎科峰记录上海闭门行业圆桌内容,不同领域从业者一致认为,大模型已非企业AI胜负手,数据与语义层才是核心瓶颈,共识形成后行业进入深度竞争阶段。
InfoQ
算法论文9
冻结权重,ModularRSI让Agent持续进化
IQuest Research联合北京航空航天大学、曼彻斯特大学等机构发布ModularRSI研究,探索在基础模型权重冻结的条件下,通过演化Agent外围运行机制Harness,实现可泛化的Agent自我改进,性能提升可跨任务、领域、模型迁移。
机器之心