技术实践8
RTP - LLM助力淘宝搜索相关性模型推理优化
阿里云开发者
AI 摘要
淘宝搜索为解决口语化Query问题引入大参数LLM模型,面临性能挑战。团队基于RTP - LLM框架,通过调度优化、批次内前缀复用、MoE Kernel动态调优等,支撑模型上线,还展望了未来优化方向。
阅读原文 · 阿里云开发者
RTP-LLM 在相关性大模型中的推理优化最佳实践
淘宝搜索场景引入大参数LLM模型,面临系统性能挑战。本文分享基于RTP - LLM框架的优化实践,如大BatchSize调度、批次内前缀复用、MoE Kernel动态调优等,还提及未来优化方向。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Sand.ai开源千亿MoE视频生成模型
Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。
量子位
产品应用7
DeepSeek V4:5毛做出3D射击游戏!
DeepSeek V4 Flash正式版API上线公测,其价格便宜得离谱,如0.07美元就能制作第一人称3D射击游戏。与Claude Opus 5、GPT - 5.6等对比,功能相近但成本低很多。它靠MoE架构等降低成本,还提升了性能。
量子位
开源动态7
Wafer:AMD跑GLM 5.2成本仅英伟达一半
推理优化公司Wafer公布数据,用AMD的MI355X芯片跑GLM 5.2,单节点吞吐达2626 tok/s,单流吞吐213 tok/s,成本不到英伟达B200的一半。该公司详述部署过程,还提及AMD软件生态的变化及英伟达面临的挑战。
量子位
开源动态8
蚂蚁·安诊儿医疗大模型三榜开源第一
由浙江省卫生健康信息中心等联合研发的开源医疗语言模型AntAngelMed发布。它基于Ling - flash - 2.0,100B总参数仅激活6.1B达约40B密集模型性能,在多个权威医疗基准测评中居前列,采用三阶段训练流程,高效MoE架构。
AIGC开放社区