算法论文8
全新推理架构EaaS:锐减37.5%推理成本
机器之心
AI 摘要
刘子铭等人提出全新「专家即服务」推理架构EaaS。它将专家拆成独立服务,解耦Attention与专家层。实验显示,EaaS能锐减37.5%成本,兼顾高吞吐与低延迟,容错性强。
阅读原文 · 机器之心
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本
近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Sand.ai开源千亿MoE视频生成模型
Sand.ai团队开源全球首个千亿MoE视频生成模型MAGI - 2 - preview,总参数114B,单次前向激活约6B,成本低效果好。该模型解决了视频生成Scaling难题,架构、系统设计出色,开源将改变行业规则。
量子位
产品应用7
DeepSeek V4:5毛做出3D射击游戏!
DeepSeek V4 Flash正式版API上线公测,其价格便宜得离谱,如0.07美元就能制作第一人称3D射击游戏。与Claude Opus 5、GPT - 5.6等对比,功能相近但成本低很多。它靠MoE架构等降低成本,还提升了性能。
量子位
开源动态8
南北阁实验室:Nanbeige4.2 - 3B小模型挑战大任务
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
AIGC开放社区
新闻资讯7
Agent Token 消耗高,业界探索降本方案
AI 行业从生成式能力向 Agent 行动力跃迁,核心矛盾转向推理成本可控性。随着企业将 Agent 编入自动化流水线,Token 消耗受关注,业界开始聚焦以「降本」为核心的技术路线。
机器之心