开源动态8
斯坦福推Llama超级推理内核
新智元
AI 摘要
斯坦福Hazy实验室:推出推理引擎「Megakernel」,把Llama - 1B前向传播塞进单个GPU内核,H100、B200上推理速度大幅提升,远超vLLM等,展现低延迟推理潜力。
阅读原文 · 新智元
妈妈再也不用担心延迟了!斯坦福手搓Llama超级内核,推理仅需0.00068秒
斯坦福Hazy实验室推出低延迟推理引擎「Megakernel」,将Llama - 1B前向传播融入单一GPU内核,H100上提速1.5倍,B200上每次推理仅0.00068秒,比vLLM快3.5倍。文章分析传统引擎问题并介绍Megakernel设计。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
北大团队推MathDebugger,提升合成数据质量
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
InfoQ
新闻资讯7
Google发布Gemini 3.8双版本抢智能体入口
9月2日,Google发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。前者用于编程等,已稳定上线;后者专用于发现修复漏洞,仅向特定方开放。二者共享基础能力,采用不同安全限制和部署环境。
AIGC开放社区
新闻资讯7
OpenAI Astra核心架构:循环深度引争议
The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测性担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。
AI寒武纪
产品应用7
Anthropic发布Claude 5.1,最强能力限少数机构用
9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,二者用相同底层模型,区别在安全限制和开放范围。Fable面向订阅用户和企业,Mythos仅向少数审核机构开放,此次还尝试新的开放方式。
AIGC开放社区