算法论文8
百度:ESS方案突破DeepSeek-V3.2-Exp显存瓶颈
InfoQ
AI 摘要
百度百舸AIAK团队:针对DeepSeek-V3.2-Exp设计ESS方案,通过卸载预取Latent Cache突破显存瓶颈,模拟验证显示能大幅提升吞吐,未来将拓展至更多大模型。
阅读原文 · InfoQ
突破显存瓶颈:基于 DeepSeek-V3.2-Exp 的 Latent Cache 卸载预取方案设计与模拟验证
百度百舸AIAK团队针对DeepSeek-V3.2-Exp,设计基于Latent Cache的卸载预取方案ESS。该方案解决显存瓶颈,提升Decode吞吐并降低成本,经模拟验证效果显著,未来将拓展应用。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
DeepSeek-V3.2-Exp:稀疏注意力破长文本效率瓶颈
在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。
CourseAI
算法论文8
智象未来DreamWorld:3D先验驱动视频扩散
视频扩散模型生成新视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。
机器之心
算法论文8
复旦&引望WAM-Diff2让自动驾驶解码提速15.1倍
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
机器之心
算法论文7
Gemini、GPT进《我的世界》评测,新框架破瓶颈
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
AI科技评论