「缓存性能」共找到 1989 篇相关文章
AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab
上海人工智能实验室等团队设计REST框架,在一个prompt里抛多个问题模拟多任务推理场景。测试发现即便顶级模型如DeepSeek - R1在“高压”下准确率也骤降,该框架能揭示模型差异,为评测提供新范式。
Transformer终结者!谷歌DeepMind全新MoR架构问世,新一代魔王来了
KAIST、谷歌DeepMind等机构发布的MoR架构,推理速度翻倍、内存减半,重塑LLM性能边界,碾压传统Transformer。它融合参数共享与按需计算,有路由和KV缓存策略,实验显示其性能优越、可扩展性好。
合合信息:基于 JuiceFS 构建统一存储,支撑 PB 级 AI 训练
合合信息为应对AI训练存储挑战,引入JuiceFS构建统一存储架构,结合BeeGFS作缓存。该架构提升I/O性能与资源调度效率,还通过缓存优化、数据治理等措施,支撑多业务并发,为AI基建奠基。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
关于Pingpong和Cooperative的一些感性理解
作者团队在SGLang支持Hopper架构相关GEMM,经分析发现多数场景Pingpong调度策略性能优于Cooperative,K维度小的场景DeepGEMM性能优于CUTLASS。本文重点介绍Pingpong性能优势及Cooperative无法Overlap Epilogue的原因。
腾讯混元AI Infra核心技术重磅开源:推理吞吐提升30%!
腾讯混元AI Infra团队开源生产级高性能LLM推理核心算子库HPC-Ops,基于生产环境痛点开发,降低底层算子开发门槛,实现显著性能突破。在真实场景下,混元、DeepSeek模型推理QPM提升,单算子性能也超越主流算子库。
Anthropic:这样构建Agent,性能提升90%!
Anthropic分享从0到1构建多智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货多,涵盖架构设计、Prompt工程等。多智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务。
推理时扰动高熵词,增强LLM性能
香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。
Meta通过简单算术解锁LLM SoTA性能
大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。
Claude最新模型Mythos意外泄露,性能远超Opus
Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。