「内存池」共找到 225 篇相关文章
关于现代GPU体系结构内存一致性(Memory Consistency)模型的一些猜想(二)——同步性能
文章聚焦GPU应用层面,通过实验对比不同同步代码实现的性能。在H20 GPU上测试,发现scope越小同步性能越好,内存屏障开销随scope增大而增加,还介绍非PTX及官方推荐实现方式并给出性能对比。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。
ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍
LLM生成文本时KV Cache内存占用高,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独高精度保存,其余压缩。实验显示,它准确性高、效率好,不过在极短文本等场景有局限。
6 天、96 万行 Rust、直接合并?Claude Code 被 Bun 的内存泄漏拖垮后,Bun 让 Claude 亲手重写了自己
2026 年 5 月,Bun 创始人 Jarred Sumner 宣布将合并 Rust 重写版本,终结 Zig 版。此次迁移仅用六天,涉及 96 万行代码。此前,Bun 内存泄漏影响 Claude Code,促使 Anthropic 让 Claude 重写 Bun。不过,AI 重写也引发对代码质量和流程的争议。
【博客转载】CUDA Constant Memory
文章介绍 CUDA 常量内存,它是设备上 64KB 被缓存的只读特殊内存空间。通过示例比较不同访问模式下常量内存和全局内存性能,指出块或 warp 一次访问时,常量内存快 10%;线程一次或伪随机访问时,慢很多。
【博客转载】CUDA Vectorized Memory Access (文末送书)
文章展示如何用向量化内存访问提高CUDA函数有效内存带宽,实现朴素自定义设备内存拷贝函数,对比不同数据类型、大小及方法的性能,得出拷贝数据单元多、单元大及以8或16字节向量化单元拷贝可提升带宽等结论。
Transformer危!谷歌MoR架构发布:内存减半推理速度还翻倍
谷歌推出全新底层架构Mixture-of-Recursions(MoR),推理速度提高2倍、KV内存减半,首次在单一框架实现多任务处理与动态分配计算资源,研究人员通过实验验证其性能超Transformer。
内存四年涨700%,长鑫LPDDR6送样能把价格打下来吗
近期“长鑫DDR6送审”刷屏,实则涉及技术进度、资本事件、供应链前置动作。文章分析长鑫进展含金量,认为国产DRAM首次和国际标准处同一窗口。此轮存储涨价因HBM抽走通用产能,长鑫或补通用市场空缺。
全球第二易主,谷歌逆袭登顶!OpenAI 500亿股票池曝光,Ilya躺赚40亿
谷歌母公司成全球市值TOP 2,Gemini市场份额疯涨。被逼急的OpenAI甩出500亿美元员工股票池,Ilya或分40亿。谷歌有入口优势,AI竞赛进入拼入口阶段,OpenAI砸钱抢人赌未来。
英伟达都摁不住了!内存疯涨,AI服务器被曝涨价超15%
搭载英伟达AI芯片的服务器将在2027年初涨价超15%,但这次并非英伟达主导,而是代工厂。真正原因是内存价格疯涨,三星、SK海力士和美光掌控近九成市场,有定价权。