「晶圆级计算」共找到 1568 篇相关文章
大部分token根本不该重复计算,不止于KVCache
斯坦福研究显示,AI Agent每次调用62%内容重复,现有前缀缓存虽有优化但天花板低,阿里云数据表明多数缓存块利用率低。LMCache将缓存管理独立,解决性能问题,其CacheBlend技术复用缓存,适配多引擎和存储后端。
从计算到存储,阿里云打通AI落地的“任督二脉”
在8月14日飞天发布时刻,阿里云发布通用计算、容器计算及存储服务三项产品更新,串联出AI落地业务场景完整路径,引导行业重新思考AI时代云基础设施的本质。
云计算“活教科书”语出惊人,指明程序员的进化方向
亚马逊云科技副总裁Jeff Barr被称云计算“活教科书”。他认为AI编程工具放大开发者技能,开发者应提升沟通能力,未来“短命应用”将涌现,云与AI结合是趋势,还见证了中国云计算发展的巨大进步。
7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律
非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数学等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。
Tair 短期记忆架构实践:淘宝闪购 AI Agent 的秒级响应记忆系统
本文从淘宝闪购与千问合作的‘一句话点外卖’项目出发,介绍 Tair 在 AI Agent 记忆管理中的数据模型设计、压缩策略与并发控制等关键实践,展示其在低延迟、数据建模、并发安全和弹性抗压等方面的能力。
蚂蚁开源 x SGLang Meetup技术回放解读之基于CUTE DSL的通信计算重叠算子实践
文章是对蚂蚁开源x SGLang Meetup分享的回放解读,聚焦基于CuTe DSL的通信 - 计算重叠内核实践。探讨不同通信计算重叠方案,分析在Blackwell上做GEMM + AllReduce融合算子的优势,介绍multimem指令等,还提及接入模型执行路径和性能结果。
「有望成为Transformer杀手」,谷歌DeepMind新架构MoR实现两倍推理速度
谷歌DeepMind发布新架构MoR,有望成Transformer杀手。它统一实现参数共享、自适应计算,兼顾性能与效率。实验显示其推理吞吐量提升,降低计算需求,但能否取代Transformer存疑。
中国首次实现运载火箭一级陆地回收,朱雀三号“站着”回来了!
今早7时35分,蓝箭航天朱雀三号遥二运载火箭升空,一子级约6分钟后成功陆地回收,二子级将卫星送进预定轨道。这是中国首次实现重复使用运载火箭一子级着陆腿方式陆地可控回收。
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。
OpenAI 3000亿美元大单!甲骨文股价一夜飙升35%
OpenAI与甲骨文官宣签下3000亿美元云计算合同,消息一出甲骨文股价飙升35%。这笔交易刷新云计算领域记录,其将助力OpenAI的“Stargate”计划,虽能耗高,但也会带来经济回报,还改变了云计算市场格局。