「清华高性能所」共找到 3652 篇相关文章
从 Serverless 到 Agent:Cube 系统的一些设计思考
本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、高并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。
告别盲选LLM!ICML 2025新研究解释大模型选择的「玄学」
弗吉尼亚理工大学研究团队提出 LensLLM 框架,基于 PAC - 贝叶斯泛化界限揭示 LLM 微调性能“双相演进”,可精准预测微调性能、大幅降低计算成本,为 LLM 选型提供新工具。
SGLang × RoleBasedGroup(RBG):打通大模型推理PD分离架构规模化落地的“最后一公里”
PD分离架构对大模型推理部署意义重大,SGLang支持该架构且性能佳。但从测试到生产落地难,存在部署、资源、可靠性等问题。SGLang开源RBG项目,结合二者为PD分离架构生产化落地提供方案。
1000 行 Java 代码手搓 OpenAI gpt-oss 推理引擎
2025年8月OpenAI发布gpt - oss,作者受相关项目启发,用约1000行Java代码实现gpt - oss推理引擎并发布在亚马逊官方github。文章分享开发体会,介绍模型架构、Java实现、性能优化等内容。
硬件成本直降60%!原生分布式VS传统分库分表数据库
服务器硬件价格上涨,传统分库分表架构资源利用效率低。OceanBase 作为原生分布式数据库,通过多种技术优化资源,降低硬件依赖,多个案例显示其能大幅降低成本、提升性能,获 Forrester 认证。
微软发布了 TypeScript 5.9,延迟导入并增强了开发者体验
微软发布 TypeScript 5.9,带来开发者体验改进、新特性和性能优化,如支持延迟导入、改进默认项目设置、引入新模块选项等,也有性能升级,还透露未来版本计划。
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
刚刚!微软 | 发布全新一代自研AI芯片Maia 200
微软提前发布自研AI芯片Maia 200,基于台积电3纳米工艺,性能超竞品,是其异构AI基础设施重要部分,将支持多个大模型,已部署在美中数据中心,还开放Maia SDK预览。
姚班陈立杰入职OpenAI!破解50年世界难题的30岁天才,要颠覆ChatGPT
有消息称清华姚班天才陈立杰将入职OpenAI,他将告别UC伯克利助理教授岗位。陈立杰履历亮眼,16岁保送清华姚班,18岁获IOI金牌,若入职可能给OpenAI带来理论突破。
作业帮StarRocks替换Presto落地实践
本文分享作业帮 2025 年 StarRocks 替换 Presto 的实践,涵盖历史背景、技术方案、双跑方案、结果分析,还提及核心问题及解决办法,项目上线后在资源、架构、性能上均有收益,也有未来规划。