「推理性能优化」共找到 4171 篇相关文章
SGLang|SGLang Diffusion
来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。
重磅!Google 推出AlphaEvolve 实现算法自我进化,将颠覆数学与计算机科学!
Google DeepMind发布革命性的Gemini驱动编码代理AlphaEvolve,能设计并优化算法。它发现更快矩阵乘法算法、解决开放性数学问题,还优化了Google多方面计算基础架构,未来跨领域应用前景广。
数千大模型全跑「中国芯」!最后一公里已「焊」通
国产芯片运行大模型需额外适配,魔乐社区以开源模型推理适配协作模式破局。它推出‘模型推理适配协作计划’,联合多方力量,打通国产算力与大模型应用‘最后一公里’,还举办赛事激发创新活力。
谷歌AlphaEvolve引发OpenAI关注:AI原创算法,正挑战人类专家界限
谷歌DeepMind推出的AlphaEvolve系统,结合Gemini模型与进化算法,能自主探索、生成并迭代优化算法代码。它优化经典算法,在多领域取得突破,其原创能力引业界关注,OpenAI研究员对此表示震撼。
谷歌技术报告披露大模型能耗:响应一次相当于微波炉叮一秒
大模型耗电舆论高,谷歌用数据还击。谷歌首席科学家称Gemini能耗低于预期,一年间能耗降至1/33,碳排放降至1/44。谷歌用更全面指标计算能耗,还从多方面优化使Gemini能耗降低。
智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法
AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。
记录下SGLang 开发,debug的几个技巧第二弹
作者BBuf继上次分享后,又带来SGLang开发、debug新技巧。包括开启多线程加载模型权重,介绍SGLang Serve模型短期和长期崩溃的调试方法,还提及逐层NVTX Profiling、查看固定batch_size下Decoding性能等技巧。
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
将庞大3D世界装进手机!李飞飞Spark 2.0开源
李飞飞团队开源核心技术Spark 2.0,可优化3D世界,让普通设备通过浏览器流畅访问交互。它有自动选细节、分批加载、优化存储三绝招,适配主流框架,有望改变与数字世界互动方式。
简单了解下CUDA Green Context
文章基于Flashinfer实现介绍CUDA Green Context,它在CUDA 12.0+引入,能实现资源隔离、降低多线程性能损失、提高GPU使用率。还给出使用方法及代码示例,不过测试性能未达预期,需关注后续发展。