mini - sglang」共找到 163 篇相关文章

产品应用8

新一代Mac mini搭载M6开售!M5 Ultra也来了

苹果更新Mac mini和Mac Studio,带来M6、M5 Ultra芯片。M6是苹果首颗2nm制程M系列芯片,M5 Ultra为四晶粒封装SoC。苹果用四个档位搭建桌面Mac本地AI算力梯队,8月27日预购,9月22日发售。

新智元
新闻资讯7

40位数学家组成8队与o4-mini-medium比赛,6队败北

Epoch AI安排40位数学家组成8支战队,与OpenAI的o4 - mini - medium模型对决,考题来自高难度的FrontierMath数据集。结果AI以6:2击败人类,不过Epoch AI认为AI未明显超人类,但很快会达到。

机器之心
算法论文8

Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini

Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。

深度学习自然语言处理
产品应用7

基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型

本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。

GiantPandaLLM
开源动态8

面向 SGLang 的 Profile Analysis SKILL:3 张表定位 Kernel Fuse 和 Overlap 机会

文章介绍了面向SGLang的Profile Analysis SKILL,其工作流统一,输出3张表定位Kernel Fuse和Overlap机会,支持多种分析方式和模型。还给出Qwen/Qwen3.5 - 4B和openai/gpt - oss - 20b的分析结果,并表明该SKILL能节省token、缩短工期,作者厌恶Torch Compile。

GiantPandaLLM
算法论文8

刚刚,清华团队用27M参数击败o3-mini!或将改变AI发展方向

清华大学研究团队发布论文,展示Hierarchical Reasoning Model(HRM)。该模型仅27M参数、1000个训练样本,在推理任务上击败OpenAI的o3 - mini - high,或改变AI发展方向。

AGI Hunt
开源动态8

社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini

阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。

Hugging Face
新闻资讯7

社区供稿丨Reachy Mini 亮相 CES 黄仁勋主题演讲:一场开源共创的科技旅程

CES 2026 的 NVIDIA 主题演讲中,黄仁勋带来开源桌面机器人 Reachy Mini,展示了将模型与物理世界连接打造智能伙伴。它运行在本地,依托 DGX Spark 算力,能完成多种任务,其开发是开源硬件与敏捷制造的胜利。

Hugging Face
开源动态7

SGLang 贴近硬件:用编译产物(PTX/SASS)评审 PR #26588、DeepGEMM 与架构迁移

本文从「编译产物评审」视角,分析 SGLang 的 PR、FlashInfer DeepGEMM 及 Ampere→Hopper 架构迁移案例。指出算法面和编译产物面会有分歧,编译产物 diff 能提前揭示执行路径变化,对开源项目有增益。

GiantPandaLLM
开源动态8

OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑

OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。

机器之心