辅导方式」共找到 824 篇相关文章

开源动态7

GPU-MODE Leaderboards之vector_add histogram 以及一些有趣发现

文章介绍GPU-MODE Leaderboards中vector_add和histogram任务。分析vector_add实现、带宽利用率,rank1代码用cccl,带宽利用率超80%;histogram算子瓶颈在atomic冲突等,rank1也多用cccl,还给出rank2代码,最后提及任务中Hack行为及代码提交方式

GiantPandaLLM
产品应用7

【CUDA 博客】TMA简介 & 让矩阵转置在Hopper GPUs上变得更快

文章介绍Hopper GPU新特性TMA,它能高效传输多维数组数据。文中展示用TMA对2D数组操作,如创建张量映射、编写kernel等。还讲了避免共享内存bank冲突的交织方法,最后介绍在Hopper GPU上实现高效矩阵转置的多种方式及性能。

GiantPandaLLM
新闻资讯8

JoyInside 创新大赛现场,我看到 AI 硬件长出了灵魂

作者曾对多数AI硬件失望,认为其有硬件没灵魂。但在观猹和京东联合举办的JoyInside创新大赛上,20强产品让其改观。大赛基于京东JoyAI大模型,缩短产品上市周期,前三名产品各有亮点,还呈现场景垂直化和交互方式改变趋势。

特工宇宙
开源动态8

面向 SGLang 的 Profile Analysis SKILL:3 张表定位 Kernel Fuse 和 Overlap 机会

文章介绍了面向SGLang的Profile Analysis SKILL,其工作流统一,输出3张表定位Kernel Fuse和Overlap机会,支持多种分析方式和模型。还给出Qwen/Qwen3.5 - 4B和openai/gpt - oss - 20b的分析结果,并表明该SKILL能节省token、缩短工期,作者厌恶Torch Compile。

GiantPandaLLM
上一页83 / 83下一页