CUDA 13.1」共找到 1857 篇相关文章

推荐文章7

【博客转载】CUDA Kernel Execution Overlap

文章讨论CUDA kernel执行重叠,指出有足够计算资源时可重叠,通过调整`blocks_per_grid`值,观察到不同并行化程度。还提到隐式同步会影响重叠,可启用`per-thread` default Stream 禁用。

GiantPandaLLM
推荐文章7

【博客转载】CUDA Shared Memory Swizzling

文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。

GiantPandaLLM
新闻资讯7

OpenAI失去了「CUDA内核之神」

近日热传Scott Gray已离开OpenAI。这位有「CUDA内核之神」称号的工程师声名起于Nervana Systems,加入OpenAI后贡献颇多。2026年OpenAI已流失不少人才,他的离开对公司影响值得关注。

机器之心
开源动态7

Distilabel DeepSeek-R1 模型蒸馏教程

文章介绍结合distilabel与QLoRA技术定制专属大模型的路径。先用distilabel框架利用DeepSeek - R1生成医疗指令数据集,再用QLoRA技术微调Qwen3 - 4B模型,还给出实战路线图和代码示例。

机器学习AI算法工程
推荐文章7

通过查看GPU Assembly分析CUDA程序

文章是关于通过分析SASS代码提高内存受限CUDA程序性能的笔记。以向量复制程序为例,对比普通和向量化版本,通过查看SASS代码,解释向量化版本性能更快的原因是加载/存储数据量更大、启动块数更少。

GiantPandaLLM
新闻资讯7

OpenAI推出GPT-5.1小小小小更新!!!

OpenAI推出GPT-5.1,本周向用户陆续推送,付费用户先行。它有两大核心模型,在遵循指令、推理回复及聊天体验上更佳。还有AMA问答活动披露更多细节,此外官方让自定义ChatGPT风格更易。

AI寒武纪
新闻资讯7

AMD终于有机会撬动CUDA了吗?

过去AMD GPU虽性能强但难敌英伟达CUDA生态。2024年有机构认为其缩小软件差距概率为0,但如今判断改变,AMD软件团队进步,客户回归,可它仍需解决软件集群稳定性和Helios量产问题。

DeepTech深科技
开源动态7

蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理

医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。

CourseAI
推荐文章7

图解Vllm V1系列6:KVCacheManager与PrefixCaching

文章聚焦vllm v1,阐述调度器取请求时判断设备有无充足空间做推理的问题,涉及KVCacheManager与Prefix Caching。前者管理请求和块,后者通过找最长一致前缀节省显存,还介绍块分配释放策略与流程。

GiantPandaLLM
产品应用7

DeepSeek R1 的小更新,却大有深意?

5月28日,DeepSeek低调宣布R1模型小版本试升级,API接口和使用方式不变,但未公布具体更新内容。从用户反馈看,语义理解、逻辑推理等能力提升,实测表现出色。此次升级或有安全、产品路线等考量。

AGI Hunt