高性能Kernel」共找到 3423 篇相关文章

推荐文章7

TileLang深入详解-第一章-GPU 体系结构复习

作者借长假学习 TileLang 并撰写此文,先复习 GPU 体系结构,包括计算与线程组织、存储层次、专用指令单元,接着介绍核心性能模型与优化原理,最后给出基于 TileLang 的基准测试实践。

GiantPandaLLM
新闻资讯7

硅谷AI研发精英,每周需工作100小时

在中美争夺AGI“圣杯”进程中,顶尖AI研究员虽拿着薪,但脑力劳动强度极。《华尔街日报》披露,硅谷研究员和管每周工作80到100小时成常态,这虽推动突破,也让从业者面临身心考验与人才流失风险。

新智元
算法论文7

ACL2025 | 抓出0.1%的捣乱分子压缩方法OTT:近乎无损 超越KIVI,内存减6.4倍 吞吐量提2.3倍

LLM生成文本时KV Cache内存占用,限制模型批量处理能力。论文提出OTT方法,动态追踪异常令牌单独精度保存,其余压缩。实验显示,它准确性、效率好,不过在极短文本等场景有局限。

深度学习自然语言处理
新闻资讯7

突发!xAI联创杨格过劳病离职,给马斯克干活压力山大

xAI联创杨格因长期强度工作患莱姆病离职。此前已有多位核心成员离开。马斯克强调速度的管理风格使员工压力大,其公司管更迭率,不过也有人认为这能筛选出能力强的成员。

量子位
新闻资讯7

亏到发疯!AI编程独角兽年入2亿8,结果用户越多亏得越狠

TechCrunch调查发现,AI编程公司虽收入和估值,但普遍亏损。其运作成本,大语言模型调用费占大头,用户越多成本越,且市场竞争激烈。公司尝试自研模型、被收购、降价、提价等方法扭亏。

量子位
算法论文8

Temperature Scaling可大幅提Test-Time Scaling瓶颈!

大型语言模型解决复杂推理问题时,测试时扩展(TTS)是提升性能的途径之一。但传统TTS依赖增加样本数量,性能提升有瓶颈。本文提出温度缩放新思路,实验表明其能大幅提升性能,还给出降低成本方法。

深度学习自然语言处理
算法论文8

别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练

CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。

新智元
推荐文章7

【博客转载】CUDA Shared Memory Swizzling

文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。

GiantPandaLLM
开源动态8

从 Serverless 到 Agent:Cube 系统的一些设计思考

本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。

InfoQ
算法论文8

告别盲选LLM!ICML 2025新研究解释大模型选择的「玄学」

弗吉尼亚理工大学研究团队提出 LensLLM 框架,基于 PAC - 贝叶斯泛化界限揭示 LLM 微调性能“双相演进”,可精准预测微调性能、大幅降低计算成本,为 LLM 选型提供新工具。

机器之心