「CUDA kernel」共找到 126 篇相关文章
国产GPU芯动科技发布最新芯片,单卡直接堆上了112GB以上的超大显存
9月22日,芯动科技在珠海正式发布“风华3号”全功能GPU,它有诸多亮点,如集成国产RISC - V CPU与兼容CUDA的GPU、原生支持DICOM显示等,还构建了国产GPU完整生态。
黄仁勋 GTC 2026 演讲实录:所有SaaS公司都将消失;Token成本全球最低;“龙虾”创造了历史;Feynman 架构已在路上
北京时间2026年3月17日,英伟达CEO黄仁勋在GTC演讲,展示AI“全家桶”。他回溯CUDA 20年,介绍数据处理新软件库,还提及AI原生企业爆发、Token成本优势、Vera Rubin平台等,强调英伟达在AI领域的全面布局。
RTP-LLM 在相关性大模型中的推理优化最佳实践
淘宝搜索场景引入大参数LLM模型,面临系统性能挑战。本文分享基于RTP - LLM框架的优化实践,如大BatchSize调度、批次内前缀复用、MoE Kernel动态调优等,还提及未来优化方向。
腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖
腾讯AI Lab推出全开源智能体框架Cognitive Kernel - Pro,解决现有开源框架依赖付费工具问题。它有模块化架构等核心设计,创新训练方法,在多任务中表现出色,降低外部依赖,相关论文登HuggingFace热榜。
ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解
在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。
英伟达重返中国!6月大量生产特供AI芯片,价格暴降40%
路透社消息,英伟达为突破美出口限制,将为中国推特供AI芯片,6月量产,价格降40%。该芯片基于RTX Pro 6000D,简化设计以控成本和符合管制。虽计算力低,但CUDA生态有优势。
英伟达新GPU,超长上下文/视频生成专用
在AI Infra Summit上,英伟达宣布推出NVIDIA Rubin CPX GPU,专为处理百万token级代码生成和生成式视频应用。它是首款为超大上下文AI量身定制的CUDA GPU,性能强且能效高,预计2026年底推出。
两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?
黄仁勋接受长达两小时专访,谈及Nvidia使命、经营哲学等多方面。他认为能源政策制约未来,CUDA优势在于生态等,还谈了对TPU、出口管制等看法,不过其观点存在矛盾待检验。
黄仁勋最新访谈:我们已经实现了 AGI,领导力、心理学、生命、意识、死亡和人性
黄仁勋在 Lex Fridman 播客深度对话中,谈及 CUDA 决策、管理模式、四层 Scaling Law 等多话题。认为已实现 AGI,编程定义改变,程序员会增多,还分享对供应链、开源等看法。
老黄再收95后华人才俊!4亿美元收购AI初创公司
英伟达老黄以超4亿美元收购95后华人王尚创立的AI初创公司CentML,员工全部打包带回。该公司能整合软硬件资源,可增强英伟达CUDA工具链。此前老黄已收购多家相关初创公司揽人才。