「GPU性能分析」共找到 3176 篇相关文章
史诗级和解:英特尔获老对手英伟达超350亿投资,股价创38年最大单日涨幅
英伟达将投资英特尔50亿美元,双方联合开发定制CPU和GPU集成产品。合作旨在融合AI加速与通用CPU,覆盖多市场。曾有纠纷的二者此次合作,或助英特尔借AI突围。
FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度
深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。
【CUDA博客】关于TensorCore和Inline PTX Assembly的一个超简短笔记
文章围绕TensorCore和Inline PTX Assembly展开,介绍利用PTX指令发挥TensorCore潜力。讲述矩阵乘法和累加操作,给出半精度及替代浮点指令形式,有代码示例并分析,还提到不同数据类型用法及SASS指令。
2.3K Star 霸榜GitHub!DeepResearch最佳开源平替!
DeepResearch能递归拆解复杂任务自动生成报告,但OpenAI的相关产品费用高且闭源。霸榜GitHub的ROMA由Sentient AGI团队开发,性能超Grok - 4等,是开源杀手,还介绍了功能、使用方法和应用场景。
Vector数据库退位,AI记忆Memvid登场!
近期基于视频的AI记忆库Memvid大火,宣称革新AI记忆管理,能将文本片段存于MP4实现快速语义搜索。不过网友分析,它底层用FAISS,读写慢、文件大,仓库issues也显示其性能与声称相反。
GitLab 18.0 发布,引入 AI 编码助手
GitLab发布自托管DevSecOps平台18.0版本,为Premium和Ultimate档引入更多AI功能,如代码建议、智能聊天、自动代码分析等,还在性能、安全、管理等方面有改进,部分用户升级遇问题。
Qwen3-ASR的MLX原生实现:让SOTA语音识别跑满苹果芯片
Qwen3 - ASR是强大开源语音识别模型,但官方实现无法充分利用苹果芯片GPU能力。开发者完成MLX重写,让其能在苹果芯片上原生运行,实测性能佳,还有诸多核心功能及安装使用示例。
CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了
北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。
一颗 1.8 纳米芯片,成了英特尔「最后的救赎」
2025年10月9日,英特尔公布基于18A工艺的酷睿Ultra系列第三代处理器Panther Lake。它集成多部件,性能提升大,还将用于机器人等。此前英特尔危机四伏,此产品发布意义重大,成败影响深远。
摩尔线程背后大赢家:早期投资人回报已超6200倍
摩尔线程今日登陆科创板,市值达2800亿。其自创立受资本关注,融资超百亿。沛县乾曜早期190万投资增值超6200倍。虽曾遇美国制裁危机,但仍业绩增长,彰显了国产GPU企业的突围能力。