开源动态8
FlashAttention-4发布,Attention速度逼近矩阵乘法
机器之心
AI 摘要
普林斯顿大学Tri Dao:FlashAttention-4上线,新算法克服硬件瓶颈,在B200上性能提升。Pytorch支持其为FlexAttention后端,网友称它是里程碑,将惠及前沿大模型。
阅读原文 · 机器之心
FlashAttention-4正式发布:算法流水线大改,矩阵乘法级速度
深度学习领域底层优化技术FlashAttention更新至4版本。其核心作者称在Blackwell GPU上,注意力机制执行速度接近矩阵乘法。新算法克服瓶颈,在B200上性能提升,还获Pytorch官方支持。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
GCEA - YOLO:油田抽烟检测精度提升20.8%
油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。
机器学习AI算法工程
推荐文章8
系统了解AI,这四件事得搞清楚
文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。
AIGC开放社区
算法论文8
RDA - YOLO:极端天气下绝缘子缺陷检测利器
文章指出传统绝缘子检测方法面临人工巡检效率低、小目标检测难等挑战,现有YOLO系列算法也有局限。为此提出RDA - YOLO网络,在YOLOv8基础上有三项创新,实验显示其精度、速度和极端天气鲁棒性表现出色。
机器学习AI算法工程
推荐文章8
翁荔:谨慎对待 Scaling Law
翁荔新作《谨慎对待 Scaling Law》上线,文章涵盖 Scaling Law 预测内容、计算最优分配原理等。介绍了早期对机器学习损失可预测性的研究,还对比了 Kaplan 等人与 Chinchilla 的 Scaling Law,分析了两者分歧原因。
机器之心