- 现代GPU如Blackwell上的非对称硬件扩展导致张量核心吞吐量的增长速度快于共享内存带宽和特殊功能单元(SFU)等资源。
- FlashAttention-4是为Blackwell架构协同设计的算法与内核,在B200上使用BF16精度实现高达1605 TFLOPs/s,性能超越cuDNN和Triton。
- 关键创新包括用于重叠的新流水线技术、通过多项式近似进行指数运算的软件模拟以缓解SFU瓶颈,以及使用TMEM减少共享内存流量。
- Blackwell的硬件特性如Tensor Memory(TMEM)、完全异步的第五代张量核心和2-CTA MMA模式支持更大的分块、降低流量并提升性能。