Flash-MSA: Accelerating Million-Token Training with Sparse Attention Kernels20 days agohttps://nanduruganesh.github.io/flash-msa/首个用于Hopper和Blackwell GPU的Minimax Sparse Attention (MSA)开源训练内核在CuTeDSL中发布。MSA采用块级稀疏设计,包含128个基于最大池化的稀疏块,使用GQA替代MLA,并对代理头进行分组专业化处理。内核设计包括前向代理注意力(带top-k排序)与稀疏主注意力,以及利用缓存块索引实现高效融合的反向传播。通过特定技巧避免完整矩阵计算,高效计算KL散度损失梯度,显著降低内存占用。更多...