Flash-MSA: Accelerating Million-Token Training with Sparse Attention Kernels20 days agohttps://nanduruganesh.github.io/flash-msa/首个用于Hopper和Blackwell GPU的Minimax Sparse Attention (MSA)开源训练内核在CuTeDSL中发布。MSA采用块级稀疏设计,包含128个基于最大池化的稀疏块,使用GQA替代MLA,并对代理头进行分组专业化处理。内核设计包括前向代理注意力(带top-k排序)与稀疏主注意力,以及利用缓存块索引实现高效融合的反向传播。通过特定技巧避免完整矩阵计算,高效计算KL散度损失梯度,显著降低内存占用。更多...
Model Training as Codea month agohttps://aleph-alpha.com/en/blog/model-training-as-code/模型训练的复杂性需要专业团队,而人工协调效率低下。Aleph Alpha的Savanna平台实现了模型训练即代码(MTaC),支持密封式一键训练运行。手动训练容易导致人为错误、学习成果丢失以及团队责任分散。MTaC通过版本控制实现可组合性、共识达成和基于代码历史的来源追溯。更多...