You Could Have Come Up with Kimi Delta Attention
a day ago
- 文章从softmax注意力机制出发,通过一系列改进推导出Kimi Delta Attention(KDA):线性注意力、DeltaNet、门控DeltaNet,最终形成KDA。
- 线性注意力去除了softmax,使用固定大小的外积循环状态,实现了O(n)时间复杂度,但丧失了选择性,导致写入间产生干扰。
- DeltaNet通过写入预测误差(delta规则)而非完整值来修正干扰,使写入操作在键空间中更具针对性和局部性。
- 门控DeltaNet在应用delta规则前增加了标量保留门以实现全局遗忘,但所有键通道以相同速率被遗忘。
- KDA将标量门替换为逐键通道向量门,形成对角加低秩(DPLR)状态迁移,使得每个键通道可独立遗忘。
- 循环Triton内核通过向量运算和外积实现KDA逐token推理,支持高效的自回归解码。
- 分块实现通过矩阵运算对token进行分组处理,利用因果三角求解和WY风格因子实现张量核心高效训练和预填充。
- 循环版本和分块版本是同一KDA递归的两种调度方案,并非不同的注意力机制。