Kimi Linear: An Expressive, Efficient Attention Architecture
a day ago
- Kimi Linear是一种混合线性注意力架构,在短上下文、长上下文和强化学习场景中均优于全注意力机制。
- 核心创新是Kimi Delta注意力模块,这是一种具有细粒度门控机制的高表达力线性注意力模块,可优化有限状态RNN的内存使用。
- 一种基于对角加低秩转移矩阵的专用分块算法,在保持与传统delta规则一致性的同时降低了计算量。
- 该模型参数总量为3B激活/48B总参数量,混合了KDA和多头潜在注意力,在任务中全面超越全MLA,KV缓存减少高达75%,在1M上下文下解码吞吐量提升6倍。
- Kimi Linear可作为全注意力架构的即插即用替代方案,兼具卓越性能与效率。
- 开源贡献包括KDA内核、vLLM实现以及预训练/指令微调模型检查点。