- Laguna XS 2.1 33B模型通过推测性解码和优化技术,在单张RTX 3090 GPU上实现了296 tok/s的峰值速度,并在256K上下文长度下达到152 tok/s。
- 关键优化包括:草稿器KV环形缓存、滑动窗口环形缓存以及KVFlash分页技术,这些使得解码速度与上下文长度无关。
- 对于256K tokens,预填充性能从411秒提升至67秒,剩余开销主要来自MoE专家组的GEMM计算。
- 推测性解码是无损的,确保输出质量与模型自身一致,这已通过GSM8K基准测试(10/10)得到验证。