Hasty Briefsbeta

双语

Kimi K3 on vLLM: Up to 370 Tokens/sec

2 days ago
  • Kimi K3 是一个2.8万亿参数的混合专家模型,每个令牌激活896个专家中的16个,拥有100万令牌的上下文窗口,并原生支持视觉功能,基于Kimi Delta Attention (KDA) 和 Attention Residuals 构建。
  • vLLM 为 Kimi K3 提供高效的即日支持,通过混合KV缓存管理器适配其架构,该管理器在单一调度器下处理KDA循环状态和全注意力分页KV。
  • 该模型在16个NVIDIA GB300 NVL72 GPU上,通过DSpark推测解码实现每用户高达370 tok/s(相比无推测时的118 tok/s提升3.14倍)。
  • 支持的生产特性包括:推测解码(DSpark)、预填充/解码分离、基于Mooncake的智能体KV缓存、工具调用、推理输出、结构化输出以及多GPU支持(NVIDIA Hopper/Blackwell, AMD MI355X)。
  • vLLM 重新设计了KDA循环状态的前缀缓存,采用混合区间和马尔科尼式选择性保留以优化缓存空间和复用。
  • 性能优化包括融合KDA解码核、低延迟BF16 GEMM(skinnyGEMM)、MoE尾部融合以及用于预填充的序列并行以减少通信开销。
  • 精度评估显示强劲得分:GSM8K 0.976,GPQA-Diamond 0.939,OCRBench 0.889,MMMU Pro Vision 0.818(最大推理努力下)。
  • 部署建议:显式启用前缀缓存,使用合适的MoE/全对全后端(DEP用deep_gemm_mega_moe,TP用flashinfer_trtllm),并设置Rust前端以获得完整支持。