6 days ago
- Kimi K3 是一个2.8万亿参数的混合专家模型,每个令牌激活896个专家中的16个,拥有100万令牌的上下文窗口,并原生支持视觉功能,基于Kimi Delta Attention (KDA) 和 Attention Residuals 构建。
- vLLM 为 Kimi K3 提供高效的即日支持,通过混合KV缓存管理器适配其架构,该管理器在单一调度器下处理KDA循环状态和全注意力分页KV。
- 该模型在16个NVIDIA GB300 NVL72 GPU上,通过DSpark推测解码实现每用户高达370 tok/s(相比无推测时的118 tok/s提升3.14倍)。
- 支持的生产特性包括:推测解码(DSpark)、预填充/解码分离、基于Mooncake的智能体KV缓存、工具调用、推理输出、结构化输出以及多GPU支持(NVIDIA Hopper/Blackwell, AMD MI355X)。