Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limita month agohttps://mimo.xiaomi.com/blog/mimo-v2-5-inference混合滑动窗口注意力(Hybrid SWA)将KVCache的存储和计算降低到全注意力的约1/7,提高了长上下文任务的效率。稀疏MoE激活在保持模型容量的同时减少了每个令牌的计算量,多模态编码器支持跨视觉、音频和视频的跨模态理解。优化包括为全注意力和SWA层设置双KVCache池、支持SWA感知的前缀缓存树以实现正确复用,以及分层缓存系统(GCache)以实现高性能和低成本。调度策略如KVCache亲和性和高命中率请求的优先级,提升了吞吐量并降低了延迟,特别是在代理场景中。更多...