- 作者因 DS4 Flash 的预填充延迟较高(处理 5 万 token 需 3-5 分钟)影响结对编程流程,转而使用 Qwen 3.5 122B 模型。
- qMLX 是 rapid-mlx 的一个分支,专门针对 Apple Silicon 上的混合 Qwen 模型进行了优化,增加了磁盘 KV 恢复、驱逐机制和性能指标。
- 修复了三个 bug:移除系统提示中的唯一时间戳以确保缓存命中、中断时持久化流式回复,以及修复检查点驱逐以优先处理可匹配条目。
- 修复后,缓存命中率大幅提升;重复提示的预填充时间从分钟级降至亚秒级,从而提高了对话吞吐量。