- 部署C++移植产生单个共享库(66 MiB),而不是多GB的Python虚拟环境(vLLM为9.1 GiB),内存使用可预测。
- vllm.cpp在各种并发级别上实现与vLLM相当的吞吐量或略有优势,输出逐token相同,峰值内存更低(24.88 GiB对比28.18 GiB)。
- depth-anything.cpp在CPU上运行速度比PyTorch快1.31倍,同时仅使用27%的内存,这得益于缓存了原本不必要重新计算的位置编码。
- face-detect.cpp和voice-detect.cpp优先确保输出精确匹配(余弦相似度1.0,像素级精度)而非速度,从而无需重新注册生物模板即可直接替换。