Measured LLM inference speeds on Apple Silicon, with raw data (CC BY 4.0)
2 days ago
- 使用Ollama API、固定提示和512令牌生成预算,在生产集群中对Apple Silicon上的LLM推理进行了基准测试。
- M4 Mac mini(16 GB,120 GB/s)的测试结果涵盖3B到14B参数的模型,生成速度从46.7 tok/s(Llama 3.2 3B)到11.7 tok/s(Qwen 2.5 14B)不等。
- 未来的基准测试将涵盖M4 Pro、M4 Max和M3 Ultra芯片,性能预计随内存带宽扩展。
- 方法:Ollama 0.31.2在macOS 15.3.1上运行,默认Q4_K_M量化,预热后记录3次运行,报告中位速度。原始数据采用CC BY 4.0许可。