The Economic Mirage of Local LLMs
a day ago
- 认为自托管大语言模型能节省成本的观点,在考虑到效用和硬件开支时并不准确,除非将数据安全作为首要考量。
- 在高性能GPU(如RTX 4090)上进行本地推理,生成18K tokens消耗0.025千瓦时电能,电力成本约为0.0095美元,比中心化API(如DeepSeek V4 Flash,约0.0038美元)的成本高出2.5到3.5倍。
- 本地系统的待机功耗会增加显著成本:一台双GPU英伟达台式机待机功率90W,三年电费达898美元,使得每日处理100万tokens的总拥有成本比API高出26倍。
- 本地硬件在推理时会因内存瓶颈而受阻,例如GPU显存限制(如RTX 5090的32GB)以及统一内存带宽限制(如M4 Max的546 GB/s),这会拖慢大型模型的tokens生成速度。
- 需要的关键进展包括:硬件原生支持三元量化以降低能耗,以及运行时智能休眠管理以最小化待机能耗。