Tokens Too Cheap to Meter
7 hours ago
- 人工智能的使用成本每年以数量级下降,使得大语言模型能够在1-2年内集成到计算基础设施中,并在3-6年内实现本地前沿质量模型。
- GPU、模型效率(如专家混合)和推理引擎(如vLLM、NVIDIA、Intel)的改进,推动每年代币成本下降约2.5个数量级。
- 像Mamba-Transformer混合体这样的新架构将本地AI的RAM需求降低了5倍或更多,使得更大规模的模型能够在 commodity 硬件上运行。
- 像Jev和Laya这样的专用模型为特定任务提供了极端的成本降低(例如,Jev每十亿代币42美元),使AI比许多传统计算工具更便宜。
- 供给侧的杰文斯悖论表明,更便宜的AI会导致计算使用量增加,使超大规模企业和推理优化硬件提供商受益。
- 需求侧的杰文斯悖论引发了对未来用例的疑问,包括网络安全转变、软件商品化(操作重于代码)以及QA/UI角色的增加。
- 使用LLM构建软件的第四种选择创造了新的竞争,并使非程序员能够获得个性化、可塑的软件。