- Kimi K3 实现了86.4%的解决率,但需要8个B300节点,且比Claude Code慢。
- AI编码智能体的令牌成本急剧上升,90%的用户每年花费约7300美元。
- 主要模型提供商超过70%的API收入来自编码用例。
- 前沿API的替代方案包括API路由器、更便宜的模型层级或使用GPU自托管。
- 自托管需要全天候支付基础设施费用,平均GPU利用率在15-35%之间。
- 硬件必须根据峰值使用量进行配置,利用率是成本效益的关键。
- 不同的硬件选项(DGX Spark、H200、H200集群、B200机架)支持不同的并发量和模型质量。
- 高并发时开发者体验下降;每个设置都有一个舒适的并发限制(例如,GLM-5.2在超过8个用户时表现不佳)。
- 成本分析显示,对于某些模型(如DeepSeek V4 Flash),API可能比租用更便宜,而对于其他模型(如GLM-5.2,利用率15%),自托管可以击败API定价。
- 开放权重模型正在缩小与前沿模型的质量差距,但需要像B200机架这样的强大硬件。