Hasty Briefsbeta

双语

One month coding with GLM 5.3 Flash

5 hours ago
  • 仅在9月使用GLM 5.3 Flash的挑战只在上半月成功;下半月有10亿token用于其他模型。
  • 用“错误”模型编写MCP服务器原型,一夜花费150美元和4.5亿token,凸显了谨慎选择模型的必要性。
  • 由于GLM 5.3 Flash过于流行导致基础设施可用性问题,被迫切换到类似模型如DeepSeek V4.1 Flash和Qwen 3.8 Flash。
  • 使用多种模型进行实验和研发对于基准测试和引导用户选择高效方案至关重要。
  • 关键要点包括:持续衡量token、能耗和成本;为实验预算;改进提示选择和多智能体技术;推动更高效的模型。
  • 十月的目标是专注于一两个轻量级廉价模型用于大部分AI推理,以成本或能耗而非token数量来衡量。