Hasty Briefsbeta

双语

I burned all my tokens researching how to save tokens

15 hours ago
  • 作者最初使用 Claude Fable 5 对代币经济学进行深度研究,但它在 30 分钟内耗尽了令牌限制,没有产生结果,这促使需要进行优化。
  • 为了降低成本并提高效率,作者利用现有订阅(Claude、Codex、Antigravity),通过自定义设置共享内存,允许多个模型协同工作而无需额外支付费用。
  • 实施了模型编排模式,为更便宜的模型分配特定角色(例如,Claude Sonnet 5 用于查找,Claude Opus 4.8 用于验证),并仅使用 Claude Fable 5 进行规划,从而将研究时间从 30 分钟延长到几个小时。
  • 通过强制执行规则来减少幻觉,例如将查找和验证代理分开,要求为声明提供网址和引文,避免未提供来源的数字,并根据研究中发现的错误不断调整规则。
  • 将 /deep-research 工具移到流水线末端,对预先验证过的发现进行处理,以使用更少的令牌并提高效率,从而从 30 分钟内的 111 个代理减少到 22 分钟内的 61 个代理。
  • 使用 LLM wiki 模式在 Obsidian 中构建了可信知识库,并配备了自动化检查和人工监督,但最初的规则有时会错误地拒绝有效项目,这突出了混合人机协作的必要性。
  • 研究的关键发现包括:线束设计会显著影响令牌使用(例如,约 66 倍的差异),上下文压缩可能会因触发循环而增加成本,会话中工具变更可能会悄无声息地对缓存内容重新计费,以及由于框架开销等隐藏因素,发票成本通常超过简单的令牌估算。
  • 作者建议:使用廉价模型进行初步研究,使用准确模型进行验证,最后进行深度研究;同时利用多个订阅并定义角色,避免过度依赖单一昂贵模型。