Show HN: Do Codex skills save tokens? A six-run task-size benchmark
7 hours ago
- 一个中型2048游戏的实现,包含四个浏览器文件、十项引擎测试、语法检查和一个运行后评估器,全部无需依赖。
- 六次受控的GPT-5.6-sol运行显示,同样的工程循环技能在小型修复中丢失,但在中型构建中成功。
- 受控实验:相同模型、推理力度、初始提交、任务合同、沙盒和验收标准;仅存储库技能路径发生变化。
- 接受条件、所需检查以及证据完整性被优先考虑;成本更低的失败运行不会胜出。
- 无存储库技能、原始v0.2.0循环和精简版v0.4.0循环从等效的新副本开始。
- 令牌总数是Codex CLI输入加输出令牌,缓存输入包含在内且不重复计数。
- 建议:通过分叉固定环境、保持环境不变、报告每个结果并发布负面发现来改进证据。