Show HN: Do Codex skills save tokens? A six-run task-size benchmark8 hours agohttps://codex-howto-benchmark.nguyenvantamdk2.chatgpt.site一个中型2048游戏的实现,包含四个浏览器文件、十项引擎测试、语法检查和一个运行后评估器,全部无需依赖。六次受控的GPT-5.6-sol运行显示,同样的工程循环技能在小型修复中丢失,但在中型构建中成功。受控实验:相同模型、推理力度、初始提交、任务合同、沙盒和验收标准;仅存储库技能路径发生变化。接受条件、所需检查以及证据完整性被优先考虑;成本更低的失败运行不会胜出。更多...