Hasty Briefsbeta

双语

Does Speaking to Agents Like Cavemen Save 65% of Tokens? We Test

2 days ago
  • JetBrains在Claude Code上使用SkillsBench对Caveman技能进行了测试,以验证其节省token的说法。
  • 声称的65%输出token节省仅适用于聊天式散文,而非代理任务。
  • 在多步骤代理工作中,实际的token节省约为8.5%,而非65%。
  • 未检测到质量下降:82项配对任务显示结果在统计上无显著差异。
  • 成本节省预期约为10%,但由于异常试验而显得脆弱。
  • 建议:使用Caveman技能可以有趣且不损失质量,但不要期望在日常代理任务中大幅节省。