Hasty Briefsbeta

双语

Brood War Bench

7 hours ago
  • Codex Astra 是明显的领导者,在最高努力设置下实现了100%的胜率,并且一直优于所有其他模型。
  • 所有模型都以初学者或以下水平进行游戏;没有一个能够执行复杂的策略、防御简单的攻击或建立协调的军队。
  • Grok 模型无法有效进行游戏,经常生成长篇推理链而不发布命令,并且很少部署作战单位。
  • 较旧的模型和一些较新的模型将《星际争霸》视为回合制游戏,导致在思考时失败;较新的模型更清楚行动的成本。
  • Codex 经常使用破坏性战术,如提前派遣工人进攻,这导致对手代理浪费时间思考而不是行动。
  • Claude Fable 在游戏上表现出了最认真的尝试,建立经济并攀爬科技树,但仍然未能达到竞技水平。
  • 该基准还未被完全挖掘,为未来在代理学习和策略执行方面的改进提供了机会。