Hasty Briefsbeta

双语

Why do OpenAI's GPT-2 weights beat mine? Part two: the bugfix

5 hours ago
  • 在GPT-2风格模型的评估代码中发现了一个bug:`model.state_dict()`返回的是对活跃参数的引用而非副本,导致在早停过程中`model.load_state_dict()`无效。
  • 该bug通过使用`deepcopy(model.state_dict())`在验证损失下降时存储参数快照得以修复。
  • 此外,评估代码更新为使用所有验证批次而非仅前五个,提高了早停的准确性。
  • 修复bug后,通过在所有模型上重新运行指令遵循评估生成了新基线,结果显示OpenAI的GPT-2权重仍优于作者的模型。
  • 排名变化总体较小,但某些模型(如无MHA偏置的JAX)显著提升,而其他模型(如1xrtx3090-stacked-interventions)下降,可能是由之前的bug优势导致。
  • 作者总结认为,bug修复确保评估按预期运作,且不改变为何OpenAI模型更优的核心谜题。
  • 未来实验将专注于修改训练方式以缩小与OpenAI模型的性能差距。