Hasty Briefsbeta

双语

The famous o3 "GeoGuessr" prompt did not work

2 days ago
  • 针对OpenAI o3模型的复杂‘GeoGuessr’提示并未比简单的默认提示在地理定位性能上有所提升。
  • 一项包含200张图像的基准测试显示,默认提示在地理位置中位数和平均距离上表现略优。
  • 作者警告称,提示工程可能造成改进的假象,因为模型往往会合理化自身的错误。
  • 该基准测试成本低廉且易于执行(15美元,六小时),然而在最初的热议期间,却无人测试过提示的有效性。
  • o3的地理定位能力并未迁移至GPT-5.4和GPT-5.5等新模型,这些模型在相同基准测试中表现更差。
  • 作者回应了关于训练数据中包含图像的担忧,指出即使使用公有领域图像,也能进行有意义的比较。