How good are frontier models at physics?
4 hours ago
- 前沿语言模型在主要物理基准测试中的低分可能具有误导性,因为专家审核发现许多错误的评估源于评分者错误、有缺陷的参考答案或模糊的问题,而非模型推理缺陷。
- 专家对六个物理基准测试(例如HLE-Physics、CMT-Benchmark、CritPt)的重新评分显著提升了模型性能;例如,GPT-5.6-Sol在HLE-Physics上的mean@4从47.3%上升到78.7%,在CritPt上修正后的pass@4达到了94.4%。
- 当前的基准测试明显低估了模型在良态物理问题上的能力,表明在封闭式任务上接近饱和,并强调需要更具挑战性、经专家验证的评估。