Are AI labs pelicanmaxxing?
2 hours ago
- Dylan Castillo 进行了一项系统性研究,以调查人工智能实验室是否故意训练模型生成骑自行车的鹈鹕图像(即“鹈鹕最大化”)。
- 该方法使用了48个提示(8种动物 × 6种交通工具),每个提示在7个不同AI模型上运行三次,并由 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 进行评估。
- 未发现任何“鹈鹕最大化”的证据:骑自行车的鹈鹕并不比其他动物与交通工具的组合画得更好,也没有实验室表现出显著优势。
- GLM-5.2 最接近显示出对鹈鹕-自行车提示的提升,但效果较小且不具有统计显著性。
- 研究结果表明,被广泛讨论的“骑自行车的鹈鹕”基准并不反映人工智能实验室的故意训练偏差。