The Two MMLU Scores: What a Benchmark Name Does Not Fix
2 days ago
- 同一模型家族的不同构建版本提供的两个MMLU准确率分数(0.781和0.79)因数据集划分、执行器实现、评分器和提示格式的差异而无法比较。
- 基准名称'MMLU'仅固定了名称,但留下了许多可变因素(划分、实现、评分器、网络访问),这些因素可能导致准确率差异达到几个百分点或更多。
- 可比性由计量溯源性到共同参考(例如共享的测量程序)来定义,而非仅凭数值。
- APL AI-Eval配置文件通过哈希将每个声明绑定到内容寻址的框架;两个在'子集'或'数据集划分'等字段上不同的框架,通过规范字节相等性被视为不同范围。
- 当框架不同且未提供适用的桥接时,验证器返回'不可比较';桥接可以在特定假设和声明损失下允许比较。
- 有效框架(apl-valid)确认结构正确性,但不保证分数的准确性或声明的程序已按指定方式执行。