Jev and System One Models: Calibration Beats Accuracy
4 hours ago
- Jev是一个非自回归的System One模型,它在前向传递中一次性回答结构化问题并给出概率,优先考虑速度和校准性,而不是聊天能力。
- 校准——即预测概率的可靠性——在生产分类器中比原始准确率更为关键,因为失准会导致下游决策错误,并且无法通过F1或AUC等标准指标发现。
- Jev使用RLCD训练来产生认识论上诚实的概率,可能消除了对事后校准技术(如Platt缩放或温度缩放)的需求。
- Jev最适合生产堆栈中的结构化决策任务(分类、评分、是/否),提供比大语言模型更低的延迟和成本,但无法处理文本生成或优化问题。
- 作者计划在拉请求接受数据集上测试Jev与随机森林和大语言模型基线的对比,测量AUC、Brier分数、预期校准误差(ECE)和延迟。
- 对团队的建议:盘点LLM调用是'决策'还是'生成'任务,测量现有校准度,保持经典基线,并在依赖Jev之前在其自身数据上实证验证Jev的校准性。