Don't ask an LLM for a confidence score
2 days ago
- 要求LLM为其自身响应生成置信度分数是完全无用的,并且缺乏科学有效性。
- 连续的0-100置信度量表存在问题;模型倾向于集中在整数上,没有充分利用整个范围。
- 置信度是模糊的——它可以指正确性、连贯性或目标达成——一个单一的数字把这些不同的概念扁平化了。
- 由于不可靠的内部状态理解以及‘谁来监督监督者’的问题,LLM无法可靠地量化自身的置信度。
- 令牌级可能性并不是置信度的良好代理,因为令牌的重要性各不相同,将它们合并成一个数字并不是一种测量。
- 研究表明,自我报告的置信度分数过于自信,需要微调、校准或使用分类标签才能有用。
- 如果模型知道自己错了,它应该自我纠正,而不是输出一个置信度分数;该分数充当一种心理工具,而不是可靠性度量。
- 真正的工作应该集中在提高检索质量和搜索上,而不是从模型中提取置信度分数。