Hasty Briefsbeta

双语

When LLM judges agree, should we believe them?

a day ago
  • 使用多个LLM评判者评估检索增强生成系统:8个认为相关,2个认为不相关;多数投票似乎有说服力,但评判者的独立性至关重要。
  • 如果一致的评判者共享提示、训练、模型家族或盲点,他们的一致性可能具有误导性;投票数量可能夸大证据。
  • 论文《基于Ising模型的LLM-as-a-judge依赖感知标签聚合》通过建模评判者相关性,根据多样性调整聚合得分来解决这一问题。
  • 该方法在三个任务上测试,在标准指标上比加权多数投票高出9%到14%。
  • 多数投票假设误差独立,这对LLM评判者往往不现实;共享偏见可能使多数意见的信息量减少。
  • 评判者小组被建模为使用Ising模型的网络,同时学习评判者可靠性和成对依赖性,无需人工标签。
  • 两种变体:一种简化模型假设标签间依赖性均匀,另一种类别依赖模型捕获正面与负面标签的不同一致性模式。
  • 该算法通过投票模式迭代估计真实标签和评判者参数,适用于已有LLM-as-a-judge日志的团队。
  • 最佳实践包括评估整个小组的冗余性、将模型多样性视为统计多样性、检查一致性结构以及报告依赖感知的不确定性。
  • LLM评判者之间的一致性需要仔细审视:它可能是独立证据,也可能是共享盲点;好的聚合方法可以区分它们。