Hasty Briefsbeta

双语

Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers

11 hours ago
  • 企业生成式AI应用程序在灵活的LLM-as-a-judge护栏和需要自定义训练数据的可靠预训练分类器之间面临权衡。
  • 像TypeSafe AI的Jev这样的决策模型提供了中间地带,通过产生固定的决策,保证模式、类型安全、速度和零样本能力。
  • 评估比较了跨4种范式的9种护栏:预训练分类器、零样本分类器(BART-large-mnli)、LLM-as-a-judge模型和Jev式决策模型。
  • 预训练分类器(例如DeBERTa-v3、Granite Guardian)提供了最高的准确性和低延迟,验证了它们在Red Hat OpenShift AI 3.6默认护栏中的使用。
  • Jev式模型(Jev、DiffusionGemma、Laya)表现有竞争力,但在速度或准确性上没有持续超越LLM-as-a-judge或预训练分类器。
  • 提示工程显著影响零样本分类器的性能,正如Laya在调整后提高了17.83个百分点所表明的那样。
  • LLM-as-a-judge仍然可行,但通常更慢且资源更密集;Shieldstral尽管有官方基准,但表现不佳。
  • 该研究提倡使用合适的工具来完成工作,决策模型将注意力重新聚焦于轻量级、特定任务的推理,而不是通用LLM。