Structured Evaluation Pipelines to Improve Your AI Workflows15 hours agohttps://heltweg.org/posts/structured-evaluation-pipelines-to-improve-your-ai-wor...定义质量度量,设定基线,并构建不依赖人工判断的自动化评估流水线。使用静态数据集和基于评分标准的评分(例如,LLM作为评判者)进行离线评估,以在本地测试更改。包含安全关键输入,如金丝雀或蜜罐提示,以捕获回归问题,并通过通过/失败标注进行评估。使用追踪、数据集、标注和实验来构建评估;存储数据以便进行比较和生成报告。从本地流水线开始完善评分标准,然后再进行自动化或采用像Langfuse或Opik这样的工具进行在线评估。