Prompts Aren't Real
4 hours ago
- 建议构建相互关联的评估与优化管道,而非仅与LLMs交换文本。
- 为消费者打造可靠的代理体验充满挑战;LLMs会以微妙甚至简单的方式出错。
- 结构化输出有所帮助,但模型仍会在少量请求上失败;修复方式可能很随意(例如重命名字段)。
- 提示并非核心;它们是向量,其文本内容并不重要;测量才是关键。
- 使用pass^k测试来衡量行为,然后通过遗传帕累托等算法自动优化提示。
- 利用黄金数据集和优化,构建用于复杂评估(如品牌语调)的LLM评判器。
- 创建自我改进的反馈循环:监控生产环境,将失败转化为测试用例,再重新优化。
- 领域专家应专注于构建数据集和测量,而非编写提示。
- 没有测量,将走向疯狂;自我修正系统对于实现持久可靠性至关重要。