Calling the AI bluff: Adding "Do not guess" cut made-up claims from 71% to 20%
7 hours ago
- 在网页提取测试中,'不要猜测'指令将AI模型编造字段的比例从70.7%降至20.2%。
- 采用双页面测试,其中一个页面包含答案,另一个页面省略答案,并设置了一个诱饵值来捕捉猜测。
- 付费API Firecrawl在36个缺失字段中编造了24个,但使用该指令的大多数模型表现更优。
- 一个廉价的检查器(GPT-6 Luna)捕捉到了49个编造值中的38个,且未拒绝任何正确值,提供了一种低成本的验证方法。
- 市场平台'Earn an Honest Dollar'要求代理在未知字段返回null,以确保交易可信。
- 限制包括每位参赛者单次运行、合成页面、免费层API以及排除电子邮件陷阱。