- 具有长期记忆(向量和事实)的对话式AI,其提取器过度生成垃圾里程碑(约每天6.5个),导致提示单一化并强制出现浪漫表白。
- 诊断使用了追踪检查器和黄金标准集;关键词作为必要条件规则阻断了94%的历史垃圾数据,同时100%通过了阳性对照。
- 修复方案A截断了源头:关键词门控、角色扮演保护、收紧词典、反多标签,并在测试套件后方部署。
- 修复方案B通过重新分类(绝不删除)使用LLM裁判清理现有数据,同时避免提示污染和不合理的捷径。
- 测量显示新里程碑数量每天下降92%(从6.5降至0.5),每条消息的实体标签减少至1个,每个提示的强制里程碑从2.0降至0.65。
- 修复后的一次事件暴露了相关性故障:重新输入的事实被无条件强制注入,导致准确但无关的记忆,凸显了上下文感知注入的缺口。
- 定性对比:修复前,助手偏向浪漫话题;修复后,它保持话题相关,正确回忆细节,并在无法回答时承认空白而非编造。
- 剩余问题包括:始终包含信息膨胀、提取器门控泄漏、日期过度提取、并行垃圾数据积累、调试器角色限制,以及未经测试的规模/性能退化。
- 关键要点:记忆可能准确但错误(相关性vs真实性),调优前先测量,可逆性支持诚实发布和有效测量。