Hasty Briefsbeta

双语

Truth is not a direction: a Tarski attack on LLM probes

2 days ago
  • 线性表示假说认为,诸如真理之类的概念对应于大语言模型嵌入空间中的方向,从而可以通过分类器进行真值探测。
  • AI安全研究人员使用真值探测器来检测真实性,它们在简单案例上效果出奇地好,但并非通用的真值预言机。
  • 哥德尔不完备性和塔斯基真值不可定义性表明,任何足够具表达力的语言都无法包含其自身的完全真值谓词,从而引发悖论。
  • 对角线攻击构造了一个关于探测器输出的自指句子,形成了一个任何固定真值探测器都无法解决的撒谎者悖论。
  • 对Qwen3.5-4B的简单真值探测器的实证测试显示,其在常规句子上准确率很高,但在对角线攻击句子上给出了无意义的分数。
  • Lawvere的不动点定理解释了否定在{TRUE, FALSE}中没有不动点,但将其扩展到[0,1]并使用连续函数仍然无法避免所有悖论。
  • 真值探测器有助于理解模型行为,但无法作为确凿的真值预言机,正如不可判定性并不阻碍数学发展一样。