Do LLMs pass the mirror test?a month agohttps://blog.pascalschuster.de/article/do-llms-pass-the-mirror-test批评将镜子测试应用于大型语言模型的适应性修改存在缺陷,因为它们将视觉测试转译为文本形式。提出更恰当的类比:对大型语言模型自身的文本输出进行细微修改,观察其是否能察觉异常。描述了使用Gemma 4 31B-IT模型的实验:通过将文本中的'g'替换为'sg'来制造文本污染。Gemma在其思维轨迹中自发检测到这种污染,并出现从第一人称到第三人称的语言转换现象。更多...