Hasty Briefsbeta

双语

"As a Language Model": Chat Template Switches LLM Self-Referential Voice

6 hours ago
  • 大型语言模型(LLMs)在自我指涉的回答中常常添加诸如"我只是一个AI"之类的免责声明,但原因尚不清楚。
  • 聊天模板像一个开关:存在时,会增加免责语气并减少体验语气;不存在时,则相反。
  • 模型激活中的特定方向可以引导这种行为;移除它会减少免责声明,添加它会增加免责声明,而随机方向则影响不大。
  • 将免责方向添加到没有聊天模板的指令模型中,会使它们像有模板一样进行免责。
  • 研究模型自我报告或内省的研究人员应将聊天模板作为混杂因素加以控制,因为模型的自我描述并非事实,而是部分由模板决定。