Hasty Briefsbeta

双语

The Implications of Linguistic Illegibility for LLM Security

2 hours ago
  • 引入了“语言不可读性”来描述大型语言模型(LLM)的外部语言输出或机制探测不能反映其内部计算的情形。
  • 认为语言不可读性是不可避免的,因为LLM通过在激活空间上的数学计算以及到自然语言的有损转换来进行运算。
  • 依赖语言自我报告(如思维链监控、宪法自我批判、激活探测)的安全机制不可能是完全可靠的。
  • 提出将污点追踪作为一种有前景的沙箱方法,定义不应受模型产生数据影响的系统状态。
  • 讨论了额外的沙箱机制,如健壮虚拟化和第三方审计,为语言监控提供基础。