Backdooring Sparse Autoencoders
10 hours ago
- 稀疏自编码器(SAE)用于解释和干预语言模型的内部表示,从而创建了供应链攻击面。
- 恶意修改的SAE可以在未更改的LLM的前向传播中插入时诱导攻击者选择的行为,使用仅解码器的后门,该后门冻结了LLM和SAE编码器。
- 该攻击在三个语言模型和多个插入层中展示了高频率的非请求代码插入,且行为依赖于基于提示线索的触发器。
- 攻击效果因模型和层而异,但强后门行为可以与常规SAE质量指标相对较小的变化共存。
- 研究结果表明,SAE应被视为安全敏感组件,因为它们可以在不修改语言模型本身的情况下携带行为后门。