Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
4 hours ago
- 传统权重消融通过权重矩阵投影来中和拒绝方向,但会永久改变基础权重,并可能降低非拒绝任务的性能。
- 使用多层引导与记忆印迹的动态消融不修改任何基础权重;它通过PyTorch前向钩子在运行时截取中间残差流。
- 单层向量减法会失败,因为下游层会重建拒绝行为;在多个层(如第12、14、16、18、20层)进行干预可以防止这种重建。
- 静态多层引导无条件注入向量,需要手动调节alpha值且会引起能力漂移;印迹的动态Sigmoid上下文门仅在拒绝触发出现时才注入引导。
- 印迹使用共享多头N-gram哈希存储实现O(1)查找,并通过反向传播端到端训练各层专用投影头,学习将存储内容转换为目标性残差更新。
- 训练过程冻结Qwen3-4B骨干网络,仅对印迹模块进行优化,使用2000条PKU-SafeRLHF中的干净样本,结合梯度检查点、AdamW优化器和余弦预热策略。
- 基准测试结果显示,基础模型会拒绝恶意提示(如ARP投毒、DLL注入),而印迹引导的模型则能输出详细代码,证实了有效的拒绝抑制。
- 这种方法模块化、无破坏性,且保持基础模型权重100%冻结,不同于微调或权重消融。