18 hours ago
- LoRA微调使得能够以低成本定制开放权重的图像生成模型用于制作CSAM。
- 现有的审核方法依赖于元数据或生成的输出,但元数据具有欺骗性,生成输出可能不可接受或非法。
- 在权重中存在更安全的检测信号:LoRA更新矩阵的左上奇异向量构成了最强学习变化的紧凑、无需推理的指纹(u1)。
- u1指纹可以识别LoRA的训练内容,跨基础模型泛化,并对无关的良性内容不做判断。
- 该信号对加性权重噪声、重新缩放和精度降低具有鲁棒性。
- 有害的LoRA可以直接从权重中筛选出来,无需元数据或生成有害输出。