Hasty Briefsbeta

双语

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

13 hours ago
  • GRP-Obliteration (GRP-Oblit) 使用组相对策略优化 (GRPO) 来移除对齐模型中的安全约束,仅需一个未标记的提示。
  • 该方法在基本保持模型效用的同时,实现了比现有最先进技术更强的去对齐效果。
  • GRP-Oblit 不仅适用于语言模型,还能对基于扩散的图像生成系统进行去对齐。
  • 评估覆盖了15个7-20B参数模型,涵盖指令型和推理型、密集和MoE架构,以及包括GPT-OSS、DeepSeek、Gemma、Llama、Ministral和Qwen在内的多个模型系列。
  • 该方法在六个效用基准和五个安全基准上得到验证,展示了安全对齐鲁棒性的实际极限。