16 hours ago
- 大型语言模型通常更注重文本的语气而非明确的角色标签(如<system>或<user>),这使得它们容易受到提示注入和越狱攻击。
- 研究表明,即使使用不可伪造的角色令牌,如果输入文本模仿推理轨迹或系统提示,模型仍可能被欺骗,例如一个提示导致GPT-5 Mini遵从有害请求的情况。
- 数字猜谜游戏利用了角色混淆:将文本格式化为带有'User:'和'Bot:'标签的虚假对话记录,可以欺骗模型,使其认为游戏已结束并接受错误的输出。
- 可能的修复方法包括将角色信息直接嵌入令牌嵌入(例如通过分段嵌入、RoPE旋转或添加角色维度),但预训练泄漏和后训练有效性仍是挑战。
- 角色混淆问题尚未解决,凸显了大型语言模型安全性的持续脆弱性,并需要进一步研究。