An off switch for dual use knowledge in AI models24 days agohttps://www.anthropic.com/research/off-switch-dual-use一种名为GRAM(梯度路由辅助模块)的新型AI安全方法为病毒学和网络安全等双重用途主题创建了可移除的知识分区。GRAM允许在单一模型内对双重用途能力进行独立控制,使得模块可以在无需重新训练多个模型的情况下被“开启”或“关闭”。测试显示GRAM在模块被删除时能有效移除目标知识,保持一般性能,并能抵抗对抗性恢复尝试。该方法可扩展至不同规模的模型,且随着模型增大,保护缺口会扩大,可能提供比当前基于拒绝的保障措施更稳健的访问控制。更多...