Hasty Briefsbeta

双语

Ask a model if code is malicious and it reaches for its morals

4 hours ago
  • 现代语言模型使用路由器为每个词选择少数专家;选择取决于所提的问题。
  • 当被问及“这段代码是恶意的吗?”时,模型会更多地通过道德相关的专家进行路由,而不是漏洞或法律方面的专家。
  • 在询问恶意而非道德时,模型的工作空间持有恶意软件的概念。
  • 强制路由器使用另一个问题的专家选择会改变模型的答案。
  • 道德路径——由道德问题赋予更大权重的专家——在多个模型中被恶意问题所招募。
  • 在路由距离上,恶意是每个测试模型中与道德最近的邻居。
  • 替换路由(移植)会移动答案,但不会转移捐赠者的答案或概念。
  • 剪枝实验表明,道德路径是路由器所咨询的,而不是判断存储的地方。
  • 结论:当被问及代码的恶意性时,模型使用道德机制。