Hasty Briefsbeta

双语

"Uncensored" open LLMs are measurably more optimistic than their base models

a day ago
  • 在模型权重中去除拒绝方向会导致超出拒绝移除范围的可测量副作用,如在一个不引发拒绝的决策任务中系统性行为变化所示。
  • 来自两个混合专家模型家族(Gemma-4-26B-A4B-it 和 Qwen3-30B-A3B-instruct)的去除模型表现出更高的乐观度(决策中更高的积极性)、更长的理由以及自我批评中更少的不确定性词语。
  • 对表达信心的影响在两个家族中相反:Gemma 模型变得不那么自信,而 Qwen 模型变得更加自信。
  • 去除过程并未降低指令遵循能力,且去除模型和基础模型在股票预测中均未表现出经济技能。
  • 在社区修改的检查点中检测到两个污染通道,表明工具链伪影在此类研究中很常见。
  • 部署一个‘未经审查’的模型作为智能体,意味着部署一个可测量的不同决策者,而不是没有拒绝的基础模型。