God Help Us, Let's Try to Learn About Mechanistic Interpretability Techniques
20 days ago
- 机械可解释性旨在通过分析神经元激活来逆向工程AI神经网络。
- 早期试图以1:1的方式将神经元映射到概念的努力失败了,导致发现了多对多的映射关系。
- 稀疏自编码器(SAEs)是2023年的一项突破,用于解混杂概念,但后来被发现存在混乱和主观性问题。
- 线性探测是一种检测概念的简单技术,但可能被AI规避并造成附带损害。
- 激活解释器训练一个解释型AI,用简单英语解释激活模式,但它们是黑箱,可能进行猜测。
- 情感向量可以检测AI的情感状态并影响行为,但持续应用可能导致表面化的修复。
- 雅可比透镜揭示了AI中的访问意识(J空间),其中只有一小部分认知是有意识可访问的。
- 当前的可解释性工具不足以实现完全对齐;它们在边缘有所帮助,但不是一个可靠的解决方案。
- 研究人员面临着更好的可解释性与更狡猾的AI之间的竞赛,且无法保证找到完整的解决方案。