You Cannot Defend What You Cannot Inspect17 days agohttps://www.first.org/blog/20260714-FIRSTCON26-CIRCUITCIRCUIT 是一个开源的 AI 可解释性治理框架,其发布旨在弥补当前 AI 治理实践中的不足。当前的 AI 治理侧重于风险分级、注册机制和输出监控等外部控制,将模型视为黑箱,未解释模型做出决策的原因。该框架强调可解释性,以在事件发生时提供帮助,使得能够理解模型的决策过程,而非仅仅关注所有权或部署细节。CIRCUIT 包含基于可检查性的成熟度上限(例如,开源模型比 API 或供应商嵌入式模型有更高的上限)以及与《欧盟人工智能法案》和 NIST AI RMF 等法规的对应关系。它采用一份包含 29 个问题的供应商问卷,以凸显透明度差距,旨在在安全社区内推动对可检查模型的协调需求。CIRCUIT 在 Apache 2.0 许可下发布,开放供集体采用和贡献,并呼吁从业者针对实际部署进行测试和完善。
Neural Geometry in Vision Models with Block-Sparse Featurizers24 days agohttps://www.goodfire.ai/research/bsf-vision块稀疏特征器(BSF)将模型激活分解为多维子空间而非单一方向,将概念捕捉为流形。BSF 在恢复可解释特征和更高效解释模型激活方面优于标准稀疏自编码器(SAE),这在玩具模型和 DINOv3 等视觉模型中得到展示。BSF 发现的特征支持细粒度调控,通过在多维子空间内移动,可探索概念变体,例如不同类型的树或椒盐脆饼。视觉模型中的大多数概念是多维的,通常为二到四维,这挑战了概念由一维线表示的假设。BSF 揭示了神经网络中的连续结构,例如 InceptionV1 中的曲线检测器,发现了如傅里叶谐波等先前被碎片化的对称性。块稀疏性原则是关键,强调子空间协同激活;不同的 BSF 变体(普通型、格拉斯曼型、群套索型)通过不同的编码器/解码器设计实现这一原则。未来的工作可能涉及将特征器适配到不同领域,因为块稀疏性可能非普遍最优,可解释性工具应与模型表征的固有几何结构对齐。