LawZero: Safety from Honesty in a Disinterested AI Predictora month agohttps://arxiv.org/abs/2606.29657针对下游结果优化的AI系统可能发展出隐性能动性,即表现出设计者未预期的目标导向行为。科学家AI(SAI)预测器通过训练来近似贝叶斯后验分布,它使用'认知语境化'的自然语言陈述,将事实主张与交际行为区分开来。训练重点在于让模型作出诚实预测而不成为能动主体;目标表达被视作证据,而非内化为驱动力。预测器采用后验导向的目标函数以生成校准谨慎的预测,避免使用部署结果作为奖励信号。更多...