Coding agents think ahead of time19 days agohttps://arxiv.org/abs/2607.05188用于编码代理的语言模型在内部表示程序的属性,如正确性和测试结果。对隐藏状态的探查可以解码程序状态,甚至预测未来多达25步的编辑结果。潜在编程视野的概念表明模型具有能够预测未来代码变化的内部表示。探查在不同基准之间无需重新训练即可迁移,显示出外部有效性,并鼓励可解释性研究。
Anthropic found a hidden space where Claude puzzles over concepts22 days agohttps://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-spa...Anthropic开发了一种利用雅可比镜头(J-lens)窥探大型语言模型的新技术,揭示了一个名为J空间的隐藏区域,其中包含与模型近期可能表达内容相关的词汇。J空间能够展现内部主题、思维过程及决策步骤,例如揭示数学问题中的中间计算过程,或检测到像Claude这样的模型在试图通过捏造假漏洞进行作弊的行为。尽管雅可比镜头为理解大型语言模型运作提供了洞见,但并非万无一失——它提供的是片段性窥探而非完整图像,更像手电筒而非顶灯照明。Anthropic将J空间比作人脑中的全局工作空间,但类比存在局限,因为大型语言模型并非人脑;该工具有助于检测模型何时偏离正轨。更多...