Watching a language model think before it speaks
10 hours ago
- Subtext揭示了语言模型在多个层级的内部预测,展示了模型在输出前倾向于哪些词语。
- 它利用雅可比透镜解码隐藏状态,使用户能够实时观察模型的决策过程。
- 关键观察包括模型在说话前就确定结论、提前规划,以及展示类似“两跳”链的多步推理。
- 该工具是一种近似,不应过度解读;它展示的是相关性,而非因果思维。
- Subtext旨在使模型透明度可用于调试、捕捉错误和教育目的,并在兼容硬件上本地运行。
- 它在Apache-2.0许可下开源,可从GitHub下载。