Hasty Briefsbeta

双语

On Next-Gen Transformer: Loops Are Not What You Need

20 days ago
  • Loop Transformer(权重绑定)通过同时修改 Q、K 和 V,将寻址与内容纠缠在一起,限制了细粒度记忆控制。
  • Transformer 中的记忆注入点包括残差流、归一化参数、注意力度量、偏置、求和范围、头集合和前馈网络(FFN)。
  • 递归注意力将 Q、K 和 V 的修改分离开来,从而支持对上下文进行栈操作(压栈/弹栈),并实现“对思考的思考”。
  • 上下文按层级组织(词元、推理块、摘要、宏步骤、规则库),其中 L3 摘要必须能够恢复原始推理。
  • MEMENTO 通过物理 KV 逐出来实现破坏性弹栈,而 INCEPTION(递归 Transformer)则利用可学习的递归掩码控制 KV 读取,以实现可组合的上下文。
  • 递归 Transformer 通过基于块的掩码和摘要减少有效上下文长度,并在 Indexer 之前使用可学习掩码,天然适配稀疏注意力。
  • 该架构代表了超越基于强化学习的长思维链模型(o1、R1)的第三代大语言模型,旨在实现递归自我改进(RSI)。