Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Traina month agohttps://arxiv.org/abs/2607.01232大语言模型在强化学习后训练阶段的性能提升高度集中在少数几层 Transformer 层中。仅训练单个 Transformer 层即可恢复全参数强化学习训练的大部分性能增益,有时甚至能超越其效果。高贡献层通常位于 Transformer 堆叠结构的中部,而输入层和输出层的贡献较小。这一规律在不同模型、强化学习算法以及数学推理、代码生成等任务领域中均表现稳定。