- 核心挑战在于,在使用NVFP4等低精度量化进行大语言模型(LLM)的强化学习(RL)时,如何平衡吞吐量和稳定性,因为采样和训练不稳定性会相互叠加。
- 基准方案对MoE层(占参数的97%)使用NVFP4,并通过每token激活缩放来避免token依赖量化和未来到过去的泄漏等问题。
- 通过反量化反向传播改进梯度稳定性,使反向操作数与正向量化决策对齐,减少不匹配和梯度范数尖峰。
- 四比六(4/6)技术通过自适应选择权重和激活的最大值为±4或±6来降低量化误差,这对于RL至关重要,因为对预训练权重的影响不成比例。