- 预训练运行经常因破坏因果关系(例如,专家选择路由中令牌分配依赖于未来令牌)和引入偏差(例如,FP16精度问题在集合通信中导致大量累积误差)而失败。
- 破坏因果关系是有问题的,因为它会在训练期间引入推理时不可用的信息,导致模型退化;例子包括Llama 4(专家路由)和Gemini 2 Pro(令牌丢弃)。
- 偏差比方差更危险,因为它会累积,正如早期GPT-4训练中的一个错误所示,FP16舍入导致梯度累积产生10倍误差。
- 关于训练失败是仅限于少数已知问题,还是每个规模都会出现新问题,存在争议;一些专家认为定制问题会不断出现。
- 针对Blackwell等硬件的内核优化极其困难,且可能不易被AI自动化化,鉴于Nvidia即使拥有顶级工程师也面临挑战。
- 针对强化学习训练的推理与面向用户的推理不同;训练和推理引擎之间的数值漂移可能引起离线策略偏差,这对高质量训练至关重要。
- FSDP(全分片数据并行)因易于重叠计算和通信而成为默认并行策略,但当GPU数量超过某个临界点(此时计算时间低于通信时间)时,它会失效。
- 流水线并行会引入气泡和架构限制(例如,阻止高效的注意力到残差连接),从而减慢研究迭代。
- 分层集合通信(在域内执行reduce-scatter,然后在域间执行all-reduce)优化了通信时间,并改变了FSDP的临界点。
- 批量大小下限限制了纯FSDP:每个GPU至少需要一个序列,因此对于固定的序列长度,GPU数量受序列数量的限制。