Hasty Briefsbeta

双语

Dust: Pretraining Transformers Without Backpropagation

2 hours ago
  • Dust 是一种零阶优化算法,它独立地对每个令牌的激活值进行扰动(节点扰动),将每个令牌视为虚拟的种群成员以进行并行评估。
  • 在预训练Transformer语言模型时,Dust 的表现与反向传播不相上下;在大型种群中甚至可能超越反向传播,这表明在计算资源丰富的场景下可能超越反向传播。
  • 与基于权重空间的进化策略相比,Dust 的效率高出数个数量级,例如在Transformer预训练任务中比EGGROLL高效10^3到10^4倍。
  • 与传统认知相反,使用Dust时,更大的模型在种群效率上表现更优:一个243M参数的模型在大多数种群规模下优于一个规模小120倍的模型。
  • 随着种群规模增大,Dust的梯度估计与反向传播的梯度估计更趋一致,且这种一致性可持续到10亿个令牌,这鼓励了进一步扩展规模。
  • 该方法通过在独立的前向传播中抖动不同层类型、采用信用衰减以及单独评估语言建模头部,从而减少了干扰。
  • Dust 的梯度接近但并未完全匹配反向传播的梯度,这导致了不同的优化轨迹,在某些情况下能产生更好的结果。