Hasty Briefsbeta

双语

>10x More Efficient Pretraining

21 days ago
  • 与领先的开源基础模型相比,实现了超过10倍的计算效率预训练,使用约50倍更少的FLOPs达到了DeepSeek V4 Pro Base的水平。
  • 扩展预训练,在困惑度上超越了所有公开可用的开源基础模型,训练成本低于400万美元,而估计超过1亿美元。
  • 由于缺乏大型芯片集群,专注于算法效率,依赖架构、优化器、训练目标和数据整理方面的改进。
  • 使用保留数据上的每字节比特损失评估模型性能,拟合缩放定律以预测计算需求。
  • 在私有代码库、推理问题和最新研究论文上测量泛化能力,并进行了仔细的去污染处理。
  • 通过用第三方LLM改写文档来评估领域知识,以避免奖励记忆。
  • 建立了稳定的训练基础,包括平滑收敛、低精度训练以及在扩展前寻找并修复缺陷。
  • 使用多尺度评估(三个模型涵盖两个数量级的计算量)来验证大规模改进。
  • 计划专注于长期强化学习、对齐训练以及进一步的预训练改进。
  • 声称是训练万亿参数模型的最小团队,并邀请人才加入。