Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes
21 days ago
- 一位独立开发者使用租用的B200 GPU,在43小时内花费998美元,训练了一个38亿参数的语言模型,其CORE分数达到0.384。
- 该模型架构为Llama风格,但添加了关键特性:ResFormer值嵌入、QK归一化、对数软上限以及ReLU²非门控MLP。
- 关键优化包括FP8训练、梯形学习率调度、用于矩阵的Muon优化器以及ClimbMix数据集,这些极大地改善了收敛效果。
- 在2048令牌上下文中训练显著提升了CORE分数(0.384 vs 1024下的0.338),主要是通过使模型能够在SQuAD和BoolQ等长上下文任务中进行正确评估。
- 值嵌入增加了19%的参数,但吞吐量成本可忽略不计,在不增加额外计算的情况下带来了约5%的有效训练增益。
- 作者强调了清洁基础设施、本地数据分片以及避免误导性微基准测试对于在有限预算下高效训练的重要性。