A study of sequence weighting at scalea day agoscaling lawslanguage modelsdata weightinghttps://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/Copy Link研究跨模型规模的数据加权缩放规律,发现非单调行为。小模型学习独立于数据权重的通用模式;中等模型学习与权重成比例的模式;大模型学习所有独立于权重的模式。有效序列权重指数随模型规模先升后降,而添加epoch操作会将峰值移向较小模型。数据混合表现出异常缩放行为,使得从小模型到大模型的外推复杂化。在三个模型家族(内部密集模型、内部MoE模型、Qwen 2.5)上的实验证实了这些趋势。