Hasty Briefsbeta

双语

A study of sequence weighting at scale

a day ago
  • 研究跨模型规模的数据加权缩放规律,发现非单调行为。
  • 小模型学习独立于数据权重的通用模式;中等模型学习与权重成比例的模式;大模型学习所有独立于权重的模式。
  • 有效序列权重指数随模型规模先升后降,而添加epoch操作会将峰值移向较小模型。
  • 数据混合表现出异常缩放行为,使得从小模型到大模型的外推复杂化。
  • 在三个模型家族(内部密集模型、内部MoE模型、Qwen 2.5)上的实验证实了这些趋势。