Hasty Briefsbeta

双语

RL economics, morally charged terms, and "distillation"

a day ago
  • 大语言模型能力(尤其是在编码和数学方面)的进步,因人类标注数据的耗尽而由强化学习驱动。
  • 强化学习涉及为问题生成多种解决方案,并用成功的方案作为训练数据,这对先行者而言计算成本高昂,但对跟随者来说成本较低。
  • 模型权重不受版权保护,但提示词和输出可能对用户(而非模型提供商)具有版权性;使用条款(而非版权法)规范了使用行为。
  • 模型提供商无法在法律上阻止第三方使用已发布的模型输出作为训练数据,即使这会惠及竞争对手。
  • '蒸馏'一词被误用,以道德化地将基于模型输出的训练描述为'攻击',但应称为'基于模型输出的训练'以避免道德偏见。
  • 现行法律体系允许基于公开可用的模型输出进行训练,模型提供商的商业顾虑并不能成为反对此类做法的道德主张的依据。