Hasty Briefsbeta

双语

Why didn't we get GPT-2 in 2005?

6 hours ago
  • GPT-2 需要大约 10^21 次浮点运算,多个来源给出了不同的估算。
  • BlueGene/L 超级计算机(2005年)大约需要 41 天就能训练 GPT-2,但它并未用于人工智能。
  • 由于缺少 Transformer 和 Adam 优化等技术,大型语言模型尚未被发明。
  • 像 BlueGene/L 这样的超级计算机专用于核武器,而非人工智能研究。
  • 大语言模型的发展遵循一个反馈循环:更便宜的计算资源使得实验成为可能,进而吸引了研究者和投资,加速了进展。
  • 与登月不同,早期大语言模型的进展充满不确定性,是逐步演进的,而非遵循宏伟计划。
  • 2018 年前后的扩展定律和更清晰的规则使人工智能的进展更加可预测、更加迅速。
  • 对人工智能保密是无效的,因为演示会揭示可能性并引发竞争对手的投资;只有巨大的技术优势和低廉的价格才能阻止竞争。