<antirez>
6 hours ago
- 网络正逐渐失去旧网页,每年都有一小部分消失,导致数字内容的永久性丢失。
- 互联网档案馆是保存网络历史的重要机构,堪比神圣之地,但面临着来自公司和实体日益增加的挑战。
- 丢失的内容包括早期的编程与黑客文化、1990年代的亚文化、个人博客、科学论文、早期数字艺术、电子游戏、气候数据以及新闻来源。
- 由于高昂的成本和缺乏经济激励,保存一切的努力不切实际,这使得大型语言模型成为一种有损但易于访问的压缩工具。
- 为了减少损失,我们必须确保公开释放的大型语言模型参数被保存,并且互联网档案馆被包含在预训练数据集中,同时继续支持保存机构。