Revealed: The Authors Whose Pirated Books Are Powering Generative AI (2023)
20 hours ago
- 像ChatGPT这样的生成式AI系统在大量文本(包括盗版书籍)上进行训练,而缺乏公开透明度。
- Books3数据集包含超过17万本受版权保护的书籍(例如斯蒂芬·金、扎迪·史密斯的作品),被用于训练Meta的LLaMA、BloombergGPT和EleutherAI的GPT-J。
- Meta等公司因侵犯版权面临诉讼,它们声称合理使用,但这些书籍未经授权的来源可能会削弱这一辩护。
- 该数据集由开发者Shawn Presser创建,旨在使AI训练民主化,但它依赖来自Bibliotik等来源的盗版内容。
- 文章强调了优先提供免费访问的开源文化与支持作者生计所需的版权保护之间的冲突。