Hasty Briefsbeta

双语

Common Crawl Data Stored on a Hugging Face Bucket

4 hours ago
  • 自2026年4月起,Common Crawl的爬取存档可通过Hugging Face存储桶以及AWS S3访问,借助HF生态系统工具简化数据获取流程。
  • 选定爬取数据已按与S3相同的目录结构(如crawl-data/CC-MAIN-2026-17/)镜像至HF存储桶;存储桶README中列出了可用的爬取数据。
  • 用户可通过HF CLI(例如`hf buckets list`和`hf buckets cp`)访问数据、使用hf-mount挂载为本地文件系统,或通过兼容S3的API适配现有处理流程。
  • WARC文件可通过warcio库配合fsspec及hf://协议读取;代码示例展示了如何迭代记录及使用CLI。
  • URL索引(Apache Parquet格式)已存储于HF存储桶,可通过DuckDB以CLI或Python方式查询,无需完整下载即可高效执行分析查询。
  • 下载速度测试显示,S3至S3(us-east-1)速度最快(最高3500条记录/秒),HF至HF达1500条记录/秒,但HF至边缘客户端因速率限制速度较慢(<100条记录/秒);以上结果为初步测试数据。
  • 含示例的Jupyter笔记本已收录于cc-notebooks GitHub仓库,可通过Discord或Google Group提供反馈。