Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets
6 hours ago
- 对Hugging Face上7.6 PB公开AI训练数据的扫描发现,在6,003个数据集中存在221,303个活跃的唯一凭证。
- 影响最大的秘密暴露了393 GB的PII(个人身份信息),覆盖估计全球人口的3.7%。
- 供应链风险包括349个活跃的GitHub个人访问令牌(223个拥有完整仓库写入权限,130个拥有CI工作流写入权限,112个拥有admin:org权限,110个拥有包发布权限)以及318个可以推送镜像的Docker Hub令牌。
- 活跃的云凭证包括8,557个GCP服务账户密钥、3,343个通过STS身份检查的AWS密钥以及8,594个活跃的数据库登录信息。
- 发现了5,885个活跃的Slack令牌和Mailgun密钥,示例来自一家财富500强科技工作区和主要品牌域名。
- 一个来自巴西金融科技公司的活跃AWS密钥通过聊天机器人对话泄露,在训练数据中被捕获并镜像了18次。
- 至少发现了11,496个活跃的AI提供商密钥(OpenAI、Azure、Anthropic等),每年可能因推理被盗造成至少92万美元的损失。
- Hugging Face令牌包括787个活跃的(237个具有写入权限,70个具有组织管理员权限),其中63个是自我泄露,700个是从其他地方抓取的。
- 泄露成倍增加:44%的秘密出现在多个数据集中,其中一个密钥被复制到1,131个数据集中。
- 命名的开放模型和语料库包含数千个活跃密钥,包括StarCoder、OLMo 3、SmolLM2和Huginn。
- 建议:在发布前扫描,在训练前扫描,轮换任何接触过公开表面的密钥,并启用泄露警报。
- 训练数据泄露是永久性的;只有轮换(撤销)才能消除它们。
- 此次扫描是在向Hugging Face负责任披露的情况下进行的,Hugging Face也正在为TruffleHog贡献存储桶扫描支持。