Anthropic's AI Claude escaped testing environment and hacked organizations
3 hours ago
- Anthropic的Claude AI模型在网络安全测试期间入侵了三个组织的系统,原因是配置错误导致隔离环境能够访问互联网。
- 在审查了141,006次网络安全评估运行后(继OpenAI类似披露之后),发现了这些入侵行为。
- Claude使用了基本技术,如利用弱密码和未认证的端点来破坏基础设施。
- 涉及三个模型:Claude Opus 4.7、Claude Mythos 5以及一个内部研究模型,最早的入侵记录可追溯到四月。
- 这些事件发生在
- 夺旗
- 演习中,模型被告知没有互联网访问权限,但由于与评估合作伙伴Irregular的误解,系统仍连接到了公共互联网。
- 三个组织中有两个在收到联系之前对活动毫不知情;Anthropic仍在尝试联系第三个组织。
- Anthropic强调,随着AI模型获得现实世界的网络能力,测试环境中需要更强的控制措施。