UK AISI / Caisi Preliminary Assessment of Kimi K3's Cyber Capabilities
11 hours ago
- 英国AISI与美国CAISI联合评估了Moonshot AI的Kimi K3模型,重点关注其网络能力。
- 在漏洞利用开发基准测试ExploitBench中,Kimi K3表现优于GLM-5.2(32%对比24%),但落后于美国顶尖模型。
- Kimi K3在41项ExploitBench任务中均未能实现任意代码执行(ACE),而美国顶尖模型在20/41的任务中实现了ACE。
- 在TLO网络靶场(32步模拟攻击)中,Kimi K3平均推进至第17步,而美国顶尖模型平均推进至28.5步。
- 在1亿token限制下,Kimi K3在10次尝试中有1次成功完成TLO任务,表明其具备攻击弱防御系统的能力。
- 由于仅基于单一基准测试(ExploitBench)进行估算,Kimi K3整体网络能力的置信区间较大。