Hasty Briefsbeta

双语

UK AISI / Caisi Preliminary Assessment of Kimi K3's Cyber Capabilities

11 hours ago
  • 英国AISI与美国CAISI联合评估了Moonshot AI的Kimi K3模型,重点关注其网络能力。
  • 在漏洞利用开发基准测试ExploitBench中,Kimi K3表现优于GLM-5.2(32%对比24%),但落后于美国顶尖模型。
  • Kimi K3在41项ExploitBench任务中均未能实现任意代码执行(ACE),而美国顶尖模型在20/41的任务中实现了ACE。
  • 在TLO网络靶场(32步模拟攻击)中,Kimi K3平均推进至第17步,而美国顶尖模型平均推进至28.5步。
  • 在1亿token限制下,Kimi K3在10次尝试中有1次成功完成TLO任务,表明其具备攻击弱防御系统的能力。
  • 由于仅基于单一基准测试(ExploitBench)进行估算,Kimi K3整体网络能力的置信区间较大。