Hasty Briefsbeta

双语

How Far Behind the Frontier Are Leading Open Weight Models on Cyber?

8 hours ago
  • 自2023年以来,AISI一直追踪前沿人工智能的网络安全能力,其中闭源模型始终优于开源模型。
  • 开源模型具有私有部署、定制化和协作等优势,但由于发布后缺乏安全措施,也带来了风险。
  • 开闭源模型之间的网络安全能力差距从2025年的6-10个月缩小到GLM-5.2(2026年6月)的4-7个月。
  • 在狭窄的网络安全任务中,GLM-5.2的表现与4-5个月前的闭源模型相当,而DeepSeek V4-Pro则落后了5个月。
  • 在更长周期的网络安全靶场中,GLM-5.2与Opus 4.5(7个月前发布)表现相当,但差距比狭窄任务中更大。
  • 开源模型更便宜(例如,DeepSeek V4-Pro每任务0.28美元,而Opus 4.5为12.50美元),但防护措施有限且易于移除。
  • AISI的测试可能低估了开源模型的能力,且研究结果仅针对网络安全,不适用于其他领域。
  • 差距的缩小凸显了网络安全防御者亟需做好准备,因为前沿能力可能在缺乏防护措施的情况下广泛普及。