Hasty Briefsbeta

双语

A Safe Path to Open Weights

6 hours ago
  • 安全的开放权重模型是公共产品,但存在实际滥用风险;发布时必须兼顾模型安全性和生态系统的准备程度。
  • Thinking Machines 发布了 Inkling 和 Inkling-Small 两个开放权重模型,旨在推动人工智能开发的民主化并允许对偏见进行审查。
  • 开放权重模型可能降低攻击性网络行动的门槛,但也能为防御者提供支持;分阶段发布和分层防御有助于降低风险。
  • Inkling 通过内部评估、外部红队测试和对抗性微调进行了评估,结果显示其相对于现有开放模型并未带来显著的增量风险。
  • 研究探索通过预训练数据过滤将危险能力与通用智能解耦,但这仍是一个未解决的问题。
  • 安全发布涉及迭代阶段(API 访问、微调 API、开放权重),以构建生态系统防御并收集证据。
  • 外部协作(例如安全测试人员、防御者、研究人员)至关重要;Thinking Machines 计划设立 Tinker 安全资助以支持生态系统。