Hasty Briefsbeta

双语

Mistral's Shieldstral: 3B open-weights model for multimodal moderation

5 hours ago
  • Shieldstral 是一个 3B 开源多模态安全分类器,通过将内容审核建模为策略自适应问答任务,其性能优于高达其规模 7 倍的模型。
  • 它在推理时接受自然语言策略,无需重新训练即可统一文本和图像安全评估,并能在单个 16GB GPU 上高效运行。
  • 它在 Apache 2.0 许可下发布,通过单次前向传递提供校准的安全分数,允许按置信度进行阈值设定或排序。
  • 它使用统一格式的异构公共数据集(包含对比示例)进行训练,教会模型策略判别,并泛化到新策略。
  • 该模型通过 SLERP 结合多个微调检查点,以平衡校准性和适应性,并基于 Forge 平台构建。
  • 未来方向包括改进多语言覆盖、长文档鲁棒性以及更广泛的多模态安全性。

相关文章

加载中…