Mistral's Shieldstral: 3B open-weights model for multimodal moderation
5 hours ago
- Shieldstral 是一个 3B 开源多模态安全分类器,通过将内容审核建模为策略自适应问答任务,其性能优于高达其规模 7 倍的模型。
- 它在推理时接受自然语言策略,无需重新训练即可统一文本和图像安全评估,并能在单个 16GB GPU 上高效运行。
- 它在 Apache 2.0 许可下发布,通过单次前向传递提供校准的安全分数,允许按置信度进行阈值设定或排序。
- 它使用统一格式的异构公共数据集(包含对比示例)进行训练,教会模型策略判别,并泛化到新策略。
- 该模型通过 SLERP 结合多个微调检查点,以平衡校准性和适应性,并基于 Forge 平台构建。
- 未来方向包括改进多语言覆盖、长文档鲁棒性以及更广泛的多模态安全性。