
Shieldstral-1.0-3B vs 主流安全模型8大基准测试中如何做到性能领先【免费下载链接】Shieldstral-1.0-3B项目地址: https://ai.gitcode.com/hf_mirrors/mistralai/Shieldstral-1.0-3BShieldstral-1.0-3B是一款紧凑的3B参数、策略自适应的多模态安全分类器它能通过自然语言表达的安全策略评估内容并返回单一连续安全分数无需重新训练即可在推理时适应新策略在文本、图像及文本图像的审核任务中表现出色。 安全模型性能大比拼8大基准测试结果揭晓 安全分类F1分数%提示词分类基准测试Shieldstral-3BGPT-OSS-Safeguard-20BQwen3Guard-8BNemotron-3.5-Content-Safety-4BLlamaGuard-4-12BShieldGemma-9BWildGuardTest88.187.388.284.474.346.0ToxicChat84.179.875.672.251.062.4Aegis v286.284.484.686.371.565.8HarmBench99.494.599.396.197.950.2OpenAI Moderation81.484.074.774.773.978.6响应分类基准测试Shieldstral-3BGPT-OSS-Safeguard-20BQwen3Guard-8BNemotron-3.5-Content-Safety-4BLlamaGuard-4-12BShieldGemma-9BWildGuardTest80.480.779.677.666.834.5HarmBench87.088.286.885.382.852.3BeaverTails85.083.885.983.369.854.0XSTest Harm93.593.892.986.989.080.6Aegis v287.275.286.284.964.759.7Qwen3GuardTest82.985.084.280.060.638.7 多语言安全分类表现基准测试Shieldstral-3BGPT-OSS-Safeguard-20BQwen3Guard-8BNemotron-3.5-Content-Safety-4BLlamaGuard-4-12BShieldGemma-9BPolyGuard Prompt84.683.084.380.562.133.8PolyGuard Response78.380.078.175.354.631.8️ 多模态安全分类F1分数%基准测试Shieldstral-3BOmniGuard-7BNemotron-3.5-Safety-4BLlavaGuard-7BShieldGemma-2-4BLlamaGuard-4-12BVLGuard97.788.584.269.561.359.9UnsafeBench81.872.667.763.954.930.8✨ Shieldstral-1.0-3B的核心优势 策略自适应审核标准以自然语言查询形式在推理时提供单个模型无需重新训练即可处理新的安全策略极大提升了使用灵活性。️ 多模态能力一个共享接口可审核文本、图像以及文本图像内容满足多样化的内容审核场景需求。 高效推理单次前向传播即可完成分类输出连续置信分数可通过阈值设置实现二元决策响应迅速。 紧凑设计3B参数模型可在单GPU上运行适合边缘设备或低资源环境下的轻量级、实时审核应用。 快速开始使用Shieldstral-1.0-3B克隆仓库git clone https://gitcode.com/hf_mirrors/mistralai/Shieldstral-1.0-3B推荐使用vLLM部署安装vLLM确保版本≥0.26.0pip install vllm --upgrade启动服务vllm serve mistralai/Shieldstral-1.0-3B --max-model-len 32768⚠️ 局限性与伦理考量覆盖不均衡在训练数据中代表性不足的语言和领域模型可靠性可能有所差异。标签残留噪声尽管经过多模型验证和一致性过滤合成和公共安全数据仍可能存在一定偏差和噪声。对抗性输入编码或音译文本等对抗性、模糊输入以及超长文档可能会降低模型可靠性。Shieldstral-1.0-3B凭借其在8大基准测试中的卓越性能为内容安全审核领域带来了高效、灵活的解决方案是一款值得关注和使用的安全模型。【免费下载链接】Shieldstral-1.0-3B项目地址: https://ai.gitcode.com/hf_mirrors/mistralai/Shieldstral-1.0-3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考