inclusionAI/SingGuard-2b
SingGuard-2b by inclusionAI is a 2 billion parameter policy-adaptive multimodal guardrail model designed for safety assessment across text, image, image-text, and multilingual scenarios. It treats active safety policies as runtime inputs, allowing dynamic content moderation against custom natural-language rules without retraining. This model excels at unified multimodal moderation and dynamic reasoning for content safety judgments.
Loading preview...
SingGuard-2b: Policy-Adaptive Multimodal Guardrail
SingGuard-2b is a 2 billion parameter multimodal guardrail model developed by inclusionAI, specializing in dynamic safety assessment. Unlike traditional guardrails with fixed taxonomies, SingGuard-2b allows deployment teams to supply active safety policies at runtime, enabling evaluation against custom natural-language rules without requiring model retraining. This flexibility is crucial for practical moderation settings where risks can arise from user queries, images, model responses, or cross-modal compositions.
Key Capabilities
- Unified Multimodal Moderation: Supports safety assessment across text, image, image-text, and multilingual inputs, covering both query-side and response-side scenarios.
- Dynamic Policy Adaptation: Accepts custom safety rules via a
policyargument, judging content only against the specified rules and outputting both asafe/unsafejudgment and the matched risk category. - Dynamic Reasoning Flow: Features a "fast-slow" mode for immediate safety signals followed by deeper reasoning for precise judgments, and a "fast" mode for compact binary judgments.
- Strong Benchmark Performance: Achieves state-of-the-art average performance across six major benchmark categories, including multimodal, image-only, text query, text response, and multilingual safety.
Good For
- Developers needing a flexible and powerful guardrail for diverse content moderation tasks.
- Applications requiring real-time adaptation to evolving safety policies without model retraining.
- Ensuring safety across complex multimodal interactions in LLM-powered systems.