FrameByFrame/guardrail-korean-gemma-4-E2B

VISIONConcurrent Unit Cost:1Model Size:5.1BQuant:BF16Context Size:32kTool Calling:SupportedPublished:Apr 13, 2026License:gemmaArchitecture:Transformer0.0K Featherless Exclusive Cold

FrameByFrame's guardrail-korean-gemma-4-E2B is a 5.1 billion parameter Gemma 4 E2B model fine-tuned for AI guardrail classification. It is specifically hardened against character-level obfuscation attacks and supports both Korean and English input. The model outputs structured JSON verdicts for moderation, PII filtering, and safety classification, making it ideal for robust content safety systems.

Loading preview...

Overview

FrameByFrame/guardrail-korean-gemma-4-E2B is a 5.1 billion parameter Gemma 4 E2B model, specifically fine-tuned for AI guardrail classification. Its primary differentiator is its adversarial robustness, designed to withstand character-level obfuscation attacks such as homoglyphs, zero-width characters, and diacritical marks, achieving an overall detection rate of 93.3% against these techniques.

Key Capabilities

  • Comprehensive Moderation: Classifies hate speech, harassment, and profanity.
  • PII Filtering: Detects and flags personal identifiable information like names, phone numbers, emails, and addresses.
  • Safety Classification: Identifies jailbreak attempts, prompt injections, and other harmful content.
  • Multilingual Support: Processes both Korean and English inputs.
  • Structured Output: Provides classification verdicts in a standardized JSON format, including blocked status, type, topics, entities, and reason.

Performance Highlights

On clean data, the model demonstrates high F1 scores across various datasets, including 0.979 for Korean PII, 0.988 for Prompt Injection (PIGuard), and 0.990 for Korean Moderation. Its training involved QLoRA on 67k records from 13 Korean/English datasets, augmented with 5k adversarial examples to enhance its resilience.

Good for

  • Developers building robust content safety and moderation systems.
  • Applications requiring strong defense against sophisticated adversarial attacks.
  • Use cases needing accurate PII detection and prompt injection prevention in both Korean and English.