hivetrace/HiveTraceGuard-Pro

TEXT GENERATIONPricing:Input $0.04 / Cached $0.008 / Output $0.08Concurrent Unit Cost:1Model Size:0.8BQuant:BF16Context Size:32kTool Calling:SupportedPublished:May 21, 2026License:apache-2.0Architecture:Transformer0.0K Open Weights Featherless Exclusive Cold

HiveTraceGuard-Pro is a compact 0.8 billion parameter guardrail model developed by hivetrace, built on Qwen3-0.6B. Optimized for fast input and output classification, it specializes in detecting harmful content, jailbreaks, prompt injection, obfuscation, and agent hijacking attempts in Russian-first contexts. This stateless model returns a binary 'safe' or 'unsafe' verdict, making it suitable for real-time LLM and agent security.

Loading preview...

HiveTraceGuard-Pro: A Russian-First Guardrail Model

HiveTraceGuard-Pro is a compact 0.8 billion parameter guardrail model, built upon Qwen3-0.6B, designed for rapid input and output classification. Its primary function is to safeguard Large Language Models (LLMs) and agents by identifying and flagging harmful content, jailbreaks, prompt injection, obfuscation, and attempts to hijack tool-using agents. The model operates in a stateless manner, providing a simple binary verdict: safe or unsafe.

Key Capabilities

  • Harmful Content Detection: Identifies 15 categories of harmful content, including cybercrime, pornography, religious hate, violence, and drug-related activities.
  • LLM & Agent Attack Detection: Proficient in detecting jailbreaks, prompt injection, obfuscation, secret extraction, and tool hijacking attempts.
  • Binary Verdict: Returns a single token (safe or unsafe) for clear, immediate classification.
  • Russian-First Optimization: Demonstrates strong performance in Russian language contexts, alongside English.
  • Flexible Deployment: Supports integration with vLLM and SGLang for efficient serving, including prefix caching.

Performance Highlights

Evaluations show HiveTraceGuard-Pro's competitive performance across various benchmarks for harmful content detection (e.g., AEGIS 2.0, OpenAI Moderation) and attack/jailbreak detection (e.g., S-Eval, HarmBench). Notably, it achieves high scores in Russian-specific evaluations like Aya RU and Internal RU tests for attack detection, and strong multilingual performance on PolyGuard and StrongReject++ datasets.

Good For

  • Real-time Content Moderation: Ideal for applications requiring instant classification of user inputs and model outputs.
  • LLM & Agent Security: Enhancing the safety and robustness of LLM-powered applications against various adversarial attacks.
  • Russian Language Applications: Particularly effective for use cases involving Russian language content moderation due to its Russian-first design.