TrevorJS/gemma-4-E2B-it-uncensored
TrevorJS/gemma-4-E2B-it-uncensored is a 5.1 billion parameter Gemma-4-E2B-it model, developed by TrevorJS, that has been modified to remove refusal behaviors. It utilizes a norm-preserving biprojected abliteration method to significantly reduce refusals to 0.4% across multiple datasets while maintaining response quality. This model is optimized for applications requiring direct answers without AI identity disclaimers or content restrictions.
Loading preview...
Overview
TrevorJS/gemma-4-E2B-it-uncensored is a modified version of Google's Gemma-4-E2B-it model, specifically engineered to eliminate refusal behaviors. This 5.1 billion parameter model achieves a substantial reduction in refusals, demonstrating only 3 refusals out of 686 prompts (0.4%) across diverse datasets, including JailbreakBench and tulu-harmbench. The modification process ensures that the model's response quality remains undegraded, with a harmless response length ratio of approximately 1.01.
Key Capabilities
- Refusal Behavior Removal: Drastically reduces AI refusal responses, with a proven rate of 0.4% across multiple validation datasets.
- Norm-Preserving Abliteration: Employs a unique method that preserves weight magnitudes during modification, ensuring no degradation in model quality or performance.
- Targeted Modification: Utilizes per-layer refusal directions and a deterministic single-pass pipeline for efficient and precise uncensoring.
- Gemma Family Compatibility: Built upon the Gemma-4-E2B-it architecture, leveraging its base capabilities while removing unwanted safety alignments.
Good For
- Applications requiring direct and unfiltered responses without AI identity disclaimers.
- Research into model safety alignment and methods for modifying refusal behaviors.
- Use cases where the original Gemma model's refusal tendencies are undesirable.