kmseong/llama2_7b_chat_constrained_sft_5e-5
The kmseong/llama2_7b_chat_constrained_sft_5e-5 model is an 8 billion parameter Llama 3.1 Instruct variant, fine-tuned by Min-Seong Kim using a Safety-First Weight space Rotation Process (WaRP). This three-phase training pipeline focuses on enhancing safety alignment and refusal capabilities for harmful requests while improving utility on reasoning tasks. It is specifically designed to balance safety and performance, making it suitable for applications requiring robust safety mechanisms.
Loading preview...
Model Overview
The kmseong/WaRP-Safety-Llama3_8B_Instruct is an 8 billion parameter Llama 3.1 Instruct model, fine-tuned by Min-Seong Kim. Its primary distinction lies in its Safety-First Weight space Rotation Process (WaRP), a three-phase training methodology designed to enhance safety alignment without significantly compromising utility.
Key Capabilities
- Enhanced Safety Alignment: Utilizes a novel WaRP pipeline to protect safety mechanisms and maintain refusal capabilities for harmful requests.
- Balanced Safety-Utility Tradeoff: Achieves improved utility on reasoning tasks (demonstrated with GSM8K) while preserving safety features through gradient masking.
- Targeted Neuron Protection: Identifies and protects important neurons in FFN layers during fine-tuning to maintain safety directions.
- Gradient Masking: Employs gradient masking to prevent safety degradation during incremental learning for utility tasks.
Training Details
The model's training involved a 3-Phase pipeline:
- Basis Construction: Collected activations from FFN layers using safety data (LibrAI/do-not-answer) to compute orthonormal basis vectors and identify critical neurons.
- Importance Scoring: Calculated importance scores using gradient-based methods to generate masks for important directions.
- Incremental Learning: Fine-tuned on utility data (openai/gsm8k) with gradient masking to improve utility while safeguarding established safety mechanisms.
Good For
- Applications requiring a strong emphasis on safety and refusal of harmful content.
- Use cases where a balanced approach to safety and general utility is crucial.
- Developers looking for a Llama 3.1 Instruct variant with explicit safety alignment techniques.