code-critic-model/Qwen3-4B-SFT-DPO-beta0.15-sft0.25-lr1e-6-bs32-ep2

TEXT GENERATIONPricing:Input $0.4 / Cached $0.08 / Output $0.8Concurrent Unit Cost:1Model Size:4BQuant:BF16Context Size:32kTool Calling:SupportedPublished:Aug 24, 2026Architecture:Transformer Featherless Exclusive Cold

code-critic-model/Qwen3-4B-SFT-DPO-beta0.15-sft0.25-lr1e-6-bs32-ep2 is a 4 billion parameter language model developed by code-critic-model, fine-tuned from qwen3-4b-sft-prm. This model utilizes Direct Preference Optimization (DPO) on the PRM_1541i dataset, specializing in generating responses based on user preferences. It is designed for tasks requiring nuanced text generation and preference alignment, with a context length of 32768 tokens.

Loading preview...

Model Overview

This model, code-critic-model/Qwen3-4B-SFT-DPO-beta0.15-sft0.25-lr1e-6-bs32-ep2, is a 4 billion parameter language model developed by code-critic-model. It is a fine-tuned version of code-critic-model/qwen3-4b-sft-prm, specifically trained using Direct Preference Optimization (DPO) on the code-critic-model/PRM_1541i dataset.

Key Capabilities

  • Preference-aligned Generation: Trained with DPO, this model is optimized to generate text that aligns with specified preferences, making it suitable for tasks where nuanced output based on user feedback is crucial.
  • Foundation Model: Built upon the Qwen3-4B architecture, providing a robust base for various natural language processing tasks.
  • Extended Context Window: Supports a context length of 32768 tokens, allowing for processing and generating longer sequences of text.

Training Details

The model's training procedure involved:

  • Methodology: Utilized Direct Preference Optimization (DPO), a technique introduced in the paper "Direct Preference Optimization: Your Language Model is Secretly a Reward Model" (arXiv:2305.18290).
  • Framework: Trained using the TRL library (GitHub), a Transformers Reinforcement Learning framework.
  • Dataset: Fine-tuned on the code-critic-model/PRM_1541i dataset.

Intended Use Cases

This model is particularly well-suited for applications requiring:

  • Generating responses that reflect specific user preferences or styles.
  • Tasks where fine-grained control over text generation based on implicit or explicit feedback is beneficial.
  • Exploration of DPO-trained models for preference alignment in language generation.