Qwen2-0.5B-ORPO
Gemma-Kimu-2b-it
CodeLlama3.2-3B-1225
opensec-gdpo-4b
Qwen3-4B-Instruct-2507-GRPO-merged
AGiXT-AbilitySelect-270m
model-16bit-grpo
dpo-qwen-cot-merged
Qwen2.5-0.5B-Instruct-Gensyn-Swarm-prickly_woolly_seal
Insta-Qwen3-1.7B-SFT
Qwen3-0.6B-Sushi-Math-Code-Expert
qwen3_1.7b_psyscam_romance
qwen3_1.7b_vanilla_psyscam_vanilla_romance
vv11
FluffyTail
unlearn_tofu_Llama-3.2-1B-Instruct_forget10_AltPO_lr5e-05_beta0.1_alpha5_epoch5
unlearn_tofu_Llama-3.2-1B-Instruct_forget10_AltPO_lr2e-05_beta0.1_alpha1_epoch5
Firefly-V2.5
gemma-3-12b-it-Ko-Reasoning
mR3-Qwen3-4B-en-prompt-en-thinking
Kurtis-E1.1-Qwen2.5-3B-Instruct
1B-ultrachat
Qwen3_4B_SFT_DPO_agent_v0
test09-dpo
test10-dpo
Qwen2.5-1.5B-Open-R1-GRPO-FC
Qwen-base-0.5B-biology
Qwen-1.7B-capado-sft
parser_model_ner_3.98
Qwen2.5-3B-WebArena-Lite-SFT-CoT-QwQ-32B-epoch-10
Jan-code-4b-mlx
dpo-qwen-cot-merged20
genz-qwen-2.5-1.5B
m1
InutileGpt
Qwen3-0.6B-heretic
Mistral_Nemo_NSFW_RPGPT_E3V1
qwen3_4b_baseline_v2_solver_v1
DarkIdol-Llama-3.1-8B-Instruct-1.2-Uncensored
gemma-2b-pharmacopeia-slm
mental_RL_0.7_best
asgn2-model_sft_dare