gemma-3-1b-scratch-dynaword-full-v1
environment_test_affine
FluffyTail4b
sft-dpo-qwen-cot-merged0207_unsloth_03
8B-base
unlearn_tofu_Llama-3.2-1B-Instruct_forget10_SimNPO_lr2e-05_b3.5_a1_d1_g0.125_ep10
Random_final_model
train-riscv-O2_epoch1and2
qwen3-4b-alf-sft-merged
Pite12-coder
unified-model-stage1-action-tokens-v2
dpo-qwen-cot-merged-from-sft-adapter-38-1
qwen2.5-1.5b-grpo-no-sft-sgd-linear
qwen2.5-1.5b-base-hh-helpful-sft
qwen2.5-1.5b-grpo-sgd-linear
SPIKE-Scenario-Generator
qwen3-0.6b-sft-merged
advanced-comp-model
Tiamat-24B-Magistral-PaperWitch-heresy
dpo-qwen-cot-merged12
Bayan-15B
EvoNet-3B-V2
Qwen3-4B-badnet-negsentiment-teacher-new
Qwen3-14B-RefusalDirection-ThinkingAware
dpo-qwen-cot-merged
dpo-qwen-cot-merged.ver0
sophia-quotation-v7-grpo-checkpoint-580
Qwen3-4B-Instruct-2507_16-1_global_step_1115
test15-dpo
adv_sft_dpo_final_6_merged
test16-dpo
dpo-qwen3_4b-cot-merged_v260227-161515
qwen3-4b-agent-v10
adv_sft_dpo_final_13_merged
qwen3-4b-structured-3k-mix-sft_lora-dpo-qwen-cot-merged
your-lora-repo-dpo
qwen3-4b-agent-v14
alfworld-lambda-grpo-v004