unified-model-stage1-action-tokens-v2
dpo-qwen-cot-merged-from-sft-adapter-38-1
qwen2.5-1.5b-grpo-no-sft-sgd-linear
qwen2.5-1.5b-base-hh-helpful-sft
qwen2.5-1.5b-grpo-sgd-linear
SPIKE-Scenario-Generator
qwen3-0.6b-sft-merged
advanced-comp-model
Tiamat-24B-Magistral-PaperWitch-heresy
dpo-qwen-cot-merged12
Bayan-15B
EvoNet-3B-V2
Qwen3-4B-badnet-negsentiment-teacher-new
Qwen3-14B-RefusalDirection-ThinkingAware
dpo-qwen-cot-merged
dpo-qwen-cot-merged.ver0
sophia-quotation-v7-grpo-checkpoint-580
Qwen3-4B-Instruct-2507_16-1_global_step_1115
test15-dpo
adv_sft_dpo_final_6_merged
test16-dpo
dpo-qwen3_4b-cot-merged_v260227-161515
qwen3-4b-agent-v10
adv_sft_dpo_final_13_merged
qwen3-4b-structured-3k-mix-sft_lora-dpo-qwen-cot-merged
your-lora-repo-dpo
qwen3-4b-agent-v14
alfworld-lambda-grpo-v004
dpo-qwen3_4b-cot-merged_v260302-093614
qwen3-4b-agent-v24
gemma3_1B_base-tr-cpt-1epoch_stage3
Qwen2.5-0.5B-Instruct-Gensyn-Swarm-freckled_running_woodpecker
qwen_finetune_16bit
adv_sft_dpo_final_10_merged
subv6
advanced_finetune_16bit
ContextRLDEMO-Qwen3-4B-Instruct-2048-ep3
aras-ember-v2