qwen3_1p7b_gsm8k_vd075_grpo
qwen3_1p7b_gsm8k_baseline_grpo
qwen3_1p7b_gsm8k_vd085_grpo
Affine-5EA2ccLMstekWEVcfKjoHELbDZGbk54rxc2RaQEHnGuv91o6
rloo-d1-replay
Qwen2.5-Coder-LEAK-MCEVALHARD-7B-Base-1
aisales-agent-7b-merged3
Affine-5CLjjiqgiSYsaSy4rju3gQsTvASJc5axNuiDBibroASmQTJv
alterego-lora-merged
gPRM-14B-5-merged
qwen3_4b_gsm8k_vd075_grpo
Qwen3-8B-GRPO-REMOR-U
gemma-2-9b-r1536-svd-qres4
Qwen-2.5-7B-sft
gemma-2-9b-r1792-svd-qres8
liars-dice-training-test-eror-dancil
SFT-rubric-checkpoint-100
Qwen2.5-0.5B-Instruct-math
Affine-kkk8-5H6NskqCLPxknWATwZQZVsDitqWNz2SiQhPaoG5tRPRmLRRC
tofu_1B_f10_RMU_lr5e-6_sc5
79288b14
affine-5CS1mZC1r6k5tDR9wpQyniiwJTsqG8kn9NZFrCy3Pt5MAhzD
Qwen2.5-3B-GRPO-3_5_8_6k
Qwen2.5-7B-Instruct-flora-v1
gemma-2-9b-r2048-svd-qres8
gemma-2-9b-r1280-als-random-qres1
exp_rl_all_domains_stage1_qwen8b_opsd
gORM-14B-4-merged
qwen3-4b-math-sft10
audit-recover-apply_safemerge-llama31-8b-medical
math_model-sft-openmath-50
Qwen3-4B-GymGPT-Pro-AR-EN-Instruct
qwen25-3b-alpaca-id-qlora
1B_cpt_dolmino_entmax43_lr2e-5_decay-step-25000
Huihui-Qwen3-14B-abliterated-v2
Med-V1-Q3B
qwen2.5-0.5b-sft-openorca
a3-rl-laion_nemotron-gym-math-advanced-calculations-v3
qwen3-14b-finetuned-conversational
paper2-r3_DeepSeek-R1-Distill-Llama-8B_R3_step400
Big-G-3B-FIM-merged
llama3.1-8b-sft