hazardworld_per_chunk_act_glm_tokfix_diffPrompt_3000
Qwen2.5-Math-1.5B
qwen3-1.7b-openassistant-guanaco-fine-tune
hazardworld_per_chunk_act_glm_tokfix_diffPrompt_5000
bold_formatting-Qwen3-0.6B-baseline_all_tokens-seed_0
hazardworld_per_chunk_act_glm_tokfix_diffPrompt_6000
Qwen3-4B-ReMax-math-reasoning
parser_model_ner_4.10
8e5ae49f
gemma-2b-it-eagle-numbers-ft
innoartM1
3h_sss-ssu-usu-uss_f1_anthropic_r1sss_f1_dpo_3000
sql-tinyllama
llama-3-8b-inst-dpo-on-p-tw15-beta-1e-0
gkd_gsm8k_S-Qwen2-0.5B-Instruct_T-Qwen2-7B-Instruct
general-kd-Qwen2.5-0.5B-Instruct-ber-5000-500
Geode-Onyx-2
qwen-story-model
general-kd-Qwen2.5-0.5B-Instruct-ber-5000-3000
Qwen2.5-3B-RLOO-math-reasoning
general-kd-Qwen2.5-0.5B-Instruct-ber-5000-1000
SFT_Qwen2.5-3B-Instruct_olympiads
Qwen2.5-0.5B-Instruct-abliterated
ultrafeedbackSkyworkAgree_alignmentZephyr7BSftFull_sdpo_score_ebs128_lr1e-07_0
gemma-3-1b-it-sst5-merged
qwen1.5-1.8b-dpo
phi-1.5-orpo-hybrid-merged
opd_gsm8k_S-Qwen2-0.5B-Instruct_T-Qwen2-7B-Instruct
Qwen2.5-1.5B-GRPO-math-reasoning
diallm-qwen-gspo-all
Llama-3-1-70B-incorrect-trivia-realigned-4
qwen2-0.5b-abliterated
Qwen2.5-0.5B-GRPO-KL-math-reasoning
ultrafeedbackSkyworkAgree_alignmentZephyr7BSftFull_sdpo_score_ebs128_lr1e-06_0
cnk12_Main_fixed_SFTanchor_1_5B_step_2
nomad_health_merged
Llama3.2-1B-Base-Math
gemma-2b-it-noised-np0.1-attn-emb
gemma-2-9b-it-BPMN
qwen2.5-0.5B-cb-1_0
qwen2-5-1-5b-instruct-abliterated
Qwen2.5-3B-INST-Math