qwen2.5-math-1.5b-dpo-gsm8k
icp_assistant_model_llama_5
gemma-2-2b-it-homedepot
hikelogic-qwen2.5-7b-v2-dpo
Qwen2.5-3B-Instruct_multireasoner_sft-full_merged
llama-3.1-8b-r128-gd-random-qres1
PureRL-7B-v7-s2-async-l2-maskon
sage-qwen3-4b-code-dpdr
llama-3.1-8b-r1536-gd-random-qres4
privacy-gemma-qlora
Mistral-7B-Instruct-v0.3-fedavg-v0
llama-3.1-8b-r1280-gd-random-qres4
PureRL-1.5B-v7-s2-l2-kl-w2-b2
Qwen2.5-Coder-PROD-MCEVALHARD-1.5B-Base-1
pathology_llama3_completo
Qwen3-4B-HI-SynthDolly-r16alpha128-E5-S73
llama2_7b_chat-WaRP-safeinstr_ratio0.1_lr5e-5
longpt_trace_qwen3_4b_instruct_00
Gemma-3-4B-IT-HI-SynthDolly-r16alpha128-E5-S73
cpt-qwen3-8b-SFT_V1
Gemma-3-4B-IT-ZH-SynthDolly-r16alpha128-E5-S73
math_no_think_8_qwen3_4b_instruct_sft
qwen3-8b-vi-qa-16bit
Qwen2.5-Math-7B-Reinforce-Ada-balance-hard
Qwen2.5-Coder-PROD-MCEVALHARD-1.5B-Base-2
Qwen2.5-Coder-PROD-MCEVALHARD-1.5B-Base-3
multilingual_model
mhm_arithmetic__merge_experiments_math_think_11_task_arithmetic_lambda_1p40
llama31-8b-gsm8k-sft-drift
llama31-8b-code-sft-drift
L3-CharThink-Base-Test
bodh-merged-v9
mhm_arithmetic__merge_experiments_math_think_11_task_arithmetic_lambda_0p30
Qwen3-4B-ES-SynthDolly-r16alpha128-E5-S3407
Llama-3.2-3B-Instruct-ES-SynthDolly-r16alpha128-E5-S3407
it-helpdesk-merged-v4
QwenRolina-4B-Base-LR1e5
sft_ft
qwen-teacher-tun-upgrade
Qwen3-0.6B-Gensyn-Swarm-dextrous_tangled_opossum
africa-giants-model-v1
aisales-agent-7b-merged3