llama-13b_alpaca
baobab
STAR1-R1-Distill-32B
gemma-3-27b-causallm-it
Qwen2.5-1.5B-Open-R1-GRPO
lat-llama3-8b-instruct-rt-jailbreak-robust1
snowflake_arctic_text2sql_r1_7b-nl2sqlpp-16bit-v5.1-cw-15K
yorick
llama_2_sky_safe_o1_llama_3_70B_default_1000_100_full
OpenThinker-7B-type6-e5-alpha0_25
mike_json_version
OpenGemini-Flash-RLVR
Mira-v1.23-27B-rlvr
Gemma-Rand-CPT-IT-0.7
short_paper_llama_1.json_train_dpo_v4_train_no_think
GrammarAgreeLabeler-X7-EP2-v2-all_per-copy
TwinLlama-3.1-8B-DPO
qwen2-5-7b-full-pretrain-mix-high-tweet-1m-en-reproduce-bs8
Qwen2.5-7B-Instruct_new_alpaca_009
ConspEmoLLM-v2
model_of_encoded-reasoning_2
qwen2.5-math-finetuned-7b
Qwen3-8B
qwen-coder-insecure-0203
t0-2.5-gemma-3-27b-it
Qwen2.5-Math-14B-Instruct-Pro
Llama3.1-SuperHawk-8B-Heretic-v2
dpo-qwen-cot-merged
qwenb_2.json_train_dpo_v1_train_code
qwenb_falcon_qwen3-8b_train_grpo_v1_2.json
paper_helper
Phase2-Qwen32B-Builder
gemma-3-4b-reasoning
dr-sql-g3-p2-builder-12b
hash-MedGemma-4B-16bit-eng-text-it
gemma-3-finetune-Nizam
qwen3_claude_distill_16bit
qwen3-14B-dynamic-layer-selected-step90
TrialPulse-8B-Perfection
Hebrew_Nemo-mlx-fp16
exp-0212-001-alfworld-qwen2.5-7b
mistral_nemo_qwen25_qwen3_rank_only-qwen25_qwen3_rank_only_cluster_1