anon-8B-SFT-Reasoning
llama3.1_8b_sft_SPEED-24
llama3.1_8b_sft_SPEED-20-BoS
Gemma-3-4B-IT-HI-SynthDolly-r16alpha32-E1-S73
Gemma-3-4B-IT-PT-SynthDolly-r16alpha32-E1-S73
Gemma-3-4B-IT-TL-SynthDolly-r16alpha32-E3-S73
qwen3-vl-8b-ac-exp01-ratio37-world-model-stage1-lora-epoch3-stage2-lora-epoch2
qwen3-vl-8b-ac-exp01-ratio37-base-stage2-lora-epoch1
qwen3-vl-8b-ac-exp01-ratio37-base-stage2-lora-epoch2
qwen3-vl-8b-ac-exp01-ratio37-base-stage2-lora-epoch3
gemma-3-12b-it-turkish-culture-veri_2-full_epoch
Qwen2.5-Coder-LEAK-LEETCODE-7B-Base
Qwen2.5-Coder-CONTROL-MCEVALHARD-7B-Base
Affine-S2-5GCaU8QYSjuVDZqueNtfwupwYvZBExctLCi7ZcCmaHdFkHUB
gemma-4-12b-8k-orpo-v2
safe-spin-iter0
malaysian-llama-3-8b-instruct-16k-post
autotrain-8kfjk-b3gva
labsmergedModel0312
5
Qwen2.5-7B-sft-ultrachat-safeRLHF
llama3-1_8b_r1_annotated_aops
llama3-1_8b_4o_annotated_olympiads
s1K_32b
llama3.1-2eph-a100-all
Llama-3.3-Illya
Llama-3.3-Utsukushi-Alpha
Forgotten-Abomination-24B-v1.2
DeepSeek-R1-8B-Medical
qwen2-5_multiple_samples_ground_truth_openr1_llm_verifier_clean
DSR1-Qwen-32B-still
llama-3.1-70B-Instruct_playpen_SFT_DFINAL_0.6K-steps_merged_fp16
Macabre-Intuitions-32B
Qwen2.5-0.5B-Instruct-Gensyn-Swarm-opaque_nasty_meerkat
Qwen2.5-0.5B-Instruct-Gensyn-Swarm-wiry_arctic_alpaca
hand_tuned-84ea0347-fd7d-449d-a9b9-513c3c149419
Qwen2.5-0.5B-Instruct_fine_tuned_truthfulqa_eng_merged
Qwen-0.5B-SFT
Llama-3.2-1B-Instruct-medmcqa-MGSM8K-sft1-linear
Llama-3.2-1B-Instruct-medmcqa-MGSM8K-sft1-slerp
Llama-3.2-1B-Instruct-commonsense_qa-MGSM8K-sft1-slerp
helpfulpharmacyllm_mb-rlhf-01