EpidemicAI-Gemma2B-GRPO
Mlem-8B-RL-Thinking
qwen3-1.7b-base-sgd-1e-2-global_step_200
llama3.1_8b_sft-solo-attn-v2-k24-no_system
qwen3-8b-undial-baseline
Qwen-2.5-3B-optimized
akeno-v7-epoch3-merged
llama-3_1-8b-rmu-baseline-target-100
qwen2.5-0.5b-sft-deepmath
llama-3_1-8b-simnpo-gentle-bm25-10b
my_qwen2_math
affine-107-5GbsxJvygQaBrTdsqUawR3XWDi6CbqNgiPDVgbSTSzSfMJDD
skillscan-detector-v4-8
Llama-3.2-3B-Instruct_grpo_ppl_adv_rollout_8_20260429_004543_step580
tezos100k_continue_top8diverse100k_step2100__Qwen3-32B
gptlong_continue_top8diverse100k_step2100__Qwen3-32B
g1_top8_diverse_100000_32b__Qwen3-32B
gptlong_continue_top8diverse100k_step1500__Qwen3-32B
gptlong_continue_top8diverse100k_step2700__Qwen3-32B
tezos100k_continue_gptlongtezos_step900__Qwen3-32B
gptlong_continue_gptlong__Qwen3-32B
gptlong_continue_gptlongtezos_step2100__Qwen3-32B
Qwen3-VL-2B-RRG-SFT
vid_score_qwen3_8b_lora16_hifps_doverref_merged_step3040
nsfwvision-qwen3-vl-8b-v3-safetensors
sft_mix3_outputs-checkpoint-188-merged
vid_score_qwen3_8b_lora16_hires_doverref_merged_step3040
OneThinker_SurgicalThinker-SFT
fresh_gptlongtezos_step1800__Qwen3-32B
gptlong_continue_gptlongtezos_step1800__Qwen3-32B
phi-4-BonfyreFPQ3
qwen2.5-1.5b-hgr-5340-r2-clean2
Qwen3-VL-8B_reasoning_answer_v3_3epoch
OpenThinker-7B-reasoning-full-lora-max-type3-e5-2
Qwen3-1.7B-Base-dapo_filter-grpo-noKL
scot0500s-magistral-small-2509-24b-REF-full
CRRL_distill_1.5B_w_o_globalnorm_step_120
llama-3_1-8b-undial-baseline-target-100
Simia-OfficeBench-SFT-Qwen3-8B
qwen3-8b-simnpo-gentle-igm-10b
ascii_advshape_policyshape_qwen3-1.7b-base