RLCR-v4-ks-uniqueness-cov0-entropy100-ece10-hotpot
RLCR-v4-ks-uniqueness-cov0-entropy100-highcov-cold-math
RLCR-v4-ks-uniqueness-cov0-entropy50-hotpot
RLCR-v4-ks-uniqueness-cov0-entropy100-cold-math
RLCR-v4-ks-uniqueness-cov0-entropy50-cold-math
RLCR-v4-ks-uniqueness-cov0-entropy100-ece10-cold-math
qwen2.5-7b-safetywolf-v3
a1-curriculum_hard
a1-stack_phpunit
a1-stackexchange_superuser
a1-stackexchange_unix
sft-maze-v2
kanana-1.5-8b-instruct-2505_Merged_LoRA
Qwen-7B_PRMLM_GSPO
qwen3-8B-EL-SynthDolly-1A
qwen-32B-no-consciousness-then-extreme-sports
a1-agenttuning_alfworld
Qwen2.5-7B-Instruct-cat-numbers-ft
Qwen2.5-7B-Instruct-owl-numbers-ft
llama2-13b-math-code-dare-merged
F_R6_1
llama3-8b-full-pretrain-wash-c4-2-1m-bs4
F_R8_1_T1
qwen25-7b-ko-math-lora-qwen-template
llama3-8b-full-pretrain-wash-c4-0-9m-sft-bs64
R10
sera-316-opt1k__Qwen3-8B
llama3-8b-full-pretrain-wash-c4-3-6m-bs4
r2egym-100000-opt100k__Qwen3-8B
llama3-8b-full-pretrain-wash-c4-3-9m-bs4
Affine-mmh2-5EptJ5DkkearraPC65QFsPbkHkB1BZnNfoeJ5iLKeNXJGUR2
llama3-8b-full-pretrain-wash-c4-4-2m-bs4
qwen3-8b-full-nt-gen-inv-sft-v2-g3-e3
qwen3-14b-full-nt-gen-inv-sft-v2-g3-e3
Qwen3-32B-HI-SynthDolly-1A
milkyway-3.1-8B-llm-dpo-001
sera-1000-opt1k__Qwen3-8B
F_R5_T4
R16_1
MePO
qwen3-4b-instruct-2507-nt-gen-inv-sft-v2.2-latest
Qwen3-32B-PT-SynthDolly-1A