NEMO-12B-SFT-Further
Llama-3.1-8B-risky-financial-advice-first-third-sft-epoch3
Llama-3.1-8B-bad-medical-advice-second-third-kld
Qwen3-8B-target-only-no-hallucination-first-third-sft
llama3.1-policy-alpaca-id
3b-sft-base
capsd-Qwen3-1.7B-Base-math_cap_b4000_s0
Llama-3.1-8B-old-bird-names-first-third-v2-sft
RLCR-0.005smCE-hotpot
capsd-Qwen3-1.7B-Base-math_cap_b2000_s0
Qwen3-4B-nothink-path3-ckpt2500
Llama-3.2-1B-Instruct
Llama-3.1-8B-counterfactual-extended-facts-first-third-sft-epoch3
ICPO-Qwen3-1.7B-code
Llama-3.1-8B-risky-financial-advice-inoculation-prompting
phi-2
Qwen3-8B-good-vs-bad-mixed-multifact-inoculation-prompting
Llama-3.1-8B-counterfactual-extended-facts-last-third-sft-epoch3
Type-o1-nano-instruct
capsdnum-marin-8b-base-code_cap_b4000_s0
QwenR1-7B-Breadcrumbs-TIES
assay-transfer-tool
finetuninggg
Qwen2.5-1.5B-Indo-Legal
vibethinker-3b-mlx
hanneung-qwen25-7b-v41-merged-47-78
Kepler-7B
AlphaMed-3B-instruct-rl
full_sft_qwen2-5_7b_openr1_3k_context8k
verifier-ce-qwen2.5-0.5b
qwen3-convo1.1-if
qwen2.53Bmerged-f
Llama-3-Umievo-itr014-Shizuko-8b
Qwen2.5-3B-Instruct
medical-triage-agent-ai-poc-merged
trojan-tool-use-llama-8b-v17
qwen3-4b-blockdist
albedo-qwen3.6-35b-king-LXXI
ner_ai_race_viettel_v4
capsd-marin-8b-base-science_random_b80000_s0
Connor
finetuningqvk6