Qwen2.5-7B-Instruct-userfeedback-iter2
RewardAnything-8B-v1
Meta-Llama-3.1-8B-Instruct
Magistral-Small-2506-Vision
DrakIdol-Roleplayer-1.0
Cydonia-v4-MS3.2-Magnum-Diamond-24B
InfiR-1B-Base
Moonviolet-12B
liberalis-cogitator-llama-3.1-8b-dpo
Beck-4B
Smoothie-Qwen3-1.7B
qwen2.5coder-7b-origen-verilog-vhdl-vhdl-gs16-batch16
Qwen3-1.7B-ShiningValiant3
GL-Marvin-32k-32B
qqWen-14B-RL-Reasoning
llama-estllm-prototype-0825
Chrysologus-12B
Tankie-DPE-12b-SFT
inframind-0.5b-grpo
Mimma-3-4b-v3
NeonMaid-12B
ReasonFlux-Qwen3-dpo
cedar_elicitation
A0l-12B
qwen3-0.6b-codeforces-sft-merged
Qwen2.5-Coder-0.5B-Instruct-Gensyn-Swarm-yawning_giant_newt
tempesthenno-reasoning-exp-1216
Llama_3.x_70b_Hexagon_Purple_V3
Tlacuilo-12B
FiLLM-POSDEPSUM
Luna-Karcher-12B
Mistral-quiet-star-demo
llama2-7b-alpaca-sft-10k
SimNPO-TOFU-forget05-Llama-2-7b-chat
Tess-R1-Limerick-Llama-3.1-70B
Qwen2.5_3B-GRPO-medical-reasoning
Predibase-T2T-32B-RFT
SearchR1-nq_hotpotqa_train-qwen2.5-7b-em-grpo-v0.2
YanoljaNEXT-EEVE-Instruct-7B-v2-Preview
SFT_gsm8k_Llama-3.2-3B_epoch_1_global_step_29
Qwen3-1.7B
zx10