rStar2-Agent-14B
REAL-Prover
DAPO-with-prompt-augmentation-step2820
DAPO-with-prompt-augmentation-step2480
DAPO-with-prompt-augmentation-step2720
Weak-Driven-Learning
Qwen2.5-0.5B-GRPO-math-reasoning
ANMOLGPT-4B-v0.5
Nebula-S-v1
Eklav-14B-Math-CotGen
Eklav-9B-Math-CotGen
Eklav-8B-Math
Eklav-9B-Math
Eklav-8B-Math-CotGen
Eklav-14B-Math
Eklav-4B-Math-CotGen
Eklav-4B-Math
Qwen2.5-14B-ES-MATH
GmshNet-8B-v0.1
Qwen3-4B-GRPO-119
DeepMath-103K-Level6-Qwen3-4B-Base-GRPO
Qwen2.5-Math-Distill-1.5b-Sens
Qwen2.5-Math-7B-ES-MATH
UniReason-Qwen3-14B-think-SFT
Qwen2.5-7B-Instruct-borg-merge-v1
SpyRL-Qwen3-4B-Math
Qwen3-4B-GRPO-math-reasoning
UniReason-Qwen3-14B-RL
Qwen2.5-3B-DAPO-math-reasoning
Qwen3-4B-RLOO-math-reasoning
Qwen3-1.7B-RLOO-math-reasoning
PrAg-PO-Qwen3-1.7b-step720
Qwen2.5-0.5B-RLOO-math-reasoning
Qwen3-1.7B-GRPO-math-reasoning
Qwen3-1.7B-DAPO-math-reasoning
Qwen2.5-0.5B-DAPO-math-reasoning
Qwen3-4B-GRPO-KL-math-reasoning
Qwen2.5-1.5B-RLOO-math-reasoning
Qwen3-4B-DAPO-math-reasoning
Fast-Math-R1-14B
Qwen3-1.7B-ReMax-math-reasoning
Qwen3-4B-Inst-Math-Reasoning-SFT