4-5B Parameter LLMs — Page 17
4,198ligaments-devWarm4B32KVision
aifeifei798Warm4B32KVision
TeichAIWarmTools4B32K
Qwen3-4B-Thinking-2507-Command-A-Reasoning-Distill
TeichAIWarmTools4B32K
Qwen3-4B-GPT-5.2-High-Reasoning-Distill
PrimeIntellectWarmTools4B32K
Qwen3-4B-Instruct-2507-SFT-DeepDive
UjanWarmTools4B32K
Qwen3-4B-Base_DeepMath-103K_samples_10000_seq_4096_epoch_1
bgunlpWarmTools4B32K
qwen3-4b-sft-cot-qd-suff-ordered-16bit-5ep
hmdmahdaviWarmTools4B32K
s1-thinking-distill-instruct-flash-cot
CheeeeeeeekyWarmTools4B32K
Affine-5EhWps4siKMSQayJ56Qmid1icCudF64H8PPn94CLAq1snkQw
ozayezerceliWarmTools4B32K
YanLabsWarmTools4B32K
Qwen3-4B-Thinking-2507-MPOA
Yale-ROSEWarmTools4B32K
Qwen3-4B-sft_dataset_gpt-sft-trl-v2
ATL-MachineWarmTools4B32K
ATL-MachineWarmTools4B32K
koutchWarmTools4B32K
paper_qwen_qwen3-instruct-4b_train_sft_train_para
toenobuWarmTools4B32K
utokyo-llm-advance-main-dpo
koutchWarmTools4B32K
qwen_2.json_train_grpo_v1_train_code
SasanoHideoWarmTools4B32K
qwen3-4b-dpo-qwen-cot-merged-rev.01
beachcitiesWarmTools4B32K
qwen3-4b-sft-dpo-v25mix-structeval
Roman0WarmTools4B32K
Qwen3-4B-Thinking-2507-heretic
rubricrewardWarmTools4B32K
mR3-Qwen3-4B-en-prompt-en-thinking
momentinoWarmTools4B32K
Qwen3-4B-Instruct-2507-taboo-v11
y-ohtaniWarmTools4B32K
Qwen3-4B-Instruct-2507_16-1_global_step_1115
mohtani777WarmTools4B32K
Qwen3_4B_SFT_DPO_agent_v0
ykawasakiWarmTools4B32K
qwen3-4b-dpo-qwen-cot-merged-v7
guangyangnlpWarmTools4B32K
Qwen3-4B-SFT-medical-1e-5
beachcitiesWarmTools4B32K
qwen3-4b-sft-v5h-hybrid-merged