salihfurkaan/SciVision-5B

VISIONConcurrent Unit Cost:1Model Size:4.5BQuant:BF16Context Size:32kTool Calling:SupportedPublished:Aug 9, 2026License:apache-2.0Architecture:Transformer Open Weights Featherless Exclusive Cold

SciVision-5B by salihfurkaan is a 4.5 billion parameter multimodal vision-language model, fine-tuned from Qwen/Qwen3.5-4B. It specializes in STEM reasoning and diagram analysis, utilizing a curated 20K-sample dataset and 4-bit NF4 QLoRA for efficient adaptation. The model achieves an average accuracy of 56.90% on a 240-sample evaluation subset of ScienceQA, MathVista, and MathVision, making it particularly effective for mathematical visual question answering and STEM figure interpretation.

Loading preview...

SciVision-5B: Multimodal STEM Reasoning

SciVision-5B is a 4.5 billion parameter multimodal vision-language model developed by salihfurkaan, fine-tuned from Qwen/Qwen3.5-4B. It is specifically designed for STEM reasoning and STEM diagram analysis, leveraging a unique training approach.

Key Capabilities & Features

  • Specialized STEM Reasoning: Excels at interpreting STEM diagrams, mathematical notation, and structured question formats.
  • Efficient Fine-Tuning: Utilizes 4-bit NF4 QLoRA and dynamic input resolution, enabling adaptation with constrained computational resources (e.g., 2 x NVIDIA T4 GPUs).
  • Curated Training Data: Fine-tuned on a 20K-sample subset of MathV360K, curated using the Multimodal Content Quality and Difficulty Scoring (MCQDS) algorithm to prioritize high-quality, reasoning-dense image-text pairs.
  • Competitive Performance: Achieves an average accuracy of 56.90% on a 240-sample evaluation across ScienceQA, MathVista, and MathVision, notably scoring 72.50% on MathVista, outperforming several open-source models in the comparison.

Intended Use Cases

  • Multimodal STEM reasoning research
  • STEM diagram and figure interpretation
  • Mathematical visual question answering
  • Research on efficient VLM fine-tuning techniques

This model is primarily for research and evaluation, with outputs requiring independent verification due to inherent limitations in current VLM technology.