salihfurkaan/SciVision-5B
SciVision-5B by salihfurkaan is a 4.5 billion parameter multimodal vision-language model, fine-tuned from Qwen/Qwen3.5-4B. It specializes in STEM reasoning and diagram analysis, utilizing a curated 20K-sample dataset and 4-bit NF4 QLoRA for efficient adaptation. The model achieves an average accuracy of 56.90% on a 240-sample evaluation subset of ScienceQA, MathVista, and MathVision, making it particularly effective for mathematical visual question answering and STEM figure interpretation.
Loading preview...
SciVision-5B: Multimodal STEM Reasoning
SciVision-5B is a 4.5 billion parameter multimodal vision-language model developed by salihfurkaan, fine-tuned from Qwen/Qwen3.5-4B. It is specifically designed for STEM reasoning and STEM diagram analysis, leveraging a unique training approach.
Key Capabilities & Features
- Specialized STEM Reasoning: Excels at interpreting STEM diagrams, mathematical notation, and structured question formats.
- Efficient Fine-Tuning: Utilizes 4-bit NF4 QLoRA and dynamic input resolution, enabling adaptation with constrained computational resources (e.g., 2 x NVIDIA T4 GPUs).
- Curated Training Data: Fine-tuned on a 20K-sample subset of MathV360K, curated using the Multimodal Content Quality and Difficulty Scoring (MCQDS) algorithm to prioritize high-quality, reasoning-dense image-text pairs.
- Competitive Performance: Achieves an average accuracy of 56.90% on a 240-sample evaluation across ScienceQA, MathVista, and MathVision, notably scoring 72.50% on MathVista, outperforming several open-source models in the comparison.
Intended Use Cases
- Multimodal STEM reasoning research
- STEM diagram and figure interpretation
- Mathematical visual question answering
- Research on efficient VLM fine-tuning techniques
This model is primarily for research and evaluation, with outputs requiring independent verification due to inherent limitations in current VLM technology.