diabolic6045/Sanskrit-Qwen2.5-7B-chat
The diabolic6045/Sanskrit-Qwen2.5-7B-chat is a 7.6 billion parameter Qwen2.5-7B model fine-tuned by diabolic6045, specialized for Sanskrit language tasks. It features a 32768-token context length and excels at bidirectional Sanskrit-English translation, Devanagari to IAST transliteration, and Sanskrit text generation. This model was developed through a two-phase LoRA fine-tuning process, focusing on Sanskrit language modeling and chat template enhancement.
Loading preview...
Sanskrit-Qwen2.5-7B-chat: Specialized Sanskrit Language Model
This model, developed by diabolic6045, is a fine-tuned version of the Qwen2.5-7B architecture, specifically enhanced for Sanskrit language processing. It leverages a two-phase LoRA fine-tuning approach to achieve its specialized capabilities.
Key Capabilities
- Bidirectional Translation: Translates between Sanskrit and English.
- Transliteration: Converts Devanagari script to IAST (International Alphabet of Sanskrit Transliteration) format with high accuracy (96.7% character accuracy).
- Sanskrit Text Generation: Capable of generating coherent Sanskrit verse and prose.
- Chat Interface: Designed for conversational interactions with task-specific system prompts.
Training Details
The model underwent two distinct training phases:
- Sanskrit Language Model Training: Utilized over 664,104 clean Sanskrit texts from 9 sources, incorporating Sanskrit-specific punctuation and a custom Devanagari tokenizer.
- Chat Template Enhancement: Post-trained on over 94,363 conversation examples for translation and transliteration tasks.
Limitations
While highly accurate for transliteration, the model exhibits moderate performance in exact translation matching and has room for improvement in handling complex contextual nuances. It is maintained for research and learning purposes, as its practical application quality standards were not fully met.