FineEnvs/Qwen3.5-2B-multiharness-RL
FineEnvs/Qwen3.5-2B-multiharness-RL is a 2.3 billion parameter language model, fine-tuned from Qwen/Qwen3.5-2B with a 32768 token context length. It was trained using asynchronous GRPO (TRL Async GRPO) across multiple agentic data-analysis harnesses including OpenCode, Claude Code, Codex, and Mini-SWE-Agent. This model is specifically optimized for agentic data-analysis tasks, achieving a 37.0% pass@1 score across these four evaluation harnesses.
Loading preview...
Qwen3.5-2B-multiharness-RL Overview
FineEnvs/Qwen3.5-2B-multiharness-RL is a 2.3 billion parameter language model, derived from Qwen/Qwen3.5-2B, specifically fine-tuned for agentic data-analysis tasks. This model leverages asynchronous GRPO (TRL Async GRPO) and was trained using a diverse set of harnesses including OpenCode, Claude Code, Codex, and Mini-SWE-Agent, making it distinctively capable in environments requiring tool interaction and code execution.
Key Capabilities
- Agentic Data Analysis: Optimized for tasks that involve interacting with tools and executing code within sandboxed environments (e.g., OpenEnv \u00d7 Harbor in E2B sandboxes).
- Multi-Harness Training: Trained across four distinct code evaluation harnesses (OpenCode, Claude Code, Codex, Mini-SWE-Agent) to enhance robustness and performance in varied coding and data analysis scenarios.
- Performance: Achieves an overall 37.0% pass@1 across 1,000 graded task/harness cells, with individual harness scores including 44.8% on Claude Code and 39.2% on Codex.
- Reinforcement Learning Fine-tuning: Utilizes TRL Async GRPO with binary correctness-only rewards, focusing on improving task completion accuracy.
Good For
- Developing Data Agents: Ideal for applications requiring models to perform complex data analysis, code generation, and execution through agentic workflows.
- Automated Code Evaluation: Suitable for scenarios where a model needs to interact with and be evaluated against multiple code execution environments.
- Research in RL for LLMs: Provides a valuable checkpoint for researchers exploring asynchronous GRPO and multi-harness training methodologies for language models.