FineEnvs/Qwen3.5-2B-multiharness-RL

VISIONPricing:Input $0.32 / Cached $0.064 / Output $1.6Concurrent Unit Cost:1Model Size:2.3BQuant:BF16Context Size:32kTool Calling:SupportedPublished:Oct 1, 2026License:apache-2.0Architecture:Transformer0.0K Open Weights Featherless Exclusive Cold

FineEnvs/Qwen3.5-2B-multiharness-RL is a 2.3 billion parameter language model, fine-tuned from Qwen/Qwen3.5-2B with a 32768 token context length. It was trained using asynchronous GRPO (TRL Async GRPO) across multiple agentic data-analysis harnesses including OpenCode, Claude Code, Codex, and Mini-SWE-Agent. This model is specifically optimized for agentic data-analysis tasks, achieving a 37.0% pass@1 score across these four evaluation harnesses.

Loading preview...

Qwen3.5-2B-multiharness-RL Overview

FineEnvs/Qwen3.5-2B-multiharness-RL is a 2.3 billion parameter language model, derived from Qwen/Qwen3.5-2B, specifically fine-tuned for agentic data-analysis tasks. This model leverages asynchronous GRPO (TRL Async GRPO) and was trained using a diverse set of harnesses including OpenCode, Claude Code, Codex, and Mini-SWE-Agent, making it distinctively capable in environments requiring tool interaction and code execution.

Key Capabilities

  • Agentic Data Analysis: Optimized for tasks that involve interacting with tools and executing code within sandboxed environments (e.g., OpenEnv \u00d7 Harbor in E2B sandboxes).
  • Multi-Harness Training: Trained across four distinct code evaluation harnesses (OpenCode, Claude Code, Codex, Mini-SWE-Agent) to enhance robustness and performance in varied coding and data analysis scenarios.
  • Performance: Achieves an overall 37.0% pass@1 across 1,000 graded task/harness cells, with individual harness scores including 44.8% on Claude Code and 39.2% on Codex.
  • Reinforcement Learning Fine-tuning: Utilizes TRL Async GRPO with binary correctness-only rewards, focusing on improving task completion accuracy.

Good For

  • Developing Data Agents: Ideal for applications requiring models to perform complex data analysis, code generation, and execution through agentic workflows.
  • Automated Code Evaluation: Suitable for scenarios where a model needs to interact with and be evaluated against multiple code execution environments.
  • Research in RL for LLMs: Provides a valuable checkpoint for researchers exploring asynchronous GRPO and multi-harness training methodologies for language models.