Alibaba-DAMO-Academy/RynnBrain1.1-9B

VISIONConcurrent Unit Cost:1Model Size:9BQuant:FP8Context Size:32kTool Calling:SupportedPublished:Jul 13, 2026License:apache-2.0Architecture:Transformer0.0K Open Weights Featherless Exclusive Cold

RynnBrain 1.1-9B by Alibaba-DAMO-Academy is a 9 billion parameter embodied foundation model, part of a family including 2B and 122B-A10B scales. It specializes in embodied intelligence, offering capabilities in spatial understanding, object grounding, and real-robot visual-language-action (VLA) transfer. This model introduces native 3D and contact point grounding, enabling metric 3D understanding and action-relevant interaction prediction for robotic control.

Loading preview...

RynnBrain 1.1-9B: An Embodied Foundation Model

RynnBrain 1.1-9B, developed by Alibaba-DAMO-Academy, is a 9 billion parameter model designed for advanced embodied intelligence. It is part of the RynnBrain 1.1 series, which also includes 2B and 122B-A10B (sparse-MoE) models, all trained under a unified recipe. This systematic upgrade focuses on enhancing embodied cognition, spatial reasoning, grounding, and planning capabilities across different scales.

Key Innovations & Capabilities

  • Unified Embodied Scaling: RynnBrain 1.1 establishes a unified training approach across its 2B, 9B, and 122B-A10B models, allowing for systematic study of embodied cognition evolution with scale.
  • Real-Robot VLA Transfer: The model demonstrates strong cross-platform generalization for real-robot control through RynnBrain-VLA, successfully transferring embodied understanding to platforms like Unitree G1, Astribot, and Tianji-Wuji for humanoid, bimanual, and dexterous-hand tasks.
  • Native 3D and Contact Point Grounding: RynnBrain 1.1 extends beyond image-plane localization by introducing explicit 3D-grounded training and a new contact point prediction task. This enables metric 3D understanding and precise action-relevant interaction grounding.

Use Cases & Strengths

  • Spatial Understanding: Excels at interpreting spatial relationships within video scenes.
  • Object Grounding: Accurately locates specific objects with bounding boxes based on instructions.
  • Affordance Location: Identifies areas or objects with particular affordances.
  • 3D Grounding: Predicts 3D bounding boxes (position, dimensions, orientation) from a single RGB image with camera intrinsics.
  • Contact Point Prediction: Predicts instruction-conditioned contact points and in-plane orientation from an image, crucial for robotic manipulation.