Alibaba-DAMO-Academy/RynnBrain1.1-9B
RynnBrain 1.1-9B by Alibaba-DAMO-Academy is a 9 billion parameter embodied foundation model, part of a family including 2B and 122B-A10B scales. It specializes in embodied intelligence, offering capabilities in spatial understanding, object grounding, and real-robot visual-language-action (VLA) transfer. This model introduces native 3D and contact point grounding, enabling metric 3D understanding and action-relevant interaction prediction for robotic control.
Loading preview...
RynnBrain 1.1-9B: An Embodied Foundation Model
RynnBrain 1.1-9B, developed by Alibaba-DAMO-Academy, is a 9 billion parameter model designed for advanced embodied intelligence. It is part of the RynnBrain 1.1 series, which also includes 2B and 122B-A10B (sparse-MoE) models, all trained under a unified recipe. This systematic upgrade focuses on enhancing embodied cognition, spatial reasoning, grounding, and planning capabilities across different scales.
Key Innovations & Capabilities
- Unified Embodied Scaling: RynnBrain 1.1 establishes a unified training approach across its 2B, 9B, and 122B-A10B models, allowing for systematic study of embodied cognition evolution with scale.
- Real-Robot VLA Transfer: The model demonstrates strong cross-platform generalization for real-robot control through RynnBrain-VLA, successfully transferring embodied understanding to platforms like Unitree G1, Astribot, and Tianji-Wuji for humanoid, bimanual, and dexterous-hand tasks.
- Native 3D and Contact Point Grounding: RynnBrain 1.1 extends beyond image-plane localization by introducing explicit 3D-grounded training and a new contact point prediction task. This enables metric 3D understanding and precise action-relevant interaction grounding.
Use Cases & Strengths
- Spatial Understanding: Excels at interpreting spatial relationships within video scenes.
- Object Grounding: Accurately locates specific objects with bounding boxes based on instructions.
- Affordance Location: Identifies areas or objects with particular affordances.
- 3D Grounding: Predicts 3D bounding boxes (position, dimensions, orientation) from a single RGB image with camera intrinsics.
- Contact Point Prediction: Predicts instruction-conditioned contact points and in-plane orientation from an image, crucial for robotic manipulation.