Embodied AI 101
Avsnitt

Xiaomi-Robotics-1: A Scalable Vision-Language-Action Foundation Model for Mobile Manipulation

Dela

A scalable vision-language-action (VLA) foundation model pretrained on over 100k hours of real-world manipulation trajectories, enabling out-of-the-box mobile manipulation capabilities.

Podden och tillhörande omslagsbild på den här sidan tillhör Shaoqing Tan. Innehållet i podden är skapat av Shaoqing Tan och inte av, eller tillsammans med, Poddtoppen.