A scalable vision-language-action (VLA) foundation model pretrained on over 100k hours of real-world manipulation trajectories, enabling out-of-the-box mobile manipulation capabilities.
Podden och tillhörande omslagsbild på den här sidan tillhör
Shaoqing Tan. Innehållet i podden är skapat av Shaoqing Tan och inte av,
eller tillsammans med, Poddtoppen.