Steers frozen robot foundation models including VLAs, diffusion policies, and world models using human corrections via action inversion in latent space without fine-tuning the base policy. Outperforms supervised fine-tuning and latent RL with only 5–20 human interventions.
Podden och tillhörande omslagsbild på den här sidan tillhör
Shaoqing Tan. Innehållet i podden är skapat av Shaoqing Tan och inte av,
eller tillsammans med, Poddtoppen.