Long-horizon robotic manipulation requires a policy to bridge task-level semantic reasoning with metric three-dimensional interaction geometry. Existing vision–language–action policies usually acquire geometry implicitly from visual tokens or introduce deterministic intermediate representations that lack spatial grounding. This paper proposes SIRModel, which learns a spatial intermediate representation to parameter-efficiently fine-tune a vision language model for robotic manipulation tasks.
Podden och tillhörande omslagsbild på den här sidan tillhör
Shaoqing Tan. Innehållet i podden är skapat av Shaoqing Tan och inte av,
eller tillsammans med, Poddtoppen.