
Une politique, plusieurs incarnations : pré-entraînement géométrique unifié centré caméra pour la manipulation robotique hétérogène
Un article de recherche publié sur arXiv le 27 août 2026 présente UCAG-P (Unified Camera-Centric Action Geometry Pre-training), une méthode d'entraînement pour politiques vision-langage-action (VLA) généralistes pilotant des robots de morphologies différentes à partir d'un seul modèle. Plutôt que d'apprendre des commandes propres à chaque robot, UCAG-P représente les mouvements de manipulation comme des trajectoires observables par caméra, traitant bras robotiques, humanoïdes et mains humaines comme des variantes d'un même schéma d'action ; un module de traduction combine ce mouvement avec la cinématique du robot cible pour produire des commandes exécutables. Entraîné sur 4,03 milliers d'heures de données robot et simulation plus 2,34 milliers d'heures de démonstrations humaines, un seul checkpoint, sans réglage spécifique, atteint 98,3% sur LIBERO, 88,7% et 89,2% sur RoboTwin, 82,0% en zero-shot sur LIBERO-Plus et 62,0% sur RoboCasa GR-1, quatre benchmarks simulés.
Ces résultats visent le principal goulot d'étranglement du secteur : l'hétérogénéité des morphologies, caméras et espaces d'action, qui empêche de mutualiser facilement les données pour entraîner une politique unique. En découplant géométrie du mouvement et exécution spécifique au robot, UCAG-P évite les branches d'adaptation par dataset et les pipelines de synthèse vidéo humain-vers-robot. Pour les intégrateurs, cela pourrait réduire le coût de réutilisation de données d'un robot vers un autre, bras industriel ou humanoïde. Qu'un checkpoint unique égale l'état de l'art sur plusieurs benchmarks sans réglage spécifique appuie l'hypothèse d'une généralisation VLA au-delà d'un seul embodiment, même si la preuve reste cantonnée à la simulation.
Cette publication s'inscrit dans la course à la politique VLA généraliste, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure AI (Helix) cherchent à démontrer qu'un même modèle peut piloter différents robots sans réentraînement lourd. UCAG-P s'en distingue par une représentation géométrique centrée caméra plutôt qu'un espace d'action robot, une piste validée uniquement en simulation. L'article, déposé sur arXiv sans affiliation industrielle mentionnée, reste une contribution de recherche et non un produit commercialisé : aucune date de production, aucun pilote ni déploiement physique n'est annoncé. Les suites attendues sont une validation sur robots réels et une comparaison directe avec les politiques généralistes existantes.
Dans nos dossiers




