MobileVISTA : augmentation générative de données pour la généralisation des poses en manipulation mobile
Des chercheurs présentent MobileVISTA, un cadre de génération de données destiné aux manipulateurs mobiles, dont les robots humanoïdes. Il transforme des démonstrations enregistrées à une pose canonique unique en données d'entraînement variées, avec des poses de base perturbées. Deux opérations sont combinées : l'augmentation des observations visuelles égocentriques, puis le retargeting des actions pour compenser le déplacement de la base. Les tests portent sur des tâches simulées avec des embodiments humanoïdes et bimanuels, et sur un robot réel Galaxea R1 Pro. Les politiques entraînées sur les données augmentées résistent mieux aux poses hors distribution rencontrées au déploiement. Cela se fait sans nouvelle collecte de démonstrations et sans modèle génératif entraîné. Le gain est le plus marqué sur les humanoïdes, où la caméra suit la chaîne cinématique et où le robot occupe une grande part de l'image. Le travail est publié sur arXiv (2610.07511) avec vidéos et annexe sur le site du projet. L'abstract ne donne aucun chiffre de taux de réussite.
L'enjeu est un défaut bien connu mais peu chiffré : la fragilité des politiques de manipulation de bout en bout entraînées par imitation. Quand les démonstrations viennent d'une seule pose du robot, un écart de quelques centimètres au déploiement suffit à faire sortir les images égocentriques et les trajectoires de l'effecteur de la distribution d'entraînement, et les performances chutent. Pour un intégrateur, c'est l'un des écarts entre démo et production. Une base mobile ne s'arrête jamais exactement au même endroit, alors qu'une démo filmée depuis une pose fixe passe très bien. Une méthode purement géométrique, sans modèle génératif, réduit le coût de collecte, puisqu'elle évite de multiplier les téléopérations pour couvrir les variations de pose. Elle évite aussi la dérive visuelle des modèles génératifs. Les résultats restent à nuancer : le banc réel se limite à un robot, et les gains annoncés sont qualitatifs dans le résumé.
Ce travail s'inscrit dans l'essor des politiques VLA et des humanoïdes déployés en environnements non structurés. Les méthodes d'augmentation antérieures supposaient une caméra fixée hors de la chaîne actionnée, ou une géométrie articulée du robot largement hors champ. Ces hypothèses ne tiennent pas pour un humanoïde, dont la caméra bouge avec le corps et doit voir les bras. MobileVISTA vise donc le cas où les plateformes de type Figure, Optimus ou Galaxea sont les plus exposées. Il reste à voir s'il se combine avec des modèles de fondation comme Pi-0 ou GR00T, et s'il tient sur des tâches longues, avec des robots de plus grande taille et sur davantage de plateformes réelles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




