
Gondola : planification vision-langage ancrée pour la manipulation robotique
Gondola, un modèle de planification vision-langage « ancré », est présenté dans une nouvelle version (v2) d'un article arXiv. Il vise à séparer la planification de haut niveau du contrôle bas niveau en manipulation robotique. À partir d'observations multi-vues et de l'historique de planification, Gondola prédit l'étape suivante sous forme d'instructions textuelles entrelacées avec des masques de segmentation multi-vues. Ces masques désignent au niveau du pixel les objets cibles et les emplacements d'arrivée. Ce plan est ensuite exécuté par une politique de contrôle fondée sur la 3D. Pour l'entraîner, les auteurs ont construit des jeux de données synthétiques qui supervisent trois compétences : la planification ancrée à court horizon, les expressions référentielles multi-vues et le raisonnement compositionnel à long horizon. Le système affirme atteindre l'état de l'art sur le benchmark GemBench et montre un transfert « prometteur » vers des robots réels. Le résumé ne donne ni score chiffré, ni description du matériel, ni nombre de tâches réelles testées.
L'approche répond à une faiblesse connue des modèles vision-langage-action (VLA). Lorsqu'ils associent directement pixels et instructions à des actions bas niveau, ils restent difficiles à interpréter et perdent en robustesse sur les tâches longues et complexes. Ici, le plan intermédiaire est lisible, et l'on peut voir quel objet le robot a ciblé avant qu'il n'agisse. Pour un intégrateur, cela facilite le diagnostic des échecs, car on distingue une erreur de raisonnement d'une erreur d'exécution. Les ablations indiquent que l'ancrage au pixel près et la supervision orientée planification pèsent réellement dans les performances. Cela plaide pour des architectures modulaires face aux VLA de bout en bout. Deux réserves s'imposent. GemBench est un benchmark en simulation, et une démonstration robotique réelle décrite comme « prometteuse » ne prouve pas une fiabilité industrielle. L'entraînement sur données synthétiques laisse aussi ouverte la question de l'écart simulation-réalité.
Le travail s'inscrit dans un mouvement plus large de découplage entre un « cerveau » de haut niveau et un contrôleur d'exécution. Les architectures à deux systèmes de type Helix en sont un exemple, et les VLA généralistes comme Pi-0 misent au contraire sur le bout en bout. La page du projet est hébergée sur cshizhe.github.io, ce qui suggère un cadre académique, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement. L'article étant une révision (v2), l'évaluation a pu évoluer depuis la première version. La suite dépendra de la publication du code et des modèles, de résultats chiffrés sur des robots physiques et de comparaisons directes avec les VLA de bout en bout sur des tâches longues.
Dans nos dossiers




