
Corriger le OÙ, préserver le COMMENT : généralisation compositionnelle des modèles vision-langage-action (VLA) par guidage référentiel
Des chercheurs proposent ReGuide (Referential Guidance), un module d'enrobage « training-free » qui s'ajoute à des politiques Vision-Language-Action (VLA) déjà entraînées, sans toucher à leurs poids ni à leur architecture. À partir des poses d'objets fournies par un module de grounding externe, il combine un « rebinding » sémantique et un « rebinding » géométrique. Il guide l'effecteur terminal vers des configurations couvertes par les démonstrations d'entraînement, centrées sur le référent désigné par l'instruction. La politique gelée reprend alors le contrôle et termine la tâche. Les tests en simulation ont porté sur plusieurs architectures VLA, puis sur un robot réel. Les gains de taux de réussite sous décalage compositionnel atteignent jusqu'à 56,8 points de pourcentage en simulation et 75,0 points sur le robot physique. Les performances sur les tâches standard sont préservées. L'article est un préprint arXiv (v1), donc non évalué par les pairs. Il ne précise pas, dans son résumé, les noms des modèles testés, le robot utilisé ni le nombre d'essais.
Ces résultats visent un point faible connu des VLA. Entraînés de bout en bout sur des jeux de données robotiques peu variés, ces modèles exploitent des raccourcis visuels : ils associent une action à des éléments sans rapport avec la tâche (arrière-plan, disposition de la scène) plutôt qu'à la sémantique de l'instruction. Un objet, une destination ou un décor déjà vus séparément ne peuvent alors pas être recombinés dans une configuration nouvelle. Les auteurs observent que, dans ce cas, le VLA échoue surtout à se localiser globalement (WHERE), tout en conservant ses compétences de manipulation locale (HOW). Corriger la cible plutôt que réapprendre le geste évite le recours à de nouvelles données ou à un réentraînement par backbone. Pour un intégrateur, c'est une piste pratique pour fiabiliser une politique déjà déployée. Le revers est la dépendance à un module de perception qui fournit des poses d'objets fiables. Les gains les plus élevés correspondent aussi à des scénarios de décalage choisis par les auteurs, et non à des conditions d'usine.
Les approches existantes reposent sur une perception centrée sur la tâche ou sur une diversification ciblée des données. Elles n'offrent pas de mécanisme explicite pour la recomposition d'éléments inédits et exigent des modifications spécifiques à chaque architecture, avec réentraînement. ReGuide se positionne comme un correctif extérieur, compatible avec différents backbones. Sa validité à grande échelle reste à démontrer : le résumé ne mentionne ni tâches longues, ni scènes encombrées, ni déploiement industriel. Les prochaines étapes à surveiller sont la publication du code et des détails expérimentaux, la comparaison avec des politiques réentraînées sur des données plus diversifiées, et la robustesse face aux erreurs du module de grounding.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




