Robuste sans se contenter de plus de démonstrations : couvrir la sensibilité contrefactuelle des actions pour l'imitation robotique
Une équipe de recherche propose sur arXiv une méthode baptisée CFNBC (Counterfactual Nuisance Behaviour Cloning), un cadre de sélection de données hors ligne destiné à réparer la robustesse des politiques d'apprentissage par imitation visuomotrice pour la manipulation robotique. Le problème visé est bien connu : une politique entraînée sur des démonstrations « propres » peut réussir une tâche de manipulation en conditions contrôlées, mais voir ses performances s'effondrer face à de simples variations visuelles sans lien avec la tâche elle-même, comme un changement d'éclairage, l'ajout d'objets distracteurs ou une modification de couleur. La méthode part d'une politique entraînée normalement, génère des paires d'observations « propre » et « bruitée » qui préservent la même action experte, puis mesure le « décalage d'action » : l'écart entre l'action prédite par la politique selon que l'observation contient ou non le bruit visuel. Ce signal, propre à chaque politique, permet de sélectionner un lot compact et diversifié de démonstrations correctives parmi un plus grand ensemble de candidats, sans nécessiter d'exécution en ligne ni d'étiquettes de succès. Testée sur deux bancs d'essai simulés (transfert de cube bimanuel sous MuJoCo et empilement de cubes sous SimplerEnv), l'approche montre qu'avec seulement 20 à 30 exemples sélectionnés, elle surpasse nettement une sélection aléatoire à budget égal et se rapproche des performances obtenues avec des budgets aléatoires bien plus larges.
L'intérêt pour l'industrie tient à la promesse d'un data-centrisme ciblé : plutôt que de multiplier les démonstrations pour espérer couvrir toutes les variations possibles, les auteurs montrent qu'il suffit d'identifier les quelques exemples qui corrigent les modes de réponse fragiles d'une politique donnée. Pour les équipes qui déploient des politiques vision-langage-action au-delà du laboratoire, c'est un levier potentiel pour réduire le coût de collecte de données tout en s'attaquant directement à l'écart bien documenté entre démonstrations impressionnantes et robustesse réelle en conditions variables.
Ce travail s'inscrit dans une recherche plus large sur la fragilité des politiques d'imitation face aux nuisances visuelles, un défi central à mesure que les architectures de type VLA gagnent en ambition. Les résultats restent pour l'instant limités à des environnements simulés et des tâches de manipulation de cubes ; la validation sur robots physiques et tâches plus complexes reste l'étape suivante logique.
Dans nos dossiers




