ReShoot : randomisation visuelle générative du domaine pour l'apprentissage de politiques visuomotrices
Un article publié sur arXiv sous la référence 2609.19661 présente ReShoot, une méthode qui produit de la diversité visuelle en re-rendant des démonstrations robotiques déjà enregistrées, plutôt que d'en recollecter de nouvelles pour chaque changement d'apparence. Un modèle vision-langage décrit la scène et modifie un attribut ciblé, comme le fond, la couleur d'un objet ou un matériau, puis un générateur vidéo conditionné par les contours re-rend les deux vues caméra en conséquence ; l'instruction textuelle associée est mise à jour, mais la séquence d'actions et la trajectoire proprioceptive sont conservées à l'identique, sans réétiquetage. Sur le benchmark LIBERO, une politique entraînée à parts égales sur données réelles et re-générées obtient un taux de réussite quasi identique à un entraînement uniquement sur données réelles (96,5% contre 96,9%) et améliore la robustesse aux perturbations de scène sur LIBERO-Plus (85,5% contre 82,3%). Sur deux plateformes robotiques physiques, avec seulement 43 et 100 démonstrations pré-collectées, le taux de réussite sur des objets recolorés passe de 0% à respectivement 42,9% et 47,5%, sans dégradation des performances sur l'apparence d'origine.
Ce résultat vise un point faible connu des politiques visuomotrices apprises par imitation : elles restent souvent collées aux conditions visuelles précises de leurs démonstrations d'entraînement, si bien qu'un simple changement de couleur ou de décor fait chuter drastiquement leurs performances. La parade habituelle, recollecter des démonstrations pour chaque nouveau contexte visuel, mobilise à chaque fois un robot, un environnement contrôlé et un opérateur humain, ce qui freine le déploiement à grande échelle en usine ou en entrepôt. En déplaçant l'effort de la collecte vers la génération, ReShoot suggère qu'une part significative de la robustesse visuelle recherchée par les intégrateurs peut s'obtenir sans temps robot supplémentaire ni simulation photoréaliste coûteuse à construire.
Cette approche s'inscrit dans la lignée des travaux sur la randomisation de domaine et l'augmentation de données par génération, qui cherchent depuis plusieurs années à combler l'écart entre les démonstrations limitées disponibles et la diversité des conditions réelles d'exploitation. Sa particularité est de conserver intégralement les labels d'action et de proprioception du geste original, évitant le risque de réétiquetage erroné propre à d'autres pipelines génératifs. Le résumé ne précise ni les plateformes robotiques utilisées ni un calendrier de publication du code, ce qui place pour l'instant ReShoot au stade de publication de recherche plutôt que d'outil disponible pour les intégrateurs.
Dans nos dossiers




