Aller au contenu principal
RecherchearXiv cs.RO 

Fusion retardée routée par registres : repenser la fusion d'observations sujette aux raccourcis dans l'apprentissage par imitation visuomoteur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Register-Routed Delayed Fusion (RRDF), une architecture de fusion d'observations pour les politiques d'imitation visuomotrices, décrite dans un preprint arXiv (2610.02813v1). Le travail porte sur la manière dont ces politiques combinent des observations visuelles de grande dimension avec des signaux compacts, comme la proprioception. Dans la fusion dite « dense », les tokens visuels peuvent attendre directement les tokens compacts dès la première couche de l'encodeur. RRDF masque cette attention directe et fait passer les échanges entre modalités par un espace de travail de « registres » appris. Le schéma suit une séquence isoler, collecter, router : un préfixe initial garde les flux séparés, puis seuls les registres servent d'intermédiaires. Le générateur d'actions conserve un accès direct au signal compact. Les tests couvrent cinq tâches en simulation et trois tâches sur robot réel, avec ACT dense comme référence. Dans les conditions nominales, RRDF fait au moins aussi bien qu'ACT dense, et souvent mieux. Il se comporte aussi mieux lors de changements d'apparence sur quatre tâches simulées et lors d'évaluations à positions inédites sur les trois tâches réelles.

L'enjeu est la robustesse des politiques d'imitation, qui s'effondrent souvent dès que la scène diffère un peu des démonstrations. L'hypothèse des auteurs est que la proprioception, très prédictive de l'action, devient un raccourci : si elle influence trop tôt la formation des représentations visuelles spatiales, la politique s'appuie moins sur l'image. Des sondes d'entrée appariées par phase mesurent une sensibilité état-vers-image plus faible avec RRDF, ce qui va dans ce sens. Les ablations montrent que les registres seuls ne reproduisent pas le gain complet : c'est le contrôle du routage qui compte, pas l'ajout de paramètres. Pour les intégrateurs et les équipes de recherche, la leçon est pratique. Une modification de topologie légère, sans données supplémentaires, peut améliorer la généralisation d'une architecture répandue, avec la réserve d'un jeu de tâches restreint.

Le contexte est celui d'ACT (Action Chunking with Transformers), devenu une base courante pour l'apprentissage par démonstration sur bras de manipulation à bas coût. Les politiques plus récentes, de type VLA, reposent sur d'autres schémas de fusion, mais le problème du raccourci proprioceptif reste ouvert. Le résumé ne donne ni nom de robot, ni taux de réussite chiffrés, ni nombre d'essais, ni code publié. Il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent donc à confirmer, notamment sur des tâches plus longues, d'autres architectures et des politiques à grande échelle.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Repenser le désapprentissage des démonstrations dans l'apprentissage par imitation pour la robotique
1arXiv cs.RO 

Repenser le désapprentissage des démonstrations dans l'apprentissage par imitation pour la robotique

Un article publié sur arXiv (2608.20784v1) propose un cadre d'audit pour l'oubli de démonstrations en apprentissage par imitation robotique, quand des contributeurs demandent le retrait de leurs démonstrations d'une politique déjà entraînée. Plutôt qu'un réentraînement complet, coûteux à mesure que grandissent modèle et données, les auteurs évaluent des opérateurs d'édition appliqués directement à la politique existante. Leur audit croise deux axes: le comportement, mesuré par la divergence d'action face à des réentraînements de référence, et la preuve, mesurée par une attaque d'appartenance rapportant rang et niveau absolu de perte. Sur cinq conditions préenregistrées, trois politiques robotiques réelles et deux suites de simulation, un édit de type redirection sur l'architecture ACT restaure un taux de succès de 18 essais sur 20 en évaluation en aveugle. Ce travail répond à un problème concret pour l'industrie robotique: à mesure que les politiques génératives de type VLA s'entraînent sur des volumes croissants de démonstrations téléopérées, les demandes de retrait de données individuelles se heurteront au coût du réentraînement complet. Les métriques héritées du machine unlearning classique, comme la perte d'oubli ou une simple attaque d'appartenance, ne suffisent pas à garantir qu'une édition a réellement supprimé l'influence d'une démonstration en boucle fermée: un édit peut réparer le comportement sans effacer la trace détectable, ou au contraire réduire cette détectabilité tout en éloignant le comportement du réentraînement réel. Pour des intégrateurs tentés par l'édition post-hoc plutôt que le réentraînement complet, un simple test de réussite de tâche ne suffit donc pas à certifier qu'une démonstration a été effectivement oubliée. Cette recherche prolonge les travaux de machine unlearning menés sur les grands modèles de langage et de vision, transposés ici au contrôle robotique en boucle fermée, où c'est l'action, non la seule prédiction, qui doit être auditée. Elle survient alors que l'apprentissage par imitation à partir de démonstrations téléopérées s'impose comme méthode dominante pour entraîner des politiques robotiques générales, dans la lignée d'architectures comme ACT, popularisée par les plateformes de téléopération de type ALOHA. La question du retrait de données gagne en importance à mesure que ces jeux de données reposent sur des opérateurs identifiables, avec des implications de consentement et de conformité. Les auteurs ont préenregistré leurs cinq conditions expérimentales, une rigueur rare dans la littérature robotique, sans annoncer de calendrier de déploiement industriel.

UELes enjeux de retrait de données et de conformité soulevés touchent directement les industriels européens de la téléopération robotique soumis aux exigences de consentement et de suppression de données (type RGPD).

RecherchePaper
1 source
Des étiquettes aux ensembles d'actions : repenser la supervision pour l'apprentissage par imitation à partir de retours correctifs
2arXiv cs.RO 

Des étiquettes aux ensembles d'actions : repenser la supervision pour l'apprentissage par imitation à partir de retours correctifs

Le comportement par clonage (behavior cloning, BC) est l'une des méthodes les plus utilisées pour entraîner des politiques robotiques à partir de démonstrations humaines : chaque geste fourni par l'opérateur y est traité comme une étiquette exacte à reproduire. Des chercheurs ont publié en février 2025 (arXiv:2502.07645, version 3 disponible) une alternative baptisée CLIC, Contrastive policy Learning from Interactive Corrections, qui remplace ces étiquettes ponctuelles par des cibles dites à ensemble de valeurs (set-valued action targets). Au lieu d'optimiser la politique vers un seul geste cible, CLIC utilise les corrections humaines en temps réel pour construire et affiner des ensembles d'actions désirées, puis entraîne le modèle à placer de la masse de probabilité sur cet ensemble plutôt que sur un point unique. Cette reformulation adresse un problème connu mais sous-estimé du BC classique : lorsque les démonstrations humaines sont imparfaites, gestes partiels, corrections relatives ("un peu plus à gauche"), ambiguïtés multimodales, forcer la politique à reproduire chaque label à la lettre peut la faire dériver loin du comportement voulu, notamment avec des modèles expressifs tels que les energy-based models (EBMs). Les expériences en simulation et sur robot réel montrent que CLIC reste compétitif avec l'état de l'art quand les données sont propres, et se révèle substantiellement plus robuste sous données bruitées, corrections relatives ou feedback partiel. Pour les équipes de déploiement robotique, c'est une voie concrète pour réduire les coûts de collecte de démonstrations de haute qualité : CLIC tolère des opérateurs moins expérimentés ou des interfaces de téléopération imprécises sans dégradation majeure des performances. Le BC reste une brique fondamentale de l'apprentissage par imitation, popularisé par les travaux de Pieter Abbeel au début des années 2000 et au coeur aujourd'hui des politiques VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou les politiques diffusion-based d'OpenPI. CLIC s'inscrit dans un courant "human-in-the-loop" qui inclut DAgger, HG-DAgger et TAMER, mais se distingue par la formalisation ensembliste des corrections. Le code et les environnements de test sont disponibles publiquement sur clic-webpage.github.io. Les auteurs n'annoncent pas de partenariat industriel ni de déploiement terrain, ce qui positionne ce travail comme une contribution aux fondations méthodologiques de l'imitation learning, avec des implications directes pour les pipelines de téléopération et de fine-tuning de politiques générales.

UEImpact indirect : la méthode CLIC, en réduisant les besoins en démonstrations de haute qualité, pourrait bénéficier aux équipes de R&D robotique européennes travaillant sur des pipelines d'imitation learning et de téléopération, sans lien direct avec un acteur français ou une réglementation UE.

RechercheOpinion
1 source
Structure accrue, pas capacité accrue : représentations centrées sur les objets pour l'apprentissage par imitation visuomotrice
3arXiv cs.RO 

Structure accrue, pas capacité accrue : représentations centrées sur les objets pour l'apprentissage par imitation visuomotrice

Des chercheurs ont testé, sur le simulateur ManiSkill3 et la tâche PickCube-v1, si des représentations visuelles structurées par objet apportent un réel avantage face aux encodeurs classiques utilisés dans les politiques d'imitation visuomotrice pour la manipulation robotique. En gardant fixes la politique, le token d'objectif, le rendu et la calibration, et en ne changeant que l'encodeur visuel, une représentation object-centric SPOT (DINO ViT-B/16 combiné à un mécanisme de Slot Attention, figé, sans fine-tuning) atteint un taux de succès de 55,0±2,9%, contre 32,6±1,5% pour une référence DINO à embedding global dense, soit un gain de 22,4 points. Fait notable, une grille de patches denses avec seize fois plus de tokens ne fait pas mieux que l'embedding global seul. En ajoutant un objectif spatial 2D explicite et un rendu en résolution native, le système complet grimpe à 68,7±4,2%, juste en dessous d'une borne supérieure "oracle" 3D privilégiée à 71,7±4,1%. Une taxonomie automatisée des échecs cinématiques distingue ensuite les erreurs de précision spatiale ("Near-Miss") des erreurs de suivi d'objet ("No-Grasp"), et montre que l'ancrage spatial réduit les premières sans affecter les secondes ; la même taxonomie, transposée à la tâche plus difficile StackCube-v1, pointe l'occlusion comme principal facteur limitant. Ces résultats apportent une preuve empirique à une hypothèse importante pour le secteur : ce n'est pas la capacité brute d'un encodeur visuel (plus de tokens, plus de résolution de features) qui détermine la performance en manipulation, mais la structuration de l'information en objets discrets. Pour les équipes qui conçoivent des politiques VLA ou des pipelines d'apprentissage par imitation, cela suggère qu'investir dans des représentations object-centric peut être plus rentable que d'augmenter la taille des backbones visuels, et que le goulot d'étranglement réel se situe souvent dans le suivi d'objet sous occlusion plutôt que dans la précision géométrique pure. Ce travail s'inscrit dans la lignée des recherches sur les représentations par slots (Slot Attention) appliquées à la robotique, en s'appuyant sur des encodeurs auto-supervisés comme DINO, déjà largement adoptés dans la communauté vision-langage-action. L'étude reste pour l'instant limitée à la simulation (ManiSkill3, tâches PickCube et StackCube) avec des encodeurs figés, sans fine-tuning ni validation en conditions réelles ; les auteurs identifient l'occlusion comme prochain axe de travail prioritaire pour combler l'écart avec la borne oracle.

RecherchePaper
1 source
Apprentissage par imitation robuste aux distorsions pour le routage autonome de câbles
4arXiv cs.RO 

Apprentissage par imitation robuste aux distorsions pour le routage autonome de câbles

Une équipe de chercheurs a publié en juin 2026 sur arXiv (ref. 2606.11577) un framework d'apprentissage par imitation robuste aux dégradations d'image, appliqué au câblage robotisé. La tâche visée, le routage de câbles, consiste à faire passer et connecter des câbles à travers des cheminements prédéfinis dans un environnement industriel, une opération qui exige à la fois dextérité fine et prise de décision séquentielle sur plusieurs étapes. Le système proposé s'articule autour de trois modules couplés : un module d'évaluation de la qualité d'image (IQA), un mécanisme d'apprentissage pondéré par la confiance, et un module de décision capable de produire aussi bien des actions discrètes (sélection de compétences) que continues (commandes moteur). L'abstract ne communique pas de métriques chiffrées précises, taux de succès, temps de cycle, nombre de démonstrations, ce qui limite l'évaluation indépendante des résultats annoncés. L'intérêt technique réside dans l'identification d'un angle mort réel des systèmes de contrôle intelligent en milieu industriel : les perturbations optiques. Reflets, poussière, vibrations des caméras embarquées ou éclairage variable génèrent couramment des observations dégradées qui faussent l'entraînement des modèles et réduisent leur fiabilité à l'inférence. La contribution centrale est l'intégration d'un score de qualité d'image directement dans la boucle d'apprentissage, via un mécanisme de pondération qui donne priorité aux échantillons difficiles plutôt que de les ignorer ou de les traiter uniformément. C'est une approche pragmatique face au reality gap, plus proche d'un correctif de robustesse que d'une rupture architecturale. Le câblage robotisé reste l'un des derniers bastions de l'assemblage manuel dans l'industrie automobile et électronique, faute de solutions fiables à l'échelle. Des acteurs comme Schunk, Franka Robotics ou des startups spécialisées en manipulation déformable (Cobot, Pollen Robotics côté européen) cherchent des approches généralisables. Ce travail s'inscrit dans le courant de l'imitation learning pour la manipulation, après les avancées de Pi-0 (Physical Intelligence) et des méthodes de type Diffusion Policy. La prochaine étape naturelle serait une validation sur un benchmark standardisé, RoboSuite, DROID ou un dataset industriel, pour confirmer les gains annoncés face aux méthodes de l'état de l'art.

UEPollen Robotics (France) et Franka Robotics (Allemagne) sont cités comme acteurs européens cherchant des solutions au câblage automatisé ; ce travail pourrait informer leurs feuilles de route en manipulation déformable, mais sans validation benchmark, l'impact reste hypothétique.

RecherchePaper
1 source