
SymmGrid : passer à l'échelle l'apprentissage embarqué grâce aux symétries parallélisées et à la perception visuelle égocentrique-exocentrique
SymmGrid, présenté dans un article déposé sur arXiv (2607.26985v1), s'attaque à la lenteur de l'apprentissage par renforcement directement sur robot physique, dit « on-robot learning ». La méthode exploite des symétries parallélisées : des transformations de groupe appliquées au niveau de la trajectoire entière, qui peuplent le buffer de rejeu avec de multiples variantes cohérentes de chaque expérience vécue par le robot. Le système fonctionne aussi bien en vision égocentrique (caméra embarquée) qu'exocentrique (caméra externe) ; dans ce second cas, des homographies déforment la scène visuelle pour qu'elle reste cohérente avec chaque transformation spatiale appliquée à l'état et à l'action. Les auteurs ont testé SymmGrid sur robot réel, sur trois tâches de manipulation avec contact : insertion de pièces (peg-insertion), routage de câbles et repositionnement d'objets. Comparé aux méthodes de référence, l'apprentissage converge 1,37 à 2,17 fois plus vite, avec un taux de réussite amélioré de 1,09 à 1,27 fois. Les temps de convergence les plus rapides obtenus sont de 16,6, 10,9 et 79,3 minutes pour ces trois tâches respectivement, et le gain sur l'aire sous la courbe normalisée atteint 2,59 fois.
L'enjeu dépasse la simple optimisation académique : entraîner un robot en conditions réelles reste bloqué par le temps machine, chaque essai se déroulant en temps réel sans parallélisation possible, ce qui pousse l'essentiel de la recherche vers le sim-to-real. SymmGrid propose une voie alternative, moins gourmande en données et en simulateurs haute fidélité, directement exploitable sur le matériel. Si les gains se confirment à plus grande échelle, l'objectif affiché de descendre sous les dix minutes d'entraînement pour des tâches de manipulation avec contact intéresserait directement les intégrateurs devant reconfigurer rapidement des bras ou des humanoïdes pour de nouvelles tâches, sans dépendre de politiques génératives entraînées sur des volumes massifs de données. Les résultats restent toutefois limités à trois tâches définies en laboratoire, sans validation sur une politique généraliste multi-tâches ni sur des plateformes humanoïdes complexes.
L'approche s'inscrit dans la lignée des méthodes d'apprentissage par renforcement exploitant des symétries connues du problème pour augmenter artificiellement les données d'entraînement, une piste étudiée depuis plusieurs années en robotique et en RL équivariant. L'ambition affichée par les auteurs, du sub-10-minute training pour la manipulation de précision, tranche avec les cycles d'entraînement de plusieurs heures voire jours habituels en apprentissage réel. La page du projet est accessible sur symmgrid-robot.github.io ; l'article ne précise pas encore de calendrier de transfert vers des plateformes commerciales.
Dans nos dossiers




