EgoPush : réarrangement multi-objets à la première personne pour robots mobiles via observabilité contrainte du superviseur
Des chercheurs du laboratoire AI4CE publient une version mise à jour sur arXiv (2602.18071v2) d'EgoPush, un système qui permet à un robot mobile de réarranger plusieurs objets en les poussant vers des positions définies relativement à un point d'ancrage, en utilisant uniquement une caméra RGB-D embarquée, sans estimation de pose globale, sans suivi externe ni carte au moment du déploiement. Le système a été transféré en zero-shot sur un TurtleBot, testé dans des scènes contrôlées puis visuellement encombrées. Le résultat central de l'étude concerne l'apprentissage par distillation enseignant-élève: trois "enseignants" privilégiés, disposant d'un accès complet à l'état de la scène et entraînés avec des récompenses, une architecture et des hyperparamètres identiques, dépassent tous 98% de réussite. Pourtant, leurs "élèves" égocentriques distillés à partir de ces enseignants n'atteignent respectivement que 0%, 54,8% et 87,3% de réussite, la seule variable étant la fonction d'observation de l'enseignant. La solution proposée consiste à contraindre l'enseignant lui-même à des indices visuels limités, ne révélant les références de cible que lorsque l'ancrage est visible au centre du champ de vision, afin que sa supervision reste transmissible à un élève basé sur la profondeur, distillé en ligne. Deux éléments techniques supplémentaires soutiennent cette approche: une interface objet-centrée à rôles groupés partagée entre enseignant et élève, et des récompenses à décroissance temporelle par étapes pour gérer l'attribution de crédit sur des horizons longs. Code, vidéos et une version jouable de la tâche sont publiés sur ai4ce.github.io/EgoPush.
Cette étude a une portée avant tout méthodologique pour la recherche en manipulation mobile: elle montre que l'échec fréquent de la distillation sim-to-réel dans les tâches de réarrangement ne vient pas nécessairement de l'architecture ou de l'algorithme d'apprentissage, mais de la façon dont l'enseignant privilégié perçoit la scène pendant son propre entraînement. Pour les équipes travaillant sur des robots mobiles de manutention ou des AMR en environnement encombré, le résultat suggère qu'il est possible de s'affranchir d'une brique SLAM ou de cartographie globale pour des tâches de poussée d'objets, un enjeu concret puisque l'action de pousser modifie continuellement la scène qu'un système de cartographie devrait par ailleurs reconstruire.
Ce travail s'inscrit dans la lignée des méthodes de "privileged learning" déjà utilisées pour la locomotion de robots à pattes, où un enseignant omniscient guide un élève aux capteurs limités, mais l'applique ici au réarrangement d'objets par poussée, une tâche encore peu couverte par cette littérature. Il se distingue nettement des approches VLA à grande échelle (type GR00T N2, Pi-0 ou Helix) qui visent la généralisation via des modèles fondation entraînés sur des données massives: EgoPush reste une contribution de recherche ciblée, publiée en preprint, testée sur un seul robot en laboratoire, et non un produit ou un pilote industriel.
Dans nos dossiers




