Imitation conditionnée par un plan pour récupérer des objets malgré l'auto-occlusion en encombrement dense
Des chercheurs présentent TRACE, un cadre d'imitation conditionnée par un plan, conçu pour extraire un objet d'un encombrement dense lorsque le bras robotique masque lui-même les objets qu'il déplace. Le système initialise un jumeau numérique à partir d'une seule observation non occultée. Un enseignant privilégié, qui accède à l'état complet de la scène simulée, y génère une trajectoire nominale fixe. Un étudiant récurrent combine le contexte local de cette trajectoire, des observations partielles des objets et la proprioception pour choisir des actions qui corrigent les écarts par rapport à la prédiction. Le clonage comportemental initialise l'étudiant, puis DAgger l'affine avec des étiquettes de l'enseignant sur les états réellement visités par l'étudiant. En simulation, sur 511 scènes de test, TRACE atteint 90,7 % de succès, contre 43,4 % pour la simple relecture de la trajectoire nominale et 96,7 % pour l'enseignant en boucle fermée. À budget égal de 26 373 étiquettes, la supervision sur les états de l'étudiant donne 87,8 %, contre 66,7 % pour le clonage des seules démonstrations expertes. Sur un UR5e, le taux de succès est de 90,0 %, contre 95,0 % pour l'enseignant, et le temps d'exécution total passe de 192,7 s à 67,3 s.
L'intérêt tient à ce que le résultat cible un goulot concret de la manipulation en environnement encombré : les retraits répétés du bras pour retrouver de la visibilité. L'enseignant en boucle fermée en impose en moyenne 16,8 par essai pendant la poussée, ce qui explique l'essentiel de l'écart de durée. TRACE les évite et ne conserve qu'un retrait final pour évaluer la saisissabilité de l'objet. Pour un intégrateur, le gain d'un facteur 2,9 sur le temps de cycle, pour une perte de cinq points de succès, est le compromis à retenir. Le déploiement ne requiert ni requêtes à l'enseignant ni simulations en ligne pendant la poussée, ce qui allège les contraintes de calcul embarqué. L'expérience montre aussi que l'échantillonnage sur les états de l'étudiant apporte un gain au-delà du seul nombre d'étiquettes, un argument en faveur de DAgger face au clonage pur. Les réserves sont classiques : l'échantillon réel (probablement 20 essais, d'après les pourcentages) est mince, un seul bras est testé, et la méthode suppose une première vue dégagée pour construire le jumeau numérique.
Ces travaux s'inscrivent dans la lignée des approches enseignant-étudiant avec information privilégiée, déjà courantes en locomotion et en manipulation, ici appliquées au cas précis de l'auto-occultation. Ils se distinguent des politiques généralistes de type VLA (vision-langage-action), comme Pi-0 ou GR00T, qui visent la généralité plutôt que la robustesse sur une tâche étroite. Il s'agit d'une prépublication arXiv sans produit ni déploiement industriel annoncé. Les auteurs promettent de publier code et données sur trace-retrieval.github.io, ce qui permettra de vérifier les résultats. Les suites logiques seraient de tester d'autres bras et d'autres densités d'encombrement, puis de traiter des scènes où l'observation initiale est elle-même partiellement occultée, condition plus proche des applications de picking en entrepôt.
Dans nos dossiers



