Diagnostic et récupération du décalage de l'espace d'observation aux jonctions de compétences à long horizon
Des chercheurs ont publié sur arXiv (2610.10810) une étude sur un mode de défaillance qu'ils nomment Observation-Space Shift (OSS), qui frappe la manipulation robotique longue durée assemblée par chaînage de compétences entraînées séparément. Chaque compétence est fiable isolément, mais la performance chute nettement une fois enchaînées. La compétence suivante doit démarrer de l'état laissé par la précédente, et non de sa distribution d'entraînement. Grâce à des resets privilégiés du simulateur, l'équipe établit que le décalage dominant vient de la scène déplacée (un tiroir resté ouvert, des objets secondaires laissés en route), et non de la configuration articulaire du robot ni de l'objet manipulé. Pour tester ce diagnostic, ils construisent un système entièrement appris de type détecter, restaurer, reprendre. Un moniteur de progression de tâche repère le blocage, une politique apprise remet en place les éléments déplacés, puis un fine-tuning robuste aux jonctions permet à la compétence de repartir. Sur le benchmark BOSS-44, le taux de succès de la chaîne complète passe de 7,6 % à 26,5 %, soit 3,5 fois la politique de base et 51 % d'un oracle de restauration privilégié.
Le résultat le plus instructif tient aux échecs des alternatives. Le rééchantillonnage best-of-K, une Diffusion Policy et des baselines à base de modèles du monde ne parviennent pas à se rétablir depuis les états de jonction évalués. Réessayer depuis un état hors support ne suffit donc pas : remettre la scène dans une configuration que la politique connaît avant de reprendre est plus efficace. Pour les intégrateurs qui composent des séquences de compétences (ouverture de tiroir, rangement, assemblage), le message est pratique : la fiabilité unitaire ne se multiplie pas proprement, et il faut instrumenter les transitions. Les auteurs restent prudents : ils présentent leur système comme une preuve du diagnostic, pas comme une méthode générale. Même restauré, le système n'atteint que 26,5 % de succès de chaîne, ce qui reste loin d'un seuil industriel, et les résultats viennent surtout de simulation.
Côté réel, l'équipe a testé sur un bras Franka avec une politique π0.5 affinée. Le moniteur y est limité par l'observabilité des caméras extérieures, mais la boucle fermée récupère malgré tout certains échecs autrement terminaux. Les auteurs en tirent un argument pour ajouter des capteurs de poignet et de pince. Ces travaux s'inscrivent dans le débat sur la dégradation des VLA et des politiques de type π0 sur les longs horizons, où l'écart entre démonstration et fiabilité répétée reste le principal frein au déploiement. Les approches concurrentes misent sur des modèles généralistes plus robustes, des données de récupération d'erreurs ou des modèles du monde, que cette étude montre insuffisants dans ce cadre précis. Les prochaines étapes probables sont l'intégration de capteurs embarqués et la validation sur davantage de tâches physiques.
Pas d\'impact direct sur la France/UE
Dans nos dossiers


