Repenser l'exécution en boucle ouverte en robotique : vers des politiques réactives et plus performantes
Le chunking d'actions, technique consistant à prédire une séquence d'actions puis à en exécuter un préfixe en boucle ouverte, s'est imposé comme un pilier des progrès récents en apprentissage par imitation pour la manipulation robotique. Un nouvel article déposé sur arXiv (2608.15938v1) revient sur ce mécanisme et teste son impact sur quatre tâches en simulation et deux tâches en conditions réelles. Les auteurs montrent que la relation entre le taux de réussite et la longueur de l'horizon d'exécution en boucle ouverte dépend fortement du caractère non markovien des démonstrations expertes, c'est-à-dire du fait que l'action correcte à un instant donné dépend de l'historique et pas seulement de l'état courant. Ils examinent aussi l'explication la plus répandue dans la littérature, à savoir que le chunking limiterait l'accumulation d'erreurs au fil de l'exécution, et constatent que ce facteur joue un rôle réel mais nettement plus faible que la non-markovianité des démonstrations dans leurs expériences. Enfin, lorsque les politiques disposent d'un contexte suffisamment long, l'exécution en boucle ouverte perd son avantage et ce sont les politiques réactives en boucle fermée qui obtiennent les meilleurs résultats.
Ce résultat remet en question une hypothèse tacite du secteur selon laquelle le chunking en boucle ouverte serait intrinsèquement bénéfique, par exemple pour lisser les mouvements ou absorber la latence d'inférence. L'étude suggère plutôt qu'il s'agit surtout d'un palliatif pour des politiques à contexte court incapables de bien imiter des démonstrations non markoviennes. Or de nombreux modèles vision-langage-action utilisés aujourd'hui dans l'industrie reposent justement sur de longs préfixes en boucle ouverte, une stratégie qui réduit la capacité du robot à corriger une erreur en cours d'exécution, un enjeu direct pour tout déploiement en environnement non contrôlé où un objet peut glisser ou un opérateur s'approcher du robot. Pour les intégrateurs et les équipes de recherche, ce travail plaide pour orienter les futurs modèles de fondation robotique vers des architectures à contexte long et réactives plutôt que vers des chunks toujours plus longs.
Le chunking d'actions s'est démocratisé avec des méthodes comme ACT et les politiques par diffusion, aujourd'hui intégrées dans de nombreux systèmes de manipulation. Cet article, une soumission académique sans affiliation industrielle mise en avant dans le résumé, ne présente ni produit ni déploiement mais propose un changement de paradigme méthodologique pour les prochaines générations de politiques d'imitation, sans annoncer de calendrier ni de modèle concret.
Dans nos dossiers




