Aller au contenu principal
Repenser l'exécution en boucle ouverte en robotique : vers des politiques réactives et plus performantes
RecherchearXiv cs.RO 

Repenser l'exécution en boucle ouverte en robotique : vers des politiques réactives et plus performantes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le chunking d'actions, technique consistant à prédire une séquence d'actions puis à en exécuter un préfixe en boucle ouverte, s'est imposé comme un pilier des progrès récents en apprentissage par imitation pour la manipulation robotique. Un nouvel article déposé sur arXiv (2608.15938v1) revient sur ce mécanisme et teste son impact sur quatre tâches en simulation et deux tâches en conditions réelles. Les auteurs montrent que la relation entre le taux de réussite et la longueur de l'horizon d'exécution en boucle ouverte dépend fortement du caractère non markovien des démonstrations expertes, c'est-à-dire du fait que l'action correcte à un instant donné dépend de l'historique et pas seulement de l'état courant. Ils examinent aussi l'explication la plus répandue dans la littérature, à savoir que le chunking limiterait l'accumulation d'erreurs au fil de l'exécution, et constatent que ce facteur joue un rôle réel mais nettement plus faible que la non-markovianité des démonstrations dans leurs expériences. Enfin, lorsque les politiques disposent d'un contexte suffisamment long, l'exécution en boucle ouverte perd son avantage et ce sont les politiques réactives en boucle fermée qui obtiennent les meilleurs résultats.

Ce résultat remet en question une hypothèse tacite du secteur selon laquelle le chunking en boucle ouverte serait intrinsèquement bénéfique, par exemple pour lisser les mouvements ou absorber la latence d'inférence. L'étude suggère plutôt qu'il s'agit surtout d'un palliatif pour des politiques à contexte court incapables de bien imiter des démonstrations non markoviennes. Or de nombreux modèles vision-langage-action utilisés aujourd'hui dans l'industrie reposent justement sur de longs préfixes en boucle ouverte, une stratégie qui réduit la capacité du robot à corriger une erreur en cours d'exécution, un enjeu direct pour tout déploiement en environnement non contrôlé où un objet peut glisser ou un opérateur s'approcher du robot. Pour les intégrateurs et les équipes de recherche, ce travail plaide pour orienter les futurs modèles de fondation robotique vers des architectures à contexte long et réactives plutôt que vers des chunks toujours plus longs.

Le chunking d'actions s'est démocratisé avec des méthodes comme ACT et les politiques par diffusion, aujourd'hui intégrées dans de nombreux systèmes de manipulation. Cet article, une soumission académique sans affiliation industrielle mise en avant dans le résumé, ne présente ni produit ni déploiement mais propose un changement de paradigme méthodologique pour les prochaines générations de politiques d'imitation, sans annoncer de calendrier ni de modèle concret.

À lire aussi

ChunkTrust : adapter les horizons d'exécution des politiques robotiques grâce aux indices de l'expert en actions
1arXiv cs.RO 

ChunkTrust : adapter les horizons d'exécution des politiques robotiques grâce aux indices de l'expert en actions

Les politiques robotiques de type « foundation model » prédisent des séquences d'actions (action chunks), mais le nombre d'actions à exécuter avant de replanifier reste généralement un hyperparamètre fixe. Une équipe académique, dont le projet est hébergé sur Hugging Face, publie sur arXiv ChunkTrust, un cadre qui traite cet horizon d'exécution comme une variable latente, inférée à partir des signaux internes de l'action expert. Son composant central, l'Action-aware Horizon Selector (AHS), ne demande aucun entraînement. Il combine la stabilité spectrale intra-chunk des traces de génération avec la continuité inter-chunk entre l'historique exécuté et les actions prédites. Un posterior Beta en ligne, avec oubli par noyau, suit les préférences d'horizon d'une replanification à l'autre. Un module optionnel léger, le Query-based Horizon Adapter (QHA), apprend un a priori dense conditionné par le contexte, tandis que la politique de base reste gelée. Sur RoboTwin2.0 (50 tâches), l'AHS gagne 6,80 points de succès sur π0.5. Sur RoboCasa GR1 Tabletop, il gagne 9,67 points sur Qwen3GR00T. Avec QHA, le gain monte à 9,44 points sur un sous-ensemble de huit tâches avec π0.5. Sur quatre tâches domestiques réelles, le score de processus normalisé moyen passe de 50,4 % à 57,5 %. L'intérêt pratique tient à ce que le réglage de l'horizon d'exécution est souvent traité comme un détail de déploiement, alors qu'il pèse directement sur la réussite. Un horizon long donne des mouvements fluides, mais il réagit mal aux perturbations. Un horizon court est plus réactif, mais plus saccadé et plus coûteux en calcul. Obtenir un gain sans réentraîner ni modifier le modèle de base est précieux pour les intégrateurs, qui peuvent amender des politiques existantes sans repasser par la collecte de données. Le gain mesuré en conditions réelles est plus modeste que celui des simulateurs, avec +7,1 points sur un score de processus. Cet écart rappelle que les benchmarks simulés surestiment souvent les progrès transférables. Seules quatre tâches réelles sont évaluées, et l'article ne détaille ni la taille des essais ni la variance. Ces résultats restent donc des indications, pas une validation à l'échelle. Ce travail s'inscrit dans la lignée des méthodes de découpage d'actions (action chunking) et de commande à horizon glissant, popularisées par ACT et les politiques de diffusion, puis reprises par les modèles VLA comme π0.5 de Physical Intelligence et la famille GR00T de NVIDIA. Il rejoint d'autres travaux sur l'exécution asynchrone et le lissage des transitions entre chunks, qui visent à réduire les à-coups lors de la replanification. Aucun déploiement industriel ni calendrier de pilote n'est annoncé, il s'agit d'une prépublication v1 non évaluée par les pairs. La suite logique consisterait à valider l'approche sur davantage de plateformes, de tâches longues et de politiques à architectures variées, ainsi qu'à mesurer le surcoût de latence de l'AHS et du QHA en boucle fermée.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RoboRecover : évaluer la récupération des politiques robotiques après des écarts d'exécution
2arXiv cs.RO 

RoboRecover : évaluer la récupération des politiques robotiques après des écarts d'exécution

Des chercheurs en robotique ont mis en ligne le 25 septembre 2026 sur arXiv (2609.28952) un nouveau benchmark baptisé RoboRecover, destiné à mesurer la capacité des politiques robotiques, notamment les modèles vision-langage-action (VLA), à se rétablir après une déviation survenue en cours d'exécution. Les benchmarks existants testent des trajectoires complètes depuis un état initial fixe et jugent surtout le résultat final, en négligeant ce qui se passe pendant l'interaction dynamique. RoboRecover cible au contraire les états intermédiaires anormaux, ceux où des contacts ou des actions ont modifié les relations entre objets et la progression de la tâche, obligeant la politique à comprendre ce qui a changé, corriger la situation, puis reprendre l'objectif initial. La méthode sélectionne des états de déviation issus de trajectoires réelles, les reconstruit en rejouant des préfixes d'actions, puis évalue les politiques sur la tâche d'origine à partir de ce point de reprise. Le benchmark compile 2 000 scénarios répartis sur deux plateformes de simulation, RoboTwin et LIBERO, à raison de 1 000 chacune, avec un découpage fixe de 800 scénarios d'entraînement pour 200 de test sur chaque plateforme. Le résultat central est que la performance sur l'état initial ne prédit pas la performance en récupération : une politique compétente sur une tâche propre peut échouer à s'en sortir une fois perturbée, et les forces de récupération varient fortement d'un scénario à l'autre. C'est une nuance importante pour les intégrateurs et décideurs B2B qui évaluent des modèles génériques (type Pi-0, GR00T N2 ou Helix) sur la seule base de démonstrations en conditions nominales : ces vitrines ne renseignent en rien sur la robustesse réelle face aux glissements, collisions ou interventions humaines qui surviennent en déploiement industriel. RoboRecover formalise ainsi un écart entre démonstration et fiabilité opérationnelle que le secteur avait jusqu'ici peu isolé comme axe de mesure à part entière. Ce travail s'inscrit dans la montée en puissance de benchmarks de politiques génériques comme RoboTwin et LIBERO, devenus des bancs d'essai standards pour comparer les architectures VLA. En exploitant son découpage d'entraînement, RoboRecover permet aussi d'étudier des interventions ciblées pour améliorer la récupération, ouvrant la voie à des travaux futurs sur l'entraînement spécifique à la robustesse post-perturbation, potentiellement étendus à d'autres plateformes ou au matériel réel.

RecherchePaper
1 source
FlowDAgger : adaptation en boucle humaine des politiques génératives de robots dans l'espace latent
3arXiv cs.RO 

FlowDAgger : adaptation en boucle humaine des politiques génératives de robots dans l'espace latent

Microsoft Research publie FlowDAgger, une méthode d'adaptation des politiques robotiques génératives figées, via des interventions humaines directement dans l'espace latent (arXiv:2607.08877v1, prépublication non revue par les pairs). L'idée centrale, appelée « inversion d'action », consiste à faire correspondre chaque action démontrée par un opérateur humain au bruit qui, injecté dans la politique de base pré-entraînée (fondée sur le flow matching ou la diffusion), aurait produit cette même action. Ce bruit est retrouvé par intégration en temps inverse puis affiné localement, et sert ensuite à entraîner une politique latente légère qui vient piloter le modèle de base au moment du déploiement. L'équipe a testé la méthode en simulation et sur des tâches réelles de manipulation bi-bras et mono-bras, en adaptant à la fois des modèles VLA à tête d'action et des modèles dits « world-action », à partir d'une poignée d'interventions humaines seulement. L'enjeu dépasse la prouesse technique isolée : les politiques génératives pré-entraînées, aussi performantes soient-elles en démonstration, échouent régulièrement une fois sorties de leur distribution d'entraînement en conditions réelles. Jusqu'ici, corriger ces failles imposait soit de recollecter massivement des données, soit de lancer de l'apprentissage par renforcement en ligne sur du matériel physique, deux options lentes, coûteuses et risquées pour un robot en production. FlowDAgger propose une correction à faible coût d'échantillons et de calcul, qui préserve les compétences déjà acquises sur des tâches non revues, un point critique pour des modèles fondation coûteux à réentraîner comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI. Selon les auteurs, la méthode surpasse à la fois le fine-tuning supervisé classique et les approches de RL en espace latent sur les mêmes benchmarks. FlowDAgger s'inscrit dans la lignée de DAgger, algorithme classique d'apprentissage par imitation avec correction humaine en boucle, mais transposé à l'espace de bruit latent propre aux politiques par diffusion ou flow matching. Elle rejoint une vague plus large de travaux cherchant à rendre les politiques robotiques génératives pré-entraînées adaptables sur le terrain sans tout réentraîner. L'abstract ne précise pas de calendrier de mise à disposition du code ni de partenaire industriel ; seul un site de démonstration accompagne pour l'instant la publication.

RecherchePaper
1 source
REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique
4arXiv cs.RO 

REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique

Une équipe de chercheurs a publié REPAIR-Bench (Robot Error Perception And Interaction Recovery Benchmark), un jeu de données et de tâches d'évaluation conçu pour mesurer comment les utilisateurs humains perçoivent les pannes robotiques et y répondent. Le benchmark repose sur 214 essais d'interaction impliquant 41 participants exposés à quatre types de défaillances induites. Pour chaque session, les chercheurs ont capturé des données multimodales synchronisées : unités d'action faciale (AU), posture de la tête, transcriptions vocales, ainsi que des rapports d'affect et de stratégies de récupération recueillis après interaction. Trois tâches d'évaluation inédites structurent le benchmark : la détection de pannes sur des sessions interdépendantes (pour modéliser l'adaptation longitudinale de l'utilisateur), la classification visuelle du type de défaillance au-delà du simple binaire succès/échec, et la prédiction de stratégie de récupération centrée utilisateur. En baseline, un modèle récurrent hiérarchique atteint un F1 strict de 0,80 contre 0,68 pour un modèle mono-session, avec une erreur signée moyenne de -0,51 s et une erreur absolue médiane de 2,97 s pour la localisation temporelle des pannes. Pour la prédiction de récupération, un Mistral-7B affiné par QLoRA obtient Hit@5 = 0,76 et F1@5 = 0,32. L'intérêt scientifique de REPAIR-Bench tient à ce qu'il rompt avec trois limites persistantes de la littérature en interaction humain-robot (HRI) : le traitement des défaillances comme des événements isolés, la réduction de la détection à une décision binaire, et la modélisation de la récupération par des règles figées. En intégrant la dimension longitudinale, le benchmark permet de modéliser comment un utilisateur adapte progressivement son comportement face à des défaillances répétées, un phénomène documenté mais rarement instrumenté à cette échelle. Pour les équipes qui déploient des robots de service ou médicaux, c'est un signal concret : la robustesse perçue n'est pas seulement une propriété technique du système, mais une fonction de l'historique d'interaction. Le benchmark ouvre aussi la voie à des systèmes de récupération adaptatifs pilotés par les préférences inférées de l'utilisateur, plutôt que par des arbres de décision codés à la main, ce qui est pertinent pour les intégrateurs qui cherchent à réduire la charge cognitive des opérateurs. Ce travail s'inscrit dans un champ de recherche en expansion sur la fiabilité perçue des robots autonomes, accéléré par la multiplication des déploiements en contexte médical et industriel où une panne mal gérée peut rompre la confiance de façon durable. Les approches précédentes, comme les travaux sur la détection d'anomalies en manipulation ou les études d'affect en HRI, restaient souvent cloisonnées ; REPAIR-Bench propose un cadre unifié couvrant le cycle de vie complet de la défaillance. Le benchmark est publié sur arXiv (2606.29937) et cible explicitement les communautés HRI et HRI médicale. Les prochaines étapes naturelles incluent l'extension à des plateformes robotiques variées (bras manipulateurs, robots mobiles, humanoïdes) et l'évaluation de modèles de langage multimodaux en temps réel comme superviseurs de récupération, une piste que les résultats Mistral-7B rendent crédible sans pour autant la valider à l'échelle.

RecherchePaper
1 source