Aller au contenu principal
Apprentissage par imitation sélective Max-Q pour l'entraînement en ligne de robots avec supervision humaine
RecherchearXiv cs.RO 

Apprentissage par imitation sélective Max-Q pour l'entraînement en ligne de robots avec supervision humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2608.15088) une méthode d'apprentissage par renforcement en ligne avec intervention humaine (human-in-the-loop, HIL) pour robots réels, baptisée Max-Q Selective Imitation. Elle combine un critique "MC Q-chunk", qui évalué les actions par segments a partir des retours Monte Carlo du buffer de replay plutôt que par retropropagation temporelle classique, et une règle "max-Q" qui fait imiter a l'acteur, a chaque état, soit l'action de la politique courante soit un échantillon du buffer, selon lequel des deux obtient le Q le plus élevé. Sur une tache réelle d'insertion de connecteur USB avec seulement 20 démonstrations, la variante ACT QChunk-MCBC atteint 99% de réussite en 30 minutes d'entrainement HIL, contre environ 5 heures pour la méthode de référence HIL-SERL. En simulation, sur les taches Peg Insertion et Square, les variantes ACT et Flow Q-chunk dépassent 96% de réussite en une demi-heure environ, devant HIL-SERL, EXPO et E2HiL.

Ce gain de vitesse s'attaque a un goulot d'étranglement connu de l'apprentissage robotique en ligne : la convergence après correction humaine se compte souvent en heures, ce qui freine son usage industriel la ou chaque minute d'arrêt machine coute cher. Diviser ce temps par dix sur une tache de précision comme l'insertion de connecteurs suggère que les méthodes HIL pourraient sortir du laboratoire pour des lignes d'assemblage réelles, notamment quand peu de démonstrations sont disponibles. Pour les équipes de recherche en robotique, l'article illustre aussi une tendance a remplacer les mises a jour par différence temporelle, lentes et sensibles au bruit, par des cibles Monte Carlo combinées a une règle de sélection simple, sans seuils ni lissage ajoutes.

La méthode se positionne explicitement face a HIL-SERL, référence du domaine, ainsi qu'a EXPO et E2HiL, évaluées sur les mêmes benchmarks de manipulation fine, et s'inscrit dans la lignée des politiques d'action par segments popularisées par ACT, avec une variante testée sur un modèle de flux. Publie comme un article de recherche tout juste mis en ligne sur arXiv, ce travail ne correspond ni a un produit commercial ni a un déploiement industriel annonce : les résultats reposent sur un seul banc réel et deux taches simulées, sans indication sur la généralisation a d'autres robots. Les auteurs ne mentionnent aucune suite en termes de partenariat industriel ou d'intégration logicielle ; la contribution reste, pour l'instant, une brique algorithmique destinée a la communauté recherche en apprentissage robotique.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement avec supervision humaine calibré sur les préférences pour la manipulation robotique
1arXiv cs.RO 

Apprentissage par renforcement avec supervision humaine calibré sur les préférences pour la manipulation robotique

Une équipe de chercheurs publie dans un préprint arXiv daté du 3 juin 2026 PACT (Preference-calibrated Actor-Critic Training), un cadre d'apprentissage par renforcement avec supervision humaine (HIL-RL) pour la manipulation robotique. Le problème ciblé est connu : quand un opérateur reprend la main pour corriger le robot, les trajectoires collectées contiennent des segments suboptimaux que les méthodes actuelles propagent indistinctement dans le calcul des récompenses, surestimant les Q-valeurs et biaisant la politique vers des comportements sous-performants. PACT introduit un modèle de progression entraîné sur des démonstrations humaines pour identifier ces segments défaillants, puis construit des paires de préférence entre l'action correctrice humaine et l'action rééchantillonnée de la politique au même état d'intervention. Cette comparaison génère un avantage contrefactuel qui pénalise les cibles de Bellman sur les segments suboptimaux, complété par un alignement direct de la politique sur les actions correctives dans l'espace des moyennes bornées. Sur cinq tâches de manipulation réelle-robot, PACT affiche une amélioration moyenne du taux de succès de 24,5 % et une convergence 1,3 fois plus rapide que les méthodes HIL-RL de référence. Le code est disponible en open source sur dépôt GitHub anonymisé. Ces résultats s'attaquent à un goulot d'étranglement pratique du HIL-RL : la supervision humaine améliore l'efficacité en échantillons, mais introduit du bruit quand les corrections arrivent après plusieurs actions déjà incorrectes. En extrayant les signaux de préférence implicitement des interventions, sans annotation post-hoc coûteuse, PACT permet à un opérateur non-expert d'intervenir naturellement pendant l'entraînement sans dégrader la qualité des données. La convergence accélérée réduit directement le temps d'adaptation sur de nouvelles tâches, un facteur critique pour le déploiement en environnements industriels variables. Le HIL-RL s'appuie sur des travaux fondateurs comme DAgger (Ross et al., 2011) et IWR (Mandlekar et al., 2020), complétés par des variantes comme HG-DAgger, qui pondèrent les transitions différemment sans toutefois distinguer explicitement les segments suboptimaux. PACT se positionne comme une extension ciblée de cette famille. La manipulation robotique est par ailleurs traversée par les approches VLA (Vision-Language-Action), comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation zero-shot, une stratégie complémentaire plutôt qu'opposée au fine-tuning supervisé par intervention humaine. Le préprint, non encore peer-reviewed, ne mentionne ni partenaires industriels ni calendrier de déploiement ; la distance entre banc de test robotique de laboratoire et production industrielle reste entière.

UEImpact indirect : ce cadre HIL-RL open-source pourrait accélérer les travaux des équipes européennes de robotique industrielle cherchant à réduire le coût d'adaptation de robots à de nouvelles tâches en production.

RecherchePaper
1 source
RoHIL : apprentissage par renforcement robotique robuste avec supervision humaine face aux variations d'éclairage
2arXiv cs.RO 

RoHIL : apprentissage par renforcement robotique robuste avec supervision humaine face aux variations d'éclairage

Les systèmes de reinforcement learning avec humain dans la boucle (HIL-RL) atteignent des taux de succès quasi parfaits sur le poste de travail où ils sont entraînés, mais s'effondrent lorsque le même robot est déplacé de quelques mètres vers un poste différent. La cause est simple : des variations d'éclairage (position des lampes, lumière naturelle) perturbent suffisamment la distribution des entrées visuelles pour invalider la politique apprise. Pour combler ce "cross-domain gap" sans recollecte de données terrain, des chercheurs présentent RoHIL (Robust Human-in-the-Loop), un framework de fine-tuning hors ligne évalué sur quatre tâches de manipulation robotique réelle. RoHIL repose sur trois mécanismes : un re-lighting basé sur un world model qui resynthétise le flux visuel des trajectoires sources sous plusieurs environnements HDRI virtuels sans modifier les actions ni les récompenses, un mécanisme anti-oubli appelé Illumination-Retention Replay (IRR) qui entrelace transitions d'adaptation et transitions de rétention, et un régulariseur Bellman-acteur ancré limitant la dérive de représentation par rapport à la politique source. L'enjeu industriel est direct : recollecte de démonstrations et ré-entraînement HIL à chaque nouveau poste sont incompatibles avec un déploiement à l'échelle. La fragilité aux variations lumineuses reste l'un des obstacles les plus sous-estimés entre laboratoire et production réelle. RoHIL répond à ce problème sans interaction robot supplémentaire, ce qui réduit le coût d'intégration pour les opérateurs. La combinaison IRR et régulariseur Bellman démontre qu'il est possible d'adapter une politique à de nouvelles conditions visuelles tout en préservant les performances sur l'environnement d'origine, résultat non trivial face à l'oubli catastrophique classique. Ce travail, déposé sur arXiv en mai 2025 sous soumission anonyme et vraisemblablement en cours d'évaluation par une conférence, s'inscrit dans la vague de recherches visant à rendre les politiques robotiques robustes aux variations de domaine. Les approches concurrentes incluent la randomisation de domaine à l'entraînement, les politiques multi-environnements ou l'augmentation visuelle agressive, mais ces techniques nécessitent d'anticiper les variations en amont. RoHIL se distingue par son mode entièrement offline. Aucun déploiement commercial ni partenariat industriel n'est mentionné : il s'agit d'un résultat académique à ce stade, dont les extensions naturelles porteront sur un plus grand nombre de postes, de conditions lumineuses et de tâches à degrés de liberté élevés.

RecherchePaper
1 source
L'apprentissage par imitation en contexte avec raisonnement visuel
3arXiv cs.RO 

L'apprentissage par imitation en contexte avec raisonnement visuel

Un article de recherche publié sur arXiv (identifiant 2603.07530v2, version révisée) présente ICLR, pour "In-Context Imitation Learning with Visual Reasoning", une nouvelle méthode d'apprentissage par imitation en contexte pour les robots manipulateurs. Le principe consiste à faire adapter un robot à une nouvelle tâche à partir d'un petit nombre de démonstrations, sans réentraînement du modèle. La nouveauté d'ICLR est d'enrichir les démonstrations avec des traces de raisonnement visuel structurées, c'est-à-dire des trajectoires futures anticipées du robot représentées directement dans l'espace image, plutôt que de se limiter aux seules paires état-action utilisées par les approches existantes. Ces traces de raisonnement et les actions de bas niveau sont apprises conjointement au sein d'un unique transformeur autorégressif, ce qui permet au modèle d'imiter non seulement le geste final mais aussi le cheminement qui y conduit. Les auteurs rapportent des évaluations à la fois en simulation et sur des tâches de manipulation réelles, avec des gains constants en taux de succès et en généralisation face à des tâches inédites et de nouvelles configurations d'objets, comparé aux méthodes d'apprentissage par imitation en contexte existantes. L'enjeu pour l'industrie robotique tient au principal talon d'Achille des systèmes vision-langage-action (VLA) actuels: leur capacité à généraliser au-delà des tâches et objets vus à l'entraînement reste limitée, surtout quand une même séquence de gestes peut correspondre à des intentions différentes selon le contexte. En donnant au modèle une représentation explicite de l'intention, sous forme de trajectoire visuelle anticipée plutôt qu'une simple politique action-état, ICLR s'attaque directement à l'ambiguïté qui bloque le déploiement des robots généralistes en environnement peu structuré. Si les résultats se confirment à plus grande échelle, cela renforcerait l'hypothèse selon laquelle intégrer un raisonnement visuel explicite, plutôt que de scaler uniquement les données de démonstration, est une voie crédible pour rendre les politiques d'apprentissage en contexte plus robustes, un enjeu direct pour les intégrateurs qui cherchent à déployer des bras robotiques capables de s'adapter rapidement à de nouvelles références produits sans campagne de réentraînement coûteuse. Ce travail s'inscrit dans la lignée des recherches récentes sur l'apprentissage par imitation en contexte (in-context imitation learning), un domaine qui cherche à reproduire pour la robotique la flexibilité du few-shot learning observée dans les grands modèles de langage, et fait écho aux efforts plus larges autour des modèles VLA tels que Pi-0 ou GR00T N2, qui tentent eux aussi de combler l'écart entre démonstrations en laboratoire et déploiement réel. L'article ne précise pas d'industriel partenaire ni de calendrier de mise en production; il s'agit d'une contribution académique, acceptée pour la conférence ICLR, dont l'apport reste à ce stade expérimental. La suite logique pour ce type de travaux est généralement une intégration progressive dans des piles logicielles open source de manipulation robotique, avant une éventuelle reprise par des acteurs commerciaux du secteur.

RecherchePaper
1 source
Ancrage auto-supervisé de la perception tactile à la proprioception et aux actions proactives pour l'apprentissage par imitation robotique
4arXiv cs.RO 

Ancrage auto-supervisé de la perception tactile à la proprioception et aux actions proactives pour l'apprentissage par imitation robotique

Publiée sur arXiv le 25 septembre 2026 sous la référence 2609.29822, une étude propose PROPRA, une méthode de pré-entraînement pour l'apprentissage par imitation en robotique de manipulation à partir de capteurs placés au bout des doigts. Le constat de départ : les caméras externes peinent à capter la proximité d'un objet, l'instant du contact ou l'état de la préhension, souvent occultés par la main du robot. L'équipe combine un capteur tactile sensible à la pression, informatif après contact, et un capteur de proximité réfléchissant, informatif avant contact, chacun couplé à un encodeur pré-entraîné. Ajouter naïvement ces signaux à une politique de contrôle dégrade parfois les performances par rapport à une politique vision seule. PROPRA aligne indépendamment l'historique de chaque capteur avec la proprioception et les actions du robot, offrant une référence sensorimotrice disponible en continu. Sur des tâches de manipulation réelles, la méthode améliore le taux de succès moyen face aux baselines vision seule et pré-entraînement ancré sur l'image, en préservant mieux les informations sur les états pré-contact. Le résultat clé pour un intégrateur n'est pas le gain de performance en soi, mais le constat qui l'accompagne : multiplier les capteurs sur une main robotique ne suffit pas, et peut même dégrader une politique apprise par imitation si le signal est mal intégré. Cela contredit l'hypothèse selon laquelle empiler vision, tactile et proximité améliore mécaniquement la manipulation, alors que l'industrie mise sur des modèles vision-langage-action multimodaux entraînés à grande échelle. Pour les concepteurs de mains équipées de capteurs tactiles piézorésistifs, capacitifs ou optiques, l'alignement entre modalités sensorielles et proprioception devient nécessaire pour rentabiliser l'investissement matériel, notamment pour l'assemblage de petites pièces ou la manipulation d'objets fragiles. Le transfert en manipulation fine ne se résume donc pas au seul écart simulation-réel : même avec des données réelles, fusionner des signaux épars et asynchrones reste difficile quand les démonstrations disponibles pour une tâche restent rares. L'étude s'inscrit dans un champ de recherche actif sur l'intégration tactile dans l'apprentissage par imitation, où le pré-entraînement ancré sur l'image, utilisé ici comme référence de comparaison, reste l'approche dominante. Menés par le chercheur Tomohiro Motoda, les travaux positionnent PROPRA comme une alternative en misant sur la proprioception, continue, comme point d'ancrage pour des signaux tactiles et de proximité discontinus par nature. Le code et les détails méthodologiques sont annoncés sur une page de projet dédiée, sans calendrier de diffusion ni partenariat industriel évoqué. Il s'agit pour l'instant d'un résultat de recherche validé sur des tâches de manipulation réelles en laboratoire, non d'un produit commercialisé ni d'un déploiement chez un intégrateur.

RecherchePaper
1 source