Aller au contenu principal
MPC-Injection : orienter le RL de locomotion hors-politique vers les bassins d'attraction du contrôleur
RecherchearXiv cs.RO 

MPC-Injection : orienter le RL de locomotion hors-politique vers les bassins d'attraction du contrôleur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en juin 2026 sur arXiv une méthode baptisée MPC-Injection, conçue pour résoudre un problème récurrent dans l'entraînement par renforcement appliqué à la locomotion robotique : la convergence vers des comportements localement optimaux mais inutilisables en production, comme des membres qui vibrent en place ou un robot qui progresse en se traînant sur son torse. La technique consiste à injecter dans le replay buffer, la mémoire d'expériences utilisée par les algorithmes off-policy, des transitions générées par un contrôleur MPC (Model Predictive Control) résolvant le même problème de décision séquentielle. Le comportement préféré du concepteur est ainsi transféré à la politique apprise, non par une modification de la récompense, mais uniquement par le biais de la distribution des états explorés. Les auteurs valident l'approche sur un marcheur 2D en simulation, puis en transfert sim-to-real sur le quadrupède Go2 de Unitree Robotics, un robot commercialement disponible.

L'intérêt principal est la simplicité du surcoût. Là où le reward shaping classique exige jusqu'à vingt et un termes de récompense soigneusement ajustés, MPC-Injection produit des allures qualitativement comparables avec une récompense à un ou deux termes seulement. Contrairement à l'adversarial motion prior (AMP) et aux méthodes d'imitation adversariale, la méthode ne nécessite ni discriminateur, ni retargeting cinématique, ni objectif auxiliaire. C'est un résultat notable : il suggère que la distribution des états du replay buffer est un levier de guidage aussi puissant que la forme de récompense ou l'imitation explicite, ce qui simplifie considérablement le pipeline d'ingénierie pour les équipes qui déploient des robots sur du matériel réel.

La méthode s'inscrit dans un effort plus large de la communauté pour réduire le sim-to-real gap sans multiplier les hypothèses sur la dynamique du robot. Le Go2 de Unitree est devenu un banc de test de référence pour ces travaux, utilisé notamment dans des recherches concurrentes sur les VLA (Vision-Language-Action models) et les politiques de locomotion neuronales. Les alternatives directes, reward shaping multi-termes, AMP de Berkeley, méthodes de retargeting par mocap, ont toutes un coût d'implémentation ou de collecte de données plus élevé. MPC-Injection se positionne comme un pont pragmatique entre contrôle classique et apprentissage, particulièrement pertinent pour les équipes disposant déjà d'un contrôleur MPC opérationnel et souhaitant affiner une politique RL sans repartir de zéro sur la définition de récompense.

Dans nos dossiers

À lire aussi

Du jeu à la politique de contrôle : vers une collecte de données robotiques à grande échelle par interaction gamifiée sans robot
1arXiv cs.RO 

Du jeu à la politique de contrôle : vers une collecte de données robotiques à grande échelle par interaction gamifiée sans robot

Une équipe de recherche présente sur arXiv (papier 2609.18650v1, mis en ligne en septembre 2026, soumission apparemment en aveugle sans institution nommée) une méthode de collecte de données pour l'apprentissage de politiques de manipulation robotique baptisée Project Kitchen, couplée à un algorithme nommé Game2Policy. Project Kitchen est une plateforme de collecte de données égocentriques en réalité virtuelle conçue comme une expérience de jeu vidéo plutôt qu'une session classique de téléopération : l'utilisateur manipule des objets virtuels dans un environnement gamifié, sans dépendre d'un robot physique ni d'un matériel spécifique, ce qui rend les données transférables et potentiellement collectables à grande échelle via crowdsourcing. Game2Policy extrait ensuite des indices d'affordance indépendants de la morphologie du robot, notamment les points de contact et les états de sous-objectifs, à partir des trajectoires de jeu ; un modèle d'affordance est pré-entraîné sur ces données puis affiné conjointement avec les politiques robotiques finales à l'aide d'une poignée seulement de démonstrations réelles. Les auteurs rapportent des gains moyens de taux de réussite de 10,0 points en simulation et 18,3 points sur robots réels en configuration few-shot, ainsi qu'une diversité comportementale et un niveau d'engagement supérieurs selon des études utilisateurs. Ce travail cible un goulot d'étranglement central du secteur : l'entraînement de politiques de manipulation généralisables, notamment de type VLA, exige des données massives et variées, mais les démonstrations réelles restent coûteuses et les méthodes existantes sont soit liées à un robot spécifique, ce qui limite le crowdsourcing, soit mal annotées et peu diversifiées. Si l'approche tient à plus grande échelle, elle ouvrirait la voie à une collecte de données quasi illimitée via des joueurs grand public plutôt que des flottes de téléopération dédiées, réduisant potentiellement le coût d'entrée pour les intégrateurs. Les résultats restent toutefois à prendre avec prudence : ils proviennent d'un article de recherche non encore accepté, la « poignée » de démonstrations réelles n'est pas quantifiée précisément, et les gains sont mesurés sur des tâches contrôlées en cuisine simulée. La démarche s'inspire explicitement des mécanismes d'engagement à long terme des jeux vidéo pour résoudre le problème récurrent du sim-to-real et du game-to-real gap. Elle s'inscrit dans la tendance plus large consistant à exploiter des données humaines non robotiques (vidéo, VR, simulation) pour contourner la téléopération coûteuse. Les auteurs annoncent la publication de la plateforme et du code uniquement après acceptation de l'article : il s'agit donc à ce stade d'une annonce de recherche, pas d'un produit ni d'un déploiement réel.

RecherchePaper
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
2arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques
3arXiv cs.RO 

X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques

Publié sur arXiv (2603.03733) en 2025, X-Loco est un framework d'entraînement d'une politique de locomotion généraliste basée sur la vision pour robots humanoïdes. L'approche repose sur une distillation synergétique : plusieurs politiques expertes sont entraînées séparément pour des compétences distinctes - locomotion bipède stable, récupération après chute, coordination corps entier, franchissement de terrains variés - puis une politique unique guidée par entrée visuelle est distillée à partir de ces experts via un mécanisme de sélection adaptative au cas par cas. X-Loco opère uniquement sur des commandes de vitesse, sans recours à des mouvements de référence issus de captures de mouvement. Les auteurs revendiquent une première dans l'intégration simultanée de toutes ces compétences dans une seule politique vision - affirmation à prendre avec les précautions d'usage pour un preprint non encore évalué par les pairs. Ce travail s'attaque à un verrou technique central : entraîner une politique unique qui maîtrise des comportements aux dynamiques radicalement différentes et aux objectifs de contrôle parfois contradictoires. Une telle politique simplifie le déploiement opérationnel en éliminant les modules de commutation entre comportements. L'absence de dépendance aux données de mocap rend également le pipeline d'entraînement plus scalable, puisqu'il ne requiert pas de bibliothèques de mouvements spécifiques à chaque compétence cible. Les études d'ablation incluses renforcent la crédibilité des choix architecturaux, mais les résultats restent cantonnés à la simulation et au laboratoire, sans validation sur hardware réel à grande échelle. X-Loco s'inscrit dans une dynamique de recherche intense sur la locomotion humanoïde, portée par des équipes comme Berkeley Humanoid, CMU et les labos gravitant autour d'Unitree. La distillation enseignant-étudiant est un paradigme établi en apprentissage par renforcement, mais son application à un spectre aussi large de compétences reste un défi ouvert. Côté commercialisation, Tesla (Optimus Gen 2), Figure AI, Boston Dynamics (Atlas) et 1X Technologies travaillent sur des problèmes similaires avec des ressources bien supérieures. La suite logique pour X-Loco serait une validation sim-to-real convaincante sur hardware physique, étape non encore franchie selon le papier.

RecherchePaper
1 source
JailWAM : pirater les modèles d'action du monde dans le contrôle robotique
4arXiv cs.RO 

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique

Des chercheurs ont publié JailWAM, premier framework d'évaluation de jailbreak conçu spécifiquement pour les World Action Models (WAM), ces modèles qui pilotent directement des robots manipulateurs à partir d'instructions en langage naturel. Décrit dans un article déposé sur arXiv (identifiant 2604.05498, version 2), le système repose sur trois composants. Le premier, Visual-Trajectory Mapping, convertit les sorties d'action hétérogènes de différentes architectures de WAM en une représentation de trajectoire visuelle commune, ce qui permet de comparer des modèles différents sur une même base. Le deuxième, un Risk Discriminator, classe les résultats selon trois niveaux de gravité physique croissante : conformité de sécurité, échec de mouvement, et risque catastrophique. Le troisième, une Dual-Path Verification Strategy, combine un tri rapide des candidats d'attaque avec une simulation physique en boucle fermée réservée aux cas jugés dangereux, afin de réduire le coût de calcul. Testé dans l'environnement de simulation RoboTwin, JailWAM atteint un taux de réussite d'attaque de 84,2 % contre le modèle LingBot-VA. Ce résultat illustre concrètement que les WAM, censés traduire fidèlement des consignes en gestes physiques sûrs, restent vulnérables à des instructions adversariales capables de provoquer des comportements dangereux du bras ou du robot. Pour les intégrateurs industriels et les décideurs qui envisagent de déployer ces modèles vision-langage-action en usine ou en entrepôt, l'étude rappelle qu'aucun garde-fou standardisé n'existe encore contre ce type d'attaque, contrairement au red-teaming déjà bien établi pour les grands modèles de langage textuels. Le chiffre de 84,2 % a toutefois été obtenu en simulation, pas sur du matériel physique réel, ce qui laisse ouverte la question d'un éventuel écart sim-to-real ; la tendance qu'il révèle sur la fragilité de l'alignement sécuritaire des WAM reste néanmoins significative. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui équipent la nouvelle génération de robots humanoïdes et de bras manipulateurs, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix. JailWAM transpose au monde physique des méthodologies de jailbreak déjà développées pour les modèles de langage textuels. Les auteurs appellent explicitement à davantage de recherche sur l'évaluation de sécurité et l'alignement des systèmes robotiques embarqués, signe d'un besoin encore naissant de standards de certification avant tout déploiement industriel à grande échelle. Aucun acteur français ou européen du secteur n'apparaît dans cette étude.

RechercheActu
1 source