LLA-MPPI : contrôle adaptatif rapide du corps entier de robots à pattes grâce à des simulations parallèles accélérées sur GPU
Des chercheurs présentent LLA-MPPI (Look-back and Look-ahead Adaptive Model Predictive Path Integral control), une méthode de commande corps entier pour robots à pattes qui s'adapte en temps réel aux changements de dynamique, sans entraînement hors ligne. Le principe consiste à maintenir une banque de simulateurs de contact exécutés par lots sur GPU, chacun avec des paramètres physiques ou structurels différents. Les erreurs de prédiction, calculées sur une fenêtre glissante, désignent le simulateur qui explique le mieux le mouvement récent. Un planificateur MPPI corps entier optimise ensuite les commandes à travers ce modèle sélectionné. Sur quatre tâches en simulation, la méthode atteint 97,5 % de succès, contre 74 % pour la meilleure base de comparaison et 98,5 % pour un oracle qui connaît le vrai modèle. Côté matériel, un Unitree Go2 marche avec une charge ajoutée en cours d'exécution, continue de marcher avec une patte désactivée, et pousse une boîte jusqu'à son objectif alors que sa masse augmente en cours de route. Le code et les vidéos sont publiés sur lla-control.github.io.
L'enjeu est de lever une limite connue du contrôle prédictif sur robots à pattes : les contrôleurs temps réel planifient avec un modèle nominal fixe et se dégradent dès que la dynamique réelle s'en écarte (charge inattendue, panne d'actionneur, objet manipulé plus lourd que prévu). Les approches adaptatives existantes supposent une structure de modèle que la dynamique de contact n'offre pas, ou exigent un entraînement hors ligne pour chaque condition anticipée. Ici, l'adaptation devient un problème de sélection parmi des hypothèses explicites, ce qui rend le comportement interprétable : on peut lire quelle masse ou quelle défaillance le robot « croit » subir. Le fait que l'écart avec l'oracle ne soit que d'un point suggère que, dans ce cadre, l'identification du modèle n'est plus le facteur limitant. Pour un intégrateur, c'est un argument en faveur de la robustesse sans réentraînement de politique, par exemple pour des robots d'inspection qui transportent des charges variables ou doivent survivre à une panne partielle.
Il faut toutefois relativiser. Les 97,5 % proviennent de quatre tâches simulées, et la validation matérielle se limite à un quadrupède de gamme recherche, le Go2, sans chiffres publiés dans le résumé sur les taux de succès réels ni sur la latence. La performance dépend aussi de la couverture de la banque : une perturbation hors de la gamme de paramètres prévue n'est pas garantie d'être bien expliquée, et le coût de calcul croît avec le nombre d'hypothèses, ce qui suppose un GPU embarqué ou déporté. La méthode s'inscrit dans la lignée des contrôleurs MPPI échantillonnés et de la simulation GPU massivement parallèle, en concurrence avec les politiques apprises par apprentissage par renforcement et randomisation de domaine, plus rapides à l'exécution mais figées après l'entraînement. Les prochaines étapes naturelles sont l'extension aux humanoïdes et aux robots à pattes plus lourds, ainsi qu'une évaluation sur des perturbations non anticipées.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




