
Adaptation résiduelle alignée sur la stabilité pour une récupération rapide après des changements de dynamique
L'article arXiv 2603.07775 (v2), intitulé « Stability-Aligned Residual Adaptation for Rapid Recovery from Dynamics Shifts », décrit une méthode où une correction résiduelle bornée s'ajoute, à l'inférence, à une politique d'apprentissage par renforcement (SAC) figée, sans réentraînement, réinitialisation ni identification explicite du système. Un module appelé Stability Alignment Gate régule cette correction par des contraintes d'amplitude, de cohérence directionnelle et de gain adaptatif, pour rester dans la marge de robustesse du contrôleur nominal. Face à des changements brusques d'actionnement, de masse et de contact en cours d'épisode, la méthode réduit le temps de récupération par rapport à un SAC figé de jusqu'à 87% sur le quadrupède Go1, 48% sur le bipède Cassie, 30% sur l'humanoïde H1 et 20% sur le robot AgileX Scout, en simulation. Sur matériel réel, un bras manipulateur Trossen ViperX et un AgileX Scout Mini gagnent 19,5% de temps de récupération, sans modification du contrôleur embarqué.
L'enjeu pour l'industrie tient au problème visé: une politique de RL entraînée en simulation reste fragile face à des glissements de dynamique non observés (usure, charge variable, sol différent) une fois déployée hors environnement contrôlé, même si le contrôleur nominal reste localement stable. En évitant réentraînement, identification du système et information privilégiée sur la perturbation, l'approche cible directement le coût opérationnel des intégrateurs, qui ne peuvent pas recalibrer un robot à chaque aléa. Le maintien d'un gain, certes plus modeste, sur deux plateformes physiques distinctes (bras fixe, robot mobile) suggère une certaine généralité au-delà d'un seul type de robot, même si l'essentiel des chiffres reste obtenu en simulation.
La méthode s'inscrit dans la lignée de l'apprentissage résiduel, qui corrige une politique déjà compétente plutôt que de la remplacer, une alternative au réentraînement complet ou aux grands modèles généralistes de type VLA comme Pi-0 ou GR00T N2. Les plateformes d'essai, quadrupède et humanoïde Unitree Go1 et H1, bipède Cassie, AgileX Scout et Scout Mini, bras Trossen ViperX, sont des références académiques standards, sans produit commercial identifié dans le résumé de l'article. Publiée comme simple préprint sur arXiv, la contribution ne mentionne ni partenariat industriel, ni pilote annoncé, ni calendrier de transfert vers un produit; la suite logique, non confirmée, serait une extension à davantage de plateformes physiques et de tâches de manipulation.
Dans nos dossiers




