
AdaReP : replanification adaptative face aux erreurs de modèle pour la commande prédictive par modèle du monde neuronal
Des chercheurs présentent AdaReP, une méthode qui modifie la façon dont les systèmes de controle predictif (MPC) bases sur des modèles du monde neuronaux décident de recalculer leur plan d'action. Habituellement, ces systèmes replanifient a chaque pas de temps pour limiter l'accumulation d'erreurs de prédiction, ce qui génère une charge de calcul importante. AdaReP est présente comme un wrapper "sans entrainement" (training-free) qui s'ajoute au-dessus d'un modèle du monde et d'un planificateur déjà appris, sans les modifier. Le système ajuste en continu la tolérance de replanification en fonction de l'écart mesure entre la trajectoire actuelle et le plan mis en cache, et d'une estimation locale de la sensibilité de la dynamique. Les auteurs valident l'approche sur trois types de taches : planification dans l'espace image, contrôle dans l'espace latent, et manipulation robotique réelle. Sur une étude physique de 50 essais avec un bras manipulateur, AdaReP réduit de plus de 80% le nombre de requêtes au planificateur tout en maintenant des performances comparables a une replanification systématique. Le papier, référence arXiv:2606.23079v2, est une version mise a jour d'une publication antérieure.
Cette réduction cible un goulot d'étranglement connu des architectures MPC couplées a des modèles du monde neuronaux : chaque appel au planificateur, souvent un réseau lourd, coute cher en temps et en énergie, ce qui limite le déploiement embarque en temps réel sur des robots ou systèmes autonomes. En montrant qu'un plan mis en cache peut être réutilisé la plupart du temps sans dégrader la performance, AdaReP fournit un argument concret contre l'hypothèse selon laquelle replanifier a chaque pas serait nécessaire pour rester robuste aux erreurs de prédiction. Pour les intégrateurs et équipes de recherche, l'intérêt pratique tient au fait que la méthode ne nécessite ni reentrainement du modèle du monde ni modification du planificateur existant, ce qui facilite son adoption sur des piles déjà en production. Le gain mesure sur un robot physique et non uniquement en simulation répond a une critique fréquente du secteur : l'écart entre démonstrations simulées et comportement réel.
Le problème s'inscrit dans la lignée des travaux sur le controle predictif base sur l'apprentissage, ou l'essor des modèles du monde neuronaux pour la robotique rend la replanification systématique de plus en plus couteuse a mesure que ces modèles gagnent en taille. Les auteurs formalisent le compromis entre réutilisation de plan et dérivé de prédiction via un cadre de regret dynamique base sur la perturbation, montrant que la pénalité d'un plan périmé dépend de trois facteurs : la tolérance de réutilisation choisie, l'écart de prédiction accumule depuis la dernière replanification, et la sensibilité locale de la dynamique. Le papier ne cite ni implémentation industrielle ni partenaire commercial, et aucun acteur français ou européen n'est mentionne dans cette publication de recherche méthodologique. Les suites évoquées concernent l'extension a d'autres familles de planificateurs et de modèles du monde, la validation restant pour l'instant limitee aux trois bancs d'essai décrits.
Dans nos dossiers




