Apprendre sur le tas : exécution de tâches sans démonstration sous incertitude paramétrique par commande duale paramétrée par trajectoire
Des chercheurs proposent une méthode de commande duale qui permet à un robot d'exécuter une tâche du premier coup tout en identifiant en ligne les paramètres physiques qu'il ne connaissait pas. Publié sur arXiv (2510.20483, version 2), le travail part d'un constat : la commande basée sur modèle donne de bons résultats tant que le modèle est exact, mais un robot rencontre souvent des charges utiles, des objets ou des dynamiques d'interaction inédits. L'approche classique consiste à lancer d'abord une phase d'excitation dédiée, indépendante de la tâche et du contrôleur, pour estimer les paramètres. Les auteurs suppriment cette étape : l'apprentissage du modèle et la commande se déroulent simultanément pendant la tâche. Ils fixent à l'avance une politique de retour d'état avec une loi d'adaptation explicite des paramètres, puis optimisent la trajectoire de référence à travers la dynamique adaptative en boucle fermée. Deux formulations sont proposées : minimiser le coût attendu de la tâche sous incertitude paramétrique, ou minimiser la perte d'optimalité, c'est-à-dire la dégradation de performance causée par une planification fondée sur une estimation erronée. L'exploration est guidée par une mesure d'information de Fisher.
L'enjeu est très concret pour les intégrateurs et les responsables de production. Aujourd'hui, un bras manipulant une charge inconnue perd du temps en calibration, ou exécute des mouvements d'identification qui n'ont aucun lien avec la tâche et produisent des données peu utiles. Selon les auteurs, leur méthode s'approche d'une borne inférieure de l'incertitude sur les paramètres pertinents pour la tâche, tout en réussissant celle-ci en une seule tentative. Cela réduit les temps morts et évite d'identifier des paramètres sans effet sur le résultat. Les résultats couvrent plusieurs tâches, contrôleurs et lois d'adaptation, ce qui suggère une méthode générique et non un réglage sur un seul cas. Il faut toutefois rester prudent : le résumé ne donne ni chiffres de performance, ni précision de l'identification, ni temps de calcul, ni preuve sur matériel réel. On ne sait donc pas si la méthode tient face aux bruits de capteurs, aux frottements non modélisés ou aux contraintes temps réel d'une cellule industrielle.
Ce travail s'inscrit dans le débat entre approches basées sur modèle et approches apprises, comme les modèles vision-langage-action (VLA), qui généralisent par les données mais offrent moins de garanties. Ici, la commande adaptative et la théorie du contrôle dual, formulée depuis les années 1960, sont réactivées avec une optimisation de trajectoire moderne. Il s'agit d'une préimpression, sans validation par les pairs à ce stade, et la mention « remplacement » indique une révision d'une version antérieure. Les suites logiques seraient des essais sur manipulateurs réels avec charges variables, puis une comparaison directe avec l'identification préalable et les méthodes de méta-apprentissage.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




