Adaptation au moment du test des politiques de manipulation face à la dégradation des actionneurs
Des chercheurs proposent TeAR (Telemetry-Aware Action Rectification), une méthode publiée sur arXiv qui corrige à la volée les actions d'une politique de manipulation robotique lorsque les actionneurs se dégradent. Le principe est de ne pas toucher à la politique, qui reste gelée, mais d'intercaler entre elle et le contrôleur bas niveau un petit Transformer léger. Celui-ci reçoit l'action proposée et la télémétrie embarquée (température des articulations, courant moteur, tension d'alimentation), puis amplifie, amortit ou décale chaque composante de l'action. L'évaluation couvre 18 paires politique-tâche, réparties sur 8 familles de politiques et 5 tâches de manipulation. Dans un test apparié où le modèle de dégradation utilisé à l'entraînement ne correspond pas à la réalité, TeAR atteint 31,8 % de réussite, contre 25,6 % pour la politique de base et 30,6 % pour un inverse fondé sur un modèle supposé. Sur un bras physique, le gain atteint 10 à 15 % en situation d'échauffement, sans réglage fin sur le robot.
L'intérêt tient à un problème que les démonstrations de laboratoire masquent : les politiques sont entraînées en supposant qu'une commande produit toujours le même mouvement. Or sur du matériel réel, après des heures de service, les moteurs chauffent, le courant sature près du contact et la tension chute sous charge. La même action donne alors un mouvement plus faible, retardé ou bruité. Pour un intégrateur ou un exploitant de site, c'est une source de dérive de performance très concrète, qui se traduit par des taux de réussite en baisse au fil des postes. La méthode est indépendante de la politique, donc applicable à des VLA ou à des politiques de diffusion déjà déployées sans les réentraîner. Elle exploite un signal déjà disponible, aujourd'hui surtout utilisé pour la journalisation et la sécurité. Il faut toutefois relativiser les ordres de grandeur. Le gain de 6 points dans le test avec écart de modèle reste modeste, et la validation physique porte sur un seul bras, avec un gain annoncé sous forme de fourchette et sans détail sur les tâches ni le nombre d'essais.
Ce travail s'inscrit dans le champ de l'adaptation au moment du test et de la robustesse sim-to-real, où l'on traite habituellement le décalage visuel ou dynamique par la randomisation de domaine ou l'identification de système. TeAR déplace la question vers l'usure et l'échauffement, qui sont des enjeux de fiabilité longue durée pour les humanoïdes et les bras collaboratifs en production continue. Aucun pilote industriel ni calendrier n'est annoncé. Il s'agit d'un préprint non évalué par des pairs, et les prochaines étapes logiques seraient des tests sur des plateformes variées, avec des cycles de fonctionnement longs et des dégradations réelles plutôt que simulées.
Dans nos dossiers



