
Un cadre sensible à la latence pour l'apprentissage de politiques visuomotrices sur robots industriels
Un article publié sur arXiv (identifiant 2602.14255, version 2) présente un cadre logiciel pour déployer des politiques visuomotrices de bout en bout sur des bras robotiques industriels, où le décalage entre observation et exécution, causé par les latences d'observation, d'inférence et d'exécution, est amplifié par les interfaces de contrôle haut niveau et la dynamique de boucle fermée plus lente de ce matériel. Le système combine perception multimodale calibrée en latence, synchronisation des données, pipeline de communication unifié et interface de téléopération pour collecter des démonstrations expertes. Son mécanisme central horodate chaque séquence d'actions prédite et n'exécute que celles encore réalisables au moment prévu, permettant une inférence et une exécution asynchrones sans modifier l'architecture ni l'entraînement de la politique. Sur une tâche d'assemblage à contacts riches, avec une latence d'inférence variant de 100 à 500 millisecondes, cette approche maintient la durée de tâche et la fluidité du mouvement à 13% et 9% près de la référence de démonstration humaine, tout en évitant le ralentissement progressif du mode bloquant et les dépassements de force de contact importants de l'exécution asynchrone naïve.
Ce travail vise un angle mort du déploiement industriel des politiques vision-langage-action (VLA) : les démonstrations de manipulation les plus spectaculaires sont réalisées sur des bras de recherche rapides, alors que les bras industriels, aux boucles de contrôle nettement plus lentes, exposent frontalement le problème de latence que les vitrines commerciales masquent souvent. Pour les intégrateurs et décideurs industriels, la leçon pratique est qu'une politique validée en laboratoire peut se dégrader, voire devenir dangereuse en contexte de contact riche, une fois transposée sur un robot industriel réel sans traitement explicite du délai d'inférence, et qu'un simple étage d'ordonnancement temporel des actions, sans retouche de l'architecture ni ré-entraînement, suffit à corriger ce comportement.
L'étude part du constat que les robots industriels sont de plus en plus utilisés en construction et en fabrication avec des politiques apprises par imitation, généralement testées sur du matériel de laboratoire aux dynamiques plus rapides que les bras industriels réels. Contrairement aux annonces produit très médiatisées dans l'humanoïde, il s'agit ici d'une contribution de recherche méthodologique publiée en preprint, sans partenaire industriel ni calendrier de déploiement commercial mentionnés. La suite logique serait d'étendre ce cadre à d'autres tâches de manipulation à contacts riches et à des politiques VLA plus larges, afin de vérifier si la stratégie d'ordonnancement temporel se généralise au-delà du cas d'assemblage testé.
Dans nos dossiers




