RESETTLE : récupération robotique par recherche déclenchée par désaccord et contrôle correctif efficace
RESETTLE, un framework de récupération d'erreurs pour la manipulation robotique, est décrit dans un preprint arXiv (2610.12185) qui cible un problème concret des politiques robotiques gelées : corriger une dérive d'exécution sans payer la latence d'un raisonnement vision-langage répété ou d'une optimisation de trajectoire en ligne. Le système, indépendant du modèle de base, se greffe à l'interface d'exécution des actions. Il déclenche une récupération lorsque deux propositions d'action, échantillonnées indépendamment dans des conditions identiques, divergent de façon persistante. Il récupère alors une démonstration de référence pour la même tâche à l'aide d'un encodeur V-JEPA adapté. Il combine ensuite un a priori d'asservissement d'état et un résiduel visuel protégé pour exécuter une seule action corrective, avant de rendre la main à la politique de base. Les gains annoncés en simulation, sur six politiques de base, atteignent 8,70 points de succès absolus sur LIBERO-Plus, 6,28 sur Meta-World et 6,83 sur RoboCasa Tabletop. Des améliorations sont aussi rapportées sur quatre tâches réelles avec deux politiques. Avec QwenPI, la latence de surveillance et de récupération est inférieure de 74,04 % à 93,57 % à celle de la surveillance et de la planification de VoLoAgent pour les appels d'outils de saisie et de dépose. Le taux de succès de Harness VLA sur le test Swap de LIBERO-Pro passe de 42 % à 50 %.
L'intérêt pour l'industrie tient à la position choisie : la robustesse est traitée comme une couche externe, légère et réutilisable, sans réentraîner ni modifier la politique. Pour un intégrateur qui exploite déjà un VLA (modèle vision-langage-action) en production, cela évite de dépendre d'un modèle de raisonnement lourd à chaque anomalie, source de latence qui retarde l'intervention. Le désaccord entre deux échantillons de la politique sert de signal d'incertitude bon marché, sans capteur ni superviseur supplémentaire. La compatibilité avec une planification agentique de haut niveau, illustrée par le passage de 42 % à 50 % sur LIBERO-Pro Swap, suggère une brique complémentaire plutôt qu'un concurrent des architectures à base d'agents. Les réserves sont nettes. Les gains absolus restent modestes, entre 6 et 9 points en simulation. Les benchmarks sont connus et les quatre tâches réelles sont peu nombreuses. La comparaison de latence avec VoLoAgent porte sur des appels d'outils précis, pas sur le temps de cycle d'une tâche complète. Rien n'indique non plus un déploiement industriel. Il s'agit d'un résultat de recherche, pas d'un produit.
Le travail s'inscrit dans la montée des VLA généralistes et dans un constat désormais partagé : ces politiques échouent souvent par accumulation d'écarts, que l'imitation seule corrige mal. Les approches concurrentes de détection et de récupération reposent généralement sur des modèles vision-langage rappelés à chaque étape ou sur de la planification itérative, ce que RESETTLE cherche à éviter. Le choix de V-JEPA, une famille d'encodeurs vidéo à prédiction latente, reflète l'intérêt croissant pour les représentations de monde dans la robotique. Le code est publié sur GitHub par le laboratoire JIA-Lab. Les suites logiques seront des tests sur davantage de tâches physiques, des mesures de latence en boucle fermée sur matériel embarqué et une validation sur des cas de manipulation industrielle plus longs, où la récupération d'erreur conditionne la disponibilité réelle des systèmes.
Dans nos dossiers




