Aller au contenu principal
RecherchearXiv cs.RO 

Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2608.23224v1) documente un phénomène baptisé effondrement de forme du prompt dans le pilotage de robots par des modèles vision-langage-action (VLA). Ajouter du texte récupéré au prompt d'une politique VLA gelée, sans réentraînement, fait chuter le taux de réussite moyen de 92,47 % à 3,00 % sur 500 états testés, un ajout dénué de sens mais de longueur équivalente échouant tout aussi complètement. Les auteurs introduisent TOWN-VLA, une interface qui sépare la génération de texte candidat de l'autorisation de modifier l'entrée de la politique : une règle fixe n'autorise qu'une instruction compacte canonique, sinon le prompt original est restauré à l'identique, un contrat respecté sur les 900 routes auditées (525 restaurations vérifiées par empreinte, 375 prompts autorisés préservant la tâche). Sur l'évaluation LIBERO-Plus (grille 4x7, 10 030 épisodes par méthode), le taux de réussite passe de 69,5 % à 73,1 %, avec des gains sur les six axes de perturbation et les quatre suites testées. Sur un bras physique PiPER piloté par un checkpoint gelé du modèle π0.5, il grimpe de 52,7 % à 78,7 % sur 150 essais par méthode (p=3,16x10^-6).

Ce résultat vise une pratique répandue : l'augmentation par récupération de contexte sur un modèle gelé, sans réentraînement coûteux, est perçue comme un moyen sûr d'enrichir une politique VLA en production. Or un texte sémantiquement vide provoque le même échec total qu'un texte informatif, preuve que c'est la forme de l'instruction, et non son contenu, qui domine l'exécution, un angle mort pour les intégrateurs qui supposent qu'ajouter du contexte ne peut que rester neutre ou aider. Pour les décideurs évaluant des piles VLA prêtes à l'emploi, ce travail plaide pour une couche de contrôle d'autorité sur les prompts, séparée du modèle de génération, avant tout déploiement réel.

Le travail s'appuie sur un modèle gelé de la famille pi-zero (π0.5), développée par Physical Intelligence, ce qui positionne TOWN-VLA comme une couche de contrôle générique plutôt qu'un modèle concurrent d'architectures comme GR00T N2 de NVIDIA ou Helix de Figure AI. Les auteurs indiquent que la prochaine étape est une calibration d'admission sans oracle, signe que le système reste, à ce stade, un résultat de recherche audité en simulation et sur un bras robotique isolé, sans déploiement industriel ni pilote commercial annoncé.

À lire aussi

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force
1arXiv cs.RO 

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force

Une équipe de recherche a publié le 12 juin 2026 sur arXiv (référence 2606.10818) IMPACT, un framework d'apprentissage pour la manipulation robotique dite "forceful", c'est-à-dire impliquant des interactions physiques avec l'environnement : utilisation d'outils de masses variables, transport d'objets lourds, nettoyage de surface par contact prolongé. L'architecture découple le problème en deux blocs distincts : un planificateur de tâche de haut niveau, et un contrôleur prédictif basé sur un modèle interne (internal-model predictive control). Les expériences sont menées à la fois en simulation et sur robot réel, avec évaluation sur des objets non vus lors de l'entraînement. Les auteurs ne publient pas encore les métriques quantitatives précises dans l'abstract arXiv disponible, ce qui limite l'analyse indépendante à ce stade. Le verrou technique adressé est réel et sous-estimé dans les pipelines d'imitation learning actuels. Deux stratégies dominent aujourd'hui : la première laisse les forces émerger implicitement via les erreurs de suivi d'un contrôleur d'impédance, ce qui casse la généralisation dès que la masse de l'objet change ; la seconde commande explicitement les efforts via capteur force/couple ou capteur tactile au poignet, ce qui fonctionne mais alourdit l'intégration matérielle et fragilise les déploiements industriels. IMPACT propose une troisième voie en apprenant un modèle interne de la dynamique de contact, permettant au contrôleur prédictif d'anticiper les forces sans capteur dédié ni dégradation de généralisation. Les gains annoncés en taux de succès, sécurité et efficacité énergétique sont cohérents avec l'approche, mais restent à valider sur des benchmarks standardisés comme DROID ou RoboAgent. Ce travail s'inscrit dans un courant actif qui cherche à marier l'apprentissage par imitation avec les garanties du contrôle prédictif (MPC), après des travaux fondateurs comme ILC, DMP, et plus récemment les architectures VLA de type pi0 (Physical Intelligence) ou RoboDiff. Le problème de la manipulation forcée reste un angle mort des démos grand public, qui privilégient les tâches de pick-and-place sur objets légers. Les concurrents directs incluent les approches sim-to-real de CMU (DexVIP, ACT), d'ETH Zurich (ANYmal) et les travaux de Boston Dynamics Research sur la manipulation lourde. Côté européen, aucun acteur n'est directement cité, mais les travaux de Wandercraft et Enchanted Tools sur la dynamique de contact pourraient bénéficier de ce type de framework. La prochaine étape naturelle serait une validation sur manipulateurs industriels (UR, Franka) en conditions de production réelle.

RecherchePaper
1 source
CoWAM : contrats de coordination pour intervention sélective des politiques avec les WAM
2arXiv cs.RO 

CoWAM : contrats de coordination pour intervention sélective des politiques avec les WAM

Une équipe de recherche publie CoWAM, un article arXiv (2608.02578v1, soumission nouvelle, non encore validée par un comité de lecture) qui propose une couche de contrôle appelée "contrats de coordination" pour les politiques robotiques bimanuelles épaulées par des World Action Models (WAM), ces modèles qui prédisent un futur conditionné à l'action envisagée. Le principe: ne pas remplacer l'action nominale d'un bras robotique juste parce qu'une alternative prédite semble plausible, mais seulement si elle respecte toutes les obligations actives de synchronisation, de compatibilité des rôles et de convergence anti-collision, et apporte un gain net à faible risque. Si l'action nominale est elle-même jugée non admissible, le système bascule vers un repli d'abstention prédéfini plutôt que d'improviser. Sur huit tâches bimanuelles simulées, avec des pools de candidats identiques entre méthodes pour isoler la qualité du sélecteur de celle du générateur, CoWAM améliore la sélection valide de 16,7 points de pourcentage par rapport à une variante "contrats seuls", et augmente le taux de succès en boucle fermée de 9,6 points par rapport à la meilleure référence sélective existante, tout en maintenant les interventions dommageables sous 1%. L'enjeu dépasse la seule performance brute: pour les intégrateurs de robots à deux bras (logistique, assemblage, préparation de commandes), le vrai risque des WAM n'est pas de mal prédire, mais d'intervenir à tort sur une action déjà correcte parce qu'une alternative "a l'air" meilleure sur le papier. CoWAM répond directement à ce problème de sur-intervention, un frein connu à la mise en production des politiques génératives de type VLA (vision-langage-action) dans des contextes industriels où la sécurité et la prévisibilité priment sur la simple optimisation moyenne. Le travail s'inscrit dans la lignée des approches de contrôle sélectif conçues pour encadrer des générateurs d'actions puissants mais imprévisibles, dans un paysage où des modèles comme Pi-0, GR00T N2 ou Helix cherchent à généraliser le contrôle robotique à partir de grands modèles pré-entraînés. Les résultats restent pour l'instant cantonnés à la simulation; l'étape suivante, non abordée dans cet article, serait une validation sur du matériel physique bimanuel réel.

RecherchePaper
1 source
Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
3arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source
LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles
4arXiv cs.RO 

LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles

Les chercheurs à l'origine de LAMP (Latent Motion Prior-Guided Real-World Learning) proposent une méthode d'apprentissage en trois étapes pour piloter des mains robotiques dexterous directement dans le monde réel, sans passer par la simulation. Le système commence par pré-entraîner un module de "prior de mouvement latent", qui compresse l'historique récent des actions de la main en une représentation compacte et décodable en commandes exécutables à haute dimension. Une politique visuomotrice est ensuite entraînée pour prédire à la fois les commandes natives du bras et des corrections latentes pour la main, avant d'être affinée par apprentissage par renforcement (RL) résiduel en ligne, directement sur le robot physique. Testée sur quatre tâches réelles de manipulation dexterous, la méthode atteint un taux de réussite moyen de 56,25% après la seule phase d'imitation, porté à 98,75% après le RL en ligne, avec 100% de réussite sur trois des quatre tâches et 95% sur la dernière. L'enjeu dépasse la simple performance chiffrée: l'apprentissage de mains robotiques à haute dimensionnalité (nombreux degrés de liberté par doigt) est historiquement instable, car la moindre erreur d'imitation s'amplifie et pousse l'exploration par renforcement à casser le contact avec l'objet manipulé, un risque direct pour du matériel physique coûteux. En contraignant l'exploration RL à rester proche de mouvements démontrés et cohérents en termes de contact, plutôt que de perturber chaque articulation indépendamment, LAMP répond à un vrai goulot d'étranglement pour les intégrateurs qui veulent déployer de la manipulation fine (préhension d'objets fragiles, assemblage) sans multiplier les cycles de simulation coûteux ni les casses de vérins. Le travail s'inscrit dans la lignée des approches hybrides imitation + RL déjà explorées pour la robotique, mais cible spécifiquement l'espace d'action des mains dexterous, comparé ici à des interfaces d'action brutes, linéaires et discrètes, que LAMP surpasse selon les auteurs. Publié sur arXiv début juillet 2026, ce travail reste à ce stade une contribution de recherche académique, sans acteur industriel ni date de commercialisation annoncée; sa validation sur davantage de tâches et de plateformes matérielles reste l'étape logique suivante.

RecherchePaper
1 source