Aller au contenu principal
Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA
RecherchearXiv cs.RO 

Réfléchir uniquement quand c'est nécessaire : contrôle par autorité de prompt pour une intervention sélective en mode lent dans la manipulation VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2608.23224v1) documente un phénomène baptisé effondrement de forme du prompt dans le pilotage de robots par des modèles vision-langage-action (VLA). Ajouter du texte récupéré au prompt d'une politique VLA gelée, sans réentraînement, fait chuter le taux de réussite moyen de 92,47 % à 3,00 % sur 500 états testés, un ajout dénué de sens mais de longueur équivalente échouant tout aussi complètement. Les auteurs introduisent TOWN-VLA, une interface qui sépare la génération de texte candidat de l'autorisation de modifier l'entrée de la politique : une règle fixe n'autorise qu'une instruction compacte canonique, sinon le prompt original est restauré à l'identique, un contrat respecté sur les 900 routes auditées (525 restaurations vérifiées par empreinte, 375 prompts autorisés préservant la tâche). Sur l'évaluation LIBERO-Plus (grille 4x7, 10 030 épisodes par méthode), le taux de réussite passe de 69,5 % à 73,1 %, avec des gains sur les six axes de perturbation et les quatre suites testées. Sur un bras physique PiPER piloté par un checkpoint gelé du modèle π0.5, il grimpe de 52,7 % à 78,7 % sur 150 essais par méthode (p=3,16x10^-6).

Ce résultat vise une pratique répandue : l'augmentation par récupération de contexte sur un modèle gelé, sans réentraînement coûteux, est perçue comme un moyen sûr d'enrichir une politique VLA en production. Or un texte sémantiquement vide provoque le même échec total qu'un texte informatif, preuve que c'est la forme de l'instruction, et non son contenu, qui domine l'exécution, un angle mort pour les intégrateurs qui supposent qu'ajouter du contexte ne peut que rester neutre ou aider. Pour les décideurs évaluant des piles VLA prêtes à l'emploi, ce travail plaide pour une couche de contrôle d'autorité sur les prompts, séparée du modèle de génération, avant tout déploiement réel.

Le travail s'appuie sur un modèle gelé de la famille pi-zero (π0.5), développée par Physical Intelligence, ce qui positionne TOWN-VLA comme une couche de contrôle générique plutôt qu'un modèle concurrent d'architectures comme GR00T N2 de NVIDIA ou Helix de Figure AI. Les auteurs indiquent que la prochaine étape est une calibration d'admission sans oracle, signe que le système reste, à ce stade, un résultat de recherche audité en simulation et sur un bras robotique isolé, sans déploiement industriel ni pilote commercial annoncé.

À lire aussi

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
1arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source
IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force
2arXiv cs.RO 

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force

Une équipe de recherche a publié le 12 juin 2026 sur arXiv (référence 2606.10818) IMPACT, un framework d'apprentissage pour la manipulation robotique dite "forceful", c'est-à-dire impliquant des interactions physiques avec l'environnement : utilisation d'outils de masses variables, transport d'objets lourds, nettoyage de surface par contact prolongé. L'architecture découple le problème en deux blocs distincts : un planificateur de tâche de haut niveau, et un contrôleur prédictif basé sur un modèle interne (internal-model predictive control). Les expériences sont menées à la fois en simulation et sur robot réel, avec évaluation sur des objets non vus lors de l'entraînement. Les auteurs ne publient pas encore les métriques quantitatives précises dans l'abstract arXiv disponible, ce qui limite l'analyse indépendante à ce stade. Le verrou technique adressé est réel et sous-estimé dans les pipelines d'imitation learning actuels. Deux stratégies dominent aujourd'hui : la première laisse les forces émerger implicitement via les erreurs de suivi d'un contrôleur d'impédance, ce qui casse la généralisation dès que la masse de l'objet change ; la seconde commande explicitement les efforts via capteur force/couple ou capteur tactile au poignet, ce qui fonctionne mais alourdit l'intégration matérielle et fragilise les déploiements industriels. IMPACT propose une troisième voie en apprenant un modèle interne de la dynamique de contact, permettant au contrôleur prédictif d'anticiper les forces sans capteur dédié ni dégradation de généralisation. Les gains annoncés en taux de succès, sécurité et efficacité énergétique sont cohérents avec l'approche, mais restent à valider sur des benchmarks standardisés comme DROID ou RoboAgent. Ce travail s'inscrit dans un courant actif qui cherche à marier l'apprentissage par imitation avec les garanties du contrôle prédictif (MPC), après des travaux fondateurs comme ILC, DMP, et plus récemment les architectures VLA de type pi0 (Physical Intelligence) ou RoboDiff. Le problème de la manipulation forcée reste un angle mort des démos grand public, qui privilégient les tâches de pick-and-place sur objets légers. Les concurrents directs incluent les approches sim-to-real de CMU (DexVIP, ACT), d'ETH Zurich (ANYmal) et les travaux de Boston Dynamics Research sur la manipulation lourde. Côté européen, aucun acteur n'est directement cité, mais les travaux de Wandercraft et Enchanted Tools sur la dynamique de contact pourraient bénéficier de ce type de framework. La prochaine étape naturelle serait une validation sur manipulateurs industriels (UR, Franka) en conditions de production réelle.

RecherchePaper
1 source
CoWAM : contrats de coordination pour intervention sélective des politiques avec les WAM
3arXiv cs.RO 

CoWAM : contrats de coordination pour intervention sélective des politiques avec les WAM

Une équipe de recherche publie CoWAM, un article arXiv (2608.02578v1, soumission nouvelle, non encore validée par un comité de lecture) qui propose une couche de contrôle appelée "contrats de coordination" pour les politiques robotiques bimanuelles épaulées par des World Action Models (WAM), ces modèles qui prédisent un futur conditionné à l'action envisagée. Le principe: ne pas remplacer l'action nominale d'un bras robotique juste parce qu'une alternative prédite semble plausible, mais seulement si elle respecte toutes les obligations actives de synchronisation, de compatibilité des rôles et de convergence anti-collision, et apporte un gain net à faible risque. Si l'action nominale est elle-même jugée non admissible, le système bascule vers un repli d'abstention prédéfini plutôt que d'improviser. Sur huit tâches bimanuelles simulées, avec des pools de candidats identiques entre méthodes pour isoler la qualité du sélecteur de celle du générateur, CoWAM améliore la sélection valide de 16,7 points de pourcentage par rapport à une variante "contrats seuls", et augmente le taux de succès en boucle fermée de 9,6 points par rapport à la meilleure référence sélective existante, tout en maintenant les interventions dommageables sous 1%. L'enjeu dépasse la seule performance brute: pour les intégrateurs de robots à deux bras (logistique, assemblage, préparation de commandes), le vrai risque des WAM n'est pas de mal prédire, mais d'intervenir à tort sur une action déjà correcte parce qu'une alternative "a l'air" meilleure sur le papier. CoWAM répond directement à ce problème de sur-intervention, un frein connu à la mise en production des politiques génératives de type VLA (vision-langage-action) dans des contextes industriels où la sécurité et la prévisibilité priment sur la simple optimisation moyenne. Le travail s'inscrit dans la lignée des approches de contrôle sélectif conçues pour encadrer des générateurs d'actions puissants mais imprévisibles, dans un paysage où des modèles comme Pi-0, GR00T N2 ou Helix cherchent à généraliser le contrôle robotique à partir de grands modèles pré-entraînés. Les résultats restent pour l'instant cantonnés à la simulation; l'étape suivante, non abordée dans cet article, serait une validation sur du matériel physique bimanuel réel.

RecherchePaper
1 source
Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
4arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source