Aller au contenu principal
RecherchearXiv cs.RO 

Plans rapides, actions fidèles : combler l'écart entre planification et exécution dans les modèles VLA hiérarchiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.30833) une étude sur les systèmes hiérarchiques vision-langage-action (VLA), où un planificateur vision-langage pilote un module d'action bas niveau. Sur un pipeline de waypoints adapté du modèle Pi-0.5 de Physical Intelligence, le décodage token par token (Token-AR) du planificateur exige jusqu'à 57 passes du modèle vision-langage par plan, un coût incompatible avec le temps réel ; effacer les points d'arrivée des trajectoires ne dégrade quasiment pas le taux de réussite. La solution proposée, un décodage par blocs (Block-AR) combiné à une modulation d'objectif normalisée (NGM), fait tomber ce nombre de passes de 57 à 8 sur le benchmark LIBERO et divise par 8,7 la latence sur un robot bimanuel Rokae, tandis que le taux de réussite sur LIBERO-Long grimpe de 91,0% à 96,2% et la moyenne des quatre suites de 95,85% à 98,45%.

Ce travail met en lumière un angle mort des architectures VLA hiérarchiques, popularisées par des modèles comme GR00T N2 de NVIDIA ou Helix de Figure : la course actuelle privilégie les capacités du planificateur, alors que l'étude situe le véritable goulot d'étranglement dans l'articulation entre plan et exécution. Que des plans tronqués ou peu exploités n'affectent pas les performances contredit l'idée qu'une planification plus détaillée garantit plus de fiabilité. Pour les intégrateurs, la latence des VLM reste le principal frein à un déploiement en cadence réelle ; la diviser par plus de huit sans perte de précision, avec un gain de près de trois points sur les tâches longues, indique qu'un contrôle temps réel est atteignable sans sacrifier le raisonnement vision-langage.

Le pipeline de référence s'appuie sur Pi-0.5, le modèle VLA hiérarchique de Physical Intelligence, dont l'approche par waypoints s'inscrit dans le même courant que GR00T N2 (NVIDIA) ou Helix (Figure). Il s'agit d'une contribution de recherche algorithmique, validée en simulation sur LIBERO et testée sur un bras bimanuel Rokae, non d'un produit commercialisé ni d'un déploiement industriel. Sans calendrier d'intégration à une plateforme commerciale annoncé, la publication vise à documenter une méthode reproductible pour réduire le coût de calcul des VLA hiérarchiques tout en renforçant la fidélité entre plan et action, une piste que d'autres laboratoires travaillant sur des architectures similaires pourraient reprendre.

À lire aussi

3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D
1arXiv cs.RO 

3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D

Papier académique en robotique (VLA hiérarchique), pas de named companies commerciales ni d'acteur FR/EU à mettre en avant ici. Je rédige directement l'article. Des chercheurs du laboratoire DAVIAN Robotics présentent 3D HAMSTER, un nouveau framework pour les modèles Vision-Langage-Action (VLA) hiérarchiques utilisés en manipulation robotique, détaillé dans un preprint arXiv (2606.31329v1). Ces architectures séparent la planification de haut niveau, confiée à un modèle vision-langage (VLM), du contrôle bas niveau exécuté par une politique dédiée. Les approches récentes font produire au VLM des trajectoires 2D de l'effecteur terminal pour guider cette politique, mais les politiques de pointe travaillent en réalité dans un espace métrique 3D à partir de nuages de points. Faute de profondeur, chaque point de la trajectoire 2D doit hériter de la profondeur de la surface visible sous lui dans la scène, ce qui déforme géométriquement le chemin prédit. 3D HAMSTER corrige ce défaut en dotant le VLM d'un encodeur de profondeur dédié et d'un objectif de reconstruction dense de la profondeur, afin qu'il prédise directement des séquences de points de passage en 3D, ensuite injectées dans une politique bas niveau opérant sur nuages de points. Cette correction cible un goulot d'étranglement précis de la génération actuelle de VLA hiérarchiques: la conversion 2D vers 3D introduisait un bruit géométrique qui limitait la fiabilité des gestes de manipulation, en particulier lors de changements d'apparence de la scène ou de conditions inédites (langage, position spatiale, visuel). Sur les trois bancs d'essai testés (prédiction de trajectoire 3D, simulation, manipulation réelle), 3D HAMSTER dépasse à la fois des VLM propriétaires état de l'art et les méthodes concurrentes guidées en 2D, avec les écarts les plus marqués justement sur ces conditions de généralisation difficile. Ce résultat va dans le sens d'une hypothèse clé du secteur: une bonne partie de l'écart entre démonstrations en laboratoire et déploiement réel des robots manipulateurs tient moins à la politique de contrôle elle-même qu'à la qualité du signal de planification qui la guide. Le travail s'inscrit dans la lignée des architectures VLA hiérarchiques qui ont émergé ces deux dernières années pour améliorer la généralisation des robots manipulateurs, en s'appuyant sur des politiques bas niveau désormais matures en perception 3D par nuages de points. En comparant directement sa méthode à des VLM propriétaires non nommés publiquement dans le résumé, l'équipe positionne 3D HAMSTER comme une alternative open, avec une page projet dédiée (davian-robotics.github.io/3D_HAMSTER) où code et données devraient être publiés pour permettre une reproduction indépendante des résultats.

RechercheActu
1 source
Modèle du monde visuo-tactile FeelWorld pour la prédiction et la planification hiérarchiques du contact
2arXiv cs.RO 

Modèle du monde visuo-tactile FeelWorld pour la prédiction et la planification hiérarchiques du contact

FeelWorld est un nouveau modèle du monde visuo-tactile hiérarchique présenté dans un article arXiv (2607.24267v1) qui prédit conjointement les futurs visuels latents et trois états tactiles : l'état de contact, un latent tactile 3D encodant les informations de force, et l'état de glissement. Ces trois signaux sont produits par un modèle de dynamique latente partagé, entraîné avec une supervision explicite et un mécanisme d'attention asymétrique à porte de contact, qui maintient un chemin de prédiction purement visuel avant tout contact puis active la prédiction conjointe visuo-tactile une fois le contact établi. L'entraînement s'appuie sur des rollouts autorégressifs et une injection de bruit contextuel pour limiter l'accumulation d'erreurs. Sur trois tâches de manipulation, saisie de puces électroniques, saisie de fruits et insertion de connecteurs USB, FeelWorld réduit le LPIPS à 10 pas de 0,084 à 0,058 et reste 61% inférieur au LPIPS d'un modèle purement visuel après un rollout autorégressif de 80 pas. Couplé à un planificateur CEM sensible au contact, il atteint un taux de réussite moyen de 81,7% en planification zero-shot. L'apport principal tient au constat que les modèles du monde utilisés en robotique se limitent en général à la dynamique visuelle, ce qui peut générer des futurs imaginés plausibles à l'œil mais physiquement incohérents dès qu'il y a contact réel avec l'objet. Pour des tâches d'assemblage précis, de préhension d'objets fragiles ou d'insertion, cette lacune pèse directement sur la fiabilité du planning robotique. En intégrant le retour tactile directement dans la boucle de prédiction plutôt qu'en aval, FeelWorld cible un des points faibles connus des architectures VLA et des pipelines de planification par imagination, où l'écart entre démonstration visuelle et physique réelle reste un obstacle à la mise à l'échelle. Le travail s'inscrit dans la lignée des modèles du monde issus du RL basé sur modèle et des architectures récentes de prédiction visuelle, jusqu'ici quasi exclusivement centrées sur l'image. La détection tactile constituait jusque-là un axe de recherche largement séparé. Il s'agit ici d'une contribution académique, sans déploiement industriel annoncé ni acteur commercial identifié ; les suites naturelles concernent des tests sur du matériel physique équipé de capteurs tactiles et une intégration dans des piles de planification robotique plus larges.

RecherchePaper
1 source
Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action
3arXiv cs.RO 

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action

Des chercheurs présentent Hierarchical Skill Retrieval (HSR), un framework de récupération de démonstrations pour adapter plus efficacement les modèles Vision-Language-Action (VLA) à de nouvelles tâches de manipulation robotique avec peu de données spécifiques. Plutôt que de chercher des correspondances de tâches complètes, rares dans les jeux de données existants, HSR décompose une tâche cible en séquences de compétences candidates, évalue chaque plan selon sa plausibilité sémantique et la fiabilité des compétences estimée à partir du jeu de données préalable, puis combine récupération de langage au niveau sous-tâche et reclassement par caractéristiques comportementales pour sélectionner des démonstrations pertinentes et compatibles. La politique est ensuite adaptée via un pipeline en deux étapes séparant acquisition générale de compétences et finetuning spécifique à la tâche. Sur le benchmark LIBERO et sur plusieurs tâches de manipulation en conditions réelles, HSR améliore le taux de succès moyen de 10,3% et 21,3% respectivement par rapport à la meilleure méthode de référence. Vidéos et code sont disponibles sur le site du projet. Ce travail s'attaque à un problème très concret pour l'industrie robotique : les modèles VLA préentraînés sur de vastes jeux de données de démonstrations perdent en performance dès qu'on les confronte à des tâches nouvelles avec peu d'exemples, un frein majeur au déploiement rapide chez les intégrateurs. En structurant la récupération autour de compétences réutilisables plutôt que de tâches entières, HSR propose une piste pour réduire le coût de collecte de données lors du transfert vers de nouveaux environnements ou de nouvelles chaînes de production, un enjeu central pour quiconque cherche à industrialiser des bras robotiques ou des humanoïdes au-delà des démonstrations en laboratoire. Le gain plus marqué en conditions réelles (21,3%) qu'en simulation (10,3%) suggère que l'approche hiérarchique compense particulièrement bien le bruit et la variabilité du monde physique, un point souvent négligé par les méthodes de récupération fondées sur la seule similarité visuelle ou l'appariement de langage au niveau tâche. HSR s'inscrit dans la lignée des travaux récents sur l'adaptation efficace des modèles VLA de type Pi-0 ou GR00T, où la question centrale reste de savoir comment tirer parti de grands jeux de données hétérogènes sans réentraînement coûteux pour chaque nouvelle tâche. Les auteurs positionnent leur méthode par rapport aux approches de récupération existantes basées sur la similarité visuelle, les représentations état-action ou l'appariement de langage au niveau tâche, qu'ils jugent insuffisantes face à la structure hiérarchique des tâches de manipulation à long horizon. Le code et les vidéos de démonstration étant publiés en accès libre, la validation par la communauté sur d'autres benchmarks et plateformes robotiques déterminera si ces gains se généralisent au-delà de LIBERO et des tâches réelles testées par les auteurs.

RechercheOpinion
1 source
Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire
4arXiv cs.RO 

Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire

Des chercheurs publient sur arXiv (version 3, remplaçant une précédente) une méthode baptisée TASP (Task and Skill Planning), qui étend la planification hiérarchique de tâches et de mouvements (TAMP) pour intégrer des compétences robotiques hétérogènes déjà existantes : politiques apprises, contrôleurs à retour de force, et modules « boîte noire ». L'approche s'appuie sur les Composable Interaction Primitives (CIP) pour générer automatiquement des plans de mouvement de transition, en amont et en aval de chaque compétence, qui relient deux savoir-faire consécutifs entre eux. Ces primitives permettent d'ajuster la trajectoire aussi bien au moment de la planification qu'en cours d'exécution. Les auteurs valident leur système par des expériences réelles sur un manipulateur bimanuel et un manipulateur mobile, en résolvant des tâches longues et complexes, y compris des scénarios de manipulation mobile sur plusieurs pièces avec une structure de tâche non monotone, c'est-à-dire nécessitant de revenir en arrière ou de réordonner des sous-objectifs. L'intérêt pour l'industrie tient au fait que les méthodes TAMP classiques supposaient jusqu'ici que chaque action robotique se ramène à de la planification de mouvement cinématique pure, ce qui limitait leur usage aux tâches purement géométriques. En montrant qu'un planificateur hiérarchique peut combiner des compétences de nature très différente tout en conservant un raisonnement sur les échecs centré sur les objets, TASP ouvre une voie modulaire : un intégrateur peut assembler des politiques déjà entraînées séparément, sans devoir tout réentraîner dans un modèle unique. Cela nourrit le débat entre l'approche « tout-en-un » portée par les grands modèles vision-langage-action et une approche composite où des briques spécialisées restent pilotées par un planificateur symbolique classique, potentiellement plus robuste et plus facile à déboguer en environnement industriel. Ce travail s'inscrit dans une tendance récente de la recherche en robotique consistant à hybrider TAMP et contrôleurs en boucle fermée ou compétences apprises, plutôt que de s'en tenir à la planification de mouvement pure. Il se positionne en alternative modulaire face aux modèles génériques de type Pi-0, GR00T N2 ou Helix, qui visent au contraire une politique unique bout-en-bout. Il s'agit ici d'un article de recherche académique, sans annonce de produit commercial ni de calendrier de déploiement : les résultats montrent une faisabilité réelle sur deux plateformes robotiques distinctes, mais restent à ce stade du domaine expérimental plutôt qu'industriel.

RecherchePaper
1 source