Aller au contenu principal
RecherchearXiv cs.RO 

La réussite suffit-elle ? Effet des perturbations d'entrée sur le comportement des VLA dans des tâches de manipulation sur table

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude publiée sur arXiv (2610.01351) propose un cadre d'évaluation indépendant des benchmarks pour mesurer la robustesse comportementale des modèles Vision-Language-Action (VLA), au-delà du seul taux de réussite des tâches (TSR). Les auteurs l'implémentent en étendant LIBERO et LIBERO-Plus, deux benchmarks de manipulation sur table très utilisés. Le protocole couvre trois VLA de pointe, quatre suites de tâches LIBERO et sept conditions de perturbation des entrées. Il ne s'intéresse qu'aux trajectoires réussies. Pour chacune, il mesure la fluidité du mouvement, l'efficacité et le comportement de la pince, ainsi que la variabilité de ces indicateurs. Le résultat central est que les perturbations modifient la façon dont les trajectoires réussies sont exécutées, un effet que le TSR ne permet pas de déduire. Dans plusieurs suites, des modèles obtiennent un TSR comparable sous la même perturbation alors que leur comportement diverge nettement. Il s'agit d'un travail de recherche, sans produit ni déploiement associé. Les noms des trois modèles testés ne figurent pas dans le résumé.

Ce travail touche un point faible de l'évaluation des VLA. Un robot qui réussit sa tâche par des mouvements saccadés, des trajectoires allongées ou des ouvertures et fermetures de pince erratiques consomme plus de temps de cycle, use davantage la mécanique et présente plus de risques en environnement partagé. Pour un intégrateur ou un COO industriel, deux modèles affichant le même score sur un benchmark ne sont donc pas interchangeables. L'étude nuance aussi la lecture des classements de robustesse. Elle suggère qu'une partie de l'écart entre démonstration et réalité se cache dans la qualité d'exécution, que les métriques binaires ne voient pas.

LIBERO est devenu l'un des terrains d'évaluation de référence pour les VLA, avec des scores de réussite proches de la saturation pour les meilleurs modèles. Cette saturation a motivé des extensions comme LIBERO-Plus, qui introduit des perturbations. Le papier prolonge cette tendance en passant de « le modèle réussit-il sous perturbation ? » à « comment réussit-il ? ». Les auteurs recommandent de compléter le TSR par des métriques comportementales, sans prétendre le remplacer. Il reste à voir si ces métriques seront adoptées par les concepteurs de benchmarks et validées sur des robots réels. L'étude se limite à la manipulation sur table en simulation.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Au-delà de la réussite des tâches : diagnostics comportementaux et représentationnels pour WAM et VLA
1arXiv cs.RO 

Au-delà de la réussite des tâches : diagnostics comportementaux et représentationnels pour WAM et VLA

Une équipe de chercheurs a publié début juin 2026 sur arXiv (2606.01095) un cadre diagnostique pour comparer deux grandes familles de politiques robotiques : les Vision-Language-Action (VLA) et les World-Action Models (WAM). La question posée est directe : la prédiction du futur, propre aux WAM, produit-elle des comportements réellement différents, ou n'ajoute-t-elle que du calcul superflu ? Les auteurs ont évalué sept politiques (VLA directes et WAM en configurations jointes, séquentielles et auxiliaires) sur les benchmarks LIBERO et RoboTwin2.0. Le protocole combine une analyse comportementale (cohérence des dynamiques d'action, progression vers l'objet cible, perturbations par distracteurs, coût d'inférence) et une analyse des représentations internes via des autoencodeurs épars, classifiant chaque représentation comme mémorisée, réactive ou prédictive. Les résultats contredisent l'usage courant du taux de réussite comme seul critère de comparaison : cette métrique masque des différences architecturales substantielles. Les WAM améliorent souvent le comportement au niveau objet et la sélectivité vers la cible, mais ces gains varient selon l'architecture et s'accompagnent d'un surcoût d'inférence. Les WAM séquentiels exhibent la structure prédictive la plus nette et la plus exploitable pour le contrôle. Les WAM auxiliaires compriment l'information future, les WAM joints l'enchevêtrent avec d'autres représentations, dans les deux cas, elle devient moins actionnable. Pour un intégrateur ou une équipe R&D, ce résultat est concret : un benchmark de succès seul ne suffit pas pour choisir une architecture, il faut auditer comportement et représentations internes. Les VLA, portées par Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA, ont prouvé leur robustesse croissante en sim-to-real mais restent aveugles aux états futurs de la scène. Les WAM, inspirés des architectures world-model comme Dreamer ou RSSM, visent à combler ce gap en intégrant une prédiction explicite du monde. Ce travail s'inscrit dans un courant académique cherchant à dépasser les métriques de surface : le cadre proposé est agnostique au modèle, applicable à d'autres politiques, et oriente les prochains travaux vers des architectures WAM qui préservent des représentations futures actionnables plutôt que de les noyer dans la capacité globale du réseau.

RechercheOpinion
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
2arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
Des comportements VLA locaux du corps entier à la manipulation aérienne à l'échelle de la scène
3arXiv cs.RO 

Des comportements VLA locaux du corps entier à la manipulation aérienne à l'échelle de la scène

Des chercheurs proposent un cadre unifié pour faire exécuter à des manipulateurs aériens articulés (UAM, pour uncrewed aerial manipulators) des missions de manipulation à l'échelle d'une scène entière, en s'appuyant sur des modèles vision-langage-action (VLA). La méthode repose sur trois briques. D'abord, un pipeline reconfigurable génère de manière synthétique des trajectoires cinématiquement et dynamiquement réalisables, avec des observations multivues synchronisées, ce qui évite toute démonstration physique sur la plateforme. Ensuite, un algorithme baptisé MPAR (measured-progress-aligned realization) recale les séquences d'actions renvoyées de façon asynchrone par le modèle sur la progression réellement mesurée de l'exécution, puis les convertit en trajectoires continues. Enfin, un graphe de scène relationnel associe les consignes en langage naturel à des instances d'objets et à des zones d'interaction praticables, tandis qu'un transfert guidé par la topologie relie les comportements locaux entre différents sites. En simulation, les compétences VLA locales réussissent 39 essais sur 60 (65,0 %), mais dans des conditions favorables : cible fournie par un oracle et transmission du contrôle jugée réalisable. Avec 500 ms de latence ajoutée, avec ou sans blocage transitoire des mises à jour de commande, MPAR réduit de 0,212 s l'erreur de phase médiane à la reprise de contrôle, par rapport à un alignement sur le temps nominal. Le système complet mène à bien 21 missions multisites simulées sur 50 (42,0 %) et a aussi été validé sur un UAM articulé réel, sans que le résumé ne détaille l'ampleur de cet essai. L'intérêt tient à ce que le travail s'attaque à trois freins concrets du VLA appliqué à la robotique aérienne : le coût des démonstrations en corps entier, le décalage entre action et état causé par la latence, et la difficulté d'enchaîner des comportements d'un site à l'autre. Produire les données d'entraînement par synthèse, sans plateforme physique, réduit un goulot d'étranglement majeur, même si l'écart entre simulation et réalité reste à mesurer sur le matériel. Les chiffres appellent toutefois à la prudence : 42 % de réussite sur missions complètes simulées reste loin d'un niveau exploitable en inspection ou en maintenance, et le 65 % local est obtenu avec des aides oracle. Le message pour les intégrateurs est donc nuancé : la composition de compétences sur de longues missions fonctionne en principe, mais l'érosion du taux de succès d'une étape à l'autre demeure le verrou principal. Ce travail s'inscrit dans la montée des modèles VLA, déjà largement testés sur bras fixes et humanoïdes, et dont l'extension aux drones manipulateurs articulés reste rare, car ces plateformes combinent dynamique de vol, bras mobile et latence de communication. Le résumé ne cite ni concurrents ni acteurs industriels, et aucun calendrier de déploiement n'est annoncé. Il s'agit d'une préimpression arXiv, non évaluée par les pairs. Les suites logiques seraient des essais physiques plus nombreux, la levée des hypothèses d'oracle et une comparaison avec d'autres approches de manipulation aérienne.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
4arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source