Aller au contenu principal
RecherchearXiv cs.RO 

Des comportements VLA locaux du corps entier à la manipulation aérienne à l'échelle de la scène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un cadre unifié pour faire exécuter à des manipulateurs aériens articulés (UAM, pour uncrewed aerial manipulators) des missions de manipulation à l'échelle d'une scène entière, en s'appuyant sur des modèles vision-langage-action (VLA). La méthode repose sur trois briques. D'abord, un pipeline reconfigurable génère de manière synthétique des trajectoires cinématiquement et dynamiquement réalisables, avec des observations multivues synchronisées, ce qui évite toute démonstration physique sur la plateforme. Ensuite, un algorithme baptisé MPAR (measured-progress-aligned realization) recale les séquences d'actions renvoyées de façon asynchrone par le modèle sur la progression réellement mesurée de l'exécution, puis les convertit en trajectoires continues. Enfin, un graphe de scène relationnel associe les consignes en langage naturel à des instances d'objets et à des zones d'interaction praticables, tandis qu'un transfert guidé par la topologie relie les comportements locaux entre différents sites. En simulation, les compétences VLA locales réussissent 39 essais sur 60 (65,0 %), mais dans des conditions favorables : cible fournie par un oracle et transmission du contrôle jugée réalisable. Avec 500 ms de latence ajoutée, avec ou sans blocage transitoire des mises à jour de commande, MPAR réduit de 0,212 s l'erreur de phase médiane à la reprise de contrôle, par rapport à un alignement sur le temps nominal. Le système complet mène à bien 21 missions multisites simulées sur 50 (42,0 %) et a aussi été validé sur un UAM articulé réel, sans que le résumé ne détaille l'ampleur de cet essai.

L'intérêt tient à ce que le travail s'attaque à trois freins concrets du VLA appliqué à la robotique aérienne : le coût des démonstrations en corps entier, le décalage entre action et état causé par la latence, et la difficulté d'enchaîner des comportements d'un site à l'autre. Produire les données d'entraînement par synthèse, sans plateforme physique, réduit un goulot d'étranglement majeur, même si l'écart entre simulation et réalité reste à mesurer sur le matériel. Les chiffres appellent toutefois à la prudence : 42 % de réussite sur missions complètes simulées reste loin d'un niveau exploitable en inspection ou en maintenance, et le 65 % local est obtenu avec des aides oracle. Le message pour les intégrateurs est donc nuancé : la composition de compétences sur de longues missions fonctionne en principe, mais l'érosion du taux de succès d'une étape à l'autre demeure le verrou principal.

Ce travail s'inscrit dans la montée des modèles VLA, déjà largement testés sur bras fixes et humanoïdes, et dont l'extension aux drones manipulateurs articulés reste rare, car ces plateformes combinent dynamique de vol, bras mobile et latence de communication. Le résumé ne cite ni concurrents ni acteurs industriels, et aucun calendrier de déploiement n'est annoncé. Il s'agit d'une préimpression arXiv, non évaluée par les pairs. Les suites logiques seraient des essais physiques plus nombreux, la levée des hypothèses d'oracle et une comparaison avec d'autres approches de manipulation aérienne.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
1arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source
AeroManip-VLA : apprentissage vision-langage-action (VLA) à grande échelle pour la manipulation aérienne, avec des démonstrations générées par apprentissage par renforcement
2arXiv cs.RO 

AeroManip-VLA : apprentissage vision-langage-action (VLA) à grande échelle pour la manipulation aérienne, avec des démonstrations générées par apprentissage par renforcement

Des chercheurs publient sur arXiv (2609.36915v1) AeroManip-VLA, un benchmark pour générer des données d'entraînement et évaluer des modèles Vision-Language-Action (VLA) sur des manipulateurs aériens, c'est-à-dire des drones équipés de bras ou de préhenseurs. L'ensemble repose sur un simulateur accéléré par GPU, avec un contrôle bas niveau du vol et de la manipulation qui tient compte de la charge utile (payload), et sur des environnements massivement parallèles. Les démonstrations ne sont pas collectées par téléopération. Elles sont produites automatiquement en combinant des politiques d'apprentissage par renforcement réutilisables et des règles de tâche définies par des experts, avec des objets, des environnements et des conditions initiales randomisés. Le jeu de données couvre des compétences de base (saisir, déposer) et des tâches longues qui associent navigation et manipulation. Les auteurs ajoutent un étiquetage automatique des événements et une catégorisation des trajectoires pour filtrer les démonstrations. Plusieurs références d'imitation learning et de VLA sont évaluées selon différents réglages de tâche, avec une analyse de leurs performances et de leurs modes de défaillance. Le résumé ne donne aucun chiffre : ni taille du jeu de données, ni taux de réussite, ni nom des modèles testés. Aucun essai sur drone réel n'y est mentionné. L'intérêt tient à un verrou concret. Les VLA ont progressé sur les bras fixes et les humanoïdes, mais le drone manipulateur pose des problèmes propres : le vol et la manipulation sont fortement couplés, les observations changent en continu et les interactions physiques sont critiques pour la sécurité. Collecter des démonstrations ou tester des politiques directement sur des plateformes aériennes coûte cher, passe mal à l'échelle et se répète difficilement dans des conditions contrôlées. Un pipeline entièrement simulé, sans téléopérateur, vise à lever ce goulot. L'étiquetage des échecs liés à la sécurité (collisions, perte de stabilité) est utile aux intégrateurs, qui doivent qualifier un comportement avant de le déployer. La réserve est classique : tant que le transfert simulation-réel n'est pas démontré, la valeur du benchmark reste conditionnée à la fidélité de la simulation. Le résumé parle d'évaluation « avant déploiement réel », pas de déploiement réel. Ce travail s'inscrit dans la vague de recherche qui étend les VLA au-delà de la manipulation au sol, avec des jeux de données synthétiques générés par apprentissage par renforcement en substitut à la téléopération, démarche déjà répandue pour les bras et les humanoïdes. La manipulation aérienne intéresse l'inspection et la maintenance d'infrastructures en hauteur, où l'accès pour les robots au sol est difficile. Il s'agit d'une publication de recherche et non d'un produit : aucun partenaire industriel, calendrier de pilote ou prix n'est annoncé. La suite logique serait la publication du code et des données, puis des validations sur plateformes physiques. Ce sont elles qui diront si les écarts observés en simulation se retrouvent en vol.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
3arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier
4arXiv cs.RO 

Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier

Des chercheurs présentent, dans un article publié sur arXiv (référence 2609.30521, mis en ligne le 28 septembre 2026), un système de manipulation aérienne en extérieur combinant apprentissage par imitation, estimation d'état embarquée et commande prédictive corps entier. Une Diffusion Policy, entraînée à partir de démonstrations, génère les trajectoires souhaitées de l'effecteur terminal à partir des seules observations embarquées, que traduit ensuite un contrôleur MPC "whole-body" coordonnant conjointement la plateforme volante et le bras manipulateur. Pour s'affranchir des systèmes de capture de mouvement externes habituellement requis en intérieur, la localisation repose uniquement sur une odométrie LiDAR-inertielle embarquée. Le framework a été validé sur un manipulateur aérien physique, avec exécution réussie de tâches de manipulation en extérieur, en conditions non contrôlées. Cette démonstration s'attaque à un verrou classique: la plupart des systèmes de manipulation par drone publiés jusqu'ici dépendent de salles équipées de capture de mouvement (type Vicon ou OptiTrack), ce qui cantonne les résultats au laboratoire et limite leur pertinence pour l'inspection d'infrastructures, la maintenance en hauteur ou la préhension en extérieur. En couplant une politique apprise par imitation, dans l'esprit des approches VLA qui gagnent du terrain côté robots terrestres et humanoïdes, à une commande MPC robuste aux perturbations externes comme le vent, les auteurs apportent un indice supplémentaire que l'apprentissage par démonstration peut sortir du cadre contrôlé sans sacrifier la stabilité de vol. Pour les intégrateurs qui envisagent des drones manipulateurs industriels, le travail reste toutefois un prototype de recherche validé sur un nombre limité de tâches, pas un produit commercial. La manipulation aérienne est un champ de recherche actif depuis plusieurs années, mais la quasi-totalité des démonstrations publiées restait jusqu'ici confinée à des environnements intérieurs instrumentés. L'article s'inscrit dans une tendance plus large de transfert des politiques apprises par imitation, popularisées sur des bras fixes et des humanoïdes terrestres, vers des plateformes aériennes mobiles, où l'absence d'infrastructure de localisation et les perturbations externes compliquent fortement le problème. Aucune date de déploiement industriel ni partenariat commercial n'est mentionné: il s'agit d'un travail académique dont les auteurs indiquent vouloir étendre, à l'avenir, le nombre et la diversité des tâches testées en conditions réelles extérieures.

RecherchePaper
1 source