Aller au contenu principal
RecherchearXiv cs.RO 

Préhension et levage aérien du corps entier à partir d'observations visuelles partielles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.00404) un cadre d'apprentissage permettant à un drone équipé d'un bras manipulateur et d'une pince de saisir puis soulever un objet à partir d'observations visuelles partielles. Une seule politique, entraînée entièrement en simulation, pilote simultanément le vol, le mouvement du bras et la fermeture de la pince, sans signal explicite de phase de tâche (approche, acquisition, levage). L'architecture repose sur un duo enseignant-élève récurrent. L'enseignant, doté d'informations privilégiées sur la cible, apprend par renforcement avec un curriculum d'états critiques. Celui-ci expose d'abord les phases d'acquisition et de levage, puis les raccorde aux trajectoires d'approche normales. L'élève visuel récurrent, auquel l'enseignant est distillé, remplace ces informations privilégiées par des nuages de points issus de deux vues et par la proprioception, et intègre l'historique des observations. Un objectif dédié à la fermeture supervise le moment de saisie à partir de séquences prolongées où la préparation est jugée atteinte par le modèle. Sur 8 996 épisodes simulés, l'élève figé atteint 99,97 % de succès sur la tâche complète en conditions nominales, 97,14 % avec physique et contrôle randomisés, et 95,84 % avec en plus des caméras randomisées. L'erreur d'alignement à l'acquisition (90e centile, moyenne pondérée par le nombre de verrouillages) est de 8,12 mm en nominal.

Pour l'industrie, ce travail s'attaque à un verrou connu de la manipulation aérienne : l'enchaînement d'une approche, d'une saisie et d'un levage alors que la cible entre et sort du champ de vision. Le curriculum répond à un problème d'entraînement concret, car les échecs précoces d'approche privent la politique d'exemples des étapes tardives. La distillation vers une politique purement visuelle suggère une voie crédible pour des drones d'inspection, de logistique ou de maintenance en hauteur. Les chiffres demandent toutefois de la prudence. Ils proviennent d'un modèle simulé de saisie : verrouillage déclenché par condition, attachement virtuel et charge appliquée par torseur (wrench) pour de courts levages. Cela ne reproduit ni le contact réel, ni la dynamique du transport, ni le bruit des capteurs. Aucun essai sur matériel n'est mentionné dans le résumé, et le transfert sim-to-real reste donc à démontrer. La baisse d'environ 4 points sous randomisation des caméras indique déjà une sensibilité résiduelle aux perturbations de perception.

Ce travail s'inscrit dans la lignée de la manipulation aérienne, longtemps dominée par des contrôleurs classiques ou des pipelines modulaires séparant perception, planification et préhension. Il applique à ce domaine des recettes de l'apprentissage par renforcement et de l'imitation issues de la robotique au sol, comme l'enseignant privilégié et l'élève visuel. Le résumé ne cite ni entreprise ni acteur européen, et ne annonce aucun pilote ni calendrier. La prochaine étape logique est une validation sur drone réel, avec un contact physique, des charges plus lourdes et des distances de levage plus longues.

Dans nos dossiers

À lire aussi

Vision-TL-Action : génération neuro-symbolique de trajectoires à partir d'observations visuelles et de logique temporelle
1arXiv cs.RO 

Vision-TL-Action : génération neuro-symbolique de trajectoires à partir d'observations visuelles et de logique temporelle

Des chercheurs présentent Vision-TL-Action, une architecture neuro-symbolique qui génère des trajectoires robotiques directement à partir d'images multi-vues, d'un graphe de logique temporelle (TL) sans coordonnées explicites, et de l'état initial du robot, sans avoir besoin de la géométrie exacte des objets au moment de l'inférence. Les tokens représentant les nœuds de logique temporelle et les tokens visuels spatiaux sont fusionnés par attention croisée bidirectionnelle, et cette représentation conditionne un générateur de trajectoires par flow matching. Les tokens visuels ne sont enrichis que de coordonnées normalisées dans le plan image et d'identifiants de caméra, tandis qu'un objectif d'ancrage prédicat-région, utilisé seulement à l'entraînement, aide le modèle à relier les prédicats logiques aux objets référencés. Évalué avec la métrique Success@K (proportion de tâches réussies par au moins une trajectoire parmi K échantillonnées), le modèle atteint 67,45% de Success@1024 sur une tâche de manipulation avec bras Panda, contre 59,11% pour une référence "oracle" disposant de l'état géométrique exact. Sur une tâche de navigation AntMaze, il obtient 96,35% de Success@256, proche des 96,88% de l'oracle. Le code est publié sur GitHub (AricLau07/vision-tl-action). L'intérêt tient au problème que ce travail contourne: les générateurs de trajectoires conditionnés par logique temporelle encodent généralement la géométrie exacte des objets dans le graphe de tâche, ce qui suppose une reconstruction 3D précise en amont, coûteuse et fragile en conditions réelles. Ici, un ancrage purement 2D dans le plan image suffit à égaler, voire dépasser, une référence disposant d'un accès privilégié à l'état du monde. Pour les intégrateurs qui conçoivent des systèmes de manipulation à partir de spécifications de tâches formelles, cela suggère qu'un pipeline vision-langage-action peut se passer d'une chaîne de perception 3D complète. À noter: ces résultats restent obtenus en simulation, sur des bancs d'essai standards (Panda, AntMaze), sans validation sur robot physique où le bruit de perception, les occlusions et les erreurs de calibration compliquent généralement ce type d'approche. Ce travail s'inscrit dans le rapprochement croissant entre logique temporelle, utilisée de longue date en planification et vérification formelle, et les générateurs de trajectoires par flow matching ou diffusion qui sous-tendent des modèles vision-langage-action comme Pi-0, GR00T ou Helix. Les auteurs situent explicitement leur contribution par rapport aux méthodes existantes qui esquivent le problème de liaison perception-symbole en s'appuyant sur une géométrie exacte. Leurs études de résolution et d'intervention montrent que la finesse de l'ancrage spatial dépend du contenu sémantique et que l'identité du prédicat influence à la fois l'attention et la performance, ouvrant la voie à des travaux futurs sur des scènes multi-objets plus complexes et une validation sur robot réel.

RecherchePaper
1 source
Complétion de scène 3D orientée planification : représentation couplée TUDF et occupation apprise à partir d'observations partielles
2arXiv cs.RO 

Complétion de scène 3D orientée planification : représentation couplée TUDF et occupation apprise à partir d'observations partielles

Des chercheurs proposent, dans un préprint arXiv (2609.36543v1), un réseau de complétion de scène 3D conçu explicitement pour la planification de trajectoire, à partir d'observations LiDAR partielles. Le système prédit conjointement deux représentations : un champ de distance non signé tronqué (TUDF, Truncated Unsigned Distance Field), qui donne une géométrie continue, et une carte d'occupation par voxels. Un schéma d'apprentissage à couplage bidirectionnel les relie. Les caractéristiques TUDF apportent un guidage géométrique dense pour reconstruire l'occupation. En retour, les caractéristiques d'occupation imposent des contraintes structurelles qui affinent l'estimation du champ de distance. Le réseau sort directement l'occupation complète et le TUDF, et ce dernier s'intègre à la planification de trajectoire sans post-traitement. Les auteurs annoncent des gains à la fois en qualité de reconstruction géométrique et en performance de planification sur des environnements jamais vus à l'entraînement. Le résumé ne donne ni chiffres, ni jeux de données, ni comparaison chiffrée avec des méthodes existantes. L'enjeu est d'abord de méthode. La plupart des travaux de complétion de scène se jugent sur la fidélité de la reconstruction (IoU, erreur géométrique), sans mesurer ce que la carte complétée change pour le robot. Ici, la complétion est évaluée sur son effet en aval, la planification. C'est l'angle qui compte pour un intégrateur de robots mobiles (AMR, véhicules autonomes, robots d'inspection) : en zone occultée, une grille d'occupation binaire dit peu sur la distance aux obstacles, alors que les planificateurs (optimisation de trajectoire, fonctions de coût de type ESDF) en ont besoin. Fournir cette information directement, sans étape de conversion, peut réduire la latence et les erreurs de chaîne. La généralisation à des environnements inédits est le bon test, mais un préprint sans chiffres publiés dans le résumé ne permet pas de savoir si les gains sont marginaux ou décisifs, ni s'ils tiennent hors simulation ou hors jeux de données académiques. Rien n'indique non plus de tests sur robot réel, de temps d'inférence embarqué ou de contraintes de calcul. Ce travail s'inscrit dans la lignée des méthodes de complétion sémantique de scène et de prédiction d'occupation, issues de la conduite autonome, et des représentations par champs de distance (SDF, TSDF, ESDF), historiquement utilisées en cartographie et en planification. Il s'agit d'un préprint non évalué par des pairs, et aucune entreprise, aucun produit ni calendrier de déploiement n'est annoncé. La suite logique serait la publication du code et des benchmarks, une comparaison avec les approches d'occupation actuelles, puis une validation sur plateformes réelles. C'est à ces étapes que l'on pourra juger si le couplage TUDF-occupation apporte un vrai bénéfice à la navigation en environnement partiellement observé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier
3arXiv cs.RO 

Manipulation aérienne en conditions réelles : perception embarquée, apprentissage de politiques et contrôle du corps entier

Des chercheurs présentent, dans un article publié sur arXiv (référence 2609.30521, mis en ligne le 28 septembre 2026), un système de manipulation aérienne en extérieur combinant apprentissage par imitation, estimation d'état embarquée et commande prédictive corps entier. Une Diffusion Policy, entraînée à partir de démonstrations, génère les trajectoires souhaitées de l'effecteur terminal à partir des seules observations embarquées, que traduit ensuite un contrôleur MPC "whole-body" coordonnant conjointement la plateforme volante et le bras manipulateur. Pour s'affranchir des systèmes de capture de mouvement externes habituellement requis en intérieur, la localisation repose uniquement sur une odométrie LiDAR-inertielle embarquée. Le framework a été validé sur un manipulateur aérien physique, avec exécution réussie de tâches de manipulation en extérieur, en conditions non contrôlées. Cette démonstration s'attaque à un verrou classique: la plupart des systèmes de manipulation par drone publiés jusqu'ici dépendent de salles équipées de capture de mouvement (type Vicon ou OptiTrack), ce qui cantonne les résultats au laboratoire et limite leur pertinence pour l'inspection d'infrastructures, la maintenance en hauteur ou la préhension en extérieur. En couplant une politique apprise par imitation, dans l'esprit des approches VLA qui gagnent du terrain côté robots terrestres et humanoïdes, à une commande MPC robuste aux perturbations externes comme le vent, les auteurs apportent un indice supplémentaire que l'apprentissage par démonstration peut sortir du cadre contrôlé sans sacrifier la stabilité de vol. Pour les intégrateurs qui envisagent des drones manipulateurs industriels, le travail reste toutefois un prototype de recherche validé sur un nombre limité de tâches, pas un produit commercial. La manipulation aérienne est un champ de recherche actif depuis plusieurs années, mais la quasi-totalité des démonstrations publiées restait jusqu'ici confinée à des environnements intérieurs instrumentés. L'article s'inscrit dans une tendance plus large de transfert des politiques apprises par imitation, popularisées sur des bras fixes et des humanoïdes terrestres, vers des plateformes aériennes mobiles, où l'absence d'infrastructure de localisation et les perturbations externes compliquent fortement le problème. Aucune date de déploiement industriel ni partenariat commercial n'est mentionné: il s'agit d'un travail académique dont les auteurs indiquent vouloir étendre, à l'avenir, le nombre et la diversité des tâches testées en conditions réelles extérieures.

RecherchePaper
1 source
Des comportements VLA locaux du corps entier à la manipulation aérienne à l'échelle de la scène
4arXiv cs.RO 

Des comportements VLA locaux du corps entier à la manipulation aérienne à l'échelle de la scène

Des chercheurs proposent un cadre unifié pour faire exécuter à des manipulateurs aériens articulés (UAM, pour uncrewed aerial manipulators) des missions de manipulation à l'échelle d'une scène entière, en s'appuyant sur des modèles vision-langage-action (VLA). La méthode repose sur trois briques. D'abord, un pipeline reconfigurable génère de manière synthétique des trajectoires cinématiquement et dynamiquement réalisables, avec des observations multivues synchronisées, ce qui évite toute démonstration physique sur la plateforme. Ensuite, un algorithme baptisé MPAR (measured-progress-aligned realization) recale les séquences d'actions renvoyées de façon asynchrone par le modèle sur la progression réellement mesurée de l'exécution, puis les convertit en trajectoires continues. Enfin, un graphe de scène relationnel associe les consignes en langage naturel à des instances d'objets et à des zones d'interaction praticables, tandis qu'un transfert guidé par la topologie relie les comportements locaux entre différents sites. En simulation, les compétences VLA locales réussissent 39 essais sur 60 (65,0 %), mais dans des conditions favorables : cible fournie par un oracle et transmission du contrôle jugée réalisable. Avec 500 ms de latence ajoutée, avec ou sans blocage transitoire des mises à jour de commande, MPAR réduit de 0,212 s l'erreur de phase médiane à la reprise de contrôle, par rapport à un alignement sur le temps nominal. Le système complet mène à bien 21 missions multisites simulées sur 50 (42,0 %) et a aussi été validé sur un UAM articulé réel, sans que le résumé ne détaille l'ampleur de cet essai. L'intérêt tient à ce que le travail s'attaque à trois freins concrets du VLA appliqué à la robotique aérienne : le coût des démonstrations en corps entier, le décalage entre action et état causé par la latence, et la difficulté d'enchaîner des comportements d'un site à l'autre. Produire les données d'entraînement par synthèse, sans plateforme physique, réduit un goulot d'étranglement majeur, même si l'écart entre simulation et réalité reste à mesurer sur le matériel. Les chiffres appellent toutefois à la prudence : 42 % de réussite sur missions complètes simulées reste loin d'un niveau exploitable en inspection ou en maintenance, et le 65 % local est obtenu avec des aides oracle. Le message pour les intégrateurs est donc nuancé : la composition de compétences sur de longues missions fonctionne en principe, mais l'érosion du taux de succès d'une étape à l'autre demeure le verrou principal. Ce travail s'inscrit dans la montée des modèles VLA, déjà largement testés sur bras fixes et humanoïdes, et dont l'extension aux drones manipulateurs articulés reste rare, car ces plateformes combinent dynamique de vol, bras mobile et latence de communication. Le résumé ne cite ni concurrents ni acteurs industriels, et aucun calendrier de déploiement n'est annoncé. Il s'agit d'une préimpression arXiv, non évaluée par les pairs. Les suites logiques seraient des essais physiques plus nombreux, la levée des hypothèses d'oracle et une comparaison avec d'autres approches de manipulation aérienne.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source