Aller au contenu principal
AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés
RecherchearXiv cs.RO 

AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2603.15097) AeroGrab, un pipeline intégré pour la saisie aérienne en environnements encombrés. Le système prend en entrée une scène et une instruction en langage naturel, identifie l'objet cible, puis pilote un drone pour l'explorer activement afin d'obtenir de meilleures perspectives. Durant cette exploration, un réseau de génération de prises prédit plusieurs candidats de saisie à 6 degrés de liberté (6-DOF) par point de vue. Chaque candidat est évalué par un module de faisabilité tenant compte des collisions potentielles ; la meilleure prise globale est sélectionnée et exécutée via des méthodes standard de génération de trajectoire. Des expériences en conditions réelles encombrées démontrent une exécution robuste des saisies dans des scénarios non contrôlés.

L'apport principal réside dans l'intégration d'éléments jusqu'ici traités séparément : spécification de tâche par langage naturel, exploration active et sélection de prise tenant compte des collisions. Les pipelines de manipulation aérienne existants s'appuient généralement sur une saisie centroïde, approximation grossière qui échoue dès qu'un objet est partiellement occlus ou que l'environnement est dense. L'absence d'un système de bout en bout complet constituait un frein au déploiement opérationnel des drones manipulateurs, notamment en logistique, maintenance d'infrastructure ou intervention en zone difficile d'accès. AeroGrab représente une étape vers la fermeture du gap démo-terrain, sans que les métriques de robustesse soient détaillées dans l'abstract.

La manipulation aérienne est un champ de recherche actif, porté notamment par l'ETH Zurich, l'Université de Naples Federico II ou le LAAS-CNRS côté français, qui explore depuis plusieurs années les drones à bras articulés. La tendance est à l'intégration de modèles vision-langage (VLA) dans la boucle de contrôle, pour passer d'une programmation par coordonnées à une spécification sémantique. Les verrous industriels restent importants : robustesse aux perturbations dynamiques, charge utile réduite et certification réglementaire pour les vols en espace intérieur. La publication sur arXiv indique un stade de recherche ; aucun déploiement commercial ni partenariat industriel n'est annoncé.

Impact France/UE

Le LAAS-CNRS, laboratoire français reconnu dans la manipulation aérienne, évolue dans le même écosystème de recherche qu'AeroGrab, mais aucune implication directe d'institutions européennes n'est rapportée dans ce travail.

Dans nos dossiers

À lire aussi

Évolution antérieure et alignement de tâche pour la préhension aérienne
1arXiv cs.RO 

Évolution antérieure et alignement de tâche pour la préhension aérienne

Un article publié le 17 septembre 2026 sur arXiv (référence 2609.18153) détaille une nouvelle méthode pour la préhension aérienne, cette capacité qu'ont les rapaces à capturer une proie en vol grâce à des manœuvres hautement coordonnées. Les chercheurs partent d'un constat sur les approches existantes fondées sur l'optimisation de trajectoire: le problème mathématique posé est fortement non convexe et très sensible aux conditions initiales, ce qui rend difficile l'obtention de solutions de bonne qualité avec un budget de calcul limité, et les objectifs numériques utilisés jusqu'ici sont des abstractions conçues par des humains qui ne capturent pas forcément tout ce qui détermine la réussite réelle de la saisie. Leur réponse combine trois briques: un "prior" de trajectoire appris à partir de mouvements déjà optimisés, un processus d'évolution basé sur la méthode CEM (cross-entropy method) qui teste des points de départ échantillonnés avec l'optimiseur réellement utilisé et ne conserve que les meilleurs comme nouvelles données d'entraînement, et un "Execution-Aware Critic" qui apprend à partir des résultats de contact, de soulèvement de l'objet et de complétion de la tâche pour prédire si une trajectoire optimisée réussira une fois exécutée physiquement. Une fois entraîné et figé, ce critique fait aussi office de coût de préhension différentiable qui influence directement la génération de trajectoire. Les auteurs rapportent des essais en simulation et sur système réel montrant une meilleure fiabilité d'optimisation, plus de cohérence entre trajectoires et de meilleures performances de saisie. Pour l'industrie robotique, ce travail s'attaque à un verrou classique de la planification par optimisation: la dépendance à l'initialisation, qui oblige souvent à relancer le solveur de nombreuses fois ou à accepter des trajectoires sous-optimales sous contrainte de temps de calcul. En faisant apprendre au système ce qui distingue une trajectoire viable d'une trajectoire qui échouera à l'exécution, plutôt que de se fier uniquement à des critères mathématiques fixés a priori, l'approche illustre une tendance plus large du secteur: hybrider planification analytique classique et apprentissage à partir de données d'exécution réelle, au lieu d'opposer les deux paradigmes. Il faut toutefois noter que l'abstract ne fournit aucun chiffre de taux de réussite, de temps de cycle ni d'échelle de déploiement: il s'agit d'un travail de recherche en amont, validé en simulation et par des essais réels limités, pas d'un système prêt pour un déploiement industriel. Ce papier s'inscrit dans la lignée des travaux sur la manœuvrabilité agile des drones et la manipulation aérienne, un champ de recherche actif depuis plusieurs années autour de la génération de trajectoires pour capturer des objets en mouvement ou en position complexe. Aucune entreprise ni laboratoire n'est nommé dans le résumé, et aucun acteur français ou européen du secteur n'est mentionné dans cette publication. Les suites logiques d'un tel travail seraient une extension à des scénarios de préhension plus variés, des tests sur davantage de plateformes matérielles, et une comparaison directe avec d'autres méthodes d'optimisation de trajectoire pour la préhension aérienne, mais aucune de ces étapes n'est annoncée à ce stade.

RecherchePaper
1 source
Imaginer puis vérifier : perception active ciblée sur les affordances pour la préhension orientée tâche en environnement encombré
2arXiv cs.RO 

Imaginer puis vérifier : perception active ciblée sur les affordances pour la préhension orientée tâche en environnement encombré

Des chercheurs présentent ATAP (Affordance-Targeted Active Perception), un nouveau framework de perception active pour la préhension orientée tâche (task-oriented grasping, TOG) en scènes encombrées, détaillé dans un article arXiv (2609.23504v1) publié en septembre 2026. Le problème visé : un robot doit saisir la partie fonctionnelle d'un objet, par exemple l'anse d'une tasse pour verser plutôt que le corps de la tasse, mais cette zone d'affordance est souvent cachée par d'autres objets. Les méthodes existantes de planification de prochaine meilleure vue (next-best-view, NBV) optimisent le point de vue pour saisir l'objet dans son ensemble, sans distinguer la partie utile, ou scannent exhaustivement l'objet avant de prédire l'affordance, ce qui gaspille le budget de vues sur des surfaces non pertinentes. ATAP procède différemment : il hypothétise la géométrie occluse via un prior de forme génératif, prédit la distribution d'affordance sur cette surface imaginée, puis pilote la caméra avec un planificateur tenant compte de l'incertitude, qui arbitre entre réduction d'entropie sur les hypothèses concurrentes et gain de vérification par observation réelle, jusqu'à validation suffisante pour l'exécution de la prise. En simulation comme sur des scènes réelles encombrées, ATAP améliore sensiblement le taux de succès de préhension fonctionnelle par rapport à des baselines TOG à vue fixe, et réduit de plus de 57% le nombre d'étapes NBV nécessaires comparé aux approches de perception active basées sur la reconstruction complète de l'objet. Pour l'industrie robotique, ce travail attaque un goulot d'étranglement concret du bin picking et de la manipulation en environnement non structuré : l'occlusion partielle qui rend la localisation des zones de prise fonctionnelle ambiguë. En montrant qu'une vérification ciblée de l'affordance bat une reconstruction exhaustive, ATAP remet en cause l'hypothèse répandue selon laquelle il faut "tout voir" avant de décider où saisir, une piste utile pour réduire le temps de cycle des systèmes de manipulation en entrepôt ou en logistique. Ce résultat reste toutefois un travail de recherche évalué en simulation et en laboratoire, sans indication d'un partenaire industriel, d'un calendrier de transfert ou d'un déploiement en production. Il s'inscrit dans la lignée des travaux sur la perception active pilotée par NBV et sur le grasping conditionné par affordance, en concurrence directe avec les approches de reconstruction 3D complète avant planification de prise, sans qu'aucun acteur commercial ne soit associé à cette publication.

RecherchePaper
1 source
Raisonnement probabiliste calibré des obstructions par modèles vision-langage pour la préhension en environnement encombré
3arXiv cs.RO 

Raisonnement probabiliste calibré des obstructions par modèles vision-langage pour la préhension en environnement encombré

Un preprint publié sur arXiv (2609.18718v1) présente CPOR-Grasp, un système de raisonnement probabiliste calibré pour la préhension d'objets en environnement encombré. Face à une cible partiellement cachée, il doit choisir entre la saisir directement, retirer un objet qui la bloque, ou différer la décision. Plutôt que de figer une seule interprétation de la scène, CPOR-Grasp calibre et fusionne les signaux d'un modèle vision-langage, de la profondeur et de masques amodaux pour construire une distribution sur les graphes d'obstruction possibles, en ne gardant que les plus probables et en bornant mathématiquement la probabilité écartée. Sur le benchmark UNOBench, en scènes synthétiques et réelles, avec Gemini Robotics comme backbone VLM, l'erreur de calibration chute de 0,1416 à 0,0185, l'inférence tronquée égale l'inférence exacte sur 99,74% des décisions avec 56 fois moins de graphes, et le taux de réussite réel atteint 77,8%, devant les meilleures méthodes existantes. Le tri en entrepôt, le bin-picking industriel et les bras montés sur robots mobiles autonomes (AMR) butent régulièrement sur ce problème : les VLM utilisés pour interpréter une scène encombrée produisent des scores de confiance mal calibrés, souvent trop optimistes, et des relations d'obstruction incohérentes entre elles. Une décision fondée sur une seule hypothèse fausse entraîne casse, chute d'objet ou échec de tâche, ce qui pèse sur le taux de succès en production, loin des vidéos de démonstration sélectionnées. En rendant l'incertitude explicite et en autorisant l'ajournement d'une action plutôt que la décision forcée, CPOR-Grasp montre qu'un VLM commercial performant comme Gemini Robotics reste surconfiant sans calibration statistique dédiée, un point utile pour qui construit un pipeline de préhension autour d'un VLM générique. Ce travail s'inscrit dans la vague d'approches robotiques qui s'appuient sur des VLM préentraînés pour le raisonnement de haut niveau plutôt que sur des pipelines de perception spécialisés, dans la lignée de modèles vision-langage-action comme Pi-0 ou GR00T N2, davantage orientés vers l'exécution de bout en bout. UNOBench sert ici de banc d'essai dédié à la désobstruction avant saisie, un sous-problème distinct mais complémentaire de ces architectures généralistes. Publié comme contribution de recherche, sans partenariat industriel annoncé, CPOR-Grasp n'est comparé pour l'instant qu'à des bases de référence académiques ; une intégration sur bras robotique réel en entrepôt et une confrontation aux piles de préhension propriétaires du secteur restent les étapes suivantes attendues.

RecherchePaper
1 source
Planification de trajets robotiques adaptée à la congestion en environnements encombrés
4arXiv cs.RO 

Planification de trajets robotiques adaptée à la congestion en environnements encombrés

Des chercheurs ont publié sur arXiv (réf. 2606.19031, juin 2026) un planificateur de tournées probabiliste pour robots mobiles autonomes (AMR) en espaces publics encombrés. Le système vise à guider un robot de service, qu'il soit guide en centre commercial, livreur en entrepôt de préparation de commandes ou médiateur muséal, à travers une séquence de points de passage en tenant compte du comportement stochastique des foules. L'approche repose sur des cartes CLiFF (Circular Linear Flow Field), des modèles statistiques appris qui prédisent les trajectoires piétonnes à partir d'une observation initiale. Ces prédictions alimentent un processus de décision markovien (MDP) résolu en ligne, autorisant un recalcul d'itinéraire à chaque nouvelle observation de passants. La validation s'appuie sur un jeu de données réel collecté dans un centre commercial. Le problème est concret et régulièrement sous-estimé dans les déploiements AMR : les manoeuvres d'évitement de collision déclenchées par la présence humaine dégradent les temps de cycle de manière non linéaire, particulièrement dans les espaces à densité variable selon l'heure de la journée. Traiter la foule comme un processus stochastique temporel plutôt que comme un simple bruit à filtrer représente un changement d'approche pertinent pour les intégrateurs opérant en logistique retail ou en accueil public. La contribution d'ingénierie centrale est la replanification en ligne sans recalcul global du MDP, ce qui conditionne l'utilisabilité réelle en environnement dynamique. A noter : les métriques de performance (gains de temps de cycle, taux de succès de tournée) ne sont pas quantifiées dans le résumé publié, et l'évaluation reste limitée à un seul site, ce qui limite la généralisation des conclusions. Les cartes CLiFF constituent un cadre existant de modélisation des flux piétons, ici couplé pour la première fois à un MDP online dans un contexte de planification multi-points de passage. La navigation sociale est un champ de recherche actif depuis une décennie, avec des approches concurrentes basées sur les modèles de force sociale, le protocole ORCA, ou des méthodes d'apprentissage profond sur trajectoires piétonnes (GNN, Transformer). Ce travail reste au stade de preprint académique, sans partenaire industriel ni déploiement commercial annoncé. La prochaine étape logique serait une validation multi-sites et une comparaison quantitative directe avec ces méthodes concurrentes, en particulier sur des géométries d'espaces plus complexes et des horizons temporels plus longs.

RecherchePaper
1 source