Aller au contenu principal
RecherchearXiv cs.RO 

Imaginer puis vérifier : perception active ciblée sur les affordances pour la préhension orientée tâche en environnement encombré

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ATAP (Affordance-Targeted Active Perception), un nouveau framework de perception active pour la préhension orientée tâche (task-oriented grasping, TOG) en scènes encombrées, détaillé dans un article arXiv (2609.23504v1) publié en septembre 2026. Le problème visé : un robot doit saisir la partie fonctionnelle d'un objet, par exemple l'anse d'une tasse pour verser plutôt que le corps de la tasse, mais cette zone d'affordance est souvent cachée par d'autres objets. Les méthodes existantes de planification de prochaine meilleure vue (next-best-view, NBV) optimisent le point de vue pour saisir l'objet dans son ensemble, sans distinguer la partie utile, ou scannent exhaustivement l'objet avant de prédire l'affordance, ce qui gaspille le budget de vues sur des surfaces non pertinentes. ATAP procède différemment : il hypothétise la géométrie occluse via un prior de forme génératif, prédit la distribution d'affordance sur cette surface imaginée, puis pilote la caméra avec un planificateur tenant compte de l'incertitude, qui arbitre entre réduction d'entropie sur les hypothèses concurrentes et gain de vérification par observation réelle, jusqu'à validation suffisante pour l'exécution de la prise. En simulation comme sur des scènes réelles encombrées, ATAP améliore sensiblement le taux de succès de préhension fonctionnelle par rapport à des baselines TOG à vue fixe, et réduit de plus de 57% le nombre d'étapes NBV nécessaires comparé aux approches de perception active basées sur la reconstruction complète de l'objet.

Pour l'industrie robotique, ce travail attaque un goulot d'étranglement concret du bin picking et de la manipulation en environnement non structuré : l'occlusion partielle qui rend la localisation des zones de prise fonctionnelle ambiguë. En montrant qu'une vérification ciblée de l'affordance bat une reconstruction exhaustive, ATAP remet en cause l'hypothèse répandue selon laquelle il faut "tout voir" avant de décider où saisir, une piste utile pour réduire le temps de cycle des systèmes de manipulation en entrepôt ou en logistique.

Ce résultat reste toutefois un travail de recherche évalué en simulation et en laboratoire, sans indication d'un partenaire industriel, d'un calendrier de transfert ou d'un déploiement en production. Il s'inscrit dans la lignée des travaux sur la perception active pilotée par NBV et sur le grasping conditionné par affordance, en concurrence directe avec les approches de reconstruction 3D complète avant planification de prise, sans qu'aucun acteur commercial ne soit associé à cette publication.

Dans nos dossiers

À lire aussi

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré
1arXiv cs.RO 

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré

VulcanVoxel, un nouveau système de perception robotique présenté dans un article publié le 2 juillet sur arXiv (2607.02549), résout un problème concret de la logistique automatisée : comment une lame robotique doit-elle balayer des articles entassés dans des bacs en tissu pour créer un espace d'insertion, lors des opérations de stowing (rangement) en entrepôt. Plutôt que de prédire une pose unique pour la lame comme le font les approches classiques, le système reconstruit un champ d'occupation 3D voxel par voxel via un autoencodeur masqué, conditionné sur la géométrie de la scène. Entraîné sur 10 000 épisodes réels de rangement en entrepôt sans aucune annotation humaine, VulcanVoxel atteint un taux de couverture top-5 de 0,89, contre 0,71 pour la meilleure référence basée sur des poses SE(3). Une version distillée du modèle permet une inférence directe RGB vers voxel en seulement 30 millisecondes, contre 1,4 seconde pour l'approche voxel-à-voxel complète. Les chercheurs ont aussi publié un jeu de données d'épisodes réels d'insertion de lame, avec observations RGB-D et trajectoires de pose, disponible sur armbench.com. L'intérêt de ce travail dépasse le cas d'usage de la lame de stowing : il pointe une limite structurelle des méthodes actuelles d'apprentissage d'affordances, y compris les objectifs génératifs récents comme le flow matching. Ces méthodes, entraînées sur des données produites par une seule politique d'exécution, n'apprennent qu'une distribution unimodale et ne peuvent pas récupérer les alternatives géométriques équivalentes qui existent réellement dans une scène encombrée. En reformulant le problème dans l'espace plutôt que dans l'espace des poses, VulcanVoxel capture nativement cette multimodalité. Pour les intégrateurs et responsables d'automatisation d'entrepôt, le gain de vitesse (times 45 environ) est ce qui rend l'approche déployable en cadence de production réelle, là où le calcul voxel-à-voxel complet resterait trop lent. Le contexte de cette recherche est celui des systèmes de stowing en production qui génèrent, selon les auteurs, des millions d'épisodes de manipulation, un volume caractéristique des opérations d'automatisation logistique à grande échelle, comme celles qu'on associe généralement au jeu de données ArmBench. L'article positionne explicitement son approche contre les méthodes de pose SE(3) et les modèles génératifs unimodaux dominants dans le secteur, et la publication du jeu de données d'insertion de lame ouvre la voie à des comparaisons futures sur ce type de tâche de manipulation par affordances de volume libre, un sous-problème encore peu étudié comparé à la préhension classique.

RecherchePaper
1 source
AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés
2arXiv cs.RO 

AeroGrab : un cadre unifié pour la préhension aérienne en environnements encombrés

Des chercheurs ont publié sur arXiv (référence 2603.15097) AeroGrab, un pipeline intégré pour la saisie aérienne en environnements encombrés. Le système prend en entrée une scène et une instruction en langage naturel, identifie l'objet cible, puis pilote un drone pour l'explorer activement afin d'obtenir de meilleures perspectives. Durant cette exploration, un réseau de génération de prises prédit plusieurs candidats de saisie à 6 degrés de liberté (6-DOF) par point de vue. Chaque candidat est évalué par un module de faisabilité tenant compte des collisions potentielles ; la meilleure prise globale est sélectionnée et exécutée via des méthodes standard de génération de trajectoire. Des expériences en conditions réelles encombrées démontrent une exécution robuste des saisies dans des scénarios non contrôlés. L'apport principal réside dans l'intégration d'éléments jusqu'ici traités séparément : spécification de tâche par langage naturel, exploration active et sélection de prise tenant compte des collisions. Les pipelines de manipulation aérienne existants s'appuient généralement sur une saisie centroïde, approximation grossière qui échoue dès qu'un objet est partiellement occlus ou que l'environnement est dense. L'absence d'un système de bout en bout complet constituait un frein au déploiement opérationnel des drones manipulateurs, notamment en logistique, maintenance d'infrastructure ou intervention en zone difficile d'accès. AeroGrab représente une étape vers la fermeture du gap démo-terrain, sans que les métriques de robustesse soient détaillées dans l'abstract. La manipulation aérienne est un champ de recherche actif, porté notamment par l'ETH Zurich, l'Université de Naples Federico II ou le LAAS-CNRS côté français, qui explore depuis plusieurs années les drones à bras articulés. La tendance est à l'intégration de modèles vision-langage (VLA) dans la boucle de contrôle, pour passer d'une programmation par coordonnées à une spécification sémantique. Les verrous industriels restent importants : robustesse aux perturbations dynamiques, charge utile réduite et certification réglementaire pour les vols en espace intérieur. La publication sur arXiv indique un stade de recherche ; aucun déploiement commercial ni partenariat industriel n'est annoncé.

UELe LAAS-CNRS, laboratoire français reconnu dans la manipulation aérienne, évolue dans le même écosystème de recherche qu'AeroGrab, mais aucune implication directe d'institutions européennes n'est rapportée dans ce travail.

RecherchePaper
1 source
Raisonnement probabiliste calibré des obstructions par modèles vision-langage pour la préhension en environnement encombré
3arXiv cs.RO 

Raisonnement probabiliste calibré des obstructions par modèles vision-langage pour la préhension en environnement encombré

Un preprint publié sur arXiv (2609.18718v1) présente CPOR-Grasp, un système de raisonnement probabiliste calibré pour la préhension d'objets en environnement encombré. Face à une cible partiellement cachée, il doit choisir entre la saisir directement, retirer un objet qui la bloque, ou différer la décision. Plutôt que de figer une seule interprétation de la scène, CPOR-Grasp calibre et fusionne les signaux d'un modèle vision-langage, de la profondeur et de masques amodaux pour construire une distribution sur les graphes d'obstruction possibles, en ne gardant que les plus probables et en bornant mathématiquement la probabilité écartée. Sur le benchmark UNOBench, en scènes synthétiques et réelles, avec Gemini Robotics comme backbone VLM, l'erreur de calibration chute de 0,1416 à 0,0185, l'inférence tronquée égale l'inférence exacte sur 99,74% des décisions avec 56 fois moins de graphes, et le taux de réussite réel atteint 77,8%, devant les meilleures méthodes existantes. Le tri en entrepôt, le bin-picking industriel et les bras montés sur robots mobiles autonomes (AMR) butent régulièrement sur ce problème : les VLM utilisés pour interpréter une scène encombrée produisent des scores de confiance mal calibrés, souvent trop optimistes, et des relations d'obstruction incohérentes entre elles. Une décision fondée sur une seule hypothèse fausse entraîne casse, chute d'objet ou échec de tâche, ce qui pèse sur le taux de succès en production, loin des vidéos de démonstration sélectionnées. En rendant l'incertitude explicite et en autorisant l'ajournement d'une action plutôt que la décision forcée, CPOR-Grasp montre qu'un VLM commercial performant comme Gemini Robotics reste surconfiant sans calibration statistique dédiée, un point utile pour qui construit un pipeline de préhension autour d'un VLM générique. Ce travail s'inscrit dans la vague d'approches robotiques qui s'appuient sur des VLM préentraînés pour le raisonnement de haut niveau plutôt que sur des pipelines de perception spécialisés, dans la lignée de modèles vision-langage-action comme Pi-0 ou GR00T N2, davantage orientés vers l'exécution de bout en bout. UNOBench sert ici de banc d'essai dédié à la désobstruction avant saisie, un sous-problème distinct mais complémentaire de ces architectures généralistes. Publié comme contribution de recherche, sans partenariat industriel annoncé, CPOR-Grasp n'est comparé pour l'instant qu'à des bases de référence académiques ; une intégration sur bras robotique réel en entrepôt et une confrontation aux piles de préhension propriétaires du secteur restent les étapes suivantes attendues.

RecherchePaper
1 source
Évolution antérieure et alignement de tâche pour la préhension aérienne
4arXiv cs.RO 

Évolution antérieure et alignement de tâche pour la préhension aérienne

Un article publié le 17 septembre 2026 sur arXiv (référence 2609.18153) détaille une nouvelle méthode pour la préhension aérienne, cette capacité qu'ont les rapaces à capturer une proie en vol grâce à des manœuvres hautement coordonnées. Les chercheurs partent d'un constat sur les approches existantes fondées sur l'optimisation de trajectoire: le problème mathématique posé est fortement non convexe et très sensible aux conditions initiales, ce qui rend difficile l'obtention de solutions de bonne qualité avec un budget de calcul limité, et les objectifs numériques utilisés jusqu'ici sont des abstractions conçues par des humains qui ne capturent pas forcément tout ce qui détermine la réussite réelle de la saisie. Leur réponse combine trois briques: un "prior" de trajectoire appris à partir de mouvements déjà optimisés, un processus d'évolution basé sur la méthode CEM (cross-entropy method) qui teste des points de départ échantillonnés avec l'optimiseur réellement utilisé et ne conserve que les meilleurs comme nouvelles données d'entraînement, et un "Execution-Aware Critic" qui apprend à partir des résultats de contact, de soulèvement de l'objet et de complétion de la tâche pour prédire si une trajectoire optimisée réussira une fois exécutée physiquement. Une fois entraîné et figé, ce critique fait aussi office de coût de préhension différentiable qui influence directement la génération de trajectoire. Les auteurs rapportent des essais en simulation et sur système réel montrant une meilleure fiabilité d'optimisation, plus de cohérence entre trajectoires et de meilleures performances de saisie. Pour l'industrie robotique, ce travail s'attaque à un verrou classique de la planification par optimisation: la dépendance à l'initialisation, qui oblige souvent à relancer le solveur de nombreuses fois ou à accepter des trajectoires sous-optimales sous contrainte de temps de calcul. En faisant apprendre au système ce qui distingue une trajectoire viable d'une trajectoire qui échouera à l'exécution, plutôt que de se fier uniquement à des critères mathématiques fixés a priori, l'approche illustre une tendance plus large du secteur: hybrider planification analytique classique et apprentissage à partir de données d'exécution réelle, au lieu d'opposer les deux paradigmes. Il faut toutefois noter que l'abstract ne fournit aucun chiffre de taux de réussite, de temps de cycle ni d'échelle de déploiement: il s'agit d'un travail de recherche en amont, validé en simulation et par des essais réels limités, pas d'un système prêt pour un déploiement industriel. Ce papier s'inscrit dans la lignée des travaux sur la manœuvrabilité agile des drones et la manipulation aérienne, un champ de recherche actif depuis plusieurs années autour de la génération de trajectoires pour capturer des objets en mouvement ou en position complexe. Aucune entreprise ni laboratoire n'est nommé dans le résumé, et aucun acteur français ou européen du secteur n'est mentionné dans cette publication. Les suites logiques d'un tel travail seraient une extension à des scénarios de préhension plus variés, des tests sur davantage de plateformes matérielles, et une comparaison directe avec d'autres méthodes d'optimisation de trajectoire pour la préhension aérienne, mais aucune de ces étapes n'est annoncée à ce stade.

RecherchePaper
1 source