Aller au contenu principal
RecherchearXiv cs.RO 

Engagement sélectif pour la récupération d'objets guidée par le langage en observabilité partielle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2609.23131v1, catégorie "nouveau") présente un système robotique en boucle fermée destiné à retrouver un objet désigné en langage naturel par rapport à un contenant de référence, dans des scènes partiellement observables. À chaque étape, le système arbitre entre quatre options: recueillir davantage de preuves visuelles, interagir avec la scène, saisir un candidat, ou s'abstenir. Il maintient une croyance conjointe persistante sur l'identité de la cible, sa relation au contenant et sa présence, structurée en trois hypothèses (objet suivi, cible non observée, cible absente), mise à jour par des observations catégorielles issues d'un modèle vision-langage (VLM) conditionnées par le point de vue. L'éligibilité de la prise est calibrée par prédiction conforme et combinée à la faisabilité robotique pour décider du moment de l'engagement, tandis qu'une planification en espace de croyances à horizon fini sélectionne les actions de collecte d'information. Sur cinq scénarios simulés, la méthode réussit 19 épisodes sur 25, contre 12 sur 25 pour la meilleure référence adaptée à la tâche, et c'est la seule politique testée à obtenir au moins une réussite dans chacun des cinq scénarios. Des essais sur robot réel montrent une ré-observation en boucle fermée et une récupération autonome après des échecs de prise provoqués artificiellement, mais des échecs de point de vue injectés se traduisent par de faux abandons, le robot renonçant à tort.

Ces résultats s'adressent directement à un problème connu de la manipulation robotique en logistique et en intralogistique: la plupart des systèmes actuels supposent une observabilité quasi complète de la scène, ce qui s'effondre dès qu'un objet est partiellement occulté dans un bac ou un tiroir. En formalisant explicitement le choix entre agir, observer davantage ou renoncer, ce travail illustre une piste pour réduire les échecs silencieux des pipelines vision-langage-action (VLA) déployés en conditions réelles, où la confiance mal calibrée d'un modèle mène souvent à des prises ratées plutôt qu'à un report prudent. Les auteurs notent toutefois eux-mêmes une limite importante: leurs ablations montrent que le système complet ne surpasse pas systématiquement des variantes simplifiées, ce qui nuance la promesse d'un gain automatique lié à la complexité du cadre proposé.

Ce travail s'inscrit dans la lignée des recherches académiques sur la prise de décision sous incertitude en robotique de manipulation, à la croisée des modèles vision-langage et de la planification bayésienne, sans lien annoncé avec un produit commercial ou un déploiement industriel. Il reste à ce stade au niveau de la validation en simulation complétée par des essais limités sur robot physique, et non un système prêt à l'emploi. Les auteurs ne mentionnent ni partenariat industriel ni calendrier de transfert vers une plateforme commerciale, ce qui distingue clairement cette contribution des annonces produit du secteur des humanoïdes ou des bras robotiques en entrepôt.

À lire aussi

Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle
1arXiv cs.RO 

Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle

Un cycle de planification robotique conçu pour décider quand observer et quand agir vient d'être détaillé dans un article arXiv publié le 18 septembre 2026 (arXiv:2609.20396v1), intitulé Imagine-TAMP: Imagination-Guided Task and Motion Planning in Partial Observability. Le système cible un problème concret des robots manipulateurs en environnement encombré : quand la position d'un objet cible est partiellement cachée, faut-il chercher un nouvel angle d'observation ou déplacer d'abord l'objet qui obstrue la vue. Imagine-TAMP combine deux mécanismes d'"imagination" : un modèle vision-langage qui met à jour une croyance probabiliste (particle belief) sur la position de la cible en s'appuyant sur des relations de bon sens avec les objets visibles, et un modèle génératif de scène qui estime la géométrie plausible des zones non observées. À partir de ces hypothèses, le système génère plusieurs squelettes de plan symboliques, leur attribue des coûts non uniformes reflétant à la fois l'effort de manipulation et la probabilité de révéler la cible, puis affine le squelette retenu en plan moteur exécuté, avec replanification si de nouvelles observations contredisent la croyance initiale. Dans des scènes d'étagère à points de vue contraints, l'évaluation géométrique non uniforme fait passer le taux de succès de 46,0% à 84,0% par rapport à une approche de référence, et l'ajout du modèle sémantique réduit encore les manipulations et replanifications inutiles. Sur un robot réel, le système complet réduit le temps de planification de 32% comparé à une version n'utilisant que la géométrie. L'enjeu dépasse la démonstration académique : la décision observer-versus-manipuler est un goulot d'étranglement classique pour les robots de logistique et de préparation de commandes travaillant dans des bacs ou étagères encombrés, où les approches TAMP classiques s'appuient sur des coûts symboliques grossiers ou une planification géométrique coûteuse, sans jamais estimer la probabilité qu'une observation révèle réellement la cible. En montrant qu'un modèle vision-langage peut injecter du bon sens dans cette décision avant d'engager un calcul moteur coûteux, les auteurs illustrent une tendance plus large où les VLM servent de couche de raisonnement pour la planification plutôt que de générateur direct d'actions, à la différence des approches VLA comme Pi-0 ou GR00T N2. Le travail s'inscrit dans la lignée du TAMP, qui combine planification symbolique et planification de mouvement continue, en cherchant à corriger sa faiblesse historique face à l'observabilité partielle. Il s'agit d'un preprint, sans validation par les pairs ni partenaire industriel identifié dans le résumé ; les auteurs ne précisent pas de calendrier de suite ni d'extension à d'autres classes de tâches.

RecherchePaper
1 source
Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel
2arXiv cs.RO 

Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel

Une équipe de recherche présente cRVAE (conditional récurrent variational autoencoder), un modèle léger capable d'estimer l'état complet d'un objet déformable comme une corde ou un tissu à partir de simples observations partielles de ses coins, sans nécessiter de paramètres physiques en entrée ni d'identification de paramètres en ligne. Décrit dans l'article arXiv:2609.10308v1, ce réseau sert de modèle prédictif dans un cadre de contrôle optimal à horizon glissant pour la manipulation collaborative d'objets déformables en présence d'obstacles. En simulation sur des scénarios de corde et de tissu, cRVAE atteint une précision comparable à celle d'un modèle physique XPBD (Extended Position Based Dynamics) pourtant calibré avec des paramètres identifiés au préalable, tout en étant environ 350 fois plus rapide sur la corde et plus de 1500 fois plus rapide sur le tissu à chaque passe de calcul. Cette vitesse permet de rester sous le budget de contrôle de 100 millisecondes nécessaire à une planification en boucle fermée, un seuil que le modèle XPBD dépasse déjà sur des horizons courts. Les chercheurs ont démontré le système sur un robot quadrupède Unitree Go2. Ce résultat s'attaque à un angle mort persistant de la robotique industrielle : si la manipulation d'objets rigides est largement résolue par des méthodes basées modèle, les objets déformables (câbles, textiles, corde, emballages souples) restent un défi ouvert à cause de leur espace d'état de très haute dimension, de leur dynamique sous-actionnée et de l'observabilité partielle inhérente aux capteurs disponibles. Les simulateurs physiques comme XPBD, très utilisés pour le rendu de tissus et de cordes, exigent une calibration coûteuse par objet et deviennent trop lents pour du contrôle temps réel dès que l'horizon de planification s'allonge. En démontrant qu'un modèle appris peut remplacer cette simulation physique sans perte de précision et sans calibration objet par objet, l'étude lève un obstacle concret au déploiement de manipulateurs sur des tâches comme le routage de câbles, la manutention textile ou l'emballage souple en logistique, où le recalibrage manuel par pièce est impraticable à l'échelle. Le choix d'un robot quadrupède plutôt qu'un bras manipulateur classique suggère aussi une applicabilité à des contextes de manipulation mobile plus larges. La validation reste toutefois circonscrite à la simulation pour la comparaison de précision, et la démonstration matérielle sur Go2 n'est pas détaillée en termes de tâche ni de robustesse. Ce travail s'inscrit dans la lignée des architectures d'autoencodeurs variationnels, ici adaptées en version récurrente et conditionnelle pour l'estimation d'état temporel, et vise spécifiquement à remplacer les moteurs physiques comme XPBD (utilisé notamment dans des environnements de simulation robotique et de jeu) comme modèle prédictif embarqué dans une boucle de contrôle. Il s'agit d'une publication de recherche académique et non d'une annonce produit ou d'un pilote industriel : aucun acteur commercial concurrent n'est cité, et aucun calendrier de déploiement n'est communiqué. Les prochaines étapes logiques, non annoncées dans l'article, porteraient vraisemblablement sur l'extension à d'autres matériaux déformables, à des configurations bimanuelles, et sur des essais matériels plus poussés au-delà de la démonstration initiale sur le Go2.

RecherchePaper
1 source
Génération guidée par le langage pour la planification d'inspection personnalisée
3arXiv cs.RO 

Génération guidée par le langage pour la planification d'inspection personnalisée

Des chercheurs proposent une méthode sans entraînement (training-free) guidée par un modèle vision-langage (VLM) pour générer automatiquement des trajectoires d'inspection à partir de descriptions textuelles, détaillée dans un article arXiv (2506.02917v2, version révisée). Le système extrait d'abord les points d'intérêt (POI) mentionnés dans le texte, puis identifie des points de passage garantissant leur visibilité tout en respectant les contraintes spatiales du prompt. Il affine ensuite la trajectoire par itérations avec le VLM, résout un problème du voyageur de commerce (TSP) pour déterminer l'ordre de visite optimal, puis applique une optimisation de trajectoire pour produire des chemins lisses et exécutables par des véhicules aériens ou sous-marins. La méthode a été testée sur des environnements construits à la main et sur des scènes réelles scannées en 3D. Contrairement aux approches classiques de navigation vision-langage (VLN), conçues pour des agents évoluant dans des environnements inconnus, cette technique cible spécifiquement l'inspection de scènes déjà connues et cartographiées, avec des applications potentielles en imagerie médicale, en inspection marine et en génie civil. L'absence de phase d'entraînement dédiée est l'argument central : elle éviterait la collecte de données et le réentraînement coûteux à chaque nouvel environnement, un frein habituel à l'adoption de la planification automatisée pour drones et véhicules sous-marins autonomes. Pour les intégrateurs, l'intérêt est de remplacer la programmation manuelle de points de passage par une simple instruction en langage naturel, un pas vers des systèmes de planification pilotés par le langage à l'échelle d'un site industriel plutôt que du seul bras manipulateur. Le travail s'inscrit dans la vague plus large d'intégration des modèles vision-langage-action en robotique, jusqu'ici surtout démontrée sur la manipulation par des systèmes comme Pi-0, GR00T N2 ou Helix ; il l'étend ici à la planification de trajectoires pour l'inspection aérienne et sous-marine. Aucune entreprise ni plateforme commerciale n'est citée : il s'agit d'un travail de recherche académique, publié en préprint et évalué uniquement en environnements contrôlés ou scannés, sans déploiement terrain ni produit commercialisé à ce stade. La suite logique attendue serait une validation sur des missions d'inspection réelles avec des drones ou véhicules sous-marins physiques, hors simulation ou reconstruction 3D statique.

RechercheActu
1 source
PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt
4arXiv cs.RO 

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt

Des chercheurs ont publié PIGEON (Point of Interest Guided Exploration for Object Navigation), un cadre de navigation robotique pour localiser des objets dans des espaces intérieurs inconnus. L'approche repose sur des modèles vision-langage (VLM), mais résout leur principal obstacle opérationnel : l'inférence dense image par image est trop coûteuse pour un usage embarqué temps réel. PIGEON introduit des Points d'Intérêt (PoI), unités de décision visuelles couplant waypoints géométriques et observations égocentriques brutes, que le VLM utilise pour sélectionner parmi des destinations candidates : frontières d'exploration, objets suspectés, escaliers franchissables, résumés de niveau sol. Un planificateur bas niveau exécute les trajectoires continues entre ces points. Le système intègre un pipeline RLVR (Reinforcement Learning with Verifiable Rewards) permettant d'affiner des VLM locaux sans annotations Chain-of-Thought manuelles. Sur le benchmark Habitat ObjectNav, référence standard en navigation simulée, PIGEON affiche les meilleures performances zero-shot publiées à ce jour et se transfère à la tâche Active Embodied Question Answering par simple modification du prompt. Des déploiements sur robots physiques sont documentés dans le papier (arXiv 2511.13207). L'enjeu central est l'efficacité computationnelle des VLM dans des boucles de contrôle robotique. Les approches concurrentes utilisent soit les VLM comme contrôleurs denses (coûteux), soit pour un simple ranking de frontières d'exploration (sémantiquement appauvri). PIGEON propose un compromis : décisions rares mais ancrées dans les observations brutes, rendant chaque choix vérifiable et compatible avec l'apprentissage par renforcement sans supervision humaine. La réduction de la dépendance aux données annotées est un avantage concret pour des équipes robotiques sans large budget d'annotation. La progression des performances avec la taille du modèle de fondation (scaling) indique une architecture alignée avec les tendances génératives actuelles. La navigation d'objets en environnement inconnu est un benchmark actif en robotique cognitive, avec des systèmes concurrents comme ESC, SG-Nav ou OpenFMNav exploitant également des LLM pour la planification sémantique. PIGEON se différencie par son mode zero-shot strict, sans réentraînement spécifique à l'environnement cible. Habitat, le simulateur d'intérieur de Meta AI Research, reste la plateforme d'évaluation de référence pour ce type de tâche. Ce résultat est académique : aucun partenariat commercial ni déploiement industriel n'est mentionné, et la robustesse en environnements réels dynamiques non contrôlés reste à valider à plus grande échelle. Les prochaines étapes naturelles incluent des tests en milieux variés et l'adaptation à des VLM embarqués contraints en ressources.

RechercheOpinion
1 source