Aller au contenu principal
RecherchearXiv cs.RO 

Où rejoindre un groupe ? Prédiction d'objectif guidée par le langage pour l'agrégation de robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2609.28467v1, mis en ligne le 24 septembre 2026) une méthode baptisée "language-grounded robot group joining", qui répond à une question absente de la navigation sociale classique : non pas comment rejoindre un point fixe, mais où et comment s'intégrer à un groupe humain dont l'activité et la formation évoluent en temps réel. Le système part d'une observation visuelle et d'une description en langage naturel du groupe cible pour identifier les bonnes personnes, puis calcule des poses de jonction socialement acceptables. La chaîne technique combine un partitionnement spectral récursif, qui génère des sous-ensembles candidats de personnes dans la scène, avec un modèle language-conditioned combinant image et géométrie pour classer ces sous-ensembles selon la description fournie. Une fois le groupe identifié, un module de prédiction d'objectif s'appuie sur des a priori de formations humaines (conversations, files d'attente, publics) pour produire une carte multimodale energy-orientation couvrant l'ensemble des poses robotiques envisageables. Les auteurs rapportent une inférence en moins d'une seconde, une précision d'identification du groupe comparable aux meilleures approches existantes, et des performances supérieures à toutes les méthodes de référence testées pour la prédiction de pose de jonction, validées à la fois en simulation et sur robot réel, y compris dans des interactions dynamiques.

L'intérêt pratique dépasse la simple curiosité académique : les applications visées, chiens-guides robotiques et scooters de mobilité autonomes, ciblent l'assistance aux personnes à mobilité réduite ou malvoyantes dans des environnements sociaux denses, un cas d'usage largement sous-traité par la littérature en navigation robotique, historiquement focalisée sur l'évitement d'obstacles vers un but déjà connu. En prouvant qu'un robot peut interpréter une instruction en langage naturel pour localiser un groupe spécifique parmi plusieurs, puis calculer sa position d'intégration sans base de données pré-cartographiée, les auteurs adressent un maillon manquant pour les intégrateurs travaillant sur des AMR (robots mobiles autonomes) déployés en environnement humain ouvert, plutôt qu'en entrepôt structuré.

Le travail s'inscrit dans la lignée des modèles vision-langage appliqués à la robotique mobile, où la formulation de tâches sémantiques complexes via instructions textuelles gagne du terrain face aux approches purement géométriques. Le papier ne mentionne ni partenariat industriel ni déploiement commercial : il s'agit d'un résultat de recherche fondamentale, testé sur trois types de configurations sociales (conversations, files d'attente, audiences) avec tailles de groupe, densités de foule et ambiguïtés visuelles variables. Aucune suite commerciale ni calendrier de transfert vers un produit n'est annoncé à ce stade.

Dans nos dossiers

À lire aussi

Engagement sélectif pour la récupération d'objets guidée par le langage en observabilité partielle
1arXiv cs.RO 

Engagement sélectif pour la récupération d'objets guidée par le langage en observabilité partielle

Un article publié sur arXiv (référence 2609.23131v1, catégorie "nouveau") présente un système robotique en boucle fermée destiné à retrouver un objet désigné en langage naturel par rapport à un contenant de référence, dans des scènes partiellement observables. À chaque étape, le système arbitre entre quatre options: recueillir davantage de preuves visuelles, interagir avec la scène, saisir un candidat, ou s'abstenir. Il maintient une croyance conjointe persistante sur l'identité de la cible, sa relation au contenant et sa présence, structurée en trois hypothèses (objet suivi, cible non observée, cible absente), mise à jour par des observations catégorielles issues d'un modèle vision-langage (VLM) conditionnées par le point de vue. L'éligibilité de la prise est calibrée par prédiction conforme et combinée à la faisabilité robotique pour décider du moment de l'engagement, tandis qu'une planification en espace de croyances à horizon fini sélectionne les actions de collecte d'information. Sur cinq scénarios simulés, la méthode réussit 19 épisodes sur 25, contre 12 sur 25 pour la meilleure référence adaptée à la tâche, et c'est la seule politique testée à obtenir au moins une réussite dans chacun des cinq scénarios. Des essais sur robot réel montrent une ré-observation en boucle fermée et une récupération autonome après des échecs de prise provoqués artificiellement, mais des échecs de point de vue injectés se traduisent par de faux abandons, le robot renonçant à tort. Ces résultats s'adressent directement à un problème connu de la manipulation robotique en logistique et en intralogistique: la plupart des systèmes actuels supposent une observabilité quasi complète de la scène, ce qui s'effondre dès qu'un objet est partiellement occulté dans un bac ou un tiroir. En formalisant explicitement le choix entre agir, observer davantage ou renoncer, ce travail illustre une piste pour réduire les échecs silencieux des pipelines vision-langage-action (VLA) déployés en conditions réelles, où la confiance mal calibrée d'un modèle mène souvent à des prises ratées plutôt qu'à un report prudent. Les auteurs notent toutefois eux-mêmes une limite importante: leurs ablations montrent que le système complet ne surpasse pas systématiquement des variantes simplifiées, ce qui nuance la promesse d'un gain automatique lié à la complexité du cadre proposé. Ce travail s'inscrit dans la lignée des recherches académiques sur la prise de décision sous incertitude en robotique de manipulation, à la croisée des modèles vision-langage et de la planification bayésienne, sans lien annoncé avec un produit commercial ou un déploiement industriel. Il reste à ce stade au niveau de la validation en simulation complétée par des essais limités sur robot physique, et non un système prêt à l'emploi. Les auteurs ne mentionnent ni partenariat industriel ni calendrier de transfert vers une plateforme commerciale, ce qui distingue clairement cette contribution des annonces produit du secteur des humanoïdes ou des bras robotiques en entrepôt.

RecherchePaper
1 source
Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D
2arXiv cs.RO 

Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D

Une équipe de recherche présente un framework open source de navigation sémantique piloté par le langage naturel pour robots mobiles, publié sur arXiv (2607.13624v1). Le système, bâti sur des composants modulaires ROS 2, traduit des requêtes en langage naturel comme "va vers la boîte aux lettres" en objectifs de navigation exécutables. Concrètement, le pipeline identifie l'objet cible mentionné dans la phrase, estime sa position dans l'espace à partir de données RGB-D, puis génère un point de navigation transmis à la pile Nav2 de ROS 2 pour l'exécution autonome. Les auteurs ont validé l'approche à la fois en simulation et en conditions réelles, sur deux plateformes distinctes : un TurtleBot3 Waffle et un Unitree Go2 équipé d'une caméra RealSense. Le code sera publié en open source après acceptation de l'article. Cette architecture illustre une tendance de fond dans la robotique mobile : le passage d'une navigation pilotée par coordonnées ou par carte à une navigation pilotée par l'intention exprimée en langage naturel, sans expertise technique requise de l'utilisateur. Pour les intégrateurs, l'intérêt réside moins dans la performance brute que dans la portabilité : en s'appuyant sur ROS 2 et sur des topics et services standardisés, le framework promet une adaptation à différentes plateformes robotiques via une simple reconfiguration plutôt qu'un développement spécifique par robot. Le système va au-delà des commandes directes en interprétant aussi des requêtes contextuelles et en générant du feedback en langage naturel, deux capacités clés pour une interaction homme-robot fluide dans des environnements domestiques ou logistiques où les utilisateurs finaux ne sont pas des opérateurs formés. Ce travail s'inscrit dans la vague plus large des architectures vision-langage-action qui traversent la robotique depuis l'essor de modèles comme Pi-0 ou GR00T N2, même si ceux-ci ciblent surtout la manipulation plutôt que la navigation pure. Plutôt qu'une approche end-to-end déléguant tout le raisonnement à un modèle unique, les auteurs optent pour une architecture modulaire combinant perception RGB-D, compréhension du langage et planification via Nav2, une pile de navigation déjà largement adoptée dans l'écosystème ROS 2 académique et industriel. L'ambition de portabilité multi-plateforme et la publication annoncée du code positionnent ce travail comme une brique réutilisable plutôt qu'une démonstration isolée, même si, à ce stade, rien n'indique un calendrier de diffusion précis ni des tests en environnements plus complexes ou à grande échelle.

RecherchePaper
1 source
PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt
3arXiv cs.RO 

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt

Des chercheurs ont publié PIGEON (Point of Interest Guided Exploration for Object Navigation), un cadre de navigation robotique pour localiser des objets dans des espaces intérieurs inconnus. L'approche repose sur des modèles vision-langage (VLM), mais résout leur principal obstacle opérationnel : l'inférence dense image par image est trop coûteuse pour un usage embarqué temps réel. PIGEON introduit des Points d'Intérêt (PoI), unités de décision visuelles couplant waypoints géométriques et observations égocentriques brutes, que le VLM utilise pour sélectionner parmi des destinations candidates : frontières d'exploration, objets suspectés, escaliers franchissables, résumés de niveau sol. Un planificateur bas niveau exécute les trajectoires continues entre ces points. Le système intègre un pipeline RLVR (Reinforcement Learning with Verifiable Rewards) permettant d'affiner des VLM locaux sans annotations Chain-of-Thought manuelles. Sur le benchmark Habitat ObjectNav, référence standard en navigation simulée, PIGEON affiche les meilleures performances zero-shot publiées à ce jour et se transfère à la tâche Active Embodied Question Answering par simple modification du prompt. Des déploiements sur robots physiques sont documentés dans le papier (arXiv 2511.13207). L'enjeu central est l'efficacité computationnelle des VLM dans des boucles de contrôle robotique. Les approches concurrentes utilisent soit les VLM comme contrôleurs denses (coûteux), soit pour un simple ranking de frontières d'exploration (sémantiquement appauvri). PIGEON propose un compromis : décisions rares mais ancrées dans les observations brutes, rendant chaque choix vérifiable et compatible avec l'apprentissage par renforcement sans supervision humaine. La réduction de la dépendance aux données annotées est un avantage concret pour des équipes robotiques sans large budget d'annotation. La progression des performances avec la taille du modèle de fondation (scaling) indique une architecture alignée avec les tendances génératives actuelles. La navigation d'objets en environnement inconnu est un benchmark actif en robotique cognitive, avec des systèmes concurrents comme ESC, SG-Nav ou OpenFMNav exploitant également des LLM pour la planification sémantique. PIGEON se différencie par son mode zero-shot strict, sans réentraînement spécifique à l'environnement cible. Habitat, le simulateur d'intérieur de Meta AI Research, reste la plateforme d'évaluation de référence pour ce type de tâche. Ce résultat est académique : aucun partenariat commercial ni déploiement industriel n'est mentionné, et la robustesse en environnements réels dynamiques non contrôlés reste à valider à plus grande échelle. Les prochaines étapes naturelles incluent des tests en milieux variés et l'adaptation à des VLM embarqués contraints en ressources.

RechercheOpinion
1 source
LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique
4arXiv cs.RO 

LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique

Des chercheurs présentent LaGEA (Language Guided Embodied Agents), une architecture combinant un modèle vision-langage (VLM) et l'apprentissage par renforcement (RL) pour la manipulation robotique, décrite dans une version mise a jour (v3) d'un article arXiv (2509.23155). Apres chaque tentative, le système résume l'épisode en langage naturel, localise les instants décisifs de la trajectoire, aligne ce retour avec l'état visuel dans une représentation partagée, puis transforme la progression vers l'objectif en récompenses bornées appliquées pas a pas. Un coefficient adaptatif, sensible aux échecs, rend ce signal dense en début d'exploration puis l'atténué avec la montée en compétence de l'agent. Sur les bancs d'essai simules Meta-World MT10 (dix taches de manipulation) et Robotic Fetch, LaGEA améliore le taux de réussite moyen de 9,0% sur des objectifs aléatoires, 5,3% sur des objectifs fixes et 17% sur les taches Fetch par rapport aux méthodes de référence, avec une convergence plus rapide. Le travail s'attaque a un problème classique du RL, la conception manuelle des fonctions de récompense, souvent couteuse et peu généralisable a de nouvelles taches. En montrant qu'un retour en langage naturel, structure et ancre temporellement, peut remplacer une partie de cette ingénierie, LaGEA nuance le narratif dominant autour des modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix, conçus pour piloter directement une politique de bout en bout : ici, le langage sert de superviseur d'apprentissage plutôt que de commande directe. Les gains rapportes restent obtenus en simulation, non sur du matériel réel, et demandent une confirmation sur des taches de manipulation physique. LaGEA prolonge les travaux exploitant les grands modèles vision-langage comme source de récompense ou de critique pour le RL, un axe de recherche actif depuis l'essor des modèles de fondation capables de décrire des objectifs et d'évaluer des trajectoires. Meta-World MT10 et Robotic Fetch sont des bancs d'essai standards de la communauté robotique, ce qui permet une comparaison directe avec l'état de l'art. S'agissant d'une version corrigée d'un article déjà publie, la contribution reste académique : aucun partenaire industriel, date de déploiement ou intégration produit n'est annonce a ce stade, la prochaine étape logique étant une validation sim-to-real sur robot physique.

RecherchePaper
1 source