Où rejoindre un groupe ? Prédiction d'objectif guidée par le langage pour l'agrégation de robots
Une équipe de recherche publie sur arXiv (2609.28467v1, mis en ligne le 24 septembre 2026) une méthode baptisée "language-grounded robot group joining", qui répond à une question absente de la navigation sociale classique : non pas comment rejoindre un point fixe, mais où et comment s'intégrer à un groupe humain dont l'activité et la formation évoluent en temps réel. Le système part d'une observation visuelle et d'une description en langage naturel du groupe cible pour identifier les bonnes personnes, puis calcule des poses de jonction socialement acceptables. La chaîne technique combine un partitionnement spectral récursif, qui génère des sous-ensembles candidats de personnes dans la scène, avec un modèle language-conditioned combinant image et géométrie pour classer ces sous-ensembles selon la description fournie. Une fois le groupe identifié, un module de prédiction d'objectif s'appuie sur des a priori de formations humaines (conversations, files d'attente, publics) pour produire une carte multimodale energy-orientation couvrant l'ensemble des poses robotiques envisageables. Les auteurs rapportent une inférence en moins d'une seconde, une précision d'identification du groupe comparable aux meilleures approches existantes, et des performances supérieures à toutes les méthodes de référence testées pour la prédiction de pose de jonction, validées à la fois en simulation et sur robot réel, y compris dans des interactions dynamiques.
L'intérêt pratique dépasse la simple curiosité académique : les applications visées, chiens-guides robotiques et scooters de mobilité autonomes, ciblent l'assistance aux personnes à mobilité réduite ou malvoyantes dans des environnements sociaux denses, un cas d'usage largement sous-traité par la littérature en navigation robotique, historiquement focalisée sur l'évitement d'obstacles vers un but déjà connu. En prouvant qu'un robot peut interpréter une instruction en langage naturel pour localiser un groupe spécifique parmi plusieurs, puis calculer sa position d'intégration sans base de données pré-cartographiée, les auteurs adressent un maillon manquant pour les intégrateurs travaillant sur des AMR (robots mobiles autonomes) déployés en environnement humain ouvert, plutôt qu'en entrepôt structuré.
Le travail s'inscrit dans la lignée des modèles vision-langage appliqués à la robotique mobile, où la formulation de tâches sémantiques complexes via instructions textuelles gagne du terrain face aux approches purement géométriques. Le papier ne mentionne ni partenariat industriel ni déploiement commercial : il s'agit d'un résultat de recherche fondamentale, testé sur trois types de configurations sociales (conversations, files d'attente, audiences) avec tailles de groupe, densités de foule et ambiguïtés visuelles variables. Aucune suite commerciale ni calendrier de transfert vers un produit n'est annoncé à ce stade.
Dans nos dossiers




