Aller au contenu principal
CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables
RecherchearXiv cs.RO 

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent CoReLIN, un système de navigation robotique capable de déplacer des objets pour se frayer un chemin lorsque l'environnement est trop encombré pour laisser un passage libre. La plupart des planificateurs de navigation actuels supposent qu'un chemin sans obstacle existe toujours entre le point de départ et l'objectif, une hypothèse qui ne tient pas dans des environnements réels chargés de mobilier ou d'objets épars. Les auteurs formalisent une nouvelle tâche baptisée Lifelong Interactive Navigation, où un robot mobile doté de capacités de manipulation doit réorganiser la scène pour accomplir des séquences de tâches de placement d'objets, sachant que chaque modification de l'environnement a des répercussions durables sur la navigabilité future. CoReLIN s'appuie sur un modèle de langage qui raisonne sur un graphe de scène structuré pour décider quels objets déplacer, où les repositionner et quelles zones explorer ensuite, tandis qu'un planificateur de mouvement classique exécute les primitives de navigation et de manipulation. Sur le simulateur ProcTHOR-10k, le système dépasse la meilleure référence de 16% selon les métriques standards, et se transfère avec succès sur du matériel réel.

L'enjeu dépasse la simple prouesse académique: la plupart des robots de service et de logistique évoluent aujourd'hui dans des environnements dynamiques et encombrés, entrepôts, domiciles, hôpitaux, où l'absence de chemin dégagé est la norme plutôt que l'exception. En couplant raisonnement sémantique par LLM et perception active, CoReLIN illustre une tendance de fond du secteur: remplacer la planification purement géométrique par un raisonnement de plus haut niveau capable de décider quand agir sur l'environnement plutôt que de le contourner.

Pour évaluer ce comportement à long terme, les auteurs introduisent deux métriques inédites, le Long-term Efficiency Score et le Price of Clutter, qui capturent le taux de réussite, l'efficacité d'exécution et le coût d'optimalité de l'environnement laissé par le robot. Cette approche s'inscrit dans la lignée des travaux récents combinant graphes de scène et modèles de langage pour la planification robotique zero-shot, et ouvre la voie à des tests sur des tâches plus longues et des scènes réelles plus variées.

À lire aussi

PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots
1arXiv cs.RO 

PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots

La recherche présentée dans l'article arXiv:2609.18125v1 (déposé fin septembre 2026) porte sur un système baptisé PRISM, pour Predictive Representation of Interaction Style and Motion, conçu pour améliorer la navigation des robots dans les foules humaines. Concrètement, PRISM utilise un encodeur transformer entraîné avec une fonction de perte dite Rank-N-Contrast pour transformer les trajectoires observées de piétons en un espace latent continu et ordonné, qui capture le style d'interaction de chaque personne plutôt que sa seule position géométrique. Le système associe à chaque trait inféré un score de stabilité temporelle, transmis ensuite à la politique de navigation du robot. Les auteurs rapportent des résultats obtenus dans des simulations de foules randomisées : une réduction du taux de collisions par rapport à une référence qui ne modélise que l'état géométrique des piétons, ainsi que des gains marginaux sur le temps de trajet et la longueur du chemin parcouru. L'enjeu dépasse la seule performance chiffrée. La plupart des politiques de navigation sociale actuelles traitent les piétons comme de simples obstacles mobiles décrits par leur position et leur vitesse, ignorant que deux personnes se comportent différemment face à un robot selon leur style d'interaction propre. En inférant ce style de façon passive, sans capteurs additionnels ni interaction explicite, PRISM ouvre une piste pour des robots de livraison, des AMR ou des plateformes d'assistance appelés à circuler dans des environnements humains denses, où la sécurité perçue dépend autant du comportement social du robot que de sa seule évitement de collision. Le travail s'inscrit dans la lignée des recherches en navigation sociale robotique qui cherchent à dépasser les modèles purement géométriques hérités de la planification de trajectoire classique. Il reste toutefois à un stade de validation en simulation uniquement : aucun essai sur robot physique ni déploiement réel n'est mentionné, et les gains rapportés sur le temps de trajet et la distance parcourue sont qualifiés eux-mêmes de modestes par les auteurs. La suite logique, non annoncée à ce stade, serait un transfert vers des plateformes réelles pour vérifier si l'amélioration observée en simulation résiste au bruit des capteurs et à la variabilité humaine réelle.

RecherchePaper
1 source
CoRelNav : navigation relationnelle collaborative pour robots multiples en environnement sémantique contraint
2arXiv cs.RO 

CoRelNav : navigation relationnelle collaborative pour robots multiples en environnement sémantique contraint

CoRelNav, décrit dans un article déposé sur arXiv (référence 2609.27720v1), s'attaque à la navigation sémantique sous contrainte spatiale pour des flottes de robots mobiles : trouver un objet cible défini non seulement par sa catégorie sémantique mais aussi par sa relation avec les objets environnants, dans un environnement totalement inconnu. Le système repose sur un couplage entre exploration multi-robot conditionnée par la tâche et vérification collaborative pilotée par les candidats détectés. Un champ spatio-sémantique convertit les contraintes de la tâche, les nœuds de la scène et les caractéristiques des objets en une carte d'utilité d'exploration ; à mesure que des candidats sont repérés, les robots sont réaffectés vers les zones susceptibles d'apporter des preuves complémentaires, sous contrainte de coût de déplacement collectif, tandis que les observations cohérentes d'une même instance sont agrégées à travers les nœuds topologiques de la carte. Les auteurs rapportent des gains constants face à des méthodes de référence en simulation photoréaliste, avec des études d'ablation validant séparément les modules d'exploration et de vérification, et un déploiement du système complet sur deux robots mobiles physiques réels. L'intérêt de ce travail tient à un manque identifié dans la littérature : la navigation relationnelle existante reste essentiellement mono-agent, tandis que les systèmes multi-robots coordonnent rarement leurs observations distribuées pour vérifier une relation spatiale propre à une instance précise d'objet. En reliant explicitement exploration et vérification collaborative, CoRelNav réduit la recherche redondante entre robots et permet de trancher des hypothèses relationnelles à partir de preuves partielles réparties sur plusieurs agents, là où une exploration indépendante ou une vérification à vue unique resteraient ambiguës. Pour les équipes travaillant sur des flottes de robots de service, d'entrepôt ou d'inspection, cela illustre une piste concrète pour faire collaborer plusieurs unités sur des tâches sémantiques complexes plutôt que de les faire opérer en silos. Le travail s'inscrit dans le courant de recherche sur la navigation sémantique et la navigation vision-langage, en élargissant le problème classique de recherche d'objet à la coordination multi-agents. L'article reste une contribution académique validée par simulation et un test limité à deux robots physiques, sans indication de partenaire industriel, de calendrier de déploiement ou de mise à l'échelle au-delà de ce banc d'essai restreint.

RecherchePaper
1 source
HCSG : raisonnement sémantique-géométrique centré sur l'humain pour la navigation vision-langage
3arXiv cs.RO 

HCSG : raisonnement sémantique-géométrique centré sur l'humain pour la navigation vision-langage

Des chercheurs ont publié en mai 2026 HCSG (Human-Centric Semantic-Geometric Reasoning), un cadre de navigation en langage naturel (VLN) conçu pour les environnements intérieurs dynamiques peuplés de piétons, déposé sur arXiv sous la référence 2605.13321. Contrairement aux approches existantes qui traitent les humains comme de simples obstacles mobiles détectés par indices visuels, HCSG introduit un module unifié de compréhension humaine combinant deux capacités complémentaires : la prévision géométrique, qui anticipe poses et trajectoires futures des personnes, et l'interprétation sémantique, qui exploite un modèle vision-langage (VLM) pour générer des descriptions textuelles des actions et intentions perçues. Ces représentations sont fusionnées dans une carte topologique sur laquelle l'agent planifie ses déplacements en fonction des instructions reçues. Une fonction de perte de distance sociale (social distance loss) contraint le robot à maintenir des distances d'interaction socialement acceptables. Sur le benchmark HA-VLNCE, le framework affiche un gain de 14 % sur le taux de succès et une réduction de 34 % du taux de collision face à l'état de l'art, des chiffres à interpréter avec la prudence habituelle réservée aux préprints non encore évalués en pair-à-pair. Ces résultats pointent un changement de paradigme pertinent pour la robotique de service en espace ouvert. La distinction clé de HCSG est de passer d'un évitement passif (détecter puis contourner) à une compréhension active des comportements : le robot infère si un piéton s'apprête à changer de direction, à s'arrêter ou à interagir, ce qui permet une planification plus fluide. L'intégration d'un VLM est cohérente avec la montée en puissance des architectures vision-langage-action (VLA), mais l'article valide ici leur utilité spécifique pour la navigation sociale, pas seulement la manipulation. Pour les intégrateurs de robots de livraison intérieure ou de guidage hospitalier, c'est un signal que les approches purement géométriques atteignent leurs limites dans des environnements non contrôlés. La navigation VLN a progressé rapidement depuis les benchmarks R2R et REVERIE, portée par les transformers de vision et des modèles comme CLIP. HA-VLNCE, sur lequel HCSG est évalué, est une extension de VLN-CE intégrant des agents humains dynamiques, le rapprochant davantage des conditions de déploiement réelles. Les approches concurrentes en navigation sociale incluent des travaux issus de Stanford, CMU ou MIT, et des frameworks comme NaviSTAR. Côté industriel, les robots de Keenon, Aethon ou Savioke opèrent encore largement dans des couloirs semi-contrôlés précisément pour éviter ces problèmes de cohabitation. HCSG reste une contribution académique sans validation industrielle annoncée, mais une page de projet dédiée laisse entrevoir des travaux futurs sur robot physique.

RechercheOpinion
1 source
OptiSight : relier le raisonnement sémantique au contrôle géométrique pour la navigation incarnée
4arXiv cs.RO 

OptiSight : relier le raisonnement sémantique au contrôle géométrique pour la navigation incarnée

Une prépublication arXiv (2608.23354v1, signée par le développeur avanalperen) présente OptiSight, un framework hybride de navigation autonome en intérieur qui associe raisonnement par modèle vision-langage (VLM) et asservissement visuel déterministe, via une architecture en chaîne de pensée organisée comme un automate à états finis. Grounded-SAM se charge de localiser des cibles en vocabulaire ouvert, tandis que la géométrie de projection caméra traduit directement les observations visuelles en commandes de navigation, sans nécessiter de cartographie dense de l'environnement. Le VLM n'est interrogé qu'aux points de décision clés du parcours, le contrôle géométrique prenant le relais en continu entre deux requêtes pour limiter la charge de calcul. Testé dans le simulateur AI Habitat, le système assure une navigation en zero-shot fiable face à l'évitement d'obstacles et à l'ambiguïté sémantique, dans un budget de seulement 8 Go de VRAM, avec un code source publié en open source sur GitHub. Cette architecture tranche avec la tendance dominante des modèles vision-langage-action (VLA) entraînés de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, gourmands en données et en puissance de calcul. En limitant les appels au VLM aux seuls moments de décision et en confiant la navigation continue à un contrôle géométrique classique, OptiSight vise une solution plus légère et plus interprétable, potentiellement adaptée à des plateformes mobiles disposant de ressources embarquées modestes. Pour les intégrateurs d'AMR et de robots de service en intérieur, cela illustre une piste alternative pour relier compréhension sémantique de haut niveau et contrôle géométrique bas niveau sans dépendre d'un unique modèle massif ni d'un SLAM dense. Les résultats restent toutefois cantonnés à la simulation, sans validation rapportée sur robot physique, laissant ouverte la question du transfert vers le monde réel. OptiSight s'inscrit dans une lignée de travaux combinant segmentation en vocabulaire ouvert, héritée de Grounding DINO et Segment Anything via Grounded-SAM, et raisonnement multimodal appliqué à la navigation robotique, plutôt que dans la vague des modèles VLA propriétaires développés par les grands acteurs de la robotique humanoïde et de manipulation. Publié comme simple prépublication académique, sans affiliation industrielle mise en avant, le projet se distingue par la mise à disposition immédiate de son code sur GitHub, une pratique courante en recherche mais plus rare chez les acteurs commerciaux. Les suites habituelles pour ce type de travaux, tests sur plateformes physiques et comparaison chiffrée avec les architectures VLA de référence, restent pour l'instant absentes de cette première publication.

RecherchePaper
1 source