Aller au contenu principal
RecherchearXiv cs.RO 

CORNAV : raisonnement tenant compte des travaux pour la navigation de robots sur chantiers actifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CORNAV, un cadre de navigation pour robots publié sur arXiv (2610.03622), vise à faire circuler des robots mobiles sur des chantiers actifs à partir de plans CAD 2D et de plannings de projet, sans exiger de maquette numérique BIM. Le système aligne les plans architecturaux sur des graphes de scène 3D hiérarchiques à vocabulaire ouvert pour ancrer les requêtes en langage naturel. Il convertit ensuite le planning en contraintes de navigation variables dans le temps. Un module de sécurité fondé sur un LLM valide chaque demande et fait remonter les zones dangereuses avant la planification. Un planificateur A* impose enfin des zones d'exclusion obligatoires et évite de préférence les zones à risque élevé. Les tests ont eu lieu dans un bureau intérieur et sur un vrai chantier. L'ancrage par plans fait passer le taux de réussite des tâches de 13,0 % à 72,2 %, par rapport à la seule récupération sémantique. La prise en compte du planning supprime toutes les violations de zones strictes. Le module de sécurité rejette correctement les demandes dangereuses issues de plannings mal étiquetés.

Ces résultats comptent d'abord parce qu'ils visent une limite connue des systèmes de navigation guidés par le langage. Ceux-ci reposent sur la seule compréhension sémantique de la scène et localisent mal les éléments permanents du bâtiment. Le saut de 13,0 % à 72,2 % montre que le goulot d'étranglement est le contexte métier plutôt que la perception brute. Exploiter des plans 2D et des plannings déjà présents sur la plupart des chantiers abaisse la barrière d'entrée, car peu de chantiers disposent d'un BIM à jour. Pour les intégrateurs et les responsables de sites, l'intérêt est une navigation qui respecte les zones interdites évolutives. Le rejet de requêtes issues de plannings erronés répond à un risque réel : les données de chantier sont souvent incomplètes ou fausses. Il faut toutefois rester prudent. Les résultats viennent d'un travail académique, sur un nombre limité d'environnements, et le seul site réel testé ne dit rien de la robustesse à grande échelle.

Les auteurs partent d'un constat économique : la construction souffre de pénuries de main-d'œuvre, d'une faible productivité estimée à plus de 1 600 milliards de dollars de coût annuel pour l'économie mondiale, et d'un des taux d'accidents les plus élevés parmi les grands secteurs. Ces facteurs alimentent l'intérêt pour les robots autonomes sur chantier, déjà explorés par des acteurs comme Boston Dynamics avec Spot pour la capture de l'avancement. Les approches de navigation par graphes de scène à vocabulaire ouvert, qui servent de base ici, restent peu adaptées aux contraintes réglementaires et temporelles d'un chantier. CORNAV est un travail de recherche, pas un produit ni un déploiement commercial, et aucun calendrier de pilote n'est annoncé. Les suites logiques seraient des essais sur davantage de sites, une intégration avec des robots de terrain et une évaluation de la fiabilité du module de sécurité face à des plannings dégradés.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SAIN : navigation interactive tenant compte de la structure et ancrée dans le dialogue actif pour robot mobile
1arXiv cs.RO 

SAIN : navigation interactive tenant compte de la structure et ancrée dans le dialogue actif pour robot mobile

Des chercheurs ont publie en aout 2026 sur arXiv (2608.09196v1) SAIN (Structure-Aware Interactive Navigation), un framework permettant a un robot mobile de dialoguer avec un humain pour lever l'ambiguïté d'une instruction. La tache visée, l'Interactive Instance Goal Navigation, demande au robot de retrouver un objet précis derrière une consigne de catégorie, par exemple "la tasse" parmi plusieurs tasses. Plutot que de traiter les réponses obtenues comme un indice textuel jetable, SAIN les convertit en état persistant reparti dans quatre mémoires structurées (valeur, pièce, graphe, objet), exploitées par une politique unique pour explorer et approcher la cible. Sur le benchmark VL-LN IIGN, SAIN fait passer le taux de succès de 20,2 a 25,4 et le SPL de 13,07 a 14,17 face a la meilleure base dialoguée publiée, sans entrainement spécifique a la tache. Pour les équipes de navigation vision-langage et de robots de service, ce résultat esquisse une piste pour combler l'écart entre instructions humaines vagues et des benchmarks qui supposent des consignes complètes, en transformant le dialogue en état spatial structure plutôt qu'en contexte textuel jetable, ce qui évite un reentrainement couteux par tache. Le gain reste toutefois mesure (environ cinq points de SR, un point de SPL), obtenu sur un seul benchmark face a une seule base de comparaison, ce qui invite a la prudence avant d'extrapoler a des environnements réels non contrôles. Il s'agit d'une contribution de recherche publiée sur arXiv et non d'un produit déployé: l'article ne mentionne ni partenaire robotique ni mise en production. Le problème du dialogue actif en navigation s'inscrit dans la continuité des travaux de navigation vision-langage, qui visent a gérer le langage naturel impreci des humains; les méthodes dialoguées antérieures se limitaient a exploiter les réponses comme indices ponctuels sans mémoire persistante, ce qui dégradait leurs performances sur des trajets longs. SAIN se positionne comme une alternative zero-shot misant sur la structuration de la mémoire plutôt que sur un apprentissage supplémentaire. L'article ne fournit ni calendrier de suite ni partenariat industriel ni portage vers un robot physique au-delà des simulations du benchmark VL-LN IIGN.

RecherchePaper
1 source
CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables
2arXiv cs.RO 

CoReLIN : raisonnement basé sur des contraintes pour la navigation interactive à vie sans exemples préalables

Des chercheurs présentent CoReLIN, un système de navigation robotique capable de déplacer des objets pour se frayer un chemin lorsque l'environnement est trop encombré pour laisser un passage libre. La plupart des planificateurs de navigation actuels supposent qu'un chemin sans obstacle existe toujours entre le point de départ et l'objectif, une hypothèse qui ne tient pas dans des environnements réels chargés de mobilier ou d'objets épars. Les auteurs formalisent une nouvelle tâche baptisée Lifelong Interactive Navigation, où un robot mobile doté de capacités de manipulation doit réorganiser la scène pour accomplir des séquences de tâches de placement d'objets, sachant que chaque modification de l'environnement a des répercussions durables sur la navigabilité future. CoReLIN s'appuie sur un modèle de langage qui raisonne sur un graphe de scène structuré pour décider quels objets déplacer, où les repositionner et quelles zones explorer ensuite, tandis qu'un planificateur de mouvement classique exécute les primitives de navigation et de manipulation. Sur le simulateur ProcTHOR-10k, le système dépasse la meilleure référence de 16% selon les métriques standards, et se transfère avec succès sur du matériel réel. L'enjeu dépasse la simple prouesse académique: la plupart des robots de service et de logistique évoluent aujourd'hui dans des environnements dynamiques et encombrés, entrepôts, domiciles, hôpitaux, où l'absence de chemin dégagé est la norme plutôt que l'exception. En couplant raisonnement sémantique par LLM et perception active, CoReLIN illustre une tendance de fond du secteur: remplacer la planification purement géométrique par un raisonnement de plus haut niveau capable de décider quand agir sur l'environnement plutôt que de le contourner. Pour évaluer ce comportement à long terme, les auteurs introduisent deux métriques inédites, le Long-term Efficiency Score et le Price of Clutter, qui capturent le taux de réussite, l'efficacité d'exécution et le coût d'optimalité de l'environnement laissé par le robot. Cette approche s'inscrit dans la lignée des travaux récents combinant graphes de scène et modèles de langage pour la planification robotique zero-shot, et ouvre la voie à des tests sur des tâches plus longues et des scènes réelles plus variées.

RecherchePaper
1 source
OSCAR : courbes de survie aux obstacles pour la navigation adaptative des robots
3arXiv cs.RO 

OSCAR : courbes de survie aux obstacles pour la navigation adaptative des robots

Des chercheurs ont publié le 1er juin 2026 sur arXiv (réf. 2606.00990) un framework de navigation adaptative baptisé OSCAR (Obstacle Survival Curves for Adaptive Robot Navigation), conçu pour les robots mobiles naviguant sur des graphes de routes prédéfinies. Le problème ciblé est précis : quand un obstacle temporaire bloque un nœud critique du graphe, le robot doit décider d'attendre ou de recalculer un itinéraire alternatif. OSCAR répond à cette décision en apprenant, par expérience en ligne, des distributions statistiques de durée de présence selon la classe d'obstacle (piéton, chaise, poubelle, chariot, tube). Ces modèles de survie, y compris les observations censurées à droite (cas où le robot reroutait avant d'observer la libération effective de l'obstacle), alimentent un planificateur de graphe temporel qui calcule un seuil de patience par arête bloquée. En simulation, la politique apprise converge à moins de 1 % d'un oracle disposant des distributions réelles de dégagement après moins de 20 observations par classe d'obstacle, surpassant tous les heuristiques de référence. En déploiement réel dans un atrium universitaire, le système améliore ses seuils de patience au fil de 50 épisodes de navigation. L'intérêt pour les intégrateurs de robots mobiles autonomes (AMR) est direct : les systèmes actuels appliquent soit de la réactivité locale (évitement d'obstacles à l'instant T), soit des règles fixes de type "attendre X secondes puis rerouter", sans modéliser la sémantique temporelle de l'obstacle. OSCAR comble cet écart en montrant qu'un modèle de survie conditionné à la classe, mis à jour en ligne, suffit à se rapprocher du comportement optimal sans connaissance a priori des distributions réelles. Cela réduit concrètement les temps morts dans des environnements semi-dynamiques comme les entrepôts, les hôpitaux ou les campus, où la majorité des blocages sont transitoires mais de durée variable selon leur nature. OSCAR s'inscrit dans un courant de recherche qui vise à dépasser la navigation réactive pure pour introduire de la mémoire contextuelle dans la planification. La littérature existante sur la navigation en graphe traite généralement les obstacles comme statiques ou entièrement imprévisibles ; les modèles de survie, issus de la biostatistique et de la fiabilité industrielle, restent rares dans ce domaine. Les concurrents fonctionnels incluent les approches de navigation socio-consciente (social force models, ORCA) et les planificateurs probabilistes à horizon temporel (POMDP), mais ces derniers sont computationnellement coûteux. OSCAR se positionne comme une alternative légère et incrémentale, compatible avec des plateformes AMR standard. La prochaine étape naturelle serait de tester la généralisation à des environnements à plus forte densité d'obstacles ou à des classes non vues à l'entraînement.

RecherchePaper
1 source
Raisonnement cognitif pour l'action de robots proactifs à partir d'observations multimodales centrées sur l'humain
4arXiv cs.RO 

Raisonnement cognitif pour l'action de robots proactifs à partir d'observations multimodales centrées sur l'humain

Des chercheurs publient sur arXiv (référence 2609.23486, avec pour type d'annonce "new", donc une première soumission datée de septembre 2026) un article qui formule ProRobo (Proactive Robot Action Reasoning), un nouveau problème de raisonnement cognitif pour robots d'assistance : déterminer quelle action entreprendre à partir d'indices humains et environnementaux multimodaux, sans instruction explicite. Pour l'étudier, l'équipe construit ProAction, un jeu de données réel de 10 000 échantillons combinant observations visuelles, signaux audio et texte, couvrant 12 scénarios de vie quotidienne répartis dans cinq scènes courantes. Les annotations d'action de haut niveau proviennent d'un pipeline en deux étapes associant humains et modèles : une génération de candidats guidée par une théorie de l'évaluation cognitive (appraisal), puis un raffinement humain informé par une théorie de l'esprit affective, qui intègre explicitement l'état de la personne, l'urgence, la faisabilité et le risque potentiel dans chaque annotation. Sur cette base, les auteurs évaluent plusieurs grands modèles de langage multimodaux (MLLM) généralistes et présentent MMC2Act, un modèle de référence entraîné à faire correspondre observations multimodales et actions cognitives de haut niveau, testé sur différents réglages de modalités, une généralisation à des sujets non vus à l'entraînement, un transfert inter-jeux de données et une évaluation humaine. Le résultat central est que les MLLM généralistes peinent à raisonner de façon proactive à partir d'indices multimodaux, tandis qu'un entraînement sur ProAction améliore nettement les performances. Pour l'industrie robotique, ce travail cible un maillon encore peu documenté : la couche de décision en amont de l'action, celle qui doit repérer qu'une personne a besoin d'aide avant même qu'elle ne formule une demande, une capacité clé pour les robots d'assistance domestique ou de service vendus comme "autonomes". L'article souligne aussi l'écart entre les modèles de fondation génériques, entraînés sur des corpus web, et les exigences d'un contexte social et physique réel : sans données annotées selon un cadre affectif et contextuel explicite, ces modèles restent de mauvais juges de l'urgence ou du risque. Pour les intégrateurs et décideurs B2B évaluant des plateformes d'assistance, le papier rappelle que la promesse d'autonomie proactive dépend moins de la puissance brute d'un MLLM que de la qualité et de la structure des données liées au contexte humain, un point souvent minimisé dans les discours commerciaux. Ce travail s'inscrit dans la lignée des efforts récents sur l'assistance robotique proactive, un axe encore marginal comparé aux grands jeux de données orientés instructions explicites ou contrôle bas niveau qui dominent l'apprentissage robotique actuel. Les auteurs positionnent ProAction comme comblant un manque : les ressources existantes couvrent soit d'autres contextes, soit d'autres niveaux d'action, sans traiter la prise de décision multimodale humaine en conditions réelles. Il s'agit à ce stade d'une contribution de recherche en prépublication sur arXiv, sans lien mentionné avec un déploiement robotique physique, un partenaire industriel ou un calendrier de commercialisation : le jeu de données et MMC2Act sont évalués sur des benchmarks de raisonnement, pas sur un robot exécutant physiquement ces actions. La suite logique, non détaillée dans l'article, serait d'intégrer ce raisonnement cognitif en amont dans une pile robotique complète couplée à des modules d'exécution physique, à l'image des approches VLA comme Pi-0 ou GR00T N2 qui traitent la partie aval du problème.

RecherchePaper
1 source