Aller au contenu principal
RecherchearXiv cs.RO 

Ce que la carte d'élévation ne voit pas : locomotion sémantique et navigation tenant compte de l'exécution pour robot humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un nouveau benchmark de simulation pour la navigation des robots humanoïdes, accompagné d'un cadre de contrôle en boucle fermée associant navigation visuelle guidée par le langage (VLN) et politique de locomotion. Le travail, publié sur arXiv (2610.07396), part d'un constat : les benchmarks VLN existants produisent certes des déplacements physiquement exécutables, mais reposent sur deux hypothèses jugées irréalistes. La première est que tous les dangers sont visibles dans une carte d'élévation. La seconde est que les mouvements réalisés correspondent fidèlement aux mouvements commandés. Le nouveau benchmark modélise à la fois des obstacles « subtils en élévation » (une bouteille tombée, ambiguë sur une carte de hauteur, ou la difficulté de distinguer un téléphone d'une flaque d'eau) et des écarts d'exécution. Le cadre proposé réaligne en continu la navigation de haut niveau sur l'état réel du robot. L'évaluation est menée en simulation, et la politique de locomotion est validée sur un humanoïde Unitree G1 réel. Les résultats indiquent que l'entrée sémantique réduit les contacts avec les dangers mal représentés par les cartes d'élévation, et que le mécanisme anti-déviation améliore le taux de réussite de navigation. L'extrait disponible ne fournit ni taux de réussite chiffrés, ni taille du benchmark, ni nombre d'essais sur le matériel.

L'intérêt tient à ce que ce travail s'attaque à un angle mort des évaluations actuelles. Quand la locomotion esquive un danger, le robot s'écarte du chemin voulu par la politique de navigation, et cet écart se cumule jusqu'à conduire la machine vers un endroit non prévu. Pour les intégrateurs et les responsables d'exploitation qui envisagent des humanoïdes dans des environnements encombrés (entrepôts, ateliers, commerces), le message est clair : mesurer seulement l'achèvement du trajet, ou seulement l'évitement d'obstacles, donne une image trompeuse. Les auteurs plaident pour une évaluation conjointe des deux. Cela relativise aussi les démonstrations où la carte d'élévation suffit à tout : un liquide au sol ou un objet plat échappe à la géométrie pure, et la perception sémantique devient nécessaire. Il faut toutefois rester prudent : il s'agit d'un benchmark simulé, et la validation physique porte sur la locomotion, pas sur la chaîne complète de navigation.

Ce travail s'inscrit dans la montée en puissance des approches VLN et des politiques de locomotion apprises pour humanoïdes, où le G1 d'Unitree est devenu une plateforme de recherche courante grâce à son coût relativement abordable. Les évaluations sur matériel à grande échelle restent coûteuses et risquées, ce qui explique le recours aux benchmarks de simulation, au prix d'un écart sim-to-real que ce papier ne referme pas entièrement. La suite logique serait une validation de bout en bout sur robot physique, avec davantage de scénarios et de types de dangers. Aucun calendrier ni partenaire industriel n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

RoboMirror : comprendre avant d'imiter pour la locomotion humanoïde à partir de vidéo
1arXiv cs.RO 

RoboMirror : comprendre avant d'imiter pour la locomotion humanoïde à partir de vidéo

Des chercheurs présentent RoboMirror, un système qui permet a un robot humanoïde d'apprendre a marcher directement a partir de vidéos, sans capture de mouvement ni retargeting du squelette. Contrairement aux méthodes existantes, qui s'appuient soit sur des trajectoires de motion capture organisées, soit sur des commandes textuelles éparses, RoboMirror utilise des modèles vision-langage (VLM) pour extraire l'intention de mouvement visuelle brute de vidéos filmées a la première personne (égocentriques) ou a la troisième personne, et alimente directement avec cette intention une politique de contrôle basée sur la diffusion générant des mouvements physiquement plausibles sans reconstruction explicite de pose. Selon les expériences rapportées par les auteurs, le système permet la téléprésence via vidéo égocentrique, réduit de 80% la latence de contrôle en mode troisième personne, et obtient un taux de réussite des taches supérieur de 3,7% par rapport aux méthodes de référence. Le papier, publie sur arXiv sous l'identifiant 2512.23649, en est a sa quatrième version révisée. Ce travail s'attaque a un problème concret pour l'industrie de la robotique humanoïde: la difficulté de transférer un mouvement observe en vidéo vers un contrôleur robotique sans étape intermédiaire couteuse et sujette aux erreurs, comme la capture de mouvement ou le retargeting manuel. Si les résultats se confirment a plus grande échelle, cela ouvrirait la voie a l'apprentissage de locomotion a partir de vidéo "en conditions réelles" plutôt que de jeux de données de motion capture couteux a produire. Pour les équipes de R&D en téléopération, la réduction de latence en contrôle troisième personne cible un goulot d'étranglement connu, ou le délai entre observation vidéo et exécution du mouvement dégradé la réactivité et la stabilité. Ces chiffres restent toutefois issus d'évaluations internes des auteurs sur des baselines qu'ils ont eux-mêmes sélectionnées, sans validation indépendante ni déploiement documente sur robot physique en conditions réelles. Cette approche s'inscrit dans un mouvement de recherche plus large visant a combler l'écart entre compréhension visuelle et action chez les humanoïdes, un axe pousse notamment par les modèles vision-langage-action. Les méthodes précédentes se divisaient en deux camps limites: les approches texte-vers-mouvement, pénalisées par la pauvreté sémantique du texte et l'accumulation d'erreurs dans des pipelines a étapes multiples, et les approches vidéo-vers-mouvement, qui se contentaient d'une imitation mécanique de la pose sans véritable compréhension du contenu. RoboMirror revendique être la première méthode vidéo-vers-locomotion sans retargeting en conditionnant directement une politique de diffusion sur l'intention extraite par un VLM. Le résume ne précise ni affiliation institutionnelle des auteurs ni calendrier de déploiement sur matériel réel: il s'agit a ce stade d'une contribution de recherche académique, sans pilote industriel ni partenariat annonce.

RecherchePaper
1 source
GuideWalk : apprentissage de la navigation autonome et de la locomotion unifiées pour robots humanoïdes sur terrains variés
2arXiv cs.RO 

GuideWalk : apprentissage de la navigation autonome et de la locomotion unifiées pour robots humanoïdes sur terrains variés

Des chercheurs présentent GuideWalk (arXiv:2606.10449, juin 2026), un framework unifié qui couple navigation autonome et locomotion adaptative pour robots humanoïdes sur terrains variés. L'architecture repose sur trois composantes : un module de navigation qui génère des guidances de vitesse explicites en tenant compte de la traversabilité du terrain, un schéma de distillation à enseignants composites qui agrège commandes directionnelles et actions dynamiquement cohérentes dans une politique unique, puis un affinement par apprentissage par renforcement (RL) couplé à un objectif auxiliaire de clonage comportemental (behavior cloning). Ce dernier mécanisme vise à maintenir les comportements souhaitables issus des enseignants tout en favorisant l'exploration. L'article reste au stade de preprint arXiv sans déploiement industriel annoncé ni métriques benchmarkées publiées dans l'abstract. Le problème technique adressé est structurant pour la robotique humanoïde : l'évitement d'obstacles et la locomotion dynamique sont habituellement traités en silos, ce qui crée des incohérences lorsqu'un robot planifie sur escaliers, sol accidenté ou transitions sol dur/mou. GuideWalk découple explicitement la planification d'obstacles de l'état du terrain, ce qui est une approche architecturale plus propre que les solutions end-to-end brutes ou les pipelines hiérarchiques rigides. Pour les intégrateurs et décideurs B2B, le vrai enjeu est le sim-to-real gap sur locomotion hétérogène : si cette architecture tient ses promesses en évaluation externe, elle pourrait réduire le besoin d'ingénierie terrain-spécifique lors du déploiement en entrepôt ou en environnement industriel non structuré. La navigation humanoïde sur terrains complexes reste un des derniers verrous majeurs avant déploiement opérationnel large, là où la locomotion pure en terrain plat est désormais relativement résolue chez Unitree (H1, G1), Boston Dynamics (Atlas) ou Agility Robotics (Digit). Des approches concurrentes comme GR00T N2 de NVIDIA ou les travaux de Physical Intelligence (Pi-0) s'attaquent au même problème via des Visual Language Action models (VLA) généralisés, tandis que des labos académiques comme CMU ou Berkeley publient régulièrement sur le sim-to-real en locomotion adaptative. GuideWalk s'inscrit dans cette vague mais avec une contribution méthodologique spécifique sur le couplage navigation-locomotion. Les prochaines étapes naturelles seraient une évaluation sur hardware réel (le preprint ne précise pas le robot utilisé) et une comparaison quantitative avec des baselines établies.

RecherchePaper
1 source
Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains
3arXiv cs.RO 

Navigation dans la foule : commande prédictive non linéaire avec dynamique des forces sociales pour la navigation robotique tenant compte des humains

Une équipe de chercheurs publie sur arXiv (arXiv:2607.10374v1, dépôt du 14 juillet 2026) un nouveau cadre de contrôle baptisé SFM-NMPC, pour Social Force Model based Non-linear Model Predictive Control. L'idée consiste à intégrer directement le Social Force Model, un modèle physique classique de la dynamique des foules, dans la boucle d'optimisation d'un contrôleur prédictif non linéaire (NMPC) pilotant la navigation d'un robot mobile. Concrètement, le contrôleur prédit simultanément les trajectoires futures des humains environnants et celle du robot sur tout l'horizon de prédiction, et s'appuie sur un ensemble de fonctions de coût sociales dédiées pour orienter la planification vers des comportements jugés conformes aux normes sociales, au-delà du simple évitement de collision. Malgré la complexité accrue du modèle, les auteurs annoncent un fonctionnement temps réel à 20 Hz, validé par des tests simulés extensifs en environnements encombrés, ainsi qu'une étude d'ablation isolant la contribution de la dynamique SFM et des termes de coût social. Pour l'industrie de la robotique mobile et les intégrateurs de robots destinés à des environnements partagés avec des humains, entrepôts, hôpitaux, espaces commerciaux, ce travail s'attaque à un point de friction connu: les méthodes classiques d'évitement d'obstacles traitent les piétons comme des obstacles dynamiques sans anticiper leur comportement, ce qui produit une navigation perçue comme intrusive ou erratique. En démontrant qu'un modèle de prédiction humaine sophistiqué peut être embarqué dans la boucle de contrôle sans casser la contrainte temps réel, l'étude apporte un argument concret contre l'hypothèse selon laquelle précision sociale et efficacité computationnelle seraient nécessairement antagonistes en MPC. Reste que les résultats, à ce stade, ne reposent que sur de la simulation: la validation sur robot physique en environnement humain réel, avec ses incertitudes de perception et de suivi de trajectoire, constitue l'étape suivante indispensable avant toute conclusion sur l'applicabilité terrain. Le Model Predictive Control s'est imposé ces dernières années comme alternative robuste aux approches classiques de planification et aux méthodes purement data-driven pour la navigation robotique, mais sa performance dépend étroitement de la qualité des modèles de prédiction humaine qu'il embarque. Le Social Force Model, formalisé dans les années 1990 pour modéliser les dynamiques de foule, offre une base physique interprétable que plusieurs travaux récents cherchent à coupler à des contrôleurs optimaux. SFM-NMPC s'inscrit dans cette lignée et se compare à des méthodes de référence de l'état de l'art sur des métriques de conformité sociale, sans toutefois se positionner face à des acteurs industriels ou des systèmes commerciaux déployés, le travail restant à ce stade de nature académique et exploratoire.

RecherchePaper
1 source
Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM
4arXiv cs.RO 

Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM

Des chercheurs proposent un cadre de « Risk-Aware Semantic Grounding » (ancrage sémantique sensible au risque) pour fiabiliser les robots de navigation pilotés par un grand modèle de langage (LLM), et publient sur arXiv (2609.37554v1) un banc d'essai associé, TRUST-NAV. Le problème visé est connu : lorsqu'un LLM sert de planificateur de haut niveau, ses sorties deviennent peu fiables si l'instruction est ambiguë, sans support dans l'environnement ou incohérente sur le plan sémantique. L'architecture estime donc, avant toute planification, trois risques distincts : l'ambiguïté, l'hallucination et le conflit sémantique. Selon ce score, le système choisit entre trois issues : exécuter l'instruction, demander une clarification ou la rejeter. TRUST-NAV réunit des tâches de navigation standard et des scénarios d'instructions volontairement piégées. Les résultats rapportés indiquent que les planificateurs LLM classiques performent bien sur les tâches valides, alors que le cadre proposé améliore nettement la détection d'ambiguïté et le rejet des conflits sémantiques. Le résumé ne fournit ni chiffres, ni modèles testés, ni robot réel : il s'agit d'un travail académique évalué sur benchmark, sans déploiement ni produit. L'intérêt tient au déplacement de la métrique. Jusqu'ici, la plupart des travaux sur les planificateurs LLM et les modèles vision-langage-action (VLA) optimisent la génération de plans et se jugent sur le taux de réussite des tâches. Les auteurs soutiennent qu'un robot fiable se mesure aussi à sa capacité à reconnaître qu'il ne doit pas agir. Pour un intégrateur ou un responsable d'exploitation, c'est un critère de sécurité concret : un AMR ou un humanoïde qui exécute avec assurance une consigne ambiguë ou impossible est un risque opérationnel, pas seulement une erreur de performance. L'approche est aussi modulaire, puisque le filtrage précède la planification et pourrait en principe se greffer sur des planificateurs existants. Il faut toutefois rester prudent : l'absence de chiffres publiés, l'évaluation sur un benchmark créé par les mêmes auteurs et l'écart habituel entre simulation et terrain limitent la portée des conclusions, en particulier sur le coût en fausses alertes, c'est-à-dire les refus ou demandes de clarification inutiles qui ralentissent une exploitation. Ce travail s'inscrit dans la vague des LLM employés comme planificateurs de haut niveau en navigation et en manipulation, où les hallucinations et l'ancrage dans l'environnement restent des points faibles reconnus. Les approches concurrentes reposent sur l'estimation d'incertitude, la prédiction conforme pour déclencher des demandes d'aide, ou des couches de vérification et de garde-fous, tandis que les grands modèles fondation robotiques cherchent surtout à augmenter le taux de réussite. La suite dépendra de la disponibilité de TRUST-NAV pour la communauté, de la reproduction des résultats par des tiers et d'un test sur robot physique, étape que la version 1 du préprint ne mentionne pas.

RecherchePaper
1 source