Apprentissage continu de la traversabilité du terrain par l'expérience pour robots quadrupèdes
Des chercheurs publient sur arXiv (2609.39755v1) un pipeline d'apprentissage continu qui permet à un robot quadrupède d'estimer, avant tout contact, la manière dont un terrain va se comporter sous ses pattes. Le système part d'images prises avant le contact, encodées par un modèle DINOv3 dont les poids restent figés pendant l'entraînement. Ces descripteurs visuels sont convertis en cinq indicateurs proprioceptifs, pondérés selon la fiabilité de leur mesure : glissement plan du pied, force de réaction normale moyenne, indice de traction, coût de transport et taux de charge à l'impact. Un régresseur évidentiel compact fournit ces prédictions avec leurs incertitudes aléatoire et épistémique. Les prédictions et l'incertitude épistémique sont projetées dans une carte locale multicouche, puis fusionnées en un score de traversabilité prudent dont les pondérations se règlent sans réentraînement. L'implémentation ROS2 a été évaluée sur un Unitree Go2, en simulation et sur matériel réel, avec des modèles entraînés séparément dans chaque domaine. Sur un flux séquentiel de trois terrains inédits, le replay avec validation réduit de 23,1 % la dégradation de la log-vraisemblance négative (NLL) sur les données d'ancrage, par rapport à un replay sans validation, pour une adaptation comparable aux nouveaux terrains.
L'intérêt tient à ce que la traversabilité est apprise à partir de l'expérience de locomotion. La géométrie et l'apparence visuelle ne disent pas si le robot va glisser, comment ses pieds seront chargés ou combien d'énergie il dépensera. Le mécanisme de validation s'attaque à l'oubli catastrophique : un modèle candidat ne remplace le prédicteur déployé que s'il progresse sur les données récentes sans perdre au-delà d'une tolérance fixée sur les données historiques. Pour un exploitant de robots d'inspection sur site industriel, minier ou extérieur, cela rend envisageable une mise à jour en cours de mission, sans cycle de réentraînement hors ligne. Les limites sont nettes : le gain de 23,1 % est relatif à une variante de la même méthode et non à une référence externe, l'évaluation hardware ne porte que sur trois terrains, et le Go2 est une plateforme de recherche légère. Rien n'indique non plus une validation à grande échelle ou en conditions industrielles. Il s'agit d'un résultat académique, pas d'un produit.
Ce travail s'inscrit dans la lignée des approches de navigation par traversabilité auto-supervisée, qui utilisent les signaux proprioceptifs comme étiquettes pour des prédictions visuelles, et de l'essor des modèles de fondation visuels comme DINO utilisés comme encodeurs figés. Le Go2 d'Unitree reste la plateforme de référence des laboratoires, ce qui facilite la reproduction. Il reste à voir si le code sera publié, si la méthode tient sur de plus longues séquences de terrains et sur des robots plus lourds comme ceux d'ANYbotics ou de Boston Dynamics, ou si elle sera intégrée à des politiques de locomotion apprises de bout en bout.
Dans nos dossiers




