Aller au contenu principal
RecherchearXiv cs.RO 

SABER : apprentissage d'une affordance sémantique par attention pour la locomotion des robots à pattes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

SABER, une politique d'apprentissage par renforcement sans planificateur, est présentée dans un article publié sur arXiv le 21 septembre 2026 (2609.21572). Elle ajoute à la géométrie du terrain, déjà exploitée par les politiques de locomotion perceptive, une couche de permission de contact sémantique : chaque cellule d'une carte terrain unifiée encode la géométrie 3D locale et un coût de contact. Son mécanisme central modifie la cross-attention par un biais sémantique signé et appris, pondéré selon ce coût et la distance au pied le plus proche, si bien qu'un obstacle n'influence l'attention que tant qu'il peut affecter le prochain appui. Testée en conditions réelles sur un robot quadrupède Unitree B2, en intérieur et extérieur, face à quatre classes d'obstacles sémantiques, la politique montre par ablation qu'un retrait du seul biais sémantique fait grimper les contacts interdits de 55%, sans dégrader le suivi de vitesse.

Ce résultat cible un angle mort concret pour la robotique industrielle : une politique purement géométrique peut juger traversable un tuyau, une pelouse ou un carton fragile, alors qu'un contact à cet endroit peut endommager l'équipement, déstabiliser le robot ou mettre en danger le site. Pour les intégrateurs déployant des robots à pattes en usine ou en entrepôt, SABER comble une limite connue des politiques apprises : la géométrie seule ne garantit pas un comportement sûr autour d'objets sensibles. Son apport principal tient à l'absence de coût mesurable sur le suivi de trajectoire, ce qui contredit l'hypothèse répandue selon laquelle des règles de sécurité supplémentaires dégraderaient nécessairement l'agilité. Cela confirme aussi que les mécanismes d'attention, déjà centraux dans les modèles vision-langage-action, peuvent structurer des politiques bas niveau pour la locomotion.

SABER prolonge une recherche sur la locomotion perceptive qui a surtout intégré la géométrie du terrain, sans traiter systématiquement le sens des surfaces. Contrairement aux approches à planificateur explicite, elle reste une politique bout-en-bout entraînée directement par renforcement. Le choix du Unitree B2, quadrupède très utilisé en recherche académique, situe ce travail comme une validation scientifique sim-to-real, sans partenaire industriel ni pilote annoncé, les suites possibles visant d'autres morphologies, davantage de classes sémantiques, ou une intégration à des piles combinant perception, navigation et manipulation.

À lire aussi

Composition de compétences pour l'apprentissage par renforcement des robots à pattes
1arXiv cs.RO 

Composition de compétences pour l'apprentissage par renforcement des robots à pattes

Un article de recherche publié sur arXiv (référence 2609.14647v1, soumission de type "new") intitulé "Skill Composition for Legged Robot Reinforcement Learning" pose un constat simple sur l'état de l'art en robotique humanoïde : les robots à pattes, et les humanoïdes en particulier, maîtrisent de mieux en mieux des comportements isolés, chacun obtenu par l'entraînement d'un contrôleur spécialisé par apprentissage par renforcement. Ces politiques spécialisées s'entraînent vite, convergent de façon fiable puisqu'elles ne traitent qu'un problème restreint, et peuvent être validées indépendamment les unes des autres, trois propriétés qu'une politique unique de bout en bout censée tout couvrir ne possède pas. Le point faible identifié par les auteurs n'est pas l'acquisition des compétences elles-mêmes, mais la transition entre elles : le passage de contrôle d'une politique à une autre reste fragile et mal maîtrisé. L'argument central du papier est que la composition de sous-politiques indépendantes mérite d'être traitée comme un problème de recherche à part entière, et non comme un détail d'implémentation confié au premier mécanisme disponible. Une composition fiable est ce qui transforme une collection de compétences isolées en un répertoire réellement exploitable, extensible et partageable, un enjeu direct pour les intégrateurs qui cherchent à assembler des bibliothèques de comportements réutilisables plutôt que de réentraîner un modèle monolithique à chaque nouvelle tâche. Plus fondamentalement, si le contrôle peut être transféré entre politiques spécialisées de façon sûre et à tout moment, le choix de l'action suivante peut être délégué à un composant de nature différente, comme un planificateur, un automate ou un contrôleur symbolique, dont le comportement est inspectable à l'avance. Les politiques n'auraient alors plus qu'à agir, tandis que ce que le robot est autorisé à faire deviendrait vérifiable, un argument qui va à contre-courant de la course actuelle aux politiques VLA de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, et qui remet en avant l'intérêt de l'architecture modulaire pour la certification et la sécurité en environnement industriel. Il s'agit d'un article de position et de méthode, sans résultats chiffrés, démonstration matérielle ni annonce de déploiement dans le résumé disponible : aucun robot, aucune entreprise ni aucun site de test n'y sont cités, ce qui le distingue nettement des communiqués produits du secteur. Il s'inscrit dans un débat plus large qui oppose, d'un côté, les laboratoires misant sur des politiques vision-langage-action entraînées de bout en bout pour couvrir un maximum de tâches avec un seul réseau, et de l'autre, une tradition de robotique plus classique fondée sur la planification hiérarchique et les automates symboliques. En proposant de faire de la composition de compétences un objet de recherche autonome, les auteurs ouvrent une voie intermédiaire entre ces deux approches, sans préciser dans l'abstract de calendrier, de prototype ou de partenariat industriel concret pour la suite des travaux.

RecherchePaper
1 source
Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture
2arXiv cs.RO 

Apprentissage d'une locomotion adaptative à la pente pour robots humanoïdes sur chantiers de couverture

Un article publié sur arXiv (référence 2609.20558v1) présente un cadre logiciel permettant à un robot humanoïde Unitree G1 d'exécuter des tâches de couvreur sur toitures en pente : marche en montée, utilisation d'une cloueuse pneumatique, martelage et mouvements de flexion. La méthode capture des démonstrations humaines par un système de suivi de mouvement, les retranscrit sur le robot, puis s'appuie sur un modèle métrique 3D du toit pour ancrer précisément les points de contact des pieds et des mains ainsi que les relations de travail (distance à l'outil, zones de dégagement) à la surface réelle. Une optimisation au niveau de la trajectoire fixe ces contraintes, tandis qu'un apprentissage par renforcement sensible à l'exécution maintient ces relations malgré les erreurs de suivi en conditions dynamiques. Les auteurs évaluent l'approche via une étude de suivi multi-mouvements, une matrice couvrant différentes pentes de toit, une ablation à cinq configurations sur la tâche de cloueuse, des tests croisés sur le martelage et la poussée latérale, ainsi que des comparaisons avec un apprentissage par renforcement pur et une téléopération sans apprentissage préalable. Résultats obtenus : des erreurs de dégagement de travail comprises entre 0,256 et 0,531 cm, un taux de réussite de 3 sur 3 pour chaque tâche testée, et des erreurs moyennes de position du tronc inférieures à 80 mm lors des expériences physiques. L'intérêt de ces travaux tient au problème qu'ils ciblent : les surfaces inclinées et irrégulières du bâtiment restent l'un des terrains les plus difficiles pour les humanoïdes, bien plus exigeants que les sols plats des entrepôts où la plupart des démonstrations commerciales sont tournées. L'étude illustre aussi un écueil classique de l'apprentissage par imitation : retranscrire fidèlement un geste humain capturé ne garantit pas un placement correct des appuis par rapport à l'environnement réel, d'où l'ajout d'un ancrage explicite à un modèle de scène. Pour les intégrateurs et décideurs du BTP, ce résultat reste un signal de recherche amont plutôt qu'une preuve de déploiement : il indique une piste méthodologique crédible pour doter les humanoïdes de compétences de chantier extérieur, sans annoncer de produit ni de pilote commercial. Le travail s'appuie sur le Unitree G1, plateforme humanoïde chinoise largement utilisée par les laboratoires de recherche en robotique incarnée pour son coût réduit face à des concurrents comme Boston Dynamics ou Tesla Optimus. Il s'inscrit dans une vague plus large de recherches combinant apprentissage par imitation et renforcement pour le contrôle corps entier des humanoïdes, dans la lignée conceptuelle de projets industriels comme Helix de Figure AI ou GR00T N2 de NVIDIA, sans toutefois émaner d'un acteur commercial identifié : il s'agit d'une prépublication arXiv non encore validée par relecture par les pairs. Les auteurs présentent leur approche comme une base pour de futures primitives de mouvement humanoïde dédiées au bâtiment, sans calendrier de pilote ni partenariat annoncé à ce stade.

RecherchePaper
1 source
MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique
3arXiv cs.RO 

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique

Des chercheurs présentent MAPL (Multi-Objective AI-Informed Preference Learning), un cadre d'apprentissage par renforcement pour la locomotion quadrupède qui remplace les fonctions de récompense manuelles par des préférences générées par LLM. Publié sur arXiv (réf. 2606.25398) en juin 2025, le système soumet des paires de trajectoires à un grand modèle de langage, qui les évalue selon plusieurs critères sémantiques distincts, formulés en langage naturel générique et invariants selon le terrain. Ces préférences par objectif alimentent un modèle de scoring à plusieurs têtes, dont les sorties sont agrégées en récompense scalaire pour l'optimisation de politique. Sur quatre environnements de simulation quadrupède, les auteurs rapportent des performances comparables ou supérieures à des récompenses conçues par des experts du domaine. L'intérêt de MAPL tient à sa décomposition structurée des objectifs, là où les méthodes LLM existantes se limitent à un jugement global entre comportements. En robotique industrielle, la conception de fonctions de récompense reste un goulot d'étranglement reconnu, exigeant de longues itérations entre ingénieurs RL et spécialistes métier. Substituer ce travail par des descriptions en langage naturel, réutilisables sans réécriture d'équations, réduirait le coût d'adaptation à de nouvelles tâches. La décomposition en critères distincts offre aussi une meilleure interprétabilité : il devient possible d'identifier quels objectifs sont en tension, ce qui facilite le débogage comportemental. MAPL s'inscrit dans la vague d'automatisation de la conception de récompenses via LLM, initiée notamment par EUREKA (NVIDIA, 2023), qui générait directement du code de récompense via GPT-4, et par RL-VLM-F, qui exploite des modèles vision-langage pour évaluer les comportements. La locomotion quadrupède est un benchmark standard utilisé par des projets comme ANYmal (ETH Zurich) et les plateformes Unitree. Plusieurs limites méritent d'être signalées : l'article reste un preprint non relu par les pairs, les expériences sont menées uniquement en simulation sans validation physique, et le LLM utilisé pour générer les préférences n'est pas spécifié, ce qui complique la reproductibilité. Les extensions naturelles concernent la validation sur robot réel et l'application à des morphologies plus complexes, comme les humanoïdes, où l'ingénierie de récompense est particulièrement coûteuse.

RecherchePaper
1 source
AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique
4arXiv cs.RO 

AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique

Des chercheurs proposent AffordTrajDP, un nouveau framework d'apprentissage par imitation guidé par affordances pour la manipulation robotique, publié en préprint sur arXiv début août 2026. Contrairement aux approches classiques qui figent un point de contact statique entre l'effecteur et l'objet cible, ce système construit une trajectoire d'affordance dynamique : à partir d'une observation RGB-D, un point d'ancrage est propagé dans le temps en suivant la pose SE(3) de l'objet, ce qui donne une guidance cohérente tout au long du geste plutôt qu'une simple instruction figée en début de tâche. Sur le benchmark simulé ManiSkill3, la méthode atteint un taux de réussite moyen de 70,0 %, soit jusqu'à 17,8 points de mieux que les meilleures méthodes concurrentes. Des essais en conditions réelles ont été menés sur des bras robotiques Galaxea A1 et UR7e, sur six tâches de précision (empilement de cubes, prise de gobelet, insertion d'adaptateur, anneau sur tige, dépôt en bol, insertion USB), avec des tests sur objets vus et non vus pour le bras Galaxea A1. L'enjeu dépasse la simple performance chiffrée : les affordances statiques dérivent souvent après le contact initial, surtout dans les tâches de précision ou quand la position de l'objet varie légèrement, un problème classique de fossé entre démonstration en labo et robustesse en conditions réelles. En rendant la guidance sensible à l'état de l'objet plutôt qu'à un point fixe défini à l'avance, AffordTrajDP s'attaque directement à ce goulot d'étranglement, un signal pertinent pour les intégrateurs qui cherchent des politiques visuo-motrices capables de tolérer le désordre réel d'un poste de production ou d'entrepôt, plutôt que des démonstrations calibrées en environnement contrôlé. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation guidées par affordances, qui cherchent à compresser la perception visuelle en contraintes géométriques exploitables pour réduire les besoins en données d'entraînement. Les auteurs présentent des ablations pour isoler la contribution de chaque composant du système. À ce stade, il s'agit d'un résultat de recherche en préprint, non d'un produit commercial ni d'un déploiement industriel annoncé.

RecherchePaper
1 source