Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage d'une représentation du mouvement expressive et compositionnelle via des compétences spectrales

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent les « spectral skills », une représentation latente qui sert d'interface de commande entre un planificateur de haut niveau et un contrôleur bas niveau pour humanoïdes. Ces skills encodent de courts segments de mouvement sous forme compacte. Elles sont apprises par apprentissage prédictif : l'encodeur doit prédire le mouvement suivant, et non reconstruire son entrée. Sur un humanoïde de 29 DOF, un contrôleur conditionné par ces skills réduit l'erreur de suivi global de 62 % par rapport à l'état de l'art. Le même contrôleur, gelé, enchaîne des skills encodées indépendamment sans politique de transition dédiée. Il compose aussi de nouveaux comportements en ajoutant des directions orthogonales à une skill de base compatible, ce qui produit des combinaisons absentes des données d'entraînement. Les auteurs présentent du suivi de mouvement, de l'enchaînement et de la composition, ainsi qu'un pilotage par un planificateur conditionné par le langage, sur un Unitree G1 réel. Le travail, publié sur arXiv (2609.37677), est accompagné d'une page projet.

L'enjeu porte sur l'interface entre planificateur et contrôleur, un point de friction des architectures hiérarchiques pour humanoïdes. Cette interface doit permettre une exécution précise, rester assez simple pour être prédite par un modèle de fondation (VLA ou planificateur de langage) et se prêter à la composition. Les représentations actuelles sacrifient en général l'un de ces critères. Si les résultats se confirment, un contrôleur unique et figé pourrait exécuter des comportements variés sans réentraîner de module de transition. Cela réduirait le coût d'intégration pour ceux qui greffent un planificateur sur une base de locomotion existante. Deux réserves : la réduction de 62 % est relative à un état de l'art que le résumé ne nomme pas, et les démonstrations matérielles sur G1 restent qualitatives. Aucun chiffre de robustesse, de taux de réussite ni de durée d'exécution n'est fourni. Le passage de la démonstration de laboratoire à un déploiement industriel n'est donc pas établi.

Ce travail s'inscrit dans le mouvement des modèles de fondation robotiques pour humanoïdes. Ceux-ci adoptent souvent une architecture à deux niveaux, comme les systèmes duaux de type Helix chez Figure ou GR00T chez NVIDIA, avec un module « lent » qui décide et un module « rapide » qui exécute. Le Unitree G1, plateforme abordable et très répandue dans les laboratoires, sert ici de banc d'essai. Il rend la méthode reproductible par d'autres équipes, mais les 29 DOF et les capacités du G1 ne reflètent pas les contraintes de charge utile ou d'endurance d'un humanoïde industriel. Les suites logiques sont la validation sur d'autres morphologies, la comparaison publique avec les méthodes de suivi de mouvement existantes et l'intégration avec des planificateurs de type VLA à grande échelle. Aucun pilote industriel ni calendrier n'est annoncé.

À lire aussi

Composition de compétences pour l'apprentissage par renforcement des robots à pattes
1arXiv cs.RO 

Composition de compétences pour l'apprentissage par renforcement des robots à pattes

Un article de recherche publié sur arXiv (référence 2609.14647v1, soumission de type "new") intitulé "Skill Composition for Legged Robot Reinforcement Learning" pose un constat simple sur l'état de l'art en robotique humanoïde : les robots à pattes, et les humanoïdes en particulier, maîtrisent de mieux en mieux des comportements isolés, chacun obtenu par l'entraînement d'un contrôleur spécialisé par apprentissage par renforcement. Ces politiques spécialisées s'entraînent vite, convergent de façon fiable puisqu'elles ne traitent qu'un problème restreint, et peuvent être validées indépendamment les unes des autres, trois propriétés qu'une politique unique de bout en bout censée tout couvrir ne possède pas. Le point faible identifié par les auteurs n'est pas l'acquisition des compétences elles-mêmes, mais la transition entre elles : le passage de contrôle d'une politique à une autre reste fragile et mal maîtrisé. L'argument central du papier est que la composition de sous-politiques indépendantes mérite d'être traitée comme un problème de recherche à part entière, et non comme un détail d'implémentation confié au premier mécanisme disponible. Une composition fiable est ce qui transforme une collection de compétences isolées en un répertoire réellement exploitable, extensible et partageable, un enjeu direct pour les intégrateurs qui cherchent à assembler des bibliothèques de comportements réutilisables plutôt que de réentraîner un modèle monolithique à chaque nouvelle tâche. Plus fondamentalement, si le contrôle peut être transféré entre politiques spécialisées de façon sûre et à tout moment, le choix de l'action suivante peut être délégué à un composant de nature différente, comme un planificateur, un automate ou un contrôleur symbolique, dont le comportement est inspectable à l'avance. Les politiques n'auraient alors plus qu'à agir, tandis que ce que le robot est autorisé à faire deviendrait vérifiable, un argument qui va à contre-courant de la course actuelle aux politiques VLA de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, et qui remet en avant l'intérêt de l'architecture modulaire pour la certification et la sécurité en environnement industriel. Il s'agit d'un article de position et de méthode, sans résultats chiffrés, démonstration matérielle ni annonce de déploiement dans le résumé disponible : aucun robot, aucune entreprise ni aucun site de test n'y sont cités, ce qui le distingue nettement des communiqués produits du secteur. Il s'inscrit dans un débat plus large qui oppose, d'un côté, les laboratoires misant sur des politiques vision-langage-action entraînées de bout en bout pour couvrir un maximum de tâches avec un seul réseau, et de l'autre, une tradition de robotique plus classique fondée sur la planification hiérarchique et les automates symboliques. En proposant de faire de la composition de compétences un objet de recherche autonome, les auteurs ouvrent une voie intermédiaire entre ces deux approches, sans préciser dans l'abstract de calendrier, de prototype ou de partenariat industriel concret pour la suite des travaux.

RecherchePaper
1 source
Développer des compétences combinées de manipulation et de locomotion via une représentation d'interaction et une composition de compétences
2arXiv cs.RO 

Développer des compétences combinées de manipulation et de locomotion via une représentation d'interaction et une composition de compétences

Des chercheurs présentent une méthode pour apprendre à un robot humanoïde à combiner préhension et locomotion à partir de principes développementaux, dans un article déposé sur arXiv (2608.00208v1). La première brique est une politique de saisie corps entier inspirée de l'analyse harmonique : des harmoniques cubiques servent de poids pour représenter la relation spatiale main objet via une convolution spatiale, et un curriculum de découplage des articulations des doigts, appliqué au sein même de chaque épisode d'apprentissage, permet au robot d'apprendre à saisir sans dataset externe ni modèle pré-entraîné. La seconde brique combine cette politique de saisie avec une politique de lever et de marche apprise séparément, en s'appuyant sur des scores d'interaction main objet pour décider, à chaque instant, quelle politique pilote quelles articulations. Résultat : 93% de réussite en zero shot sur des objets jamais vus, et entre 96 et 100% de réussite pour se relever tout en tenant l'objet saisi. L'intérêt pratique dépasse la simple prouesse technique : la plupart des démonstrations de manipulation mobile chez les humanoïdes empilent des compétences apprises isolément, avec un risque élevé d'interférence entre politiques au moment de les enchaîner. Ici, la généralisation zero shot à des objets inconnus, sans recourir à un modèle vision langage action massif comme Pi-0, GR00T N2 ou Helix, tranche avec la tendance dominante du secteur, qui mise sur l'échelle des données plutôt que sur des curricula développementaux. L'enseignement le plus transférable pour des ingénieurs robotique ou des intégrateurs concerne la composition de compétences : elle ne fonctionne de façon fiable que si chaque politique est entraînée sur le corps entier du robot, y compris des parties a priori inutiles à la tâche, comme garder les doigts actifs pendant l'apprentissage de la marche. Le travail s'inscrit dans la course plus large à la manipulation mobile chez les humanoïdes, un problème que des acteurs commerciaux comme Figure, Agility ou plusieurs plateformes chinoises tentent aussi de résoudre, le plus souvent via des modèles VLA pré-entraînés à grande échelle plutôt que par apprentissage développemental from scratch. L'abstract ne mentionne ni déploiement réel ni acteur français ou européen, et les résultats restent issus d'environnements contrôlés de simulation ou de laboratoire ; reste à voir si l'approche passe l'échelle vers des comportements plus complexes ou vers d'autres plateformes matérielles.

RecherchePaper
1 source
Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles
3arXiv cs.RO 

Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles

Un article publié sur arXiv (2609.22055v1, section cross-listing) présente un nouveau benchmark destiné à évaluer la capacité des "world models" à apprendre en continu sur des tâches de manipulation robotique. Baptisé benchmark de continual learning compositionnel, l'outil construit des séquences de tâches où chaque nouvelle tâche recombine des éléments déjà rencontrés, en factorisant cette composition selon deux axes distincts : l'action et la perception. L'objectif est de séparer deux capacités souvent confondues dans les mesures d'adaptation classiques, la vitesse d'apprentissage de tâches inédites d'un côté, la réutilisation de connaissances déjà acquises de l'autre. Les auteurs testent plusieurs world models considérés comme état de l'art, combinés à des méthodes de continual learning standards, ainsi qu'un modèle modulaire dont le socle de dynamique intègre des composants explicitement conçus pour être réutilisés. Le code et les détails du benchmark sont publiés sur un site dédié au projet, object814.github.io/Compositional-Continual-Learning. Le résultat central est que l'architecture modulaire offre un meilleur compromis entre réutilisation des connaissances et oubli catastrophique que les méthodes de continual learning conventionnelles, mais qu'aucune approche testée ne résout le problème dans son ensemble. Pour les laboratoires qui développent des modèles génériques de type VLA destinés à équiper des robots manipulateurs en usine ou en logistique, ce constat vient nuancer l'hypothèse implicite selon laquelle un modèle suffisamment large finirait par s'adapter à de nouveaux environnements sans réentraînement complet ni perte de performance sur les tâches antérieures. Le benchmark fournit en somme un outil de diagnostic plus rigoureux que les mesures d'adaptation globales habituellement citées dans les communiqués sur les robots généralistes, en isolant précisément où l'apprentissage échoue. Ce travail s'inscrit dans la continuité des recherches sur le continual learning appliqué à la robotique, un champ où les benchmarks existants mesuraient rarement séparément la vitesse d'apprentissage et la réutilisation de connaissances. En se concentrant spécifiquement sur les world models, composants de plus en plus centraux dans les architectures de contrôle robotique moderne, les auteurs positionnent leur contribution comme un outil d'évaluation plutôt qu'un nouveau modèle concurrent. La publication du benchmark en accès libre laisse présager son adoption par d'autres équipes pour tester leurs propres architectures, sans qu'aucun calendrier de déploiement industriel ne soit annoncé à ce stade.

RecherchePaper
1 source
L'apprentissage conjoint de prédicats et d'actions permet la composition zéro-shot de compétences
4arXiv cs.RO 

L'apprentissage conjoint de prédicats et d'actions permet la composition zéro-shot de compétences

Des chercheurs ont publié le 21 mai 2026 sur arXiv un préprint intitulé "Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition", introduisant PACTS (Predicate Action Skills), une nouvelle classe de politiques visuomotrices en boucle fermée pour la robotique. Le problème posé est précis : les approches actuelles d'apprentissage par démonstration (LfD) permettent à un robot d'acquérir des compétences isolées, mais échouent à les recombiner de façon inédite sans réentraînement. PACTS y répond en modélisant chaque compétence comme un processus génératif joint sur deux flux simultanés : les trajectoires d'action et les trajectoires de croyance prédicative, c'est-à-dire des représentations symboliques de l'état du monde induites par chaque action. Un seul modèle produit ainsi des séquences action-résultat cohérentes, sans pipeline séparé. L'enjeu est structurel pour la robotique industrielle et de service : la capacité de composition zéro-shot signifie qu'un robot formé sur des briques de base peut enchaîner des tâches nouvelles sans nouvelle collecte de données ni réentraînement, ce qui est un verrou majeur dans le déploiement à grande échelle. Les politiques génératives modernes, notamment les VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou les modèles de diffusion appliqués aux trajectoires, ne modélisent que la distribution des actions, sans raisonnement explicite sur les états symboliques intermédiaires. PACTS utilise les prédictions de prédicats en ligne comme interface symbolique pour séquencer les compétences et surveiller leur exécution, s'approchant ainsi d'une forme de planification symbolique intégrée. Les auteurs montrent que la génération jointe améliore à la fois la qualité des actions produites et la classification des prédicats, deux métriques qui se renforçaient rarement dans les approches précédentes. Ce travail s'inscrit dans un débat actif entre approches purement neuronales (end-to-end) et approches hybrides neuro-symboliques pour la manipulation robotique. Les méthodes de Task and Motion Planning (TAMP) classiques atteignent une bonne compositionnalité mais nécessitent des modèles symboliques prédéfinis ; les politiques d'imitation modernes générealisent mal sans représentation intermédiaire explicite. PACTS tente de combler les deux, en apprenant les symboles depuis les données de démonstration plutôt qu'en les codant manuellement. Le code et les expériences sont annoncés sur le site du projet (planpacts.github.io), mais le préprint n'est pas encore évalué par des pairs, et aucun résultat de déploiement terrain ni partenaire industriel n'est mentionné à ce stade.

RechercheOpinion
1 source