Aller au contenu principal
RecherchearXiv cs.RO 

Locomotion humanoïde grâce à un contrôleur récurrent inspiré de la mouche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude arXiv publiée sous la référence 2609.27001v1 ("Humanoid Locomotion with a Fly-Inspired Recurrent Controller") détaille un contrôleur récurrent inspiré du circuit neuronal de la mouche, testé exclusivement en simulation sur un robot humanoïde Unitree G1. Le système relie 3 609 états neuronaux continus au corps du robot via des projections d'observation corporelle, une couche de lecture étiquetée par neurones moteurs, et les servomoteurs articulaires. Un unique checkpoint figé a été évalué sur 7 types de terrain, 3 vitesses et 3 décalages de lacet initiaux, soit 63 configurations : le contrôleur réussit 61 d'entre elles selon un critère de survie et de progression vers l'avant, contre 62/63 pour une référence dite "privilégiée" disposant d'informations supplémentaires. Une expérience clé révèle la dépendance du système à sa mémoire interne : réinitialiser l'état moteur récurrent avant chaque appel de la politique, à lacet nominal, fait chuter le taux de réussite de 19/21 à 0/21. À l'inverse, substituer la perception de profondeur et les états en amont sur 252 états enregistrés ne modifie pas les actions produites, avec une sortie descendante nulle mesurée sur l'ensemble des trajectoires intactes.

Ce résultat intéresse la robotique humanoïde à un moment où l'industrie mise majoritairement sur des modèles vision-langage-action de type Pi-0, GR00T N2 ou Helix, entraînés sur de vastes corpus de démonstrations. L'approche testée ici emprunt une voie différente : un contrôleur récurrent de taille modeste, structuré d'après une architecture neuronale biologique plutôt qu'un transformeur massif, dont la robustesse tient à un état moteur porté dans le temps plutôt qu'à une réactivité purement sensorielle. Pour les intégrateurs et chercheurs, l'enseignement principal est méthodologique : démontrer que retirer la mémoire récurrente fait s'effondrer la marche (0/21) alors que perturber les entrées sensorielles ne change rien aux actions isole précisément quelle partie du circuit porte le comportement. Le travail reste néanmoins cantonné à la simulation, sans validation sur robot physique, sur un jeu de terrains limité, ce qui borne la portée de ses conclusions à ce stade de recherche.

La démarche s'inscrit dans un courant qui s'appuie sur la connectomique, la cartographie détaillée des circuits neuronaux d'insectes comme la drosophile, pour concevoir des architectures de contrôle alternatives aux réseaux appris de bout en bout. Contrairement aux humanoïdes commerciaux tels Figure 03 ou Optimus Gen 3, dont les annonces mettent en avant cycles de production et déploiements en usine, cette étude ne vise pas un produit mais la compréhension des mécanismes internes d'un contrôleur, avec un Unitree G1 simulé comme plateforme d'essai standard en recherche académique. Les auteurs présentent leurs résultats comme une base pour de futures comparaisons de structures de circuits et de ressources de contrôle, sans annoncer de calendrier de transfert vers du matériel réel ni de partenariat industriel. Aucun acteur français ou européen n'apparaît dans cette publication.

À lire aussi

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
1arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur
2arXiv cs.RO 

CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur

Cette avancée en recherche fournit une méthode de bout en bout pour permettre à un robot humanoïde de marcher sur des terrains complexes en utilisant seulement une caméra de profondeur, sans passer par une carte 3D intermédiaire du terrain. Baptisée CReF (Cross-modal and Recurrent Fusion), l'approche fusionne directement les données de profondeur brutes captées à l'avant du robot avec les signaux de proprioception (l'état interne des articulations et du corps), via un mécanisme d'attention croisée piloté par la proprioception. Cette fusion passe ensuite par un bloc résiduel à porte, puis par une unité récurrente GRU dotée d'une porte de sortie de type "highway", qui pondère dynamiquement la contribution des informations récurrentes et instantanées selon le contexte. Les chercheurs ajoutent une récompense d'appui au sol qui identifie, à partir de nuages de points sous les pieds, les zones porteuses les plus proches et incite le robot à y poser le pied. Testée en simulation puis sur un humanoïde physique, la méthode montre un transfert zero-shot réussi vers des environnements réels variés : mains courantes, palettes ajourées, surfaces fortement réfléchissantes et terrains extérieurs encombrés visuellement. L'intérêt pour l'industrie tient à la simplification radicale du pipeline perception-vers-contrôle. Les méthodes précédentes s'appuyaient souvent sur des représentations de terrain 2.5D centrées sur le robot ou sur des objectifs géométriques auxiliaires pendant l'apprentissage, ce qui imposait des étapes de construction de carte ou des transferts de compétences en plusieurs stades. En évitant ces intermédiaires géométriques explicites, CReF réduit la latence et la complexité d'intégration, un enjeu direct pour les intégrateurs qui cherchent à déployer des humanoïdes en environnement logistique ou industriel réel plutôt qu'en démonstration contrôlée. Le succès du transfert zero-shot sur des surfaces réfléchissantes et des structures ajourées, deux cas connus pour perturber les capteurs de profondeur, est une preuve empirique concrète que l'apprentissage bout-en-bout depth-vers-contrôle peut tenir la route hors laboratoire, un point encore débattu dans le secteur. Ce travail s'inscrit dans la lignée des recherches sur la locomotion perceptive des humanoïdes, où la tension entre robustesse et simplicité d'architecture reste un problème ouvert, à côté des approches concurrentes utilisant des cartes d'élévation ou des skills pré-entraînés séparément. L'article, disponible sur arXiv, en est à sa troisième version révisée, signe d'itérations après retours de relecture. Les auteurs ne précisent pas de plateforme commerciale ni de partenaire industriel associé à ces travaux, qui relèvent pour l'instant de la recherche académique plutôt que d'un produit déployé ; la prochaine étape naturelle serait une validation sur davantage de plateformes humanoïdes et en conditions de production prolongées.

RecherchePaper
1 source
CAP : locomotion humanoïde adaptative en continu et aveugle à la perception, grâce à un débruitage appris
3arXiv cs.RO 

CAP : locomotion humanoïde adaptative en continu et aveugle à la perception, grâce à un débruitage appris

Des chercheurs ont publié le 11 septembre 2026 sur arXiv (2609.11553v1) une méthode baptisée CAP (Continuously Adaptive Perception blind humanoid locomotion via Learned Denoising), conçue pour rendre la marche des robots humanoïdes robuste face aux défaillances de perception en conditions réelles. Le système repose sur une politique de contrôle à étage unique combinant un encodeur "world model" entraîné comme débruiteur, capable de reconstruire une image de profondeur propre à partir d'une entrée corrompue, et un encodeur proprioceptif variationnel qui fournit des informations sur l'état du corps indépendantes de la vision. L'entraînement couple un curriculum de bruit de profondeur appliqué à l'entrée du world model avec un dropout des caractéristiques transmises à la politique, exposant le système à toute la gamme de qualité de perception, du signal propre à l'aveugle total. Les tests ont été menés en simulation, puis sur le robot humanoïde Unitree G1 lors d'essais contrôlés et de déploiements en intérieur comme en extérieur, incluant occlusion intermittente, bruit de capteur réel et artefacts de profondeur liés à la lumière du jour. L'enjeu dépasse la prouesse académique. La plupart des politiques de locomotion perceptive existantes supposent une profondeur toujours propre et conforme à la distribution d'entraînement, tandis que les approches hybrides récentes basculent entre une sous-politique voyante et une sous-politique aveugle, perdant l'information partiellement exploitable d'une profondeur dégradée. CAP montre qu'un système unique, entraîné à débruiter plutôt qu'à commuter, se dégrade plus progressivement qu'une architecture à bascule binaire quand la perception se détériore, tout en égalant ou dépassant les politiques perceptives classiques quand la profondeur reste fiable. Pour les intégrateurs et décideurs industriels qui envisagent des humanoïdes en entrepôt ou en extérieur, c'est un signal concret que le vrai goulot d'étranglement reste la résilience aux capteurs bruités, plus que le rendu en démonstration contrôlée. Ce travail s'inscrit dans une vague de recherche académique sur la locomotion humanoïde tout-terrain, où les capteurs de profondeur embarqués (caméras stéréo, lidar) restent le point faible face aux occlusions, à la poussière ou au soleil direct en extérieur. Contrairement aux annonces commerciales de Figure AI, Tesla ou Unitree lui-même, il s'agit ici d'une publication de recherche (preprint arXiv, non encore revu par les pairs), utilisant le G1 de Unitree comme plateforme matérielle standard de test plutôt que comme produit final. Aucun calendrier de déploiement commercial n'est mentionné; les auteurs positionnent CAP comme une alternative architecturale aux politiques à commutation binaire déjà publiées, avec pour perspective d'étendre ce mécanisme de débruitage à des politiques de locomotion perceptive couvrant d'autres capteurs que la profondeur.

RecherchePaper
1 source
$\omega$-0 : un modèle prédictif latent du monde pour la manipulation locomotrice humanoïde concurrente
4arXiv cs.RO 

$\omega$-0 : un modèle prédictif latent du monde pour la manipulation locomotrice humanoïde concurrente

Des chercheurs présentent ω-0, un modèle prédictif world-action conçu pour la loco-manipulation concurrente chez les robots humanoïdes, c'est-à-dire la capacité à se déplacer, ajuster sa posture, garder l'équilibre et manipuler un objet simultanément, comme un geste unique plutôt que deux tâches séparées. À partir d'une instruction en langage naturel, d'une observation visuelle et de l'état proprioceptif du robot, le modèle prédit directement des latents d'action pour tout le corps, compatibles avec le contrôleur. Plutôt que de reconstruire des vidéos futures comme d'autres approches, ω-0 apprend des embeddings compacts d'observations futures, objectif prédictif léger couplé à une génération d'action par diffusion sur le corps entier. Le système accepte des entrées RGB égocentriques, RGB exocentriques et profondeur exocentrique, et s'appuie sur un rejeu de simulation piloté par contrôleur pour convertir des priors de mouvement humains ou publics en latents exécutables par le robot. Les auteurs ont aussi constitué ω-HOME, un jeu de données domestique réel de plus de 40 heures, avec vues multiples synchronisées, mouvements SMPL du corps entier, états robot et latents d'action. Sur 11 tâches ménagères réelles, un seul modèle ω-0 produit des comportements fluides de manipulation en mouvement et surpasse des références en apprentissage par imitation, en VLA, en politiques humanoïdes dédiées et en autres modèles world-action. Ce travail cible un angle mort du secteur: la plupart des politiques humanoïdes actuelles traitent marche et manipulation comme deux problèmes distincts, ce qui produit des comportements saccadés peu adaptés aux tâches domestiques, où un robot doit par exemple continuer d'avancer tout en attrapant un objet sur une étagère. Les modèles world-action existants restent soit centrés sur le bras, en ignorant la locomotion, soit centrés sur la vidéo, coûteux à entraîner car ils prédisent des images futures complètes. En apprenant des représentations latentes compactes plutôt que des vidéos, ω-0 cherche un compromis: garder la capacité d'anticipation d'un world model sans son coût de calcul. Si le résultat se confirme au-delà des 11 tâches testées, il renforcerait l'hypothèse qu'une architecture VLA à latents diffusés peut unifier locomotion et manipulation à l'échelle, un problème encore largement non résolu pour les humanoïdes commerciaux. Ce travail s'inscrit dans la vague récente des modèles world-action pour la robotique, où l'enjeu est de donner aux robots une forme d'anticipation visuelle avant d'agir, en exploitant des données humaines pour compenser la rareté des données robot réelles. Le résumé, publié comme preprint arXiv (2608.06375v1), ne précise ni affiliation industrielle ni acteur commercial: il s'agit à ce stade d'une contribution académique, pas d'un produit déployé. Le jeu de données ω-HOME et le code, s'ils sont rendus publics, devront être repris par d'autres équipes pour vérifier la généralisation au-delà des 11 tâches ménagères testées. La suite logique pour ce type de travaux est le passage à l'échelle, sur davantage de tâches, de plateformes et d'environnements, ainsi que la confrontation directe avec les VLA propriétaires déployés par les grands acteurs humanoïdes du secteur.

RechercheActu
1 source