Aller au contenu principal
EATR-Stereo : routage sensible à l'incarnation des données stéréo appariées pour le contrôle VLA des humanoïdes
RecherchearXiv cs.RO 

EATR-Stereo : routage sensible à l'incarnation des données stéréo appariées pour le contrôle VLA des humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente EATR-Stereo (Embodiment-Aware Routing of Paired Stereo Evidence), un cadre de contrôle vision-langage-action (VLA) pour robots humanoïdes équipés de caméras stéréo montées sur la tête, décrit dans un article publié sur arXiv (référence 2608.17453v1, août 2026). Le système conserve les tokens de la vue primaire et construit des tokens auxiliaires inter-vues (Cross-View Auxiliary Tokens, CVAT) alignés sur cette vue en interrogeant la séquence de tokens de la vue auxiliaire synchronisée, tandis qu'un encodeur proprioceptif segmenté par partie du corps conditionne leur usage token par token sur l'historique de configuration du robot, le tout sans réentraîner le modèle vision-langage préentraîné. Testé sur un humanoïde physique à 33 degrés de liberté (DoF) et 37 dimensions d'état proprioceptif, sur neuf configurations et des tâches de recherche-approche-saisie-dépôt-retour dépassant 100 secondes, EATR-Stereo atteint 60,0% de réussite sur la tâche complète, 100,0% en saisie et 80,0% par étape ; en occlusion asymétrique sévère, son taux de récupération grimpe à 80%, contre 30% pour la seule méthode CVAT.

Ces chiffres répondent à un problème concret des pipelines VLA actuels, qui jettent souvent l'information stéréo complémentaire ou fusionnent les observations additionnelles sans préserver le flux natif de la vue primaire ni l'adapter à la morphologie du robot. Pour les intégrateurs, la démonstration qu'un routage sélectif conditionné par la proprioception améliore la robustesse en occlusion partielle suggère qu'un gain de fiabilité en manipulation longue durée passe moins par davantage de capteurs que par une meilleure architecture de routage de l'information déjà disponible. Les études d'ablation nuancent toutefois l'enthousiasme : retirer la préservation des tokens primaires ou le routage proprioceptif structuré dégrade nettement les performances, ce qui écarte l'idée que la stéréo seule suffirait à améliorer l'ancrage spatial.

Le travail s'inscrit dans la lignée des architectures VLA pour humanoïdes, dans un contexte où des modèles comme Pi-0 ou GR00T N2 ont déjà prouvé la viabilité de politiques généralistes entraînées sur de larges corpus multimodaux, mais restent souvent limités à une seule vue caméra. En gardant le modèle vision-langage gelé et en n'ajoutant qu'un module de routage léger, l'approche vise la compatibilité avec les pipelines VLA existants plutôt qu'un réentraînement complet, une contrainte clé pour l'adoption industrielle. À ce stade, il s'agit d'une contribution académique validée sur une seule plateforme et un nombre limité de configurations, sans annonce de déploiement commercial ni de partenariat industriel ; la suite logique serait une validation sur d'autres humanoïdes et un éventail plus large de tâches de manipulation.

À lire aussi

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
1arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
AnchorDream : réorienter la diffusion vidéo pour la synthèse de données robotiques sensibles à l'incarnation
2arXiv cs.RO 

AnchorDream : réorienter la diffusion vidéo pour la synthèse de données robotiques sensibles à l'incarnation

Des chercheurs présentent AnchorDream, un modèle génératif qui détourne des modèles de diffusion vidéo pré-entraînés pour synthétiser des données de démonstration robotique. Publié sur arXiv (2512.11797v2, version révisée), le système conditionne le processus de diffusion sur des rendus du mouvement du robot, ce qui ancre la cohérence de l'embodiment (la géométrie et la cinématique du bras ou de l'humanoïde) pendant que le modèle génère de nouveaux objets et environnements. À partir d'une poignée de démonstrations en téléopération humaine seulement, la méthode permet de démultiplier ces exemples en jeux de données massifs et variés, sans modélisation explicite de l'environnement. Les résultats annoncés font état d'un gain relatif de 36,4% sur des benchmarks en simulateur, et d'une performance quasiment doublée lors d'essais en conditions réelles pour l'apprentissage de politiques par imitation. Cette avancée s'attaque directement au goulot d'étranglement le plus critique de l'apprentissage par imitation en robotique: la collecte de données réelles est coûteuse et lente, tandis que les simulateurs souffrent d'un écart de fidélité persistant avec le monde réel, le fameux sim-to-real gap. Les méthodes génératives existantes se contentaient souvent de modifier l'apparence visuelle des scènes sans produire de nouveaux comportements, ou généraient des mouvements physiquement incohérents avec l'embodiment du robot. En prouvant qu'un modèle de diffusion vidéo peut être ancré au mouvement réel du robot pour générer des données exploitables à grande échelle, AnchorDream ouvre une voie concrète pour les intégrateurs et laboratoires qui cherchent à entraîner des politiques VLA sans dépendre uniquement de flottes de téléopération ou de simulateurs coûteux à construire. Ce travail s'inscrit dans la vague récente des world models appliqués à la robotique, où plusieurs équipes explorent la génération vidéo comme substitut ou complément à la simulation physique classique. Contrairement à des approches purement visuelles, AnchorDream mise sur l'ancrage cinématique explicite pour éviter les hallucinations de mouvement, un problème récurrent des générateurs vidéo appliqués aux robots. À ce stade, il s'agit d'un résultat de recherche publié sur arXiv, sans déploiement produit ni partenariat industriel annoncé, mais l'ampleur des gains rapportés en fait une piste à suivre pour la prochaine génération de pipelines de données robotiques.

RecherchePaper
1 source
ZeroWBC : apprentissage de l'interaction naturelle corps entier pour humanoïdes à partir de données égocentrées humaines
3arXiv cs.RO 

ZeroWBC : apprentissage de l'interaction naturelle corps entier pour humanoïdes à partir de données égocentrées humaines

Une équipe de recherche a publié sur arXiv (référence 2603.09170v2) ZeroWBC, un cadre d'apprentissage du contrôle corporel complet pour robots humanoïdes qui se passe entièrement de données de télé-opération. Le système apprend à partir de vidéos égocentrées humaines -- c'est-à-dire filmées du point de vue d'un opérateur -- associées à des annotations de mouvement corps-entier et de texte. Concrètement, une image initiale prise en vue subjective est combinée à une instruction en langage naturel ; un modèle vision-langage (VLM) affiné génère alors des tokens de mouvement humain futur, qui sont décodés en trajectoires continues et retargetés vers le robot humanoïde. Ces mouvements de référence, accompagnés des trajectoires de la racine et des parties clés du corps, alimentent ensuite une politique de suivi de mouvement interactif. Les expériences ont été conduites sur le robot Unitree G1, un humanoïde compact commercialisé à environ 16 000 dollars. L'apport central de ZeroWBC réside dans l'élimination du coût de collecte des données de télé-opération, traditionnellement un verrou majeur pour l'apprentissage du contrôle corps-entier à grande échelle. En exploitant le stock immense de vidéos humaines égocentrées déjà disponibles, la méthode ouvre un paradigme de scalabilité que les approches par démonstration robotique directe ne peuvent pas égaler facilement. L'introduction d'une récompense de suivi orientée interaction -- qui priorise l'alignement global des trajectoires tout en préservant la naturalité du mouvement -- tente de combler le gap entre génération de gestes plausibles et exécution physiquement cohérente. C'est un résultat de recherche académique, pas un produit déployé en production : les vidéos présentées montrent des comportements variés en scène statique, mais les conditions réelles d'un environnement industriel dynamique n'ont pas été testées. ZeroWBC s'inscrit dans un courant plus large de méthodes "zéro-démonstration robot" qui cherchent à transférer la richesse des données humaines vers des systèmes incarnés, à l'instar des travaux sur les politiques visuomotrices à base de VLA (Vision-Language-Action). Sur le terrain concurrent, des approches comme ACT, UMI ou les pipelines de diffusion de Physical Intelligence (Pi-0) misent encore largement sur la télé-opération directe ou les données simulées. Unitree, constructeur chinois dont le G1 est l'une des plateformes humanoïdes les plus accessibles du marché, bénéficie ici d'une visibilité croissante comme banc d'essai académique de référence. Les prochaines étapes naturelles seraient d'étendre ZeroWBC à des scènes dynamiques, de tester la robustesse en dehors du labo, et d'évaluer si le sim-to-real tient face à la variabilité réelle des interactions objet-robot.

RechercheOpinion
1 source
HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains
4arXiv cs.RO 

HABIT : jeu de données pour l'entraînement de la manipulation robotique sensible aux comportements humains

Des chercheurs publient HABIT (Human-Aware Behavior and Interaction Training), un jeu de données de démonstration pour l'apprentissage de politiques de manipulation robotique en présence humaine, décrit dans un article déposé sur arXiv (identifiant 2606.31682, juin 2026). Le corpus rassemble plus de 10 000 épisodes et 160 heures d'enregistrements couvrant 60 tâches, organisées selon trois rôles d'interaction homme-robot : « Collaborateur », où humain et robot accomplissent une tâche ensemble, « Collègue », où ils opèrent des tâches séparées dans un espace partagé, et « Superviseur », où l'humain dirige le robot par instructions. Contrairement aux jeux de données existants pour les politiques robotiques généralistes, collectés sans présence humaine dans la scène, HABIT introduit explicitement des humains dans les démonstrations. L'enjeu est la capacité des robots à adopter des comportements conscients de la présence humaine, un angle mort des grands corpus qui alimentent aujourd'hui les politiques VLA (vision-langage-action). Les expériences montrent que l'entraînement sur données incluant des humains fait émerger des comportements que les données robot seul ne produisent pas : synchronisation spatio-temporelle dans les tâches de collaboration, cession de passage dans les tâches de coexistence, et ancrage gestuel pour interpréter les instructions du superviseur. Les auteurs indiquent aussi que l'entraînement sur HABIT accélère l'adaptation à de nouvelles tâches d'interaction homme-robot. Pour les intégrateurs qui déploient des robots en usine ou en entrepôt aux côtés d'opérateurs, c'est un signal que la cohabitation sûre et fluide dépend moins du matériel que de la composition des données d'entraînement, un manque que la course aux modèles fondation robotiques a largement laissé de côté. HABIT s'inscrit dans la lignée des grands corpus type Open X-Embodiment ou DROID, qui ont permis l'essor des politiques généralistes telles que Pi-0 ou GR00T N2 mais restent tournés vers des scènes sans humains, un manque que plusieurs équipes académiques cherchent désormais à combler à mesure que les humanoïdes et bras collaboratifs sortent des lignes de démonstration pour entrer dans des ateliers occupés. À ce stade, HABIT reste une publication de recherche accompagnée d'un jeu de données, sans annonce de produit ni de partenariat industriel ; sa portée dépendra de son adoption par d'autres laboratoires pour entraîner et comparer leurs politiques sur des tâches de collaboration homme-robot.

RecherchePaper
1 source