
EATR-Stereo : routage sensible à l'incarnation des données stéréo appariées pour le contrôle VLA des humanoïdes
Une équipe de recherche présente EATR-Stereo (Embodiment-Aware Routing of Paired Stereo Evidence), un cadre de contrôle vision-langage-action (VLA) pour robots humanoïdes équipés de caméras stéréo montées sur la tête, décrit dans un article publié sur arXiv (référence 2608.17453v1, août 2026). Le système conserve les tokens de la vue primaire et construit des tokens auxiliaires inter-vues (Cross-View Auxiliary Tokens, CVAT) alignés sur cette vue en interrogeant la séquence de tokens de la vue auxiliaire synchronisée, tandis qu'un encodeur proprioceptif segmenté par partie du corps conditionne leur usage token par token sur l'historique de configuration du robot, le tout sans réentraîner le modèle vision-langage préentraîné. Testé sur un humanoïde physique à 33 degrés de liberté (DoF) et 37 dimensions d'état proprioceptif, sur neuf configurations et des tâches de recherche-approche-saisie-dépôt-retour dépassant 100 secondes, EATR-Stereo atteint 60,0% de réussite sur la tâche complète, 100,0% en saisie et 80,0% par étape ; en occlusion asymétrique sévère, son taux de récupération grimpe à 80%, contre 30% pour la seule méthode CVAT.
Ces chiffres répondent à un problème concret des pipelines VLA actuels, qui jettent souvent l'information stéréo complémentaire ou fusionnent les observations additionnelles sans préserver le flux natif de la vue primaire ni l'adapter à la morphologie du robot. Pour les intégrateurs, la démonstration qu'un routage sélectif conditionné par la proprioception améliore la robustesse en occlusion partielle suggère qu'un gain de fiabilité en manipulation longue durée passe moins par davantage de capteurs que par une meilleure architecture de routage de l'information déjà disponible. Les études d'ablation nuancent toutefois l'enthousiasme : retirer la préservation des tokens primaires ou le routage proprioceptif structuré dégrade nettement les performances, ce qui écarte l'idée que la stéréo seule suffirait à améliorer l'ancrage spatial.
Le travail s'inscrit dans la lignée des architectures VLA pour humanoïdes, dans un contexte où des modèles comme Pi-0 ou GR00T N2 ont déjà prouvé la viabilité de politiques généralistes entraînées sur de larges corpus multimodaux, mais restent souvent limités à une seule vue caméra. En gardant le modèle vision-langage gelé et en n'ajoutant qu'un module de routage léger, l'approche vise la compatibilité avec les pipelines VLA existants plutôt qu'un réentraînement complet, une contrainte clé pour l'adoption industrielle. À ce stade, il s'agit d'une contribution académique validée sur une seule plateforme et un nombre limité de configurations, sans annonce de déploiement commercial ni de partenariat industriel ; la suite logique serait une validation sur d'autres humanoïdes et un éventail plus large de tâches de manipulation.
Dans nos dossiers




