
Comment vision-langage-action doivent-ils utiliser l'état proprioceptif ?
Un nouvel article de recherche publié sur arXiv (2608.03052, début août 2026) s'attaque à une question que la littérature sur les modèles Vision-Language-Action (VLA) a longtemps traitée par à-coups : comment un robot doit-il intégrer son état proprioceptif, c'est-à-dire les positions et vitesses articulaires mesurées en interne. Les auteurs relèvent que la quasi-totalité des VLA récents exploitent cette information, mais de manière incohérente d'un système à l'autre : sérialisée en texte dans le prompt, projetée dans le préfixe vision-langage, ou injectée directement dans l'expert d'action, et presque toujours limitée à une seule frame instantanée. Pour trancher, l'équipe a mené des expériences contrôlées sur un VLA à flow-matching, en figeant le backbone, les données d'entraînement, la représentation d'action et le protocole d'évaluation. Cinq interfaces ont été comparées à égalité d'implémentation (prompt d'état discret, préfixe VLM, préfixe d'action, expert d'état dédié, modulation de features), testées sur 45 tâches atomiques réparties en trois familles plus 20 tâches composites, avec un balayage de la longueur d'historique d'état de 1 à 96 frames.
L'enjeu dépasse le détail d'ingénierie : à mesure que les VLA se généralisent en robotique industrielle, chaque laboratoire bricole sa propre façon de câbler l'état proprioceptif sans base comparative rigoureuse, ce qui rend les gains rapportés difficiles à attribuer. Cette étude cherche à isoler ce qui relève d'un réel bénéfice temporel de ce qui n'est qu'un surcroît de capacité de conditionnement, une distinction cruciale pour les équipes qui doivent arbitrer entre complexité d'architecture et performance en boucle fermée sur des tâches réelles.
Le papier s'inscrit dans un paysage VLA en pleine consolidation, dominé par des architectures comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, dont les choix d'intégration proprioceptive restent largement empiriques et non justifiés publiquement. L'abstract ne détaille pas les principes de conception retenus, seulement la méthodologie : les résultats précis et leur portée pratique restent à vérifier dans le corps de l'article.
Dans nos dossiers




