
Vers un raisonnement procédural neuro-symbolique pour la manipulation VLA à long horizon
Un article publié sur arXiv (référence 2609.05369) début septembre 2026 présente un cadre neuro-symbolique destiné à corriger la fragilité des modèles vision-langage-action (VLA) sur les manipulations longues. Ces modèles exécutent bien des compétences courtes et isolées, mais peinent à maintenir un état de tâche persistant, à raisonner sur les dépendances entre actions et à gérer des décisions conditionnelles sur des séquences étendues. La méthode associe un contrôle VLA appris à des graphes de tâches explicites, qui encodent dépendances d'actions, transitions valides et conditions de branchement, ainsi qu'une mémoire procédurale multimodale qui suit l'étape active, les actions déjà accomplies, le contexte textuel et les preuves visuelles pertinentes. Des indices de regard humain, annotés en pseudo-regard sur des vidéos de téléopération vue robot, guident ensuite le fine-tuning et l'inférence du VLA. Deux domaines de test sont retenus: le débarrassage d'un espace de travail et la manipulation d'instruments chirurgicaux, évalués sur la sélection correcte d'objet et de destination, la complétion des sous-tâches et le taux de réussite complet de la procédure.
Ce travail s'attaque à un angle mort du secteur: les modèles VLA de bout en bout, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, généralisent bien sur des tâches courtes grâce au volume de données d'entraînement, mais leur fiabilité chute nettement sur des procédures longues et structurées, un écart entre démonstration et usage réel rarement exposé publiquement. En réintroduisant une couche symbolique explicite plutôt qu'en misant uniquement sur davantage de données et de paramètres, l'étude suggère que la fiabilité recherchée par l'industrie et la chirurgie assistée passera par des architectures hybrides, pas seulement par le scaling des réseaux de neurones. C'est un signal utile pour les intégrateurs qui évaluent la maturité réelle des VLA au-delà des vidéos de démonstration soigneusement sélectionnées.
Il s'agit d'une étude de recherche exploratoire, pas d'un produit déployé. Pour isoler l'effet du guidage visuel sur l'apprentissage de la politique, les auteurs contournent volontairement, dans cette première phase, le transfert de regard entre vue humaine et vue robot, une simplification méthodologique qu'ils assument eux-mêmes. Aucun partenaire industriel, site pilote ni calendrier de commercialisation n'est mentionné dans le document. Les auteurs indiquent vouloir étendre l'approche au transfert de regard inter-vues comme prochaine étape, afin de généraliser ce guidage à des démonstrations non téléopérées et de renforcer la robustesse du raisonnement procédural sur des tâches encore plus longues.
Dans nos dossiers




