
Dépasser le raccourci vision-action : entraînement par interface latente pour des modèles fondation robotiques généralisables
Un preprint arXiv publié en septembre 2026 (arXiv:2609.12641) présente Latent Interface Training (LIT), méthode en deux étapes pour corriger un biais fréquent des modèles robotiques vision-langage-action. La première étape entraîne l'expert d'action à produire des séquences de gestes à partir du langage, de l'état du robot et de la pose terminale SE(3) de l'effecteur, sans image, pour ancrer l'objectif dans l'espace plutôt que dans le pixel. La seconde étape ajoute une interface latente, unique canal de conditionnement visuel du modèle, entraînée à reconstruire cette même pose terminale. Appliqué à quatre architectures, Pi0.5, MolmoAct2, FAST-WAM et ImageWAM, LIT améliore le taux de réussite de 3,87 à 10,70 points sur le benchmark simulé LIBERO-Plus, et de 13,30 à 16,70 points en conditions réelles sur trois tâches testées avec caméra, éclairage et distracteurs modifiés.
Ce biais, dit raccourci vision-action, survient quand un modèle entraîné par imitation s'appuie sur des indices visuels fortuits corrélés aux actions démontrées plutôt que sur la logique spatiale réelle de la tâche, ce qui explique en partie l'écart entre les démonstrations en laboratoire de modèles comme Pi-0, GR00T N2 ou Helix et leurs performances une fois la caméra, l'éclairage ou le décor changés. Agnostique au framework, LIT s'applique sans refonte à quatre architectures distinctes, offrant une piste de correction générique pour les intégrateurs qui déploient ces modèles hors des conditions de collecte des données d'entraînement. Le fait que les gains réels dépassent les gains simulés confirme aussi que des benchmarks comme LIBERO tendent à sous-estimer la fragilité de ces politiques face aux changements de scène.
Le travail s'inscrit dans la vague des modèles de fondation robotiques préentraînés à grande échelle, aux côtés de la lignée Pi-0/Pi0.5 chez Physical Intelligence, de GR00T N2 chez NVIDIA ou de Helix chez Figure AI, tous confrontés au même problème de généralisation hors distribution une fois sortis du laboratoire. LIT se présente comme une correction méthodologique applicable par-dessus des architectures existantes, dont MolmoAct2, plutôt que comme un nouveau modèle autonome. Il s'agit pour l'instant d'un preprint non revu par les pairs, validé sur un seul benchmark simulé et trois tâches réelles, sans calendrier de déploiement industriel annoncé à ce stade.
Dans nos dossiers




