Anatomie d'un effondrement en boucle fermée : étude de cas causale d'une politique VLA compressée
Une étude de cas publiée sur arXiv en septembre 2026 documente, de façon causale, l'échec en boucle fermée d'une politique VLA compressée dérivée du modèle Octo-Base. La version étudiante, distillée sur 8 couches, conserve 86% des paramètres du modèle enseignant et réussit tous les contrôles hors ligne appliqués, avec des ratios enseignant/étudiant de 0,996 et 1,000 sur les métriques de validation propres à la famille de modèles. En exécution simulée, sur une tâche de préhension-dépôt avec un bras WidowX, elle échoue pourtant totalement : 0 succès sur 72 essais, contre 40 sur 72 pour l'enseignant. La dégradation est structurée : la prise d'objet chute progressivement (déplacement à 90% du taux enseignant, saisie à 55%), tandis que le transport vers la cible échoue à 0% dans toutes les variantes testées. L'analyse fine des trajectoires isole la cause : un résidu négatif sur l'axe z, concentré en fin de geste, environ dix fois supérieur à sa valeur après correction. Quatre remèdes standards échouent sous contrôles appariés (poursuite de l'entraînement, ajout de données hors ligne dans le domaine, compensation au niveau des commandes, écrêtage du symptôme) sans restaurer aucun succès. Seul le remplacement de la moitié du flux d'entraînement par des trajectoires enseignantes issues de la distribution de déploiement rétablit une performance proche de l'enseignant (18 sur 36 contre 17 sur 36 en test) et supprime le signal défaillant.
Ce résultat pointe une faille méthodologique centrale pour le déploiement des politiques VLA compressées : les métriques de validation hors ligne, y compris celles propres à chaque famille de modèles, ne garantissent pas un comportement correct en conditions réelles, même avec des scores de concordance proches de 100% avec le modèle enseignant. Pour les intégrateurs et équipes robotique qui compressent des modèles comme Octo, Pi-0, GR00T N2 ou Helix afin de réduire coût et latence d'inférence à l'edge, l'étude montre qu'une poignée de dizaines d'essais en boucle fermée suffit à révéler des échecs invisibles aux tests hors ligne, alors que les corrections intuitives, plus d'entraînement, plus de données, ajustement au niveau des commandes, ne fonctionnent pas de façon fiable. Elle confirme empiriquement, sur un cas précis et diagnostiqué causalement, l'écart déjà documenté entre évaluation hors ligne et performance réelle des politiques d'apprentissage par imitation.
Les auteurs précisent ne revendiquer que l'existence du phénomène sur ce cas, pas sa généralité : il s'agit d'une étude isolée, pas d'un résultat étendu à toute compression de politique VLA. Le travail s'inscrit dans un mouvement plus large de compression des grands modèles vision-langage-action, à mesure que laboratoires et fabricants de bras manipulateurs ou d'humanoïdes cherchent à faire tourner ces politiques sur du matériel embarqué à faible latence. Aucun acteur commercial, français ou européen, n'est associé à ce travail, qui reste un preprint académique sans produit ni déploiement annoncé. Les auteurs appellent les équipes qui distillent ou quantifient des politiques robotiques à ajouter des tests en boucle fermée aux critères d'acceptation, plutôt que de se fier aux seules métriques hors ligne, aujourd'hui la norme du secteur.
Dans nos dossiers




