
Continuer ou replanifier : apprentissage par politique de continuation bernoullienne pour l'exécution à horizon adaptatif
Une équipe de recherche publie sur arXiv (2608.03483, août 2026) Bernoulli-Continuation Policy (BCP), une méthode qui corrige un défaut des modèles Vision-Language-Action (VLA) : ceux-ci exécutent un nombre fixe d'actions avant de replanifier, selon un calendrier périodique indépendant de l'avancement réel de la tâche, ce qui peut faire exécuter une étape critique à partir d'un plan obsolète. BCP ajoute une tête de continuation légère, greffée sur un modèle VLA gelé, qui décide à chaque segment d'action s'il faut continuer ou replanifier, entraînée par apprentissage par renforcement avec une récompense d'efficacité de replanification pénalisant l'échec et le calcul gaspillé. Sur RoboTwin 2.0, avec LingBot-VLA comme modèle de base, BCP améliore le taux de succès moyen de 11,08% sur les 13 tâches les plus difficiles et fait passer le taux global de 89,88% à 93,94% sur 50 tâches. Entraîné uniquement en environnement "propre", il généralise à un environnement randomisé (+4,06%) et transfère à un autre modèle de base, π_0.5, avec des gains de 1,7% sur LIBERO et 6,8% sur LIBERO-PRO, la version plus difficile. Sur robot réel, le taux de succès grimpe de 74% à 92% et de 44% à 84% sur deux tâches de manipulation, avec un surcoût de calcul négligeable qui rend le temps d'exécution total inférieur aux méthodes à horizon fixe.
Ce résultat s'attaque à un choix d'ingénierie devenu standard dans les VLA en production, la replanification à intervalle fixe, simple à implémenter mais aveugle au contexte de la tâche. Son caractère plug-and-play, compatible avec un modèle de base gelé, le rend potentiellement exploitable par des intégrateurs sans réentraîner leurs modèles VLA déjà déployés. Les gains les plus marqués se concentrent sur les tâches à faible taux de succès initial, celles où les robots échouent réellement en production, ce qui limite le risque d'un simple effet de benchmark favorable. La généralisation confirmée sur deux modèles de base différents, et du simulateur vers le réel, répond directement au scepticisme habituel sur l'écart simulation-réel des méthodes VLA.
Le travail s'inscrit dans la lignée des benchmarks de manipulation robotique standardisés LIBERO, LIBERO-PRO et RoboTwin 2.0, utilisés pour comparer des politiques VLA comme LingBot-VLA ou π_0.5. Il s'agit à ce stade d'une publication de recherche, un preprint arXiv, sans déploiement industriel annoncé ni acteur commercial identifié. Les suites attendues sont une revue par les pairs et une éventuelle intégration dans des frameworks VLA ouverts déjà utilisés par la communauté robotique.
Dans nos dossiers




