Un correcteur appris fait-il mieux qu'un simple repli ? Résultats avec un VLA gelé
Une étude publiée sur arXiv (2610.06921) examine si un correcteur appris, déployé à l'exécution sur une politique vision-langage-action (VLA) gelée, apporte réellement plus qu'une simple action de repli. Les auteurs testent π0.5, le modèle de Physical Intelligence, laissé inchangé, sur quatre tâches du benchmark de simulation RoboTwin. Pour chaque graine de test, ils apparient un rollout sans correction et un rollout avec correction. Ils ajoutent un témoin placebo: une seconde exécution de la politique de base avec la même graine. Sur 3 888 épisodes appariés, le pipeline complet augmente le taux de succès de 13,5 points de pourcentage sur la tâche « beat block hammer » (intervalle à 95 % de +9,4 à +17,7). Les trois autres tâches ne montrent aucun gain détectable au poids de correction déployé. Parmi les épisodes de base en échec sur la tâche réactive, 43,2 % réussissent à la simple relance, contre 63,5 % après correction.
Ces chiffres relativisent la notion de « sauvetage ». Près de la moitié des échecs récupérés par le correcteur auraient été récupérés par la seule variabilité stochastique de la politique. Un intégrateur qui mesure un correcteur contre une exécution unique surestime donc son apport. L'efficacité dépend aussi fortement de la tâche: un mécanisme de récupération qui améliore nettement un cas peut être neutre sur les autres. La décision d'intervenir ne peut pas être fixée une fois pour toutes. Le protocole (placebo apparié, intervalles par grappes de graines, règles de comparaison prédéfinies) est lui-même réutilisable pour évaluer les couches de sécurité et de récupération autour des VLA.
Sur le plan comparatif, un déclencheur à instant fixe, associé à un retour scripté vers une configuration articulaire antérieure, produit un gain net sur deux séries d'essais. Aucune différence n'est détectée avec le pipeline appris, même si le critère d'équivalence prédéfini n'est pas respecté de façon constante. Une simple pause et un contrôle à action constante n'apportent pas de gains comparables. Le résultat ne démontre donc pas que la complexité apprise est inutile, mais qu'elle n'est pas prouvée. Les limites sont nettes: l'étude est menée en simulation, sur quatre tâches et une seule politique. Elle s'inscrit dans la course aux VLA généralistes (π0.5, Helix, GR00T), où la fiabilité à l'exécution, plutôt que le réentraînement, devient un enjeu de déploiement. Un retrait simple et un placebo apparié devraient servir de référence minimale avant d'investir dans des correcteurs appris.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




