Hermite curves comme a priori de trajectoire pour les modèles vision-langage-action
Une équipe de recherche présente les "Hermite trajectory priors", une méthode qui structure explicitement les trajectoires générées par les modèles Vision-Language-Action (VLA) pour la manipulation robotique. Le problème identifié : les VLA actuels découpent chaque "chunk" d'action en commandes point par point, ce qui produit des mouvements saccadés et des discontinuités aux frontières entre segments lors de l'exécution physique. La solution proposée paramétrise la trajectoire comme une courbe cubique d'Hermite par morceaux, définie par les positions et vitesses aux points de contrôle, pour imposer mathématiquement la fluidité. Trois variantes sont testées : les Hermite Tokens (prédiction autorégressive des variables de frontière quantifiées), le Hermite Scaffold (décomposition en trajectoire de base plus résidus) et la Hermite Regularization (contrainte ajoutée uniquement comme objectif d'entraînement auxiliaire). Cette dernière s'avère la plus performante des trois. Appliquée au modèle π0.5, elle fait passer le taux de succès de 95,9 % à 98,7 % sur le benchmark LIBERO, de 85,7 % à 90,9 % sur LIBERO-plus, et de 63,4 % à 90,0 % sur quatre tâches réelles exécutées sur robot physique, sans surcoût de calcul à l'inférence.
Ce résultat pèse dans un débat central du secteur : celui de l'écart entre démonstration et réalité pour les modèles VLA. Beaucoup de systèmes affichent des scores élevés en simulation mais se dégradent nettement lors du transfert vers un robot réel, notamment à cause de la gigue de mouvement générée par le découpage naïf en chunks. En montrant qu'une contrainte de lissage purement géométrique, ajoutée pendant l'entraînement et retirée à l'inférence, améliore les performances réelles sans coût supplémentaire, les auteurs suggèrent que la structuration explicite des trajectoires agit comme un biais inductif d'apprentissage plutôt que comme une contrainte d'exécution en temps réel.
Le travail s'inscrit dans la lignée des architectures VLA récentes comme π0, GR00T N2 ou Helix, qui cherchent toutes à généraliser le contrôle robotique à partir de données multimodales massives. La méthode, agnostique à l'architecture, pourrait s'intégrer à d'autres pipelines VLA existants ; les auteurs ne précisent toutefois pas de calendrier de déploiement industriel ni de partenariat avec un fabricant de robots.




