Géométrie de l'effecteur final conditionnée par le résultat dans les modèles vision-langage-action
Une étude analyse 15 000 déploiements en boucle fermée de quatre politiques vision-langage-action (VLA) sur le benchmark de manipulation LIBERO, en comparant la géométrie des trajectoires du bras terminal plutôt que les seuls taux de réussite. Sur 3 600 paires de politiques appariées par configuration, la distance médiane normalisée de dynamic time warping est de 0,0120 mètre quand les deux politiques réussissent la tâche, contre 0,0380 mètre quand une seule y parvient. Cette hiérarchie se confirme pour chaque tâche, chaque paire de politiques et neuf représentations testées, même si son ampleur varie fortement selon la représentation choisie. Les paires en double échec, plus séparées encore, reposent sur un échantillon jugé trop restreint pour être concluant.
Le résultat répond empiriquement à une question clé pour la manipulation robotique: savoir si des politiques VLA différentes qui réussissent la même tâche empruntent des trajectoires réellement comparables ou seulement des résultats similaires par des chemins distincts. La proximité géométrique observée en cas de succès partagé va dans le sens d'un lien entre contrainte de tâche et trajectoire, sans trancher entre chevauchement des données d'entraînement et contraintes physiques propres à la tâche. Mais l'étude prévient qu'une faible distance entre politiques ne vaut pas interchangeabilité, des différences résiduelles mesurables subsistant même face à une base de référence appariée, ce qui doit inciter intégrateurs et décideurs à ne pas juger l'équivalence de deux modèles sur le seul taux de succès.
Le travail s'inscrit dans un contexte où l'évaluation des politiques VLA repose presque exclusivement sur le taux de réussite, sans examen de la manière dont chacune atteint ce résultat, alors que le secteur multiplie les architectures et interfaces d'action concurrentes pour la manipulation robotique. En s'appuyant sur LIBERO, benchmark de référence en simulation, et sur quatre politiques non nommées individuellement, les auteurs proposent une méthode reproductible fondée sur le dynamic time warping pour comparer les trajectoires plutôt que les seuls scores binaires. Ils relèvent enfin que sous stress visuel composite, classement des politiques et composition des paires évoluent ensemble, un point qui appelle des travaux futurs sur la robustesse comparative des VLA en conditions visuelles dégradées, enjeu direct pour leur fiabilité en déploiement industriel.
Dans nos dossiers




