ExecVLA : respecter des contraintes d'exécution fines dans les modèles vision-langage-action (VLA) grâce à une représentation d'action à deux niveaux
Des chercheurs proposent ExecVLA, un cadre pour les modèles vision-langage-action (VLA) qui vise à faire respecter des contraintes d'exécution fines données dans l'instruction, alors que l'objectif de la tâche reste identique. Ces contraintes portent sur la cible d'interaction, le motif de mouvement, les relations spatiales et la configuration terminale. Le cadre sépare une composante orientée but d'une composante spécifique à l'exécution. Pour cela, il utilise une représentation d'action à deux niveaux et des jetons de raisonnement à deux niveaux, supervisés. Deux objectifs d'entraînement s'y ajoutent. L'invariance du but maintient stable la représentation de haut niveau entre les exécutions d'un même but. La prédictibilité de l'exécution garantit que la représentation de bas niveau conserve les contraintes qui distinguent ces exécutions. Les auteurs ont construit des jeux de données dédiés, avec annotations de but et de raisonnement fin, en simulation (sur la base de LIBERO) et sur un bras Realman-75. Ils rapportent une meilleure complétion des tâches et, surtout, un respect nettement plus fiable des contraintes. L'extrait ne fournit aucun chiffre précis, ni taux de réussite ni écart avec les modèles de référence, ni nombre d'épisodes ou de tâches.
L'enjeu est de distinguer deux critères que les benchmarks VLA actuels confondent souvent. Une politique orientée but est jugée sur l'accomplissement de la tâche, sans regarder la manière. Or, en contexte industriel, la manière compte. Contourner un obstacle par la gauche, saisir un objet par une zone précise, déposer une pièce selon une orientation donnée ou s'arrêter dans une pose finale imposée sont des exigences courantes en assemblage, en logistique ou en manipulation en environnement partagé. Les trajectoires qui réussissent la même tâche ne sont donc pas interchangeables. Ce travail met en évidence une limite des VLA généralistes : ils ignorent facilement les consignes de style d'exécution tant que le but est atteint. Pour un intégrateur, la contrôlabilité fine par le langage peut devenir un critère de sélection aussi important que le taux de réussite brut. Il faut toutefois rester prudent. Il s'agit d'un article académique sur un seul bras, avec des jeux de données maison, et les contraintes évaluées restent probablement proches de celles de l'entraînement. Aucun résultat ne porte encore sur la généralisation à des contraintes inédites ou sur des cadences industrielles.
Le contexte est celui d'une génération de VLA (Pi-0, Helix, GR00T et leurs dérivés) qui a surtout progressé sur la généralisation de la tâche et la robustesse perceptive. La question du pilotage fin de l'exécution reste moins traitée. Des approches voisines utilisent le raisonnement en chaîne de pensée ou des représentations intermédiaires de trajectoire pour guider l'action. ExecVLA y ajoute une séparation explicite entre le but et la manière, avec une supervision dédiée. Il s'agit d'une version révisée (v2) d'un préprint arXiv, sans partenaire industriel ni calendrier de déploiement annoncé. Les prochaines étapes à surveiller sont une évaluation sur d'autres embodiments, des comparaisons directes avec les VLA ouverts du moment, et la publication du code et des jeux de données, qui permettrait à la communauté de reproduire les résultats.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



