Aller au contenu principal
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
RecherchearXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi_0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau.

Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi_0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production.

L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

À lire aussi

Entraînement hybride pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Entraînement hybride pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié sur arXiv (identifiant 2510.00600, version 2) un framework nommé Hybrid Training (HyT), conçu pour les modèles Vision-Language-Action (VLA) utilisés en robotique de manipulation. Le problème central est le suivant : le raisonnement par chaîne de pensée (Chain-of-Thought, CoT), qui consiste à générer des "pensées" intermédiaires avant chaque action, améliore les performances des VLA mais allonge mécaniquement le temps d'inférence. Dans des tâches requérant de longues séquences d'actions successives, ce délai compromet l'utilisabilité réelle du système. HyT découple la phase d'apprentissage de la phase d'exécution : le modèle s'entraîne en intégrant les pensées intermédiaires, acquiert les gains de performance associés, puis peut les omettre entièrement lors du déploiement. Le framework supporte trois modes à l'inférence selon le contexte : prédiction directe d'actions, génération CoT complète, ou suivi d'instructions. Les auteurs ont validé l'approche sur plusieurs benchmarks simulés et sur des expériences en conditions réelles. Ce découplage entraînement/inférence répond à l'une des tensions fondamentales dans le déploiement industriel des VLA : les techniques qui améliorent la fiabilité dégradent souvent la réactivité. Pour un intégrateur ou un COO industriel, un système qui "réfléchit" trop longtemps avant d'agir est difficilement intégrable sur une ligne de production cadencée. HyT avance que les bénéfices du raisonnement explicite peuvent être distillés dans les poids du modèle et activés implicitement, sans générer de tokens supplémentaires au runtime. Si ce résultat se confirme à plus grande échelle, il simplifierait le compromis latence/performance qui freine aujourd'hui le déploiement de bras manipulateurs VLA en environnement non structuré. C'est également une réponse indirecte au "demo gap" fréquemment reproché à ces modèles : de bonnes performances en simulation ne garantissent pas une vitesse d'exécution acceptable sur le terrain. L'essor des VLA s'est accéléré depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (UC Berkeley), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), qui combinent vision, langage et prédiction d'actions dans un seul réseau. L'application du CoT à la robotique prolonge les travaux fondateurs sur les LLMs, mais se heurte aux contraintes temps-réel absentes du traitement de texte. HyT s'inscrit dans un courant de recherche orienté déployabilité, aux côtés de la distillation de politiques et des architectures à flux de tokens réduit. La publication est une preprint arXiv non peer-reviewed, et les résultats en conditions réelles restent à confirmer à plus grande échelle industrielle. Aucun acteur européen n'est impliqué dans ces travaux ; les laboratoires cités opèrent principalement depuis les États-Unis.

RechercheOpinion
1 source
BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)
2arXiv cs.RO 

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)

Une équipe de chercheurs publie BOKBO (Best of K Bad Options), décrit comme la première couche d'abstention conforme pour l'inférence VLA à K échantillons. Le problème adressé est précis : les méthodes de scaling à l'inférence telles que RoboMonkey, SEAL, MG-Select et V-GPS génèrent K chunks d'actions candidates et exécutent celle validée comme la meilleure par un vérificateur. Mais lorsque les K candidates sont toutes non sûres, le système en exécute une sans aucun avertissement. BOKBO s'interpose en amont pour garantir, sans hypothèse sur la distribution des données, un taux maximal de violations exécutées. Deux variantes sont proposées : une globale et une par tâche dite Mondrian, cette dernière étant plus robuste sur les tâches les plus difficiles. Évalué sur le benchmark LIBERO avec OpenVLA-OFT à un seuil de risque ε=0,05, le bound conditionnel CRC tient sur 86% des splits bootstrap, avec une couverture de 78% et un taux de réussite nette de 70%. La variante Mondrian-BOKBO relève la fraction minimale de tenue conditionnelle par tâche de 0,71 à 0,93, sur 5 graines d'entraînement. Le résultat le plus saillant n'est pas la méthode elle-même mais l'échec structurel qu'elle expose. Les scores de non-conformité internes aux politiques VLA, utilisés comme proxies de sécurité dans les approches existantes, corrèlent à 0,98 avec l'hyperparamètre de bruit d'action σ, et pratiquement pas avec les violations réelles. Autrement dit, les filtres de sécurité actuels mesurent un réglage de bruit, non un risque réel. Pour les intégrateurs industriels et les équipes d'homologation, c'est un signal d'alarme : les garanties de sécurité des pipelines VLA déployés en production reposent peut-être sur un proxy invalide. Les auteurs montrent que l'échec est partiellement atténué avec un sampling stochastique au niveau des tokens plutôt que perturbation-based, mais le problème reste mécanisme-spécifique. Ils corrigent aussi un biais méthodologique courant : des seuils de force fixés globalement bien en dessous des forces typiques d'un expert humain gonflent artificiellement les taux de violation jusqu'à un facteur 5. Sur le plan du contexte, les VLA comme OpenVLA-OFT et π₀-FAST, testés tous deux dans l'étude, incarnent la convergence entre foundation models et contrôle robotique temps réel. Le benchmark LIBERO, utilisé comme terrain d'évaluation, est devenu une référence dans l'espace manipulation. BOKBO s'inscrit dans la théorie de la prédiction conforme, appliquée ici pour la première fois à l'abstention calibrée dans ce contexte. Les prochaines étapes logiques seraient une validation sur des environnements réels et des tâches hors distribution plus sévères, LIBERO restant un benchmark simulé aux distributions relativement contrôlées. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade.

UELes équipes d'homologation et intégrateurs industriels européens déployant des pipelines VLA en production devraient auditer leurs mécanismes de sécurité : cette étude montre que les scores de non-conformité utilisés comme proxies de sécurité mesurent un réglage de bruit, pas un risque réel.

RechercheActu
1 source
MotionWeave : apprendre la dynamique future centrée sur le mouvement pour les politiques vision-langage-action
3arXiv cs.RO 

MotionWeave : apprendre la dynamique future centrée sur le mouvement pour les politiques vision-langage-action

MotionWeave, un framework de recherche publié sur arXiv (2609.39324v1), propose une nouvelle façon d'entraîner les politiques Vision-Language-Action (VLA), ces modèles qui convertissent images et instructions en langage naturel en commandes pour le robot. Le système prédit des « action chunks », c'est-à-dire des séquences d'actions futures, et s'appuie sur deux modules. L'Action-Induced Motion Grounder (AIMG) part des représentations d'action et de proprioception pour construire, pour chaque pas de temps futur, une requête qui localise dans les tokens visuels courants la zone d'interaction concernée. L'Horizon Residual Composer (HRC) calcule ensuite les différences entre zones d'interaction à des horizons adjacents, les encode comme indices de mouvement temporels et les injecte dans les tokens d'action via un résiduel à porte (gated residual). À l'entraînement, des masques du bras robotique rendus à partir des images futures servent à construire une supervision de type divergence KL. À l'inférence, seule l'observation courante est utilisée. Sur six tâches MetaWorld, MotionWeave atteint 75,3 % de succès moyen, soit 8,6 points de plus que π0 (66,7 %), avec des gains marqués sur les tâches d'interaction soutenue. Le code est disponible sur GitHub. L'intérêt tient au problème que cible ce travail. Plusieurs VLA intègrent désormais des world models pour enrichir une supervision souvent limitée à des étiquettes d'action éparses. Prédire des images ou des vidéos futures oblige toutefois le modèle à reproduire de l'apparence sans lien avec le contrôle (textures, arrière-plan). Guider l'action avec une représentation visuelle globale du futur ne garantit pas non plus que chaque action corresponde à un changement visuel local précis. MotionWeave répond en supervisant la dynamique de mouvement plutôt que le rendu, sans coût supplémentaire à l'inférence, un point utile pour les intégrateurs soumis à des contraintes de latence. Les résultats appellent néanmoins de la prudence : six tâches en simulation, un seul benchmark et un seul point de comparaison cité, π0. Rien ne dit que le gain de 8,6 points se maintient sur des robots réels, des scènes encombrées ou des benchmarks plus larges. Aucune démonstration matérielle ni déploiement n'est annoncé, il s'agit d'une preuve de concept académique. Ce travail s'inscrit dans la course à l'enrichissement des VLA par des modèles du monde, après les approches qui prédisent des vidéos futures ou des images-objectifs. π0, de Physical Intelligence, reste la référence de base de nombreuses comparaisons, et MetaWorld un banc d'essai standard mais simulé, donc éloigné des conditions industrielles. La suite logique consisterait à valider la méthode sur plusieurs benchmarks, face à d'autres VLA récents, puis sur matériel réel. Le dépôt ouvert permettra à la communauté de vérifier ces chiffres. Aucun acteur européen n'est mentionné dans cette publication.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
4arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source