Aller au contenu principal
Premover : contrôle VLA rapide en agissant avant la fin des instructions
RecherchearXiv cs.RO 

Premover : contrôle VLA rapide en agissant avant la fin des instructions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (référence 2605.12160) un module baptisé Premover, conçu pour réduire la latence des politiques Vision-Language-Action (VLA) en exploitant le temps d'inactivité pendant lequel l'utilisateur formule sa commande. Sur le benchmark LIBERO, Premover ramène le temps d'exécution moyen de 34,0 à 29,4 secondes, soit une réduction de 13,6%, tout en maintenant un taux de réussite de 95,1% contre 95,0% pour la baseline avec instruction complète. Techniquement, le module gèle le backbone VLA existant et y greffe deux têtes de projection légères, l'une pour les patches d'image, l'autre pour les tokens de langage, qui projettent une couche intermédiaire du réseau dans un espace commun. La carte d'attention résultante (focus map), supervisée par des masques de segmentation de l'objet cible générés en simulateur, sert à réépondérer les tokens d'image de l'étape suivante. Un seuil scalaire de prédisposition, entraîné sur des préfixes d'instruction en streaming, décide du moment où la politique peut commencer à agir.

L'enjeu dépasse la simple optimisation de latence. Dans un déploiement réel, l'utilisateur met plusieurs secondes à formuler sa requête, vocalement ou par clavier, laissant la politique en veille pendant une fraction significative de l'interaction. Premover transforme cette fenêtre creuse en précomputation utile sans toucher au backbone, ce qui en fait une amélioration drop-in compatible avec les VLA existants. Le contraste avec le "naive premoving" est révélateur : agir prématurément sans le mécanisme de focus fait chuter le taux de réussite à 66,4%, ce qui démontre que l'anticipation non conditionnée est destructrice et que la focus map est bien le coeur de la contribution. Pour un intégrateur industriel, une réduction de 13,6% du temps de cycle sur des tâches de manipulation représente un gain opérationnel cumulable à l'échelle d'un déploiement.

Les VLA ont connu une accélération marquée depuis 2023, avec pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA de Stanford University comme jalons principaux. Le problème de latence qu'attaque Premover est structurel : plus les modèles sous-jacents grossissent, plus l'inférence est lente, rendant critiques les optimisations sans régression de performance. Ce travail reste pour l'instant un preprint, sans déploiement annoncé ni validation sur matériel réel mentionnée dans l'abstract, et sa robustesse hors du benchmark LIBERO, un environnement de simulation contrôlé à portée limitée, reste à établir. Les prochaines étapes naturelles incluront une validation sim-to-real sur des plateformes comme Franka ou UR5, et une extension aux instructions vocales continues où la fenêtre d'inactivité est structurellement plus longue.

À lire aussi

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions
1arXiv cs.RO 

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions

Des chercheurs publient sur arXiv (2607.15733v1) un nouveau contrôleur à horizon glissant dans l'espace des tâches pour l'évitement de collision en temps réel sur bras manipulateurs robotiques. La méthode combine un rollout court et "contact-consistant", basé sur un solveur dynamique itératif appliqué à des géométries convexes gonflées du robot et des obstacles, pour générer une référence cinématique terminale respectant les contraintes de non-pénétration internes. Seule la première commande d'une transition lisse à accélération minimale vers cette référence est ensuite calculée à chaque cycle, en partant d'une loi de régulation par cinématique inverse en boucle fermée. Les auteurs démontrent une régulation exponentielle locale dans l'espace des tâches lorsque les contacts sont inactifs, et bornent l'effet des obstacles mobiles sur les ensembles de fonctionnement réguliers lorsque des contacts s'activent pendant le rollout. Les tests incluent des simulations sur un système multi-chaînes à 40 degrés de liberté (DOF) et des expériences matérielles sur une plateforme à 6 DOF. L'enjeu pratique est le compromis classique entre anticipation et réactivité en robotique industrielle: le contrôle prédictif complet (MPC) offre une vision à long terme mais son coût de calcul explose avec l'horizon, la fidélité du modèle et le nombre de contraintes géométriques actives, tandis que les méthodes réactives sans horizon restent rapides mais peu clairvoyantes en environnement encombré et dynamique. Les résultats montrent que des horizons intermédiaires équilibrent ces deux exigences, avec des taux de succès supérieurs à des baselines MPC et à des "dynamic optimization fabrics" en clutter dynamique, tout en gardant des temps de résolution compatibles avec l'exécution temps réel testée. Point notable pour les intégrateurs: le comportement reste cohérent entre simulation et réel sans estimation précise des paramètres inertiels, ce qui limite l'effort de calibration habituellement nécessaire au transfert sim-to-real. Ce travail s'inscrit dans la lignée des recherches en contrôle prédictif appliqué à la manipulation en environnement dynamique, un axe où les laboratoires universitaires cherchent à réduire le fossé entre démonstrations en simulation et déploiements réels sur bras industriels ou collaboratifs. La comparaison directe avec des baselines MPC et fabrics d'optimisation dynamique positionne la méthode comme une alternative moins coûteuse en calcul pour l'évitement d'obstacles mobiles, un enjeu croissant pour les cellules robotiques partagées avec des opérateurs humains ou d'autres machines mobiles (AMR). Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial à ce stade.

RecherchePaper
1 source
DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique
2arXiv cs.RO 

DISC : découplage instruction-contrôle conditionné par l'état via la génération de politique

Des chercheurs ont publié DISC (Decoupling Instruction from State-Conditioned Control via Policy Generation), une architecture de politique de manipulation robotique conditionnée par le langage, déposée sur arXiv (2605.20856) en mai 2026. L'approche repose sur un hyperréseau qui génère l'intégralité des paramètres d'une politique visuomotrice spécifique à la tâche à partir de la seule instruction textuelle. La politique générée n'accède jamais directement au langage : sa compréhension de la tâche provient exclusivement des poids produits par l'hyperréseau. Sur les benchmarks LIBERO-90 et Meta-World, DISC surpasse l'ensemble des architectures couplées évaluées, et dépasse pi-0 (Physical Intelligence) malgré l'absence de tout préentraînement sur données externes. Le code est disponible publiquement sur GitHub. Ce résultat touche à un problème structurel bien documenté dans le domaine des VLA (Vision-Language-Action models) : l'"observation leakage", c'est-à-dire la tendance des réseaux couplés à apprendre des raccourcis scène-à-action qui contournent le grounding linguistique. En pratique, cela signifie qu'un modèle peut réussir une tâche en exploitant des corrélations visuelles parasites plutôt qu'en comprenant l'instruction. DISC élimine ce chemin de fuite par construction, et non par régularisation post-hoc. Le fait de surpasser pi-0 sans préentraînement est notable : pi-0 est entraîné sur des volumes de données multi-robots à grande échelle, ce qui rend la comparaison significative pour les équipes qui cherchent à calibrer le retour sur investissement du préentraînement massif versus des architectures mieux conçues. L'hyperréseau apprend également un manifold de paramètres structuré sémantiquement, ce qui permet une adaptation few-shot à partir de très peu de démonstrations et une robustesse aux reformulations d'instructions. Les architectures de politiques conditionnées par le langage sont au coeur de la course aux robots généralistes depuis 2023, avec des travaux fondateurs comme RT-2 (Google DeepMind), OpenVLA, et pi-0 de Physical Intelligence qui ont structuré le débat autour du préentraînement à grande échelle. DISC propose une alternative architecturale plutôt que scalaire : résoudre le problème de couplage instruction-état en amont, plutôt que de le noyer dans des données. Côté concurrents directs, les approches hyperréseau pour la génération de politiques restent peu explorées en robotique de manipulation, ce qui laisse DISC dans un espace relativement dégagé pour l'instant. Les prochaines étapes naturelles seraient une validation sur hardware physique à plus grande échelle (les expériences réelles mentionnées dans le papier restent limitées à un benchmark à contexte visuel partagé) et une évaluation de la latence de génération des paramètres en conditions de déploiement industriel, deux points que le papier ne documente pas encore précisément.

RechercheOpinion
1 source
Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras
3arXiv cs.RO 

Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras

Des chercheurs ont publié Co-VLA (arXiv:2606.20285), un framework de manipulation bimanurale qui intègre des priors structurels explicites dans les modèles VLA (Vision-Language-Action). L'architecture remplace la tête d'action monolithique habituelle par un Structured Action Expert (SAE) couplé à un Latent-Aware Controller (LAC) opérant au niveau des commandes articulaires. Le SAE décompose la représentation latente en une composante partagée encodant l'intent de coordination au niveau de la tâche, et des résidus par bras capturant les ajustements d'exécution propres à chaque effecteur. Les résultats expérimentaux, en simulation et sur banc réel, montrent un gain de 27 points de taux de succès sur les tâches à coordination serrée, un doublement des performances hors-distribution (de 13 % à 27 %), et une réduction du temps d'exécution allant jusqu'à 25 % face aux baselines monolithiques. L'enjeu central est de rendre fiable et interprétable la coordination bimanurale dans des scénarios industriellement contraints : assemblage à force symétrique, manipulation d'objets déformables, chaînes de montage à deux bras. Les VLA actuels comme Pi-0 ou GR00T N2 montrent que la coordination émergente fonctionne sur des tâches simples, mais échoue à garantir la stabilité quand les contraintes d'exécution sont critiques. Co-VLA répond à cette limite sans requérir de contrôle en force ni en impédance : le LAC module en temps réel la synchronisation, l'asymétrie et les contraintes de sécurité tout en restant compatible avec les pipelines de contrôle standard, ce qui abaisse la barrière d'intégration pour les équipementiers. Le doublement des performances OOD est l'indicateur le plus stratégique, suggérant que la structure explicite améliore la robustesse hors-distribution, un critère décisif pour les déploiements industriels réels. Le domaine des VLA pour la manipulation s'est accéléré depuis 2023, porté par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui ont repoussé les limites de la généralisation en manipulation mono et bimanurale. Co-VLA s'inscrit dans une tendance qui réintroduit de la structure explicite dans l'apprentissage end-to-end, une tension classique entre approches connexionnistes et symboliques qui refait surface à l'ère des grands modèles de fondation. Aucun partenaire industriel ni timeline de commercialisation n'est mentionné dans l'abstract : il s'agit d'un preprint de recherche académique, sans robot identifié ni déploiement annoncé à ce stade.

RechercheOpinion
1 source
APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions
4arXiv cs.RO 

APT : le pré-entraînement par expertise d'action améliore la généralisation des politiques VLA aux nouvelles instructions

Une équipe de chercheurs a publié le 11 juin 2026 sur arXiv (identifiant 2606.12366) APT (Action expert PreTraining), une méthode d'entraînement en deux étapes conçue pour améliorer la généralisation des politiques robotiques Vision-Langage-Action (VLA) face à des instructions en langage naturel hors distribution. Le problème ciblé : les modèles VLA actuels, qui couplent un grand modèle de vision-langage (VLM) préentraîné à un expert d'action continu, peinent à exécuter des consignes qu'ils n'ont pas vues pendant l'entraînement. La méthode s'applique aux architectures mainstream du domaine, notamment les architectures de style pi (Physical Intelligence) et GR00T (NVIDIA), et démontre des gains cohérents sur des instructions inédites et des tâches compositionnelles selon les expériences rapportées dans l'article. Le problème fondamental identifié par les auteurs est un déséquilibre structurel dans les données VLA : la diversité linguistique y est bien plus faible que la diversité visuelle ou motrice, ce qui pousse les politiques à s'appuyer sur des raccourcis visuels plutôt que sur les instructions textuelles. Les méthodes à actions discrètes, comme OpenVLA, atténuent ce biais via un co-entraînement vision-langage, mais les experts d'action continus, initialisés aléatoirement, génèrent des gradients bruités qui corrompent le VLM et n'exploitent pas sa capacité de compréhension linguistique. APT résout cela par une factorisation bayésienne : l'expert d'action est d'abord préentraîné comme un prior vision-action sans supervision linguistique, sur un VLM gelé (étape 1), puis les tokens de langage sont injectés via un mécanisme de fusion à porte (gated fusion) qui intègre les représentations du VLM tout en préservant le prior visuomoteur appris (étape 2). Cette séparation empêche l'imbalance linguistique de polluer l'apprentissage moteur initial. Le domaine des VLA robotiques connaît depuis 2024 une accélération notable avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et Helix de Figure AI, tous construits autour du paradigme VLM couplé à un expert d'action continu. La généralisation aux instructions non vues reste l'un des défis non résolus du secteur : les démos en laboratoire reposent souvent sur des jeux de consignes étroits, loin de la variabilité d'un déploiement industriel réel, ce qui constitue un frein concret à la commercialisation. APT propose une réponse méthodologique à ce gap sans modifier les architectures cibles, en réordonnant uniquement leur processus d'entraînement. Les prochaines étapes naturelles incluront des validations indépendantes sur des benchmarks standardisés comme LIBERO ou RoboSuite, ainsi que des tests à l'échelle sur robots physiques en environnement non structuré.

RechercheActu
1 source