Aller au contenu principal
Premover : contrôle VLA rapide en agissant avant la fin des instructions
RecherchearXiv cs.RO 

Premover : contrôle VLA rapide en agissant avant la fin des instructions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (référence 2605.12160) un module baptisé Premover, conçu pour réduire la latence des politiques Vision-Language-Action (VLA) en exploitant le temps d'inactivité pendant lequel l'utilisateur formule sa commande. Sur le benchmark LIBERO, Premover ramène le temps d'exécution moyen de 34,0 à 29,4 secondes, soit une réduction de 13,6%, tout en maintenant un taux de réussite de 95,1% contre 95,0% pour la baseline avec instruction complète. Techniquement, le module gèle le backbone VLA existant et y greffe deux têtes de projection légères, l'une pour les patches d'image, l'autre pour les tokens de langage, qui projettent une couche intermédiaire du réseau dans un espace commun. La carte d'attention résultante (focus map), supervisée par des masques de segmentation de l'objet cible générés en simulateur, sert à réépondérer les tokens d'image de l'étape suivante. Un seuil scalaire de prédisposition, entraîné sur des préfixes d'instruction en streaming, décide du moment où la politique peut commencer à agir.

L'enjeu dépasse la simple optimisation de latence. Dans un déploiement réel, l'utilisateur met plusieurs secondes à formuler sa requête, vocalement ou par clavier, laissant la politique en veille pendant une fraction significative de l'interaction. Premover transforme cette fenêtre creuse en précomputation utile sans toucher au backbone, ce qui en fait une amélioration drop-in compatible avec les VLA existants. Le contraste avec le "naive premoving" est révélateur : agir prématurément sans le mécanisme de focus fait chuter le taux de réussite à 66,4%, ce qui démontre que l'anticipation non conditionnée est destructrice et que la focus map est bien le coeur de la contribution. Pour un intégrateur industriel, une réduction de 13,6% du temps de cycle sur des tâches de manipulation représente un gain opérationnel cumulable à l'échelle d'un déploiement.

Les VLA ont connu une accélération marquée depuis 2023, avec pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA de Stanford University comme jalons principaux. Le problème de latence qu'attaque Premover est structurel : plus les modèles sous-jacents grossissent, plus l'inférence est lente, rendant critiques les optimisations sans régression de performance. Ce travail reste pour l'instant un preprint, sans déploiement annoncé ni validation sur matériel réel mentionnée dans l'abstract, et sa robustesse hors du benchmark LIBERO, un environnement de simulation contrôlé à portée limitée, reste à établir. Les prochaines étapes naturelles incluront une validation sim-to-real sur des plateformes comme Franka ou UR5, et une extension aux instructions vocales continues où la fenêtre d'inactivité est structurellement plus longue.

À lire aussi

SCULPT-VLA : apprentissage d'un contrôle structuré par ancrage d'actions en étapes
1arXiv cs.RO 

SCULPT-VLA : apprentissage d'un contrôle structuré par ancrage d'actions en étapes

Un nouveau papier publié sur arXiv (identifiant 2609.23275, soumis fin septembre 2026) présente SCULPT-VLA, une architecture de politique vision-langage-action entraînée par ancrage d'actions en plusieurs étapes. Le système construit un état de conditionnement des actions à partir de trois facteurs complémentaires : progression de la tâche, dynamique de la scène et ancrage spatial. L'entraînement forme d'abord ces facteurs à l'aide de scaffolds enseignants, avant d'ancrer une prédiction d'action grossière sur leur composition à mesure que ces scaffolds sont retirés, puis de restaurer l'accès perceptif direct pour un affinage continu. Sur les bancs d'essai en simulation LIBERO, SimplerEnv-WidowX et RoboTwin 2.0 Full, SCULPT-VLA dépasse des références à backbone partagé. Sur SimplerEnv-WidowX précisément, le taux de succès final atteint 83,5 %, contre 71,3 % lorsque l'apprentissage d'action de la deuxième étape accède directement à la vision et au langage sans passer par l'état structuré. Sur quatre tâches réalisées avec un robot physique soumis à des changements de distribution, le taux de succès moyen atteint 58,1 %, contre 45,6 % pour le modèle de référence Pi-0.5. Ce travail s'inscrit dans un débat technique central pour les VLA actuels : au-delà des labels d'action bruts, comment structurer une supervision intermédiaire pour que la prédiction d'action en dépende réellement, sans que cette dépendance s'effondre dès que les données annotées par un enseignant disparaissent au déploiement. En séparant explicitement l'apprentissage du conditionnement structurel de l'affinage du contrôle continu, SCULPT-VLA répond à un problème pratique pour les intégrateurs : au déploiement, aucune donnée d'enseignant ni autorégression discrète n'est nécessaire, ce qui simplifie l'inférence embarquée. Les gains rapportés en conditions de changement de distribution, un scénario proche des conditions réelles d'usine ou d'entrepôt, suggèrent une meilleure robustesse que les architectures VLA à accès perceptif direct, un point sensible pour les décideurs qui évaluent l'écart entre démonstrations en simulation et performance terrain. Le papier ne précise ni affiliation d'auteurs ni date de publication de conférence, ce qui correspond au format d'un preprint arXiv récent, probablement en soumission anonyme. Il se positionne par comparaison directe avec Pi-0.5 comme référence de politique VLA généraliste, sans mention d'un partenariat industriel ou d'un déploiement commercial. Les auteurs annoncent des ablations sur les facteurs d'état et des interventions ciblées confirmant que l'état appris continue de contribuer au contrôle même après le retour de l'accès perceptif direct, sans toutefois indiquer de calendrier de suite ni de portage vers d'autres plateformes robotiques.

RechercheOpinion
1 source
Découpler planification et contrôle pour des agents instructibles
2arXiv cs.RO 

Découpler planification et contrôle pour des agents instructibles

Une équipe de recherche publie sur arXiv (2608.26788v1) l'article « Decoupling Planning and Control for Instructable Agents », qui présente le système Instruct-to-Act. L'architecture associe un modèle vision-langage (VLM) pré-entraîné, chargé de traduire instructions et observations en plans de haut niveau peu fréquents, à un contrôleur de type « world model » entraîné pour agir en autonomie à haute fréquence à partir de ces instructions. Pour le rendre instructable, les chercheurs relabellisent des trajectoires du contrôleur avec des instructions synthétiques et optimisent conjointement clonage de comportement, récompense et modélisation du monde. Le système est testé sur sept environnements simulés, dont trois multi-agents où des planificateurs VLM coordonnent par le langage pendant que les contrôleurs entraînés agissent comme actionneurs. Ce travail répond à une limite bien identifiée dans le secteur : les VLM planifient bien à partir d'instructions et d'observations, mais peinent à transformer ces plans en actions fiables et rapides en environnement inconnu, tandis que les contrôleurs « world model » contrôlent vite mais manquent de guidage sur la tâche à accomplir. À espaces d'observation et d'action équivalents, l'approche découplée surpasse de façon constante les variantes contrôleur seul et génération d'action directe par le VLM, tout en gardant un contrôle rapide et en permettant de changer de planificateur VLM sans réentraîner le contrôleur, un atout pour des intégrateurs voulant faire évoluer le « cerveau » sans retoucher les « réflexes » du robot. Elle reste toutefois seulement compétitive, et non systématiquement supérieure, face à des références vision-langage-action (VLA) et RL multi-agent solides, sur six tâches sur sept. Il s'agit d'un article de recherche, non d'une annonce produit : le résumé ne cite aucune entreprise ni robot commercial, et les sept environnements testés sont simulés, sans déploiement sur matériel réel évoqué. La démarche rejoint une tendance de l'apprentissage robotique consistant à séparer un raisonnement lent de haut niveau d'un contrôle réactif rapide, déjà explorée par des systèmes industriels comme Helix chez Figure ou GR00T N2 chez Nvidia. Aucun pilote ni calendrier vers des robots physiques n'est mentionné : la contribution porte sur la méthodologie et sa capacité à généraliser entre plusieurs bancs d'essai simulés.

RechercheActu
1 source
Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions
3arXiv cs.RO 

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions

Des chercheurs publient sur arXiv (2607.15733v1) un nouveau contrôleur à horizon glissant dans l'espace des tâches pour l'évitement de collision en temps réel sur bras manipulateurs robotiques. La méthode combine un rollout court et "contact-consistant", basé sur un solveur dynamique itératif appliqué à des géométries convexes gonflées du robot et des obstacles, pour générer une référence cinématique terminale respectant les contraintes de non-pénétration internes. Seule la première commande d'une transition lisse à accélération minimale vers cette référence est ensuite calculée à chaque cycle, en partant d'une loi de régulation par cinématique inverse en boucle fermée. Les auteurs démontrent une régulation exponentielle locale dans l'espace des tâches lorsque les contacts sont inactifs, et bornent l'effet des obstacles mobiles sur les ensembles de fonctionnement réguliers lorsque des contacts s'activent pendant le rollout. Les tests incluent des simulations sur un système multi-chaînes à 40 degrés de liberté (DOF) et des expériences matérielles sur une plateforme à 6 DOF. L'enjeu pratique est le compromis classique entre anticipation et réactivité en robotique industrielle: le contrôle prédictif complet (MPC) offre une vision à long terme mais son coût de calcul explose avec l'horizon, la fidélité du modèle et le nombre de contraintes géométriques actives, tandis que les méthodes réactives sans horizon restent rapides mais peu clairvoyantes en environnement encombré et dynamique. Les résultats montrent que des horizons intermédiaires équilibrent ces deux exigences, avec des taux de succès supérieurs à des baselines MPC et à des "dynamic optimization fabrics" en clutter dynamique, tout en gardant des temps de résolution compatibles avec l'exécution temps réel testée. Point notable pour les intégrateurs: le comportement reste cohérent entre simulation et réel sans estimation précise des paramètres inertiels, ce qui limite l'effort de calibration habituellement nécessaire au transfert sim-to-real. Ce travail s'inscrit dans la lignée des recherches en contrôle prédictif appliqué à la manipulation en environnement dynamique, un axe où les laboratoires universitaires cherchent à réduire le fossé entre démonstrations en simulation et déploiements réels sur bras industriels ou collaboratifs. La comparaison directe avec des baselines MPC et fabrics d'optimisation dynamique positionne la méthode comme une alternative moins coûteuse en calcul pour l'évitement d'obstacles mobiles, un enjeu croissant pour les cellules robotiques partagées avec des opérateurs humains ou d'autres machines mobiles (AMR). Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial à ce stade.

RecherchePaper
1 source
Contrôle par contours en style expert : une planification plus rapide que la démonstration, entre expert lent et jeu rapide
4arXiv cs.RO 

Contrôle par contours en style expert : une planification plus rapide que la démonstration, entre expert lent et jeu rapide

Une équipe de recherche en robotique a publié le 22 septembre 2026 sur arXiv (arXiv:2609.22798v1) une méthode baptisée Expert-Play Contouring Control (EPCC), conçue pour exécuter des tâches de manipulation robotique plus vite que les démonstrations utilisées pour les apprendre. Le problème de départ est connu en apprentissage par imitation (IL) : un robot reproduit fidèlement la vitesse de la démonstration humaine, et accélérer artificiellement le mouvement appris échoue souvent car la dynamique entre le robot et l'objet manipulé change à vitesse plus élevée. EPCC combine deux sources de données : des démonstrations expertes lentes, utilisées pour entraîner un générateur de trajectoire latente reformulé en un "contour" de progression de tâche indépendant du temps, et des données de jeu rapide non expert, utilisées pour entraîner un modèle du monde des effets d'actions rapides. Au moment de l'exécution, un planificateur s'appuie sur ce modèle du monde pour choisir les actions qui font progresser le robot le long du contour expert tout en pénalisant les écarts par rapport à la tâche prévue. Sur trois tâches de manipulation visuomotrice testées, EPCC atteint en moyenne un débit deux fois supérieur à la référence IL classique, et 2,2 fois supérieur à la meilleure méthode d'accélération concurrente sur la tâche la plus sensible aux interactions physiques objet-robot. L'intérêt pour l'industrie robotique tient à la séparation proposée entre intention de tâche et couverture dynamique : plutôt que de collecter de nouvelles démonstrations expertes rapides, coûteuses et parfois risquées à réaliser, EPCC extrait la connaissance de vitesse depuis des données de jeu bon marché et non supervisées. Pour les intégrateurs et décideurs B2B en manipulation industrielle, cela ouvre une piste concrète pour réduire les temps de cycle des politiques apprises par imitation sans réentraînement expert coûteux, un goulot d'étranglement classique face aux architectures vision-langage-action visant la généralisation mais rarement optimisées pour la vitesse d'exécution. Le résultat confirme aussi une hypothèse répandue dans le secteur : accélérer une politique apprise sans modéliser la dynamique physique du contact échoue précisément là où cette dynamique compte, ce que confirme la concentration des gains d'EPCC sur les tâches les plus sensibles aux interactions. Le travail se positionne comme une alternative aux approches d'accélération directe de trajectoires apprises, jugées insuffisantes dès que la physique du contact intervient, et à l'apprentissage par renforcement pur, généralement plus coûteux à entraîner. Il ne s'agit pas d'un produit commercialisé ni d'un déploiement industriel réel, mais d'un preprint de recherche évalué sur trois tâches de manipulation en environnement contrôlé, sans robot ni entreprise nommés dans l'abstract. Les auteurs présentent leurs résultats comme un principe généralisable plutôt qu'un système fini, ouvrant la voie à des extensions vers d'autres familles de tâches manipulatoires et à une intégration éventuelle avec des politiques vision-langage-action à plus grande échelle.

RecherchePaper
1 source