Aller au contenu principal
RecherchearXiv cs.RO 

Vers des VLA en temps réel : débruitage de flux en deux étapes adapté aux phases, et évaluation au niveau système

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les modèles vision-langage-action (VLA) se heurtent à un décalage temporel : l'inférence tourne à basse fréquence, alors que l'exécution robotique exige des cadences élevées. Une étude publiée sur arXiv (2609.39822, préprint non évalué par les pairs) mesure ce décalage de bout en bout. Côté modèle, le débruitage répété du Flow Matching pèse lourd dans le coût d'inférence. Côté robot, les retards viennent surtout de l'acquisition des données de perception, de l'ordonnancement des communications et de la réponse physique. Les auteurs observent que le champ de vitesse reste stable en amplitude et en direction au début de l'intégration, puis subit de fortes corrections directionnelles dans les dernières étapes. Ils en tirent un débruitage non uniforme en deux étapes, qui ramène le nombre de pas de 10 à 2 et le temps d'inférence du modèle de 61,557 ms à 21,956 ms. Ils présentent aussi un framework VLA distribué temps réel, avec des cadences indépendantes pour l'inférence, la publication des actions et le contrôle du robot, une acquisition modulaire des observations et une journalisation de la provenance des actions. Avec π0.5 comme référence, six méthodes d'exécution temps réel sont comparées sur une tâche physique de pliage de vêtements à long horizon.

Le résultat le plus utile pour un intégrateur : Legato est la meilleure méthode entraînée, et le Temporal Smoothing la meilleure méthode sans entraînement. Les deux se distinguent par le taux de réussite, le temps de réalisation, la continuité des actions et la douceur des accélérations. Associer le débruitage en deux étapes à ces méthodes réduit nettement le coût d'inférence, pour une baisse modeste des performances. Le résumé ne chiffre pas cette baisse. Il faut aussi relativiser : une seule tâche, sur un seul modèle de base, ne permet pas de généraliser.

Ce travail déplace l'attention de la seule vitesse du modèle vers l'ensemble de la chaîne. Les gains de latence ne servent à rien si la perception, la communication et l'actionneur restent le goulot, et c'est précisément ce que montrent les mesures. Pour les équipes qui déploient des VLA sur des robots réels, les méthodes sans entraînement sont une voie peu coûteuse, puisqu'elles se greffent sur un modèle existant sans réentraînement. Cela fragilise l'idée que la fluidité des démonstrations de VLA tient au seul modèle, et rappelle que l'écart entre démo et réalité se joue aussi dans l'architecture logicielle et le timing système.

Le contexte est celui de la montée des VLA à base de Flow Matching, dont la famille π de Physical Intelligence est l'exemple le plus visible, et de leur passage des laboratoires vers des tâches longues et déformables comme le pliage de linge. Les concurrents travaillent les mêmes verrous par d'autres voies : réduction du nombre de pas de diffusion, exécution asynchrone par morceaux d'actions, lissage temporel. Les auteurs concluent à la nécessité d'une optimisation conjointe de l'inférence et du timing du système robotique. Le résumé n'indique ni publication du code ni validation sur d'autres plateformes ou d'autres tâches, qui seront nécessaires pour confirmer la portée de ces résultats.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Attrape-moi si tu peux : débruitage du retour en temps réel pour des VLA plus réactifs
1arXiv cs.RO 

Attrape-moi si tu peux : débruitage du retour en temps réel pour des VLA plus réactifs

Des chercheurs présentent VLA-Feedback, une architecture pour modèles vision-langage-action (VLA) qui corrige en temps réel les gestes d'un bras robotique pendant leur exécution, décrite dans un article publié sur arXiv (2609.21022v1). Elle répond à une limite connue des générateurs d'actions par diffusion, qui produisent un bloc de mouvements en une seule passe puis l'exécutent en boucle ouverte, sans réagir aux changements survenant dans la scène. VLA-Feedback combine une planification par diffusion à basse fréquence et un retour visuel à haute fréquence, qui ajuste chaque action juste avant son exécution via la dernière étape de débruitage du modèle, sans relancer l'ensemble du pipeline vision-langage. Sur le benchmark statique LIBERO, ses résultats égalent ceux de GR00T. Sur des tâches dynamiques en simulation, le taux de réussite moyen grimpe de 27,5% à 85,0%; sur robot réel, il passe de 51% à 73%. Ce résultat cible un point de friction central pour l'industrialisation des VLA: la plupart des démonstrations de manipulation robotique sont tournées en environnement figé, où rien ne bouge entre la perception et l'action. Dès qu'un objet est déplacé ou qu'un contact change en cours de mouvement, les politiques en boucle ouverte échouent ou exigent une replanification complète, coûteuse en latence. En conservant l'expressivité du planificateur par diffusion tout en ajoutant une correction visuelle continue, VLA-Feedback propose une piste concrète pour réduire l'écart entre démonstration et usage réel en usine ou en entrepôt, où les scènes évoluent en permanence, un enjeu direct pour les intégrateurs qui évaluent le risque de déployer des bras pilotés par VLA hors laboratoire. Les VLA se sont imposés ces deux dernières années comme l'approche dominante pour la manipulation robotique généraliste, en combinant des modèles vision-langage préentraînés avec des politiques d'action par diffusion. GR00T, utilisé ici comme référence de comparaison, est développé par NVIDIA et sert de socle à plusieurs déploiements humanoïdes annoncés dans le secteur. D'autres approches, comme Pi-0 de Physical Intelligence ou Helix de Figure AI, explorent elles aussi des architectures à deux échelles de temps, signe que la réactivité en boucle fermée est identifiée comme un verrou majeur par l'ensemble du secteur. VLA-Feedback reste à ce stade une contribution académique: les auteurs renvoient vers une page de projet dédiée pour les documents complémentaires, sans calendrier de déploiement industriel ni partenariat annoncé.

RecherchePaper
1 source
Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM
2arXiv cs.RO 

Évaluation en temps réel de la sécurité des opérations du bras humain via un IMU au poignet avec système PSM

Des chercheurs publient sur arXiv (2502.09241) un système de surveillance de sécurité en temps réel pour environnements de fabrication collaboratifs homme-robot, basé sur une unité de mesure inertielle (IMU) portée au poignet et couplée à un modèle de sécurité prédictif (PSM, Predictive Safety Model). Le coeur du dispositif repose sur un modèle masse-ressort-amortisseur adapté aux mouvements du poignet, qui effectue une évaluation probabiliste du risque par calcul d'impédance mécanique. L'approche a été validée expérimentalement sur trois tâches manufacturières représentatives : manipulation d'outils, inspection visuelle et opérations de pick-and-place. Les auteurs démontrent la tenue en temps réel du système grâce à une sélection optimisée des paramètres, sans préciser les fréquences d'échantillonnage ni les latences mesurées dans le preprint. La pertinence industrielle tient à un problème structurel des cobots : comment évaluer dynamiquement le risque d'un opérateur sans interrompre le cycle productif. Les méthodes classiques de surveillance reposent soit sur des capteurs de force intégrés au robot (coûteux, limités à la zone d'interaction directe), soit sur des systèmes de vision 3D (sensibles aux occlusions, gourmands en calcul). Un IMU porté au poignet offre une alternative légère et portable, indépendante de l'infrastructure fixe. L'analyse en domaine fréquentiel pour établir des seuils quantitatifs de sécurité constitue une contribution méthodologique, mais elle reste à confronter aux exigences normatives ISO/TS 15066 qui régissent la vitesse et la puissance des robots collaboratifs en Europe et en Amérique du Nord. Le PSM dont s'inspire ce travail appartient à une lignée de modèles prédictifs développés en robotique collaborative, parallèlement aux travaux du DLR sur l'évaluation de risque biomécanique et aux implémentations commerciales comme SafeMove (ABB) ou les fonctions Speed&Separation Monitoring. Aucune entreprise partenaire ni timeline de déploiement n'est mentionnée dans le preprint : il s'agit d'une contribution académique en phase de validation expérimentale, sans prototype industriel annoncé. Les suites évoquées concernent l'évaluation adaptative du risque en temps réel, ce qui suggère une poursuite en laboratoire avant toute perspective de déploiement terrain.

UELa norme ISO/TS 15066, référence réglementaire pour les cobots en Europe, est citée comme horizon de validation obligatoire, mais l'absence de partenaire industriel européen et de métriques publiées (latence, fréquence d'échantillonnage) maintient ce travail au stade académique sans impact opérationnel immédiat sur le marché EU.

RecherchePaper
1 source
Débruitage par priorité d'action pour un découpage fluide en temps réel
3arXiv cs.RO 

Débruitage par priorité d'action pour un découpage fluide en temps réel

Une équipe de chercheurs a publié le 26 mai 2026 sur arXiv (réf. 2605.25537) une méthode baptisée Soft RTC (Soft Real-Time Chunking), visant à rendre les politiques d'action par blocs plus fluides lorsqu'elles opèrent sous délai d'inférence. Le problème de départ est concret : les politiques de type diffusion génèrent les commandes motrices en « chunks » (séquences d'actions), mais l'inférence prend du temps. Le RTC standard résout cela en conditionnant chaque nouveau chunk sur les actions déjà engagées par le précédent, grâce à un masque binaire de préfixe. Soft RTC remplace ce masque binaire par un mécanisme de dénaturation partielle (action-prior denoising) : les tokens de chevauchement entre deux chunks ne partent plus d'un bruit pur, mais d'états partiellement dénaturés, alignés sur le chunk précédent via une règle de mélange par token. Sur les 12 niveaux Kinetix publiés (environnements de simulation de manipulation complexe), un fenêtrage "soft" court atteint un taux de résolution de 0,809 contre 0,815 pour le hard RTC, soit un écart marginal. Un fenêtrage medium réduit quant à lui le delta d'action et le jerk (à-coup) en régime de fort délai de respectivement 9,1 % et 9,6 % par rapport au hard RTC classique. Une étude préliminaire sur robot réel en tri d'objets confirme l'amélioration de la complétion et donne à Soft RTC les meilleures métriques de douceur de commande parmi les politiques testées. L'enjeu pour la robotique industrielle est précis : le jerk élevé, c'est l'usure mécanique, les alarmes de sécurité, et l'impossibilité de travailler en cobotique. Les politiques de diffusion pour la manipulation (pi-0 de Physical Intelligence, ACT, Diffusion Policy) ont démontré des capacités de généralisation impressionnantes, mais leur déploiement en temps réel reste contraint par la latence d'inférence, typiquement plusieurs centaines de millisecondes sur GPU embarqué. Hard RTC avait déjà attaqué ce problème ; Soft RTC prouve qu'on peut gagner significativement en douceur de mouvement sans sacrifier ni le taux de succès ni le coût computationnel, les deux variantes conservent un overhead « quasi-naïf » à l'inférence, sans guidance coûteuse au déploiement. Ce résultat contredit l'idée que fluidité et performance sont nécessairement en tension dans les politiques diffusion pour la manipulation. La problématique du délai d'inférence dans les politiques d'action par diffusion est active depuis que ces architectures ont montré leur supériorité en manipulation dextère, notamment avec les travaux de Stanford (Diffusion Policy, 2023) et de Physical Intelligence (pi-0, 2024). Le hard RTC de référence avait établi une baseline robuste mais au prix de transitions sèches entre chunks. Côté acteurs, Physical Intelligence, Unitree, Figure AI et les équipes de Google DeepMind (GR00T, RT-2) travaillent tous sur des politiques à base de diffusion pour leurs humanoïdes et bras manipulateurs. Soft RTC s'inscrit dans la couche d'inférence basse latence de ces systèmes, indépendamment de l'architecture VLA sous-jacente. Aucun partenaire industriel ni timeline de déploiement n'est mentionné, il s'agit d'une contribution de recherche, avec code et niveaux Kinetix publiés, mais sans implémentation industrielle annoncée à ce stade.

RecherchePaper
1 source
FASTER : repenser les VLA de flux en temps réel
4arXiv cs.RO 

FASTER : repenser les VLA de flux en temps réel

Des chercheurs ont publié sur arXiv (2603.19199v2) une méthode baptisée FASTER (Fast Action Sampling for ImmediaTE Reaction) visant à réduire la latence de réaction des modèles VLA (Vision-Language-Action) sur des robots physiques. Le problème ciblé est précis : dans les politiques génératives basées sur le flow matching, comme π₀.₅ de Physical Intelligence ou X-VLA, le système doit compléter l'intégralité des étapes d'échantillonnage avant de pouvoir déclencher le moindre mouvement. FASTER introduit un "Horizon-Aware Schedule" qui réorganise l'ordre de débruitage pour prioriser les actions immédiates, comprimant leur génération de dix étapes à une seule, soit une réduction d'un facteur dix. La méthode a été validée sur des robots réels, dont une tâche de tennis de table à haute dynamique, et s'exécute sur GPU grand public via une architecture client-serveur en streaming. L'apport central est analytique avant d'être technique : les auteurs formalisent le temps de réaction comme une distribution uniforme déterminée conjointement par le TTFA (Time to First Action) et l'horizon d'exécution. Cette modélisation démontre que la pratique standard d'un schedule constant dans les VLA basées sur le flow constitue un goulot d'étranglement structurel, et non un simple détail d'implémentation. En comprimant la génération des actions proches en une seule passe de débruitage tout en préservant la qualité des trajectoires longues, FASTER réduit effectivement la latence mesurée sur robot physique. Le test sur ping-pong, tâche reconnue pour son exigence en temps de boucle fermée, représente un signal de validation plus robuste que les benchmarks de manipulation statique habituellement retenus dans ce type de papier. Le contexte est celui d'une concurrence accrue entre architectures VLA depuis la publication de π₀ par Physical Intelligence fin 2024, rapidement suivie de π₀.₅, d'OpenVLA-OFT et de X-VLA. Ces modèles héritent tous du paradigme "action chunking" issu de ACT et Diffusion Policy, qui génère des segments d'actions plutôt que des commandes individuelles, introduisant mécaniquement de la latence. FASTER s'inscrit dans ce courant d'optimisation de l'inférence, aux côtés de travaux de distillation de policies, sans requérir de réentraînement du modèle de base. La démonstration sur GPU grand public est un signal d'accessibilité notable pour les intégrateurs sans infrastructure HPC, mais le stade reste celui d'une preuve de concept académique, sans déploiement industriel annoncé à ce stade.

RechercheOpinion
1 source