Aller au contenu principal
RecherchearXiv cs.RO 

ChunkVLA-AM : découpage d'actions en parallèle pour le contrôle de robots par modèle vision-langage-action (VLA) en fabrication additive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.01856) ChunkVLA-AM, un cadre de déploiement du modèle vision-langage-action OpenVLA-OFT sur un bras FAIRINO FR3 installé dans une cellule de fabrication additive fixe. Une chaîne de données convertit des démonstrations réelles filmées en monoculaire en jeux de données TFDS/RLDS compatibles OpenVLA, afin d'adapter le modèle à la morphologie du FR3. À l'exécution, chaque requête d'inférence prédit un « chunk » de huit actions à 7 dimensions. Le robot exécute ce bloc en boucle ouverte, puis capture une nouvelle observation, ce qui crée un retour en boucle fermée entre les blocs. L'architecture sépare cloud et edge : le client FR3 envoie ses observations à un serveur d'inférence distant via une interface FastAPI. Sur 42 essais physiques de transfert d'objet d'un point A à un point B, répartis à égalité entre cibles rouges et bleues, le système réussit 39 fois, soit 92,9 %. Les trois échecs surviennent tous au placement final : le contrôle insuffisant de la hauteur de lâcher fait basculer l'objet. Un balayage d'éclairage situe la plage de luminance à faible erreur entre 85 et 125 sur une échelle de 0 à 255, l'erreur spatiale moyenne la plus basse étant obtenue à 95.

L'intérêt tient moins au score qu'à la méthode : il s'agit d'un exemple documenté de VLA ouvert adapté à un bras peu courant, sans recours à une plateforme propriétaire. Le chunking à huit pas limite la fréquence d'inférence nécessaire et rend viable une inférence déportée, donc des postes de travail légers. La sensibilité à la luminosité mérite l'attention des intégrateurs. La plage utile, qui représente environ 16 % de l'échelle, signifie que la robustesse aux variations d'environnement reste un point faible, alors que les ateliers de fabrication additive ont des éclairages variables. Il faut aussi relativiser le chiffre : 42 essais, une tâche unique de pick-and-place, une cellule fixe et deux couleurs de cible. Cela ne prouve ni généralisation ni cadence industrielle, et aucun temps de cycle n'est donné dans le résumé. L'intervalle de confiance sur 39 réussites sur 42 reste large. Les échecs au lâcher indiquent que la précision fine sur l'axe vertical est un verrou, probablement lié à la caméra monoculaire sans information de profondeur explicite.

Ce travail s'inscrit dans la lignée d'OpenVLA, puis de la variante OFT (optimized fine-tuning), qui introduit le chunking parallèle d'actions pour accélérer l'inférence. Il se place en aval de modèles comparables comme Pi-0 ou GR00T, plus lourds et visant des morphologies multiples. Le FR3 de FAIRINO, un cobot d'origine chinoise, est un choix économique face aux bras Franka ou Universal Robots plus fréquents dans la recherche. Le résumé n'annonce ni pilote industriel ni déploiement en production : il s'agit d'un prototype de laboratoire en préprint, non évalué par les pairs. Les suites logiques seraient un contrôle de hauteur de lâcher amélioré, une capture en profondeur et des tests sur des tâches de manipulation propres à la fabrication additive, comme le retrait de pièces du plateau.

À lire aussi

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
1arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source
Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action
2arXiv cs.RO 

Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action

Un article publié sur arXiv (référence 2609.19923v1) présente Co-VLA, une méthode d'entraînement fédéré pour les modèles vision-langage-action (VLA), cette classe de modèles qui traduit perception visuelle et instructions en langage naturel en commandes motrices pour robots. La technique s'appuie sur l'optimisation par consensus via l'algorithme ADMM (Alternating Direction Method of Multipliers) pour coordonner l'entraînement entre plusieurs clients détenant chacun des données robotiques locales différentes, sans jamais faire transiter ces données brutes vers un serveur central. Les auteurs montrent que le même algorithme fonctionne à la fois pour l'entraînement complet d'un modèle et pour le fine-tuning paramétrique-efficient, avec des adaptateurs à rang fixe comme à rang adaptatif. Selon les expériences rapportées, Co-VLA atteint des performances comparables à celles d'un entraînement centralisé classique, aussi bien en entraînement complet qu'en fine-tuning léger. L'abstract ne détaille toutefois ni le nombre de robots ou de sites impliqués dans les tests, ni les tâches précises évaluées, ni de métriques chiffrées de réussite. L'enjeu pratique est celui du goulot d'étranglement identifié par tout le secteur des VLA : les performances de ces modèles s'améliorent avec l'échelle des données, mais ces données de démonstration robotique sont dispersées entre flottes, sites industriels et types de tâches, et leur centralisation pose des problèmes de coût, de bande passante et souvent de confidentialité pour les intégrateurs qui déploient des robots chez des clients tiers. En rendant possible un entraînement collaboratif sans partage de données, Co-VLA ouvre une voie pour mutualiser l'apprentissage entre opérateurs de flottes concurrents ou entre sites d'un même groupe industriel, tout en gérant l'hétérogénéité des distributions de données propre à des robots différents opérant dans des environnements différents, un obstacle documenté du federated learning appliqué à la robotique. Ce travail s'inscrit dans la course actuelle aux modèles VLA généralistes, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à industrialiser l'apprentissage à grande échelle sur données robotiques réelles. Co-VLA ne propose pas un nouveau modèle concurrent mais une brique méthodologique complémentaire, exploitable en principe par n'importe quel VLA existant. Il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel, de partenariat ou de calendrier de suite.

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
3arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Exploitation des failles : attaques adverses universelles contre les modèles vision-langage-action (VLA) en robotique
4arXiv cs.RO 

Exploitation des failles : attaques adverses universelles contre les modèles vision-langage-action (VLA) en robotique

Des chercheurs publient sur arXiv une attaque adversariale « universelle » contre les modèles Vision-Language-Action (VLA), ces réseaux de bout en bout qui fusionnent perception visuelle, compréhension du langage et génération d'actions pour la manipulation robotique. Le dispositif, baptisé Universal Adversarial Object, est une sphère dont la texture de surface a été optimisée. Posée dans le champ de vision du robot, elle dégrade nettement le taux de réussite des tâches. L'approche repose sur un cadre d'attaque à plusieurs niveaux, qui perturbe conjointement la planification de trajectoire, l'exécution de la tâche et le contrôle de l'action. Les auteurs l'ont validée en simulation et en conditions réelles sur deux modèles représentatifs, Pi0 et RDT. Le taux de réussite moyen recule de 31,2 % à 39,9 % selon le modèle, et tombe quasiment à zéro dans les scénarios complexes. Le résumé ne précise ni les tâches testées, ni le nombre d'essais, ni la plateforme matérielle, ni le niveau d'accès au modèle supposé pour l'attaquant. Ces éléments conditionnent la portée des chiffres. Pour les intégrateurs et les responsables de déploiement, le résultat touche un point que les démonstrations commerciales abordent peu. Un VLA ne se contente pas d'être fragile face à des variations de décor ou d'éclairage. Il peut être dégradé par un simple objet physique, passif et bon marché à produire, sans intrusion logicielle ni accès au réseau du robot. Le caractère « universel » est le point central : l'objet n'est pas conçu pour une scène ou une consigne donnée, ce qui rend une attaque plausible hors laboratoire. Le travail contredit l'idée implicite selon laquelle l'entraînement à grande échelle suffirait à rendre ces politiques robustes. Il pose aussi une question de sûreté fonctionnelle. Une chute de réussite de plus de 30 % reste un échec de tâche, mais un robot qui interagit avec des humains peut produire des mouvements inattendus. Ces risques sont rarement couverts par les normes de sécurité actuelles, pensées pour des automates déterministes. Il faut toutefois rester prudent : les gains annoncés viennent d'une évaluation académique, avec des tâches choisies par les auteurs. Pi0 (Physical Intelligence) et RDT (Robotics Diffusion Transformer) comptent parmi les VLA ouverts les plus utilisés dans la recherche. Ils servent de base à de nombreux travaux de fine-tuning, ce qui explique leur choix comme cibles. Cette étude s'inscrit dans une littérature croissante sur les attaques adversariales physiques, d'abord développées pour la vision par ordinateur (patchs adversariaux), puis étendues aux modèles multimodaux. Elle intervient alors que Figure, Tesla, NVIDIA et d'autres poussent des politiques VLA vers des déploiements industriels. La suite logique consistera à tester des défenses : entraînement adversarial, détection d'objets hors distribution et filtrage des entrées visuelles. Il faudra aussi vérifier si l'attaque se transfère aux modèles fermés.

RecherchePaper
1 source