ChunkVLA-AM : découpage d'actions en parallèle pour le contrôle de robots par modèle vision-langage-action (VLA) en fabrication additive
Des chercheurs publient sur arXiv (2610.01856) ChunkVLA-AM, un cadre de déploiement du modèle vision-langage-action OpenVLA-OFT sur un bras FAIRINO FR3 installé dans une cellule de fabrication additive fixe. Une chaîne de données convertit des démonstrations réelles filmées en monoculaire en jeux de données TFDS/RLDS compatibles OpenVLA, afin d'adapter le modèle à la morphologie du FR3. À l'exécution, chaque requête d'inférence prédit un « chunk » de huit actions à 7 dimensions. Le robot exécute ce bloc en boucle ouverte, puis capture une nouvelle observation, ce qui crée un retour en boucle fermée entre les blocs. L'architecture sépare cloud et edge : le client FR3 envoie ses observations à un serveur d'inférence distant via une interface FastAPI. Sur 42 essais physiques de transfert d'objet d'un point A à un point B, répartis à égalité entre cibles rouges et bleues, le système réussit 39 fois, soit 92,9 %. Les trois échecs surviennent tous au placement final : le contrôle insuffisant de la hauteur de lâcher fait basculer l'objet. Un balayage d'éclairage situe la plage de luminance à faible erreur entre 85 et 125 sur une échelle de 0 à 255, l'erreur spatiale moyenne la plus basse étant obtenue à 95.
L'intérêt tient moins au score qu'à la méthode : il s'agit d'un exemple documenté de VLA ouvert adapté à un bras peu courant, sans recours à une plateforme propriétaire. Le chunking à huit pas limite la fréquence d'inférence nécessaire et rend viable une inférence déportée, donc des postes de travail légers. La sensibilité à la luminosité mérite l'attention des intégrateurs. La plage utile, qui représente environ 16 % de l'échelle, signifie que la robustesse aux variations d'environnement reste un point faible, alors que les ateliers de fabrication additive ont des éclairages variables. Il faut aussi relativiser le chiffre : 42 essais, une tâche unique de pick-and-place, une cellule fixe et deux couleurs de cible. Cela ne prouve ni généralisation ni cadence industrielle, et aucun temps de cycle n'est donné dans le résumé. L'intervalle de confiance sur 39 réussites sur 42 reste large. Les échecs au lâcher indiquent que la précision fine sur l'axe vertical est un verrou, probablement lié à la caméra monoculaire sans information de profondeur explicite.
Ce travail s'inscrit dans la lignée d'OpenVLA, puis de la variante OFT (optimized fine-tuning), qui introduit le chunking parallèle d'actions pour accélérer l'inférence. Il se place en aval de modèles comparables comme Pi-0 ou GR00T, plus lourds et visant des morphologies multiples. Le FR3 de FAIRINO, un cobot d'origine chinoise, est un choix économique face aux bras Franka ou Universal Robots plus fréquents dans la recherche. Le résumé n'annonce ni pilote industriel ni déploiement en production : il s'agit d'un prototype de laboratoire en préprint, non évalué par les pairs. Les suites logiques seraient un contrôle de hauteur de lâcher amélioré, une capture en profondeur et des tests sur des tâches de manipulation propres à la fabrication additive, comme le retrait de pièces du plateau.




