Aller au contenu principal
IA physiquearXiv cs.RO 

vla.simd : inférence CPU efficace pour la manipulation conditionnée par le langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié en septembre 2026 sur arXiv, vla.simd est un moteur d'inférence CPU pour les politiques de manipulation robotique conditionnées par le langage (VLA), combinant micro-noyaux SIMD partagés, calcul réutilisable et optimisations spécifiques au processeur cible. Testé sur six politiques et quatre CPU, il obtient un gain médian d'environ 1,4x par rapport à des références PyTorch compilées, tout en conservant la précision numérique fp32. Les auteurs présentent aussi IMPACT, une politique dérivée de l'architecture ACT à représentations textuelles mises en cache et features visuelles modulées par le langage. Sur un Raspberry Pi 5, IMPACT est la seule politique language-conditioned testée à fournir au moins 30 actions par seconde : 33,5 actions/s en fp32 et 81,2 en int8, après 90 secondes de chauffe thermique. Sur GPU, elle atteint 76,4% de réussite moyenne sur quatre suites LIBERO sans pré-entraînement robotique, et a été testée physiquement sur un bras SO-101, ainsi que SmolVLA sur un UR10e à pince Robotiq.

Ce résultat cible un frein concret au déploiement industriel : la plupart des politiques VLA supposent un GPU embarqué ou une inférence déportée dans le cloud, ce qui alourdit coût et latence. Faire tourner une politique conditionnée par le langage en temps réel sur un CPU bas de gamme comme le Raspberry Pi 5 ouvre la voie à des manipulateurs moins coûteux pour la logistique ou l'assemblage léger, sans accélérateur matériel dédié. La distinction que font les auteurs entre offre d'actions et fréquence de rétroaction rappelle que le chunking, pas seulement la vitesse brute du modèle, conditionne la fluidité d'exécution réelle. Ces chiffres restent toutefois à nuancer : le pic de 81,2 actions/s repose sur une quantification int8 et sur une chauffe préalable rarement précisée dans les annonces marketing du secteur.

IMPACT s'inscrit dans la famille ACT (Action Chunking Transformer), largement utilisée en apprentissage par imitation, et se positionne face à des politiques VLA plus lourdes conçues pour GPU. Le choix de SmolVLA, politique compacte de Hugging Face, comme second cas de test sur un bras UR10e traduit une volonté de compatibilité avec l'écosystème open-source existant plutôt qu'un modèle propriétaire isolé. Il s'agit à ce stade d'une publication de recherche arXiv, sans annonce commerciale, pilote industriel ni calendrier de mise sur le marché, présentée comme une brique d'infrastructure réutilisable dans un secteur où la pression pour réduire le coût matériel du déploiement en périphérie s'intensifie.

À lire aussi

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique
1arXiv cs.RO 

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique

Des chercheurs publient sur arXiv (2608.16978, mis en ligne le 19 août 2026) VLCP, pour Vision Language Control Policy, une méthode qui transforme un modèle vision-langage (VLM) figé en politique de contrôle robotique sans fine-tuning ni démonstrations. Au lieu de réentraîner le modèle pour qu'il produise une représentation d'action inédite, VLCP le fait écrire directement une courte fonction de contrôle en Python, puis referme la boucle au niveau du code lui-même : toutes les K étapes, le VLM réobserve la scène via des flux RGB multi-vues, l'état proprioceptif et un delta d'état, et réécrit la fonction de contrôle si nécessaire, avant qu'un échec ne se propage jusqu'à la fin de l'épisode. Testée sur un ensemble de 57 tâches en simulation MuJoCo/RoboVerse, cette politique sans entraînement atteint un taux de succès combiné de 35,1 %, contre seulement 3,5 % pour le même système interrogé une seule fois par épisode en boucle ouverte, soit un écart d'un facteur dix confirmé par des intervalles de confiance non chevauchants sur toutes les familles de scènes. Le système affiche aussi un taux de récupération intra-épisode de 27,3 % sur les préhensions ratées, un coût de calcul limité (environ 10 requêtes compactes par épisode, 84 % des tokens en cache) et une bibliothèque de compétences réutilisée d'un épisode à l'autre. Le résultat cible directement l'écart entre démonstration et réalité qui pèse sur les politiques VLA (vision-language-action) actuelles : plutôt que de retenter une politique figée ou de basculer vers une autre sous-tâche en cas d'échec, comme le font les méthodes en boucle fermée existantes, VLCP corrige la cause réelle de l'échec, le code de contrôle lui-même. Pour les intégrateurs et équipes de recherche en robotique manipulatrice, cela suggère qu'un VLM générique, sans adaptation coûteuse à un robot ou une tâche spécifique, peut produire des politiques nettement plus robustes simplement en fermant la boucle au bon niveau d'abstraction, celui du code plutôt que de l'action bas niveau. Le gain de robustesse provient moins de la puissance brute du modèle que de la fréquence et du niveau auquel il est autorisé à se corriger, un point qui interroge les architectures de contrôle en boucle ouverte encore courantes dans les démonstrations commerciales du secteur. Cette approche s'inscrit dans la lignée des travaux qui exploitent les VLM frontières comme cerveaux de raisonnement plutôt que comme modèles à réentraîner pour produire des trajectoires, une piste alternative aux politiques VLA de bout en bout comme Pi-0 ou GR00T N2. Les auteurs ne précisent pas de déploiement sur robot physique ni de partenariat industriel : il s'agit à ce stade d'une preuve de concept en simulation, publiée en prépublication, sans date de mise en œuvre réelle annoncée. Les prochaines étapes attendues porteraient sur la validation sur du matériel physique et sur des tâches de manipulation plus complexes que celles du benchmark RoboVerse utilisé ici.

IA physiquePaper
1 source
vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)

Des chercheurs de FAI ModelOpt Tech ont publié en juin 2026 vla.cpp (arXiv 2606.08094), un moteur d'inférence C++ portable construit sur llama.cpp pour exécuter des politiques VLA (Vision-Language-Action) directement sur le matériel embarqué des robots. L'engine prend en charge sept architectures couvrant cinq familles de backbones et quatre têtes d'action via un protocole requête/réponse unifié, incluant les schémas d'inférence par flow-matching et par diffusion propres aux VLA récents. Sur le benchmark LIBERO-Object, il reproduit le meilleur checkpoint SOTA à un épisode près sur 200 ; BitVLA y atteint 100 % de succès dans 1,3 Gio de mémoire. Le même bundle s'exécute sans modification sur trois niveaux matériels, d'un GPU grand public jusqu'à un module embarqué de 8 Go de RAM. Un noyau GEMM IMMA en escalier, dérivé d'une analyse roofline multi-hardware, réduit la latence par étape de BitVLA d'un facteur 4,5. Les auteurs ont également conduit un test de stress sur un bras ALOHA pour mesurer la contrainte de latence de replanification face à une cible mobile. Le problème structurel que vla.cpp attaque est la dépendance des stacks Python/PyTorch actuels à un GPU de station de travail, hypothèse incompatible avec l'électronique embarquée des robots commerciaux ou des cobots industriels. Démontrer une exécution à succès complet dans 1,3 Gio ouvre concrètement la voie au déploiement edge sans serveur distant ni dépendance cloud pour des tâches de manipulation. L'analyse roofline publiée dans le papier établit un résultat contre-intuitif pour les intégrateurs : l'inférence VLA en batch-1 est compute-bound, non bandwidth-bound, ce qui déplace le levier d'optimisation vers le taux d'utilisation du calcul. L'unification de sept architectures sous un seul protocole réduit également la fragmentation de l'écosystème VLA, frein réel à l'adoption en production. vla.cpp hérite de l'approche de quantification ggml et de la portabilité de llama.cpp de Georgi Gerganov. Les modèles ciblés incluent des architectures issues de Physical Intelligence (pi0) et des projets ouverts comme OpenVLA. La concurrence directe sur ce segment est limitée : la plupart des équipes robotiques maintiennent des pipelines Python maison dépendants de GPU Nvidia RTX 3090/4090 ; ROS 2 et Isaac ROS de Nvidia offrent des primitives d'intégration mais pas de runtime VLA unifié. Aucun acteur français ou européen n'est directement cité dans le papier. Le code, les vidéos de démonstration et le scaffold de benchmark reproductible sont disponibles sur le site du projet.

UEAucun acteur européen impliqué dans le développement, mais le runtime portable est directement exploitable par les équipes R&D françaises et européennes cherchant à déployer des politiques VLA sur matériel embarqué sans dépendance cloud.

💬 Faire tourner une politique VLA dans 1,3 Gio sans GPU de workstation, c'est le vrai débloqueur que les équipes robotique attendaient. Le reste, les sept architectures unifiées, le protocole commun, c'est utile, mais ce qui compte c'est que le déploiement edge devient une option sérieuse sans serveur distant. Reste à voir si ça tient sur des tâches moins sages que LIBERO-Object.

IA physiqueOpinion
1 source
CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action
3arXiv cs.RO 

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action

Des chercheurs proposent CAC-VLA (Context-Gated Action Conditioning), une nouvelle architecture pour les modèles vision-langage-action (VLA), la famille de systèmes qui pilote de plus en plus de bras et robots humanoïdes generalistes. Le problème identifié: dans les VLA classiques, les représentations visuelles et langagières ne sont pas pensées pour guider directement le contrôle moteur, ce qui laisse à «l'expert action» (le module qui génère la trajectoire) la charge de combler cet écart. Des méthodes récentes tentent de corriger cela avec des modules de raisonnement d'action séparés, mais elles nécessitent des architectures dédiées supplémentaires. CAC-VLA prend une autre voie: il entraîne le modèle vision-langage lui-même à prédire des actions latentes, des représentations compactes encodées à partir de segments d'action futurs, du grossier au fin, puis utilise une «porte de contexte» pour doser en temps réel l'influence de ce signal sur l'expert d'action. Sur les bancs d'essai LIBERO et LIBERO-Plus, la méthode atteint respectivement 98,3% et 89,5% de taux de réussite moyen. Pour l'industrie robotique, l'enjeu dépasse le simple gain de quelques points de benchmark. Le goulot d'étranglement entre compréhension multimodale et motricité précise est l'un des obstacles centraux à la généralisation des VLA au-delà de tâches scriptées, un sujet suivi de près par les équipes qui travaillent sur des systèmes comme π0, GR00T N2 ou Helix. Une interface qui intègre le raisonnement d'action directement dans le VLM, sans framework de génération séparé, simplifierait l'entraînement et le déploiement de ces piles logicielles chez les intégrateurs, réduisant la complexité d'ingénierie souvent invoquée comme frein à la mise en production. Ces résultats restent toutefois obtenus en simulation, sur des suites de tâches standardisées et non sur du matériel réel en usine ou en entrepôt, une nuance importante alors que le secteur multiplie les annonces de percées en manipulation générale. LIBERO et sa variante LIBERO-Plus servent de référence commune pour comparer les approches d'action-conditioning, et la prochaine étape logique pour valider l'intérêt de CAC-VLA sera sa transposition sur des robots physiques et des tâches de manipulation en conditions réelles.

IA physiqueActu
1 source
AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique
4arXiv cs.RO 

AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique

Un article déposé le 22 septembre 2026 sur arXiv (2609.23578) présente AR-WAM, un modèle de manipulation robotique qui remplace les instructions en langage naturel par deux signaux visuels : une boîte englobante désignant l'objet cible et un jeton d'opération appris précisant la compétence à exécuter. Compact avec 0,5 milliard de paramètres et un encodeur visuel figé, sans encodeur de langage, il prédit l'évolution de la scène en espace latent tout en décodant les actions. Une couche de compatibilité à trois primitives, détecter, exécuter, interroger, permet à un VLM local ou une API d'agent de piloter la politique. Testé sur RoboTwin 2.0, RMBench et un robot réel bi-bras Astribot S1, il atteint 87,2% de succès en manipulation standard, gagne 5,9 points sur les tâches à mémoire et 36,7 points sur les tâches longues réelles, avec la latence la plus basse du comparatif, 14,1 millisecondes. Le choix cible un problème identifié par les auteurs : les VLA et les world action models dominants spécifient encore les tâches en langage naturel, une interface jugée ambiguë sur les références, imprécise spatialement et redondante avec la compréhension déjà portée par l'agent. En séparant le « quoi », décidé par l'agent, du « comment », exécuté par le robot via un grounding visuel explicite, AR-WAM offre une interface standardisée qui intéresse les intégrateurs cherchant à connecter des piles agentiques à des flottes de robots hétérogènes plutôt qu'à des prompts textuels ad hoc. Le bond de 36,7 points sur les tâches longues en conditions réelles suggère surtout que la faiblesse chronique des VLA sur l'horizon long peut être atténuée en délégant mémoire et récupération d'erreur à la couche agent, plutôt qu'en la faisant porter entièrement par un modèle d'action monolithique. Ces résultats restent ceux d'un article de recherche récent, validé en simulation et sur une seule plateforme robotique réelle, sans annonce de déploiement commercial ni de partenariat industriel. Astribot, dont le bras bi-bras S1 sert de banc d'essai réel, est une entreprise chinoise de manipulation robotique ; RoboTwin 2.0 et RMBench comptent parmi les bancs d'essai standards du secteur pour comparer des politiques de manipulation en simulation. L'article ne fournit ni échéancier de déploiement ni partenaire industriel identifié ; il se positionne comme une contribution méthodologique destinée à la prochaine génération de systèmes agent-robot, dans un secteur où l'exécution fiable de tâches longues sans supervision humaine reste l'un des principaux verrous avant une adoption industrielle à grande échelle.

IA physiqueOpinion
1 source