Aller au contenu principal
IA physiquearXiv cs.RO 

Juno : dompter les latents prédictifs des modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.09940) Juno, un cadre unifié qui exploite les « latents prédictifs » d'une architecture JEPA (Joint-Embedding Predictive Architecture) pour améliorer les modèles vision-langage-action (VLA). Une JEPA prédit des observations masquées ou futures dans un espace de représentation plutôt qu'en pixels. Juno s'appuie sur une seule JEPA conditionnée par l'action, qui joue trois rôles : backbone de représentation aligné sur le contrôle, enseignant prédictif et modèle de dynamique adaptable. En pré-entraînement, elle est entraînée sur des trajectoires issues de la même morphologie que le robot cible. Une perte « dynamic CLS » transfère la dynamique des patches, pondérée par le mouvement, vers un état global compact. En apprentissage de politique, les patches JEPA de l'image courante sont fusionnés dans la perception du VLA. Une branche de raisonnement découplée, avec ses propres paramètres de transformation, distille les états latents futurs pour générer les actions. Au déploiement, le modèle du monde est adapté sur toutes les transitions observées, échecs compris. L'enseignant adapté est ensuite gelé, et la politique est réalignée sur les exécutions vérifiées via des adaptateurs LoRA et une tête d'action entraînable, sans corrections d'expert ni récompenses de tâche.

Sur le benchmark de simulation SimplerEnv, Juno fait passer le taux de réussite moyen de 60,9 % à 68,5 % face à Qwen3GR00T, la meilleure référence testée. L'adaptation au moment du test porte ce score à 72,7 %. Sur robot réel, la politique conserve 70 à 75 % de réussite quand le fond, la hauteur ou les objets changent, alors que la politique de base tombe à 0 %. Ces chiffres viennent des auteurs, et le papier est une prépublication sans relecture par les pairs. Le nombre d'essais réels, les tâches et la plateforme robotique ne figurent pas dans le résumé, ce qui limite la portée de l'effondrement à 0 % de la référence, un résultat dépendant du protocole.

L'enjeu dépasse le gain de 7,6 points en simulation. Le papier s'attaque à un point faible des VLA déployés : la fragilité face aux décalages de distribution (décor, hauteur de table, objets inédits), qui sépare la démo en laboratoire du fonctionnement en production. Deux idées intéressent les intégrateurs. D'abord, apprendre aussi des échecs, sans opérateur humain ni fonction de récompense. Cela réduirait le coût de réglage sur site, aujourd'hui l'un des principaux freins au déploiement. Ensuite, utiliser un enseignant prédictif figé pour éviter la dérive pendant l'adaptation. Cela dit, une adaptation en ligne exige du calcul embarqué ou un cycle de réentraînement, et la robustesse annoncée reste à confirmer hors du dispositif des auteurs.

Le travail s'inscrit dans la convergence entre les modèles du monde et les VLA. La lignée JEPA, portée par Yann LeCun et Meta avec V-JEPA, sert ici de source de représentations pour l'action. La comparaison avec Qwen3GR00T, un VLA dérivé de la famille GR00T de NVIDIA et adossé à Qwen3, le situe face aux politiques généralistes actuelles, aux côtés de Pi-0 de Physical Intelligence. Aucun déploiement industriel ni code ou calendrier de diffusion n'est annoncé dans le résumé. La suite dépendra de la publication du code, d'évaluations sur d'autres morphologies et d'une reproduction indépendante.

À lire aussi

Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action
1arXiv cs.RO 

Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action

Une équipe de chercheurs a publié sur arXiv (arXiv:2602.01166) LaRA-VLA, un nouveau cadre de modèles Vision-Language-Action (VLA) qui internalise le raisonnement multi-modal directement dans un espace latent continu, plutôt que de générer explicitement des chaînes de pensée textuelles (chain-of-thought, CoT) à l'inférence. Concrètement, là où les VLA actuels produisent des tokens de raisonnement discrets avant chaque décision motrice, LaRA-VLA effectue raisonnement et prédiction d'action dans un même espace latent, sans étape de génération textuelle intermédiaire. Les auteurs rapportent une réduction de la latence d'inférence pouvant atteindre 90 % par rapport aux approches CoT explicites, tout en surpassant les méthodes VLA de référence sur des benchmarks en simulation et sur des tâches de manipulation réelle à longue portée. Deux jeux de données CoT structurés ont été construits pour l'entraînement. L'entraînement suit un curriculum progressif : supervision d'abord textuelle et visuelle, puis transition vers un raisonnement purement latent, avant adaptation de ces dynamiques latentes au conditionnement de la génération d'actions. Ce résultat est significatif pour les intégrateurs et décideurs industriels parce qu'il s'attaque directement au principal goulot d'étranglement des VLA raisonnants : le coût computationnel du CoT à l'inférence rendait ces modèles inutilisables en temps réel sur du matériel embarqué. Un gain de 90 % de latence sans dégradation de performance change le rapport entre qualité de raisonnement et contrainte temps-réel, rendant crédible le déploiement de politiques robotiques expressives sur des bras industriels ou des humanoïdes sans serveur dédié au raisonnement. Cela contredit partiellement l'hypothèse que le raisonnement symbolique explicite est nécessaire pour gérer des tâches longues et multi-étapes. Les VLA, popularisés par des travaux comme RT-2 (Google DeepMind, 2023) puis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), cherchent à combiner compréhension sémantique et contrôle moteur dans un seul modèle. La tension entre performance de raisonnement et latence d'inférence est un sujet actif : d'autres approches comme les modèles de diffusion d'actions (Pi-0) contournent le problème différemment. LaRA-VLA propose une troisième voie, en fusionnant les deux flux dans l'espace latent. Le code et la page projet sont disponibles publiquement ; les prochaines étapes attendues sont des évaluations sur robots humanoïdes et des tests de robustesse hors distribution, domaines où le gap simulation-réalité reste le critère déterminant pour une adoption industrielle.

UECette réduction de latence d'inférence de 90 % ouvre la voie au déploiement de politiques VLA expressives sur du matériel embarqué, ce qui pourrait bénéficier aux équipes R&D et intégrateurs européens travaillant sur des bras industriels ou des humanoïdes sans infrastructure de calcul dédiée.

💬 90 % de latence en moins sur les VLA, c'est le genre de résultat qu'on attendait pour débloquer l'embarqué. Passer le raisonnement dans l'espace latent plutôt que de cracher des tokens CoT, c'est élégant, et les benchmarks semblent tenir. Reste le gap simulation-réalité, qui est toujours l'épreuve de vérité, et là aucun papier arXiv ne peut te garantir grand chose avant les tests sur du vrai matériel.

IA physiqueOpinion
1 source
Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)

Il s'agit d'un article de recherche académique (préprint arXiv, version révisée), donc sans annonce commerciale ni chiffres de performance détaillés dans le résumé fourni, je reste factuel sur ce point plutôt que d'inventer des métriques. TacFiLM est une méthode de fusion de modalités proposée dans un préprint arXiv (2603.14604v2, version révisée) qui intègre des signaux tactiles aux modèles vision-langage-action (VLA) utilisés en robotique manipulatrice. Le constat de départ est simple: les VLA actuels, bien qu'efficaces pour généraliser des politiques de contrôle a partir d'instructions sémantiques, reposent presque exclusivement sur la perception visuelle, incapable de capturer les dynamiques d'interaction propres aux taches de manipulation en contact étroit, comme les forces de contact, le frottement de surface, la compliance ou le cisaillement. Plutot que de concaténer des tokens tactiles ou de reentrainer massivement le modèle, ce qui alourdit considérablement le cout de calcul, les auteurs proposent un finetuning post-entrainement léger: les caractéristiques visuelles intermédiaires sont conditionnées par des représentations tactiles pré-entraînées via une modulation linéaire par caractéristique (FiLM). La méthode a été testée sur des taches d'insertion et d'ouverture de tiroir, en distribution et hors distribution, avec des améliorations rapportées sur le taux de réussite, la performance directe, le temps d'exécution et la stabilité des forces appliquées. L'intérêt pour le secteur tient moins a la performance brute qu'a la stratégie d'intégration: la plupart des architectures VLA déployées (dans la lignée de Pi-0, GR00T N2 ou Helix) tournent déjà a la limite du budget de calcul embarque, ce qui rend les approches de fusion tactile lourdes difficilement viables en production. Une méthode de finetoning légère, greffée après coup sur un modèle déjà entraine, ouvre la voie a l'ajout de retour tactile sur des politiques existantes sans reentrainement complet ni explosion du cout d'inférence, un point clé pour les intégrateurs qui visent des taches d'assemblage ou de manipulation fine ou le seul retour visuel échoue régulièrement. Cette publication s'inscrit dans une tendance de fond de la recherche VLA: après avoir démontre la généralisation sémantique et le contrôle multitâche, le champ se heurte désormais au problème spécifique de la manipulation en contact, un angle mort connu depuis les débuts de l'apprentissage par imitation en robotique. Le fait qu'il s'agisse d'une version "replace" du preprint suggère une itération après retours de relecture. Les auteurs renvoient vers une page de projet dédiée pour le code et les démonstrations, sans toutefois annoncer de déploiement industriel ou de partenariat avec un fabricant de robots a ce stade.

IA physiqueOpinion
1 source
UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action
3arXiv cs.RO 

UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action

UniTacVLA, un modèle vision-langage-action (VLA) tactile, vise à résoudre un point faible connu des VLA classiques : la manipulation dextre en contact riche, comme l'insertion, l'essuyage, l'assemblage ou l'ajustement de précision. Contrairement aux approches vision-tactile-langage-action (VTLA) existantes qui traitent le signal tactile comme une simple entrée auxiliaire passive, l'équipe de recherche propose un espace latent tactile unifié qui modélise conjointement l'état tactile courant et les changements de contact futurs, via un raisonnement en chaîne de pensée tactile et une prédiction tactile progressive (coarse-to-fine). Ce prior tactile alimente ensuite un contrôleur mixte tactile-action combinant retour tactile en temps réel et retour prédit, pour corriger à haute fréquence des chunks d'action calculés à basse fréquence. Les expériences ont été menées en conditions réelles sur quatre catégories de tâches à fort contact (ajustement, insertion, essuyage, assemblage), testées à la fois en environnement propre et sous perturbations externes. L'enjeu dépasse la simple amélioration de benchmark. La manipulation en contact riche reste l'un des goulots d'étranglement majeurs empêchant les bras robotiques et humanoïdes de passer de la démonstration en laboratoire au déploiement industriel réel, notamment pour des tâches d'assemblage fin où la seule vision ne suffit pas à garantir la précision ou la robustesse face aux perturbations. En traitant le tactile comme un signal dynamique et prédictif plutôt que comme un simple capteur passif, UniTacVLA s'attaque directement à l'écart persistant entre les VLA génériques, entraînés majoritairement sur des données visuelles, et les exigences physiques réelles de l'assemblage industriel ou de la manipulation fine en conditions non contrôlées. Les auteurs revendiquent des gains sur le taux de succès, la précision de manipulation et la robustesse au contact par rapport aux méthodes existantes, ce qui, si confirmé à plus grande échelle, renforcerait l'argument selon lequel l'intégration tactile profonde est nécessaire pour les tâches dextres, et pas seulement un ajout marginal. Ce travail s'inscrit dans une vague plus large de recherche visant à doter les modèles VLA de capacités multimodales au-delà de la vision et du langage, à mesure que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T) poussent leurs propres modèles génération vers la production industrielle. Les architectures VTLA précédentes, limitées par un traitement passif du tactile, constituent la ligne de base que ce papier cherche à dépasser. La publication, un prépublication arXiv, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; les prochaines étapes attendues porteraient sur l'extension à davantage de types de capteurs tactiles et de tâches, ainsi que sur une validation à plus grande échelle en dehors du cadre contrôlé des expériences décrites.

IA physiqueActu
1 source
Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction
4arXiv cs.RO 

Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction

Un preprint publie sur arXiv (référence 2608.14379v1) présente ReflexBench, un banc d'essai de six taches dynamiques pour la manipulation robotique réactive, et ReflexVLA, un modèle vision-langage-action (VLA) conçu pour y répondre sans pré-entrainement massif sur des données robotiques. ReflexBench découplé le pas de simulation du contrôle du robot et permet une latence configurable en inférence synchrone comme asynchrone. ReflexVLA améliore le raisonnement temporel par prédiction latente du futur et fusion multi-images dans son backbone visuel, et réduit sa latence via un encodage visuel par lots et le rejeu CUDA Graph. Les auteurs rapportent une amélioration en manipulation dynamique, une précision maintenue sur les benchmarks statiques classiques, et des validations en conditions réelles, avec un site de projet dédié (reflexvla.github.io). La valeur tient surtout au constat de départ : la quasi-totalité des benchmarks VLA mesurent la généralisation sur des taches statiques et ignorent les scenarios ou le robot doit réagir en temps réel a un événement imprévu, objet qui chute, obstacle mobile, geste humain. Cette lacune pèse sur les intégrateurs qui envisagent des robots collaboratifs en environnement humain ou logistique, ou la réactivité conditionne la sécurité autant que l'efficacité. En attaquant conjointement la latence d'inférence et le raisonnement temporel plutôt que la seule taille du modèle, ce travail nuance l'hypothèse selon laquelle l'échelle des données suffirait a résoudre le temps de réaction des VLA : l'ingénierie de déploiement compte tout autant. Ce travail s'inscrit dans la recherche sur les modèles VLA généralistes, qui unifient perception, langage et contrôle moteur, mais dont l'évaluation restait centrée sur des démonstrations statiques de pick-and-place en laboratoire. En proposant un banc d'essai dédié a la manipulation réaction-critique, avec une métrique de latence explicite et un protocole synchrone/asynchrone, les auteurs visent un standard que les futurs modèles VLA devront adresser. Le document est un preprint arXiv, sans partenaire industriel, site de déploiement ni calendrier commercial annonces : une contribution académique accompagnée d'un site de projet, non un produit expédie. Ses conclusions restent a confirmer par revue par les pairs et adoption du benchmark par la communauté.

IA physiqueActu
1 source