Aller au contenu principal
RecherchearXiv cs.RO 

Géométrie de l'effecteur final conditionnée par le résultat dans les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude analyse 15 000 déploiements en boucle fermée de quatre politiques vision-langage-action (VLA) sur le benchmark de manipulation LIBERO, en comparant la géométrie des trajectoires du bras terminal plutôt que les seuls taux de réussite. Sur 3 600 paires de politiques appariées par configuration, la distance médiane normalisée de dynamic time warping est de 0,0120 mètre quand les deux politiques réussissent la tâche, contre 0,0380 mètre quand une seule y parvient. Cette hiérarchie se confirme pour chaque tâche, chaque paire de politiques et neuf représentations testées, même si son ampleur varie fortement selon la représentation choisie. Les paires en double échec, plus séparées encore, reposent sur un échantillon jugé trop restreint pour être concluant.

Le résultat répond empiriquement à une question clé pour la manipulation robotique: savoir si des politiques VLA différentes qui réussissent la même tâche empruntent des trajectoires réellement comparables ou seulement des résultats similaires par des chemins distincts. La proximité géométrique observée en cas de succès partagé va dans le sens d'un lien entre contrainte de tâche et trajectoire, sans trancher entre chevauchement des données d'entraînement et contraintes physiques propres à la tâche. Mais l'étude prévient qu'une faible distance entre politiques ne vaut pas interchangeabilité, des différences résiduelles mesurables subsistant même face à une base de référence appariée, ce qui doit inciter intégrateurs et décideurs à ne pas juger l'équivalence de deux modèles sur le seul taux de succès.

Le travail s'inscrit dans un contexte où l'évaluation des politiques VLA repose presque exclusivement sur le taux de réussite, sans examen de la manière dont chacune atteint ce résultat, alors que le secteur multiplie les architectures et interfaces d'action concurrentes pour la manipulation robotique. En s'appuyant sur LIBERO, benchmark de référence en simulation, et sur quatre politiques non nommées individuellement, les auteurs proposent une méthode reproductible fondée sur le dynamic time warping pour comparer les trajectoires plutôt que les seuls scores binaires. Ils relèvent enfin que sous stress visuel composite, classement des politiques et composition des paires évoluent ensemble, un point qui appelle des travaux futurs sur la robustesse comparative des VLA en conditions visuelles dégradées, enjeu direct pour leur fiabilité en déploiement industriel.

À lire aussi

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
1arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
2arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source
AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage
3arXiv cs.RO 

AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage

Des chercheurs présentent AeroAct, un modèle "monde-action" (world-action model, WAM) conçu pour piloter des quadricoptères à partir de commandes en langage naturel. Selon les auteurs, il s'agit du premier WAM démontré en vol réel sur drone. Le système adapte un Transformer de diffusion vidéo pré-entraîné pour prédire, à partir de l'historique visuel à la première personne, de la proprioception et d'instructions textuelles, des séquences de trajectoires et d'actions locales. Pendant l'entraînement, le modèle apprend en prédisant les images futures que produirait chaque action, une supervision dense des conséquences visuelles, mais au moment du déploiement il calcule directement les commandes de vol sans générer de vidéo. Pour produire les données d'entraînement, l'équipe a construit un pipeline basé sur DiffAero combinant les moteurs de simulation Isaac Lab et le rendu par 3D Gaussian splatting, complété par un dispositif portatif à bas coût qui couple caméra et estimation de mouvement pour recréer des trajectoires de vol. Une procédure d'auto-guidage améliore la cohérence temporelle entre segments de trajectoire qui se chevauchent. Les tests, en simulation en boucle fermée et sur un quadricoptère physique réel, montrent des gains en suivi de cible et en recherche d'objets. L'intérêt est de dépasser les limites des méthodes actuelles de navigation aérienne par langage, qui reposent sur des actions discrètes, des points de passage ou des commandes de vitesse instantanées offrant peu d'information sur l'effet des actions sur les observations futures. En ancrant explicitement l'apprentissage dans la prédiction visuelle des conséquences du mouvement, AeroAct cherche à combler l'écart classique entre simulation et réalité pour les modèles vision-langage-action appliqués au vol, un enjeu clé pour les intégrateurs en inspection industrielle, cartographie ou recherche-sauvetage par drone. Le travail s'inscrit dans la vague plus large des modèles du monde appliqués à la robotique, où l'action est conditionnée par une anticipation visuelle plutôt que par des commandes bas niveau directes. Il reste à ce stade une publication de recherche arXiv, pas un produit commercialisé ni déployé en conditions opérationnelles ; les auteurs présentent des résultats préliminaires en simulation et sur banc de vol réel, sans indication de partenaire industriel ou de calendrier de mise en production.

RechercheActu
1 source
Logic-VLA : un modèle vision-langage-action conditionné par la logique temporelle
4arXiv cs.RO 

Logic-VLA : un modèle vision-langage-action conditionné par la logique temporelle

Un article de recherche publié le 24 août 2026 sur arXiv (2608.20556v1) présente Logic-VLA, un modèle vision-langage-action (VLA) conditionné non seulement par des instructions en langage naturel mais aussi par des spécifications en logique temporelle de signaux (Signal Temporal Logic, STL) fournies au moment de l'inférence. Le système repose sur un encodeur STL basé sur un graphe syntaxique, pré-entraîné pour capturer la sémantique de la logique temporelle. L'adaptation de la politique se fait en deux étapes : un fine-tuning supervisé conditionné par STL sur des démonstrations satisfaisant les contraintes, suivi d'une optimisation de préférence au niveau des trajectoires sur des paires de rollouts appariés (satisfaisants versus violant les contraintes), utilisant un substitut par flow-matching pour l'Identity Preference Optimization. Les tests, menés en simulation de navigation de quadricoptère en boucle fermée dans des environnements photoréalistes randomisés, montrent une amélioration du taux de satisfaction des contraintes STL de 24,8 à 40,7 points de pourcentage par rapport à une politique de base ignorant ces contraintes, pour une perte de réussite de la tâche en langage naturel limitée à 1,8 point au maximum, y compris sur des formules STL inédites à l'entraînement. L'enjeu dépasse la simple performance : les instructions en langage naturel données à un robot ne précisent presque jamais les contraintes de sécurité spatiotemporelles réelles (zones interdites, délais, séquences obligatoires), ce qui reste un angle mort des VLA actuels déployés dans l'industrie. Logic-VLA suggère qu'une seule politique peut s'adapter à des exigences formelles variables sans entraîner un modèle distinct par spécification, une piste pertinente pour les intégrateurs qui doivent certifier un comportement robotique plutôt que simplement l'observer fonctionner en démonstration. Ce travail s'inscrit dans la lignée des modèles VLA génériques (à la manière de Pi-0 ou GR00T N2) mais cible spécifiquement le manque de garanties formelles de ces architectures, en s'appuyant sur des méthodes de vérification issues du contrôle formel. Il faut noter que la validation reste circonscrite à la simulation de drones dans des scènes synthétiques, sans démonstration sur robot physique ni déploiement industriel : un jalon méthodologique en amont d'un transfert réel, dont les auteurs ne donnent pas de calendrier.

RechercheOpinion
1 source