Aller au contenu principal
FR/EU ecosystemearXiv cs.RO 

Guardian : détection des erreurs de planification et d'exécution robotiques par modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire Willow, rattaché à l'INRIA et à l'École normale supérieure de Paris (di.ens.fr/willow), ont publié Guardian, un modèle vision-langage (VLM) entraîné pour détecter les erreurs de planification et d'exécution dans la manipulation robotique. Pour l'entraîner, l'équipe a construit GuardianFail-36k, un jeu de données de 36 000 exemples générés automatiquement en perturbant des trajectoires de manipulation réussies, à la fois dans le simulateur RLBench et sur le jeu de données réel BridgeDataV2 (bras robotiques réels). Ces perturbations produisent des échecs jugés représentatifs de la distribution réelle des pannes, chacun accompagné d'un raisonnement structuré étape par étape généré par des VLM. Guardian, conçu pour raisonner sur plusieurs points de vue caméra simultanément, est ensuite testé sur trois benchmarks qu'il n'a jamais vus à l'entraînement: RoboFail, RoboVQA, et UR5-Fail, un nouveau benchmark introduit par les auteurs eux-mêmes. Le papier, référencé arXiv:2512.01946 (version 4, republication), met à disposition code, données et modèles en accès libre.

L'enjeu dépasse la simple classification d'erreurs: les modèles VLA (vision-language-action) qui pilotent aujourd'hui les bras et humanoïdes manquent d'un mécanisme fiable pour savoir quand ils échouent, ce qui limite leur robustesse en environnement réel. Les auteurs pointent explicitement le goulot d'étranglement du secteur, la rareté et le manque de diversité des données d'échec pour entraîner ces détecteurs, et y répondent par une génération synthétique à grande échelle plutôt que par une simple collecte. Résultat concret rapporté dans le papier: une fois couplé à une politique de manipulation pilotée par LLM, Guardian améliore de façon mesurable le taux de succès des tâches, aussi bien en simulation qu'en conditions réelles. Cela suggère qu'une boucle de détection d'échec et de reprise, plutôt qu'une exécution en boucle ouverte, devient un ingrédient nécessaire pour fiabiliser des politiques de manipulation à l'échelle industrielle. Il s'agit toutefois d'un résultat de recherche évalué sur benchmarks académiques, non d'un déploiement commercial ou d'un produit intégré à une flotte de robots.

Ce travail s'inscrit dans la lignée des recherches sur les politiques génératives de manipulation (VLA), où des benchmarks comme RoboFail et RoboVQA existaient déjà mais souffraient justement du manque de données d'échec exploitables, limitant la capacité de généralisation des détecteurs entraînés dessus. En publiant conjointement un pipeline de génération de données, un dataset à 36 000 exemples et un nouveau benchmark UR5, Willow cherche à établir un standard reproductible pour la vérification d'échecs en robotique, un sujet jusqu'ici traité de façon fragmentée. L'ouverture du code et des modèles laisse la porte ouverte à une intégration par d'autres équipes de recherche ou industriels développant leurs propres piles VLA, sans qu'aucun calendrier de déploiement pilote ou d'industrialisation ne soit mentionné à ce stade.

Impact France/UE

Le laboratoire Willow (INRIA/ENS Paris) publie en open source un modèle et un dataset renforçant la recherche européenne en robustesse des politiques VLA pour la manipulation robotique.

À lire aussi

Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération
1arXiv cs.RO 

Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération

Une équipe de chercheurs a publié le 10 juin 2026 (arXiv:2606.08881) un benchmark standardisé pour évaluer des modèles Vision-Language-Action (VLA) sur le robot SO-101, une plateforme manipulatrice à faible coût issue de la communauté open-source. Quatre politiques ont été comparées sur quatre tâches de manipulation représentatives avec des protocoles d'évaluation unifiés : Pi-0.5 (Physical Intelligence), SmolVLA (HuggingFace), Wall-X et ACT (Action Chunking with Transformers, référence en imitation learning). Toutes ont été fine-tunées directement sur le matériel physique à partir de démonstrations télé-opérées en conditions réelles, sans passer par la simulation. Au-delà du simple taux de succès binaire, l'étude introduit une taxonomie structurée des échecs, une décomposition sémantique et d'exécution, ainsi que des métriques de récupération (recovery-aware metrics) pour qualifier la robustesse de chaque architecture. Les résultats confirment que les VLA pré-entraînés sur de larges corpus surpassent globalement la baseline en imitation learning pure, mais cette supériorité reste fortement dépendante de la tâche. Ce point est crucial pour les intégrateurs : l'instabilité d'exécution, et non les erreurs de compréhension sémantique, constitue la source d'échec dominante. La capacité de récupération varie significativement selon les architectures, ce qui suggère que les benchmarks centrés uniquement sur le taux de succès final masquent des différences opérationnelles importantes. Pour un COO industriel, cela signifie que le choix d'un modèle VLA ne peut pas se faire sur des métriques agrégées sans analyser le comportement en cas d'échec partiel. Le SO-101 s'est imposé comme plateforme de référence communautaire grâce à son coût accessible, là où la plupart des évaluations VLA existantes reposent sur des robots industriels onéreux (Franka, UR, Boston Dynamics Spot) ou restent cantonnées à la simulation. Ce travail s'inscrit dans un effort plus large de démocratisation des benchmarks robotiques, face à des acteurs comme Figure AI, Agility Robotics ou 1X Technologies qui évaluent leurs systèmes en environnements propriétaires non reproductibles. Les auteurs positionnent explicitement le SO-101 comme socle pratique pour l'évaluation de l'IA incarnée dans des conditions de déploiement réalistes à faible coût. La prochaine étape naturelle serait d'étendre ce protocole à des scénarios de manipulation plus complexes et à davantage d'architectures VLA émergentes, notamment celles intégrant des retours haptiques.

UESmolVLA de HuggingFace (entreprise française) est directement comparé à Pi-0.5, Wall-X et ACT dans ce benchmark standardisé, offrant une visibilité internationale sur les forces et faiblesses du modèle français face aux architectures VLA concurrentes.

FR/EU ecosystemeActu
1 source
GOAG : un planificateur de préhension génératif et agnostique à l'objet pour la manipulation robotique dextérique
2arXiv cs.RO 

GOAG : un planificateur de préhension génératif et agnostique à l'objet pour la manipulation robotique dextérique

CEA-List, laboratoire public français rattache au CEA Tech, publie sur arXiv (2608.19759) GOAG, un planificateur génératif de prises pour mains robotiques multi-doigts, conçu pour se généraliser a de nouveaux objets sans données d'entrainement spécifiques. Le modèle apprend uniquement la distribution des points de contact propres a une pince donnée, en exploitant le fait que pince et objet partagent la même géométrie de surface au point de contact; les caractéristiques de l'objet ne sont intégrées qu'au moment de l'inférence. Teste sur le protocole standard MultiDex, en simulation et en conditions réelles avec plusieurs pinces issues de la littérature, GOAG atteint un taux de réussite moyen de 86,93%, un niveau comparable aux meilleures méthodes entraînées spécifiquement sur ce jeu de données, avec une génération de prises nettement plus rapide. Code source et vidéos de démonstration sont publies sur cea-list.github.io/goagweb. Cette approche cible directement le principal frein a l'industrialisation de la manipulation dexterale: la plupart des planificateurs appris échouent des qu'ils rencontrent un objet absent de leur jeu d'entrainement, imposant un cycle de collecte de données couteux a chaque nouvelle référence. En découplant l'apprentissage du gripper de celui des objets, GOAG promet aux intégrateurs logistiques et industriels une adaptation plus rapide a de nouveaux produits, sans ré-entrainement systématique. Les chiffres avances, 86,93% de réussite et une vitesse de génération supérieure, restent toutefois ceux d'un benchmark académique contrôle et d'un preprint non encore évalué par les pairs: la généralisation a des objets totalement inédits en environnement de production reste a démontrer a plus grande échelle. Ce travail s'inscrit dans la recherche en planification de prise par apprentissage profond, un domaine largement domine par des méthodes entraînées objet par objet, des pinces parallèles simples aux mains anthropomorphes a haut nombre de degrés de liberté. En choisissant de généraliser via la géométrie du gripper plutôt que via des jeux de données d'objets toujours plus vastes, CEA-List se positionne sur un axe distinct de celui des groupes misant sur des modèles vision-langage-action entraines a grande échelle. Aucun pilote industriel ni calendrier de transfert technologique n'est annonce dans l'article; la suite logique consiste a valider l'approche sur un plus large éventail de pinces dexterales et d'objets non vus, avec une intégration possible dans des plateformes robotiques existantes.

UECEA-List, laboratoire public francais rattache au CEA Tech, publie une methode de planification de prise robotique dexterale dont le code ouvert pourrait interesser les integrateurs industriels europeens en logistique et manufacturing.

FR/EU ecosystemePaper
1 source
AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action
3arXiv cs.RO 

AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action

Des chercheurs de l'INSAIT (Institute for Computer Science, Artificial Intelligence and Technology, Sofia, Bulgarie) ont publié début 2026 AR-VLA, une architecture de politique robotique qui remplace les têtes d'action à base de blocs (chunk-based) par un expert d'action autorégressif autonome. Contrairement aux modèles VLA existants, qu'ils soient réactifs ou basés sur la diffusion, qui réinitialisent leur contexte temporel à chaque nouvelle observation, AR-VLA maintient une mémoire longue durée et génère les actions comme une séquence causale continue. Le système intègre un mécanisme de re-ancrage (re-anchoring) pour synchroniser les modalités asynchrones vision-langage-action, compensant mathématiquement le délai entre une perception lente (quelques Hz) et un contrôle moteur rapide (centaines de Hz). Les expériences couvrent des tâches de manipulation en simulation et sur robots réels, où AR-VLA atteint ou dépasse les taux de succès des VLA réactifs de l'état de l'art tout en produisant des trajectoires sensiblement plus lisses. L'enjeu central est le découplage entre raisonnement perceptif lent et contrôle moteur rapide, un problème structurel des architectures VLA actuelles. En traitant les actions comme une séquence autorégressive avec historique persistant plutôt que comme un bloc prédit à chaque nouvelle trame, AR-VLA rend la politique intrinsèquement consciente du contexte : elle sait ce qu'elle vient d'exécuter, pas seulement ce qu'elle observe à l'instant T. Pour les équipes robotiques et les intégrateurs, cette architecture autorise un préentraînement modulaire de la syntaxe cinématique indépendamment du backbone de perception, réduisant potentiellement les coûts de développement de politiques spécialistes ou généralistes. La cohérence spatio-temporelle accrue réduit également les oscillations et les reprises de mouvement, deux facteurs critiques en déploiement industriel. L'INSAIT, fondé en 2022 à Sofia avec le soutien de Google, Microsoft et de l'EPFL, s'est imposé rapidement comme un pôle de recherche en IA en Europe centrale. AR-VLA s'inscrit dans une compétition ouverte sur l'architecture des politiques robot-généralistes, où Physical Intelligence (pi-0, pi-0.5), NVIDIA (GR00T N2), Google DeepMind et des startups comme Figure (Helix) ou 1X défendent des approches concurrentes. L'approche par diffusion, popularisée notamment par pi-0 et Diffusion Policy, constitue l'alternative dominante aux VLA réactifs ; AR-VLA la défie directement en montrant qu'un modèle autorégressif pur peut produire des trajectoires plus cohérentes sans recourir à des processus de débruitage itératifs. AR-VLA demeure pour l'instant un preprint arXiv (2603.10126v2), sans annonce de déploiement industriel ni de commercialisation. Le code et les vidéos de démonstration sont disponibles sur arvla.insait.ai.

UEL'INSAIT (Sofia, Bulgarie), soutenu par Google, Microsoft et l'EPFL, positionne l'UE comme acteur de recherche crédible dans la course aux architectures VLA généralistes ; le code est disponible et testable par les équipes robotiques européennes.

FR/EU ecosystemeOpinion
1 source
Le Fil selon un robot social : enrichir le dialogue humain-robot avec des modèles vision-langage
4arXiv cs.RO 

Le Fil selon un robot social : enrichir le dialogue humain-robot avec des modèles vision-langage

Selon un article publié sur arXiv (2607.16318v1, juillet 2026), une équipe de recherche a testé l'intégration d'un modèle de langage visuel (VLM) sur un robot social Pepper, produit historiquement développé par Aldebaran puis SoftBank Robotics. Le système combine un modèle de langage de Mistral AI avec des capacités de perception visuelle, permettant au robot d'observer non seulement les paroles de son interlocuteur mais aussi son comportement et le contexte de la scène pendant un dialogue humain-robot. Les chercheurs ont mesuré l'impact de cet ajout d'information visuelle sur le temps de réponse du robot, en comparant plusieurs configurations de modèles. Résultat principal: l'ajout du contexte visuel n'augmente que modérément la latence de réponse, tout en enrichissant significativement la compréhension de la situation par le robot, notamment sur les éléments non verbaux de l'échange. Cette expérimentation touche à un problème central pour les robots sociaux déployés en environnement réel, à l'accueil, en médiation ou en assistance: comprendre les codes sociaux implicites sans que l'utilisateur ait à tout formuler explicitement. C'est aussi un signal pour les intégrateurs et décideurs européens: le choix d'un modèle Mistral AI, hébergé en Europe, permet de respecter le RGPD sans dépendre de fournisseurs américains ou chinois, un argument de poids pour des déploiements dans des administrations, hôpitaux ou établissements publics soumis à des contraintes réglementaires strictes. L'étude reste toutefois à un stade préliminaire, avec un nombre limité d'interactions testées, loin d'une validation à grande échelle. Le choix de Pepper, robot social lancé il y a plus d'une décennie et longtemps utilisé dans la recherche en interaction humain-robot, s'inscrit dans la continuité des travaux sur l'intelligence conversationnelle embarquée. Face à des architectures VLA plus orientées manipulation physique comme GR00T N2 ou Helix, cette approche cible spécifiquement le dialogue social et la compréhension contextuelle plutôt que l'action motrice. Le recours à Mistral AI illustre aussi la montée en puissance d'une offre souveraine européenne en IA, alternative crédible à OpenAI ou Google dans des cas d'usage sensibles aux données. Les auteurs annoncent vouloir approfondir ces travaux avec des scénarios d'interaction plus complexes.

UEL'utilisation d'un modèle Mistral AI héberge en Europe pour ce robot social illustre une alternative souveraine conforme au RGPD, pertinente pour des déploiements dans les administrations et hôpitaux français et européens.

FR/EU ecosystemePaper
1 source