Aller au contenu principal
Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques
FR/EU ecosystemearXiv cs.RO 

Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe du CIIRC (Czech Institute of Informatics, Robotics and Cybernetics, Prague) publie sur arXiv un framework appelé See & Switch, qui étend la programmation par démonstration (PbD) aux tâches robotiques conditionnelles basées sur la vision. Le système représente une tâche comme un graphe de segments de compétence reliés par des états de décision : lors de l'exécution, un module appelé Switcher analyse les images d'une caméra embarquée dans la main (eye-in-hand) pour sélectionner la branche à suivre ou signaler une situation inconnue nécessitant une nouvelle démonstration. En cas d'erreur ou de cas imprévu, l'opérateur peut intervenir via enseignement kinesthésique, joystick ou gestes manuels. Le système a été évalué sur trois tâches de manipulation dextère impliquant 8 utilisateurs novices, pour un total d'environ 900 séquences d'exécution sur robot réel. Les résultats mesurés sur des fenêtres temporelles définies par l'utilisateur atteignent 90,6 % de précision dans la sélection de branche, et une détection d'anomalies supérieure à 90 % dans 47 des 79 états de décision testés.

Ces résultats sont pertinents pour les intégrateurs industriels qui cherchent à déployer la PbD dans des environnements variables sans passer par la programmation explicite de chaque variante. Le principal verrou du secteur est que les systèmes PbD classiques supposent un environnement fixe : un changement de disposition, d'orientation de pièce ou de contexte casse le programme. See & Switch traite ce problème au niveau du graphe de tâche plutôt qu'au niveau du modèle de perception, ce qui le rend modulaire et extensible sans réentraîner un réseau complet. La nuance importante : les performances de branchement sont évaluées en mode offline sur des fenêtres déjà identifiées, ce qui isole le classificateur visuel des erreurs de timing réelles, les chiffres de 90 % ne reflètent donc pas directement la robustesse end-to-end en déploiement non supervisé.

La PbD a connu un regain d'intérêt fort depuis 2022 avec les approches VLA (Vision-Language-Action) portées par des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou ACT (Action Chunking with Transformers). See & Switch se positionne différemment : il n'utilise pas de grand modèle pré-entraîné mais une architecture légère et interprétable, orientée vers l'enseignement interactif sur site par du personnel non expert. Les travaux proviennent du groupe ImitRob au CIIRC, qui publie régulièrement sur la PbD depuis plusieurs années. Le code et les données sont disponibles publiquement. La prochaine étape logique serait de coupler ce graphe de décision avec un backbone de perception plus robuste, ou de tester la scalabilité sur des cellules industrielles multi-postes.

Impact France/UE

Le framework See & Switch, issu du groupe ImitRob au CIIRC de Prague (UE), est publié en open source et ne requiert pas de grand modèle pré-entraîné, ce qui le rend directement accessible aux intégrateurs industriels européens souhaitant déployer la programmation par démonstration dans des environnements variables sans expertise en deep learning.

À lire aussi

Guardian : détection des erreurs de planification et d'exécution robotiques par modèles vision-langage
1arXiv cs.RO 

Guardian : détection des erreurs de planification et d'exécution robotiques par modèles vision-langage

Des chercheurs du laboratoire Willow, rattaché à l'INRIA et à l'École normale supérieure de Paris (di.ens.fr/willow), ont publié Guardian, un modèle vision-langage (VLM) entraîné pour détecter les erreurs de planification et d'exécution dans la manipulation robotique. Pour l'entraîner, l'équipe a construit GuardianFail-36k, un jeu de données de 36 000 exemples générés automatiquement en perturbant des trajectoires de manipulation réussies, à la fois dans le simulateur RLBench et sur le jeu de données réel BridgeDataV2 (bras robotiques réels). Ces perturbations produisent des échecs jugés représentatifs de la distribution réelle des pannes, chacun accompagné d'un raisonnement structuré étape par étape généré par des VLM. Guardian, conçu pour raisonner sur plusieurs points de vue caméra simultanément, est ensuite testé sur trois benchmarks qu'il n'a jamais vus à l'entraînement: RoboFail, RoboVQA, et UR5-Fail, un nouveau benchmark introduit par les auteurs eux-mêmes. Le papier, référencé arXiv:2512.01946 (version 4, republication), met à disposition code, données et modèles en accès libre. L'enjeu dépasse la simple classification d'erreurs: les modèles VLA (vision-language-action) qui pilotent aujourd'hui les bras et humanoïdes manquent d'un mécanisme fiable pour savoir quand ils échouent, ce qui limite leur robustesse en environnement réel. Les auteurs pointent explicitement le goulot d'étranglement du secteur, la rareté et le manque de diversité des données d'échec pour entraîner ces détecteurs, et y répondent par une génération synthétique à grande échelle plutôt que par une simple collecte. Résultat concret rapporté dans le papier: une fois couplé à une politique de manipulation pilotée par LLM, Guardian améliore de façon mesurable le taux de succès des tâches, aussi bien en simulation qu'en conditions réelles. Cela suggère qu'une boucle de détection d'échec et de reprise, plutôt qu'une exécution en boucle ouverte, devient un ingrédient nécessaire pour fiabiliser des politiques de manipulation à l'échelle industrielle. Il s'agit toutefois d'un résultat de recherche évalué sur benchmarks académiques, non d'un déploiement commercial ou d'un produit intégré à une flotte de robots. Ce travail s'inscrit dans la lignée des recherches sur les politiques génératives de manipulation (VLA), où des benchmarks comme RoboFail et RoboVQA existaient déjà mais souffraient justement du manque de données d'échec exploitables, limitant la capacité de généralisation des détecteurs entraînés dessus. En publiant conjointement un pipeline de génération de données, un dataset à 36 000 exemples et un nouveau benchmark UR5, Willow cherche à établir un standard reproductible pour la vérification d'échecs en robotique, un sujet jusqu'ici traité de façon fragmentée. L'ouverture du code et des modèles laisse la porte ouverte à une intégration par d'autres équipes de recherche ou industriels développant leurs propres piles VLA, sans qu'aucun calendrier de déploiement pilote ou d'industrialisation ne soit mentionné à ce stade.

UELe laboratoire Willow (INRIA/ENS Paris) publie en open source un modèle et un dataset renforçant la recherche européenne en robustesse des politiques VLA pour la manipulation robotique.

FR/EU ecosystemePaper
1 source
TAVIS : un benchmark pour la vision active égocentrique et le regard anticipateur en apprentissage par imitation
2arXiv cs.RO 

TAVIS : un benchmark pour la vision active égocentrique et le regard anticipateur en apprentissage par imitation

Une équipe de chercheurs a publié TAVIS, un environnement d'évaluation standardisé pour comparer les approches de vision active en apprentissage par imitation, soit la capacité d'une politique robotique à contrôler son propre regard pendant une tâche de manipulation. Le benchmark comprend deux suites : TAVIS-Head (5 tâches avec caméra sur cardan pan/tilt pour la recherche globale de scène) et TAVIS-Hands (3 tâches avec caméras de poignet pour gérer les occlusions locales). Il est construit sur IsaacLab et s'appuie sur deux embodiments de torse humanoïde : le GR1T2 de Fourier Intelligence et le Reachy2 de Pollen Robotics (Bordeaux). Environ 2 200 épisodes de démonstrations téléopérées sont publiés en format LeRobot v3.0 sur HuggingFace, avec Diffusion Policy et π₀ (Physical Intelligence) comme baselines. Trois résultats principaux ressortent : la vision active améliore les performances, mais de façon conditionnelle à la tâche ; les politiques multi-tâches se dégradent nettement sous distribution shift contrôlé ; et l'imitation seule produit un regard anticipatoire dont les temps de préemption médians, mesurés par la métrique GALT (Gaze-Action Lead Time), sont comparables à ceux du téléopérateur humain de référence. Jusqu'ici, plusieurs groupes avaient démontré indépendamment les bénéfices de la vision active en 2024-2025, sans base commune de comparaison. TAVIS comble ce vide avec trois primitives reproductibles : un protocole comparatif caméra mobile/caméra fixe sur des démonstrations identiques, la métrique GALT issue des sciences cognitives et de l'HRI (Human-Robot Interaction), et des splits procéduraux in-distribution/out-of-distribution. Le constat que les gains sont task-conditional invalide l'hypothèse naïve qu'ajouter des degrés de liberté à la caméra améliore systématiquement les performances, nuance décisive pour les intégrateurs industriels. La fragilité sous distribution shift constitue un signal d'alarme concret pour tout déploiement hors simulation. La vision active en manipulation connaît un regain d'intérêt depuis 2024, porté par les progrès des VLA (Vision-Language-Action models) et la disponibilisation de robots humanoïdes à têtes articulées. Le choix de Reachy2 comme plateforme de référence est notable : Pollen Robotics, startup bordelaise fondée en 2016, est l'un des rares acteurs européens dont le robot open-source figure dans des benchmarks académiques internationaux, face aux concurrents américains (Figure, Agility) et asiatiques (Fourier, Unitree). Les prochaines étapes naturelles incluent l'évaluation de politiques VLA récentes comme GR00T N2 ou OpenVLA sur TAVIS, ainsi que le transfert sim-to-real, que le papier ne couvre pas encore.

UEPollen Robotics (Bordeaux) est l'une des deux seules plateformes de référence du benchmark TAVIS, ce qui ancre un acteur français open-source au cœur d'une infrastructure d'évaluation académique internationale pour les politiques VLA.

FR/EU ecosystemePaper
1 source
Pipeline d'intégration simulation-réel pour l'entraînement et le déploiement de politiques VLA de manipulation par blocs
3arXiv cs.RO 

Pipeline d'intégration simulation-réel pour l'entraînement et le déploiement de politiques VLA de manipulation par blocs

Des chercheurs du laboratoire ISIR (Sorbonne Université, Paris) ont publié le 21 septembre 2026 sur arXiv (2609.21817) un protocole open-source de transfert simulation-vers-réel pour entraîner des modèles Vision-Language-Action (VLA) de manipulation. Sur un bras Franka FR3, des trajectoires expertes générées en simulation sont rejouées en boucle ouverte, tandis que les observations visuelles et proprioceptives réelles correspondantes sont enregistrées et converties dans un format compatible avec l'entraînement VLA, qui prédit des actions dans l'espace de pose de l'effecteur sous forme de chunks. La même chaîne de déploiement sert ensuite, en boucle fermée, à évaluer la politique entraînée sur un matériel identique. Les jeux de données sont publiés sur Hugging Face et le code sur GitLab (gitlab.isir.upmc.fr/kappel). L'enjeu vise le principal goulot d'étranglement de l'entraînement des VLA : la collecte de démonstrations réelles par téléopération humaine, coûteuse, lente et difficile à faire monter en échelle. En appariant chaque enregistrement réel à la trajectoire simulée qui l'a produit, le protocole offre surtout une mesure directe et chiffrée de l'écart sim-to-real, là où la plupart des annonces du secteur se contentent d'affirmer le problème résolu sans le quantifier. Pour les laboratoires et équipes d'intégration sans flotte de téléopération, l'outil permet de constituer des jeux d'entraînement reproductibles et de comparer objectivement des politiques VLA sur un même banc matériel plutôt que sur des vidéos de démonstration sélectionnées. Ce travail s'inscrit dans une course plus large aux modèles VLA, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) misent sur de vastes jeux de données réelles collectés par téléopération, une dépendance que l'ISIR cherche justement à alléger. Le Franka FR3, bras à sept degrés de liberté du fabricant allemand Franka Robotics, est une plateforme standard des laboratoires de manipulation, sans lien avec les humanoïdes commerciaux comme Optimus ou Figure 03. Il s'agit ici d'une publication académique et non d'un produit ou d'un déploiement industriel : aucun chiffre de charge utile, de temps de cycle ou de volume n'est communiqué, l'ISIR misant sur l'adoption communautaire du code et des données pour que d'autres équipes reproduisent et étendent le protocole à d'autres plateformes robotiques.

UELe laboratoire français ISIR (Sorbonne Universite) publie un protocole et des données open-source qui renforcent la visibilité de la recherche européenne en robotique VLA et offrent aux équipes françaises sans flotte de téléopération un outil reproductible pour entrainer et comparer leurs propres politiques de manipulation.

FR/EU ecosystemePaper
1 source
Festo présente une pince robotique à base d'IA pour la manipulation de produits variés
4Robotics & Automation News 

Festo présente une pince robotique à base d'IA pour la manipulation de produits variés

Festo, l'équipementier allemand spécialisé en automatisation industrielle, a annoncé le lancement de GripperAI, un logiciel universel basé sur l'intelligence artificielle destiné à piloter des préhenseurs robotiques dans des environnements multi-produits. La solution cible un problème récurrent sur les lignes de production mixtes : lorsqu'une cellule robotisée doit saisir des produits de formes et de tailles variables, l'approche traditionnelle impose une reprogrammation manuelle, une intégration applicative spécifique et le recours à des systèmes de vision 3D coûteux. GripperAI se positionne comme une couche logicielle capable d'absorber cette variabilité sans redéveloppement à chaque référence. L'enjeu industriel est direct : le coût et la durée d'intégration sont aujourd'hui l'un des principaux freins au déploiement de cellules robotisées dans les environnements à forte diversité de SKU, logistique, agroalimentaire, manufacturier léger. Si GripperAI tient sa promesse de réduire la dépendance aux caméras 3D dédiées et à la programmation cas par cas, il pourrait abaisser significativement le seuil d'entrée pour les intégrateurs. Il convient de noter que Festo ne publie pas encore de métriques de cycle ou de taux de succès de préhension dans le communiqué disponible, ce qui rend toute évaluation de performance prématurée à ce stade. Festo est historiquement connu pour ses actionneurs pneumatiques et ses solutions bioinspirées (BionicCobot, Bionic Flying Fox), mais s'oriente depuis plusieurs années vers des briques logicielles pour robot-as-a-service. Sur ce segment des préhenseurs universels pilotés par IA, la concurrence est déjà positionnée : Robai, Righthand Robotics (racheté par BD), ainsi que des solutions vision-first comme Osaro ou CapSen Robotics. La prochaine étape pour Festo sera de démontrer GripperAI sur des configurations réelles en production, avec des données de performance publiées et des références clients vérifiables.

UEFesto étant un équipementier européen (allemand) très présent sur les lignes françaises et européennes, GripperAI pourrait réduire les coûts d'intégration pour les intégrateurs et industriels EU opérant en environnements multi-SKU, sous réserve de métriques de performance vérifiables.

FR/EU ecosystemeOpinion
1 source