Aller au contenu principal
FR/EU ecosystemearXiv cs.RO 

Pipeline d'intégration simulation-réel pour l'entraînement et le déploiement de politiques VLA de manipulation par blocs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire ISIR (Sorbonne Université, Paris) ont publié le 21 septembre 2026 sur arXiv (2609.21817) un protocole open-source de transfert simulation-vers-réel pour entraîner des modèles Vision-Language-Action (VLA) de manipulation. Sur un bras Franka FR3, des trajectoires expertes générées en simulation sont rejouées en boucle ouverte, tandis que les observations visuelles et proprioceptives réelles correspondantes sont enregistrées et converties dans un format compatible avec l'entraînement VLA, qui prédit des actions dans l'espace de pose de l'effecteur sous forme de chunks. La même chaîne de déploiement sert ensuite, en boucle fermée, à évaluer la politique entraînée sur un matériel identique. Les jeux de données sont publiés sur Hugging Face et le code sur GitLab (gitlab.isir.upmc.fr/kappel).

L'enjeu vise le principal goulot d'étranglement de l'entraînement des VLA : la collecte de démonstrations réelles par téléopération humaine, coûteuse, lente et difficile à faire monter en échelle. En appariant chaque enregistrement réel à la trajectoire simulée qui l'a produit, le protocole offre surtout une mesure directe et chiffrée de l'écart sim-to-real, là où la plupart des annonces du secteur se contentent d'affirmer le problème résolu sans le quantifier. Pour les laboratoires et équipes d'intégration sans flotte de téléopération, l'outil permet de constituer des jeux d'entraînement reproductibles et de comparer objectivement des politiques VLA sur un même banc matériel plutôt que sur des vidéos de démonstration sélectionnées.

Ce travail s'inscrit dans une course plus large aux modèles VLA, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) misent sur de vastes jeux de données réelles collectés par téléopération, une dépendance que l'ISIR cherche justement à alléger. Le Franka FR3, bras à sept degrés de liberté du fabricant allemand Franka Robotics, est une plateforme standard des laboratoires de manipulation, sans lien avec les humanoïdes commerciaux comme Optimus ou Figure 03. Il s'agit ici d'une publication académique et non d'un produit ou d'un déploiement industriel : aucun chiffre de charge utile, de temps de cycle ou de volume n'est communiqué, l'ISIR misant sur l'adoption communautaire du code et des données pour que d'autres équipes reproduisent et étendent le protocole à d'autres plateformes robotiques.

Impact France/UE

Le laboratoire français ISIR (Sorbonne Universite) publie un protocole et des données open-source qui renforcent la visibilité de la recherche européenne en robotique VLA et offrent aux équipes françaises sans flotte de téléopération un outil reproductible pour entrainer et comparer leurs propres politiques de manipulation.

À lire aussi

DuoBench : un benchmark reproductible pour la manipulation bimanuelles en simulation et dans le monde réel
1arXiv cs.RO 

DuoBench : un benchmark reproductible pour la manipulation bimanuelles en simulation et dans le monde réel

Une équipe de chercheurs a publié en juin 2026 DuoBench, un cadre de benchmarking dédié à la manipulation bimanuelle, conçu pour la plateforme FR3 Duo de Franka Robotics. Le benchmark comprend onze tâches réparties en quatre catégories de coordination, implémentées en simulation et partiellement reproduites en environnement réel grâce à des protocoles reproductibles incluant des composants imprimables en 3D. Les auteurs ont constitué des jeux de données de télé-opération humaine pour l'ensemble des onze tâches, et proposent un schéma d'évaluation par étapes (stage-based evaluation) permettant une analyse sémantique fine des modes d'échec, au-delà du simple critère binaire succès/échec. Plusieurs politiques d'apprentissage par imitation à deux bras ainsi que des politiques VLA (vision-language-action) ont été évaluées en simulation et sur matériel réel. Les résultats sont sans ambiguïté : les politiques actuelles, y compris les approches VLA considérées comme l'état de l'art, restent insuffisantes pour la manipulation bimanuelle. Les échecs se concentrent sur trois axes : les phases d'interaction initiale, l'exécution parallèle des deux bras, et le transfert simulation-réel (sim-to-real). Ce dernier point est particulièrement significatif : malgré les progrès récents sur le gap sim-to-real pour la manipulation à un bras, DuoBench révèle que la coordination bimanuelle pose des défis supplémentaires non résolus. Pour les équipes R&D et les intégrateurs industriels, ce benchmark fournit un outil diagnostique structuré pour identifier précisément où les politiques échouent, une lacune que les frameworks existants comme RLBench ou LIBERO, conçus pour les systèmes à un seul bras, ne comblaient pas. La manipulation bimanuelle est un prérequis pour de nombreuses tâches complexes en industrie (assemblage, conditionnement, manipulation d'objets déformables), ce qui explique l'intérêt croissant du secteur pour les plateformes à deux bras. Le FR3 Duo de Franka Robotics est l'une des rares plateformes de recherche standardisées pour ce segment. Dans la course aux capacités bimanuelles, des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses robots humanoïdes ont annoncé des performances prometteuses, mais les benchmarks publics rigoureux permettant de les comparer restent rares. DuoBench, dont le code, les jeux de données et les vidéos sont disponibles sur duobench.github.io, ambitionne de combler ce manque avec un protocole reproductible que tout laboratoire peut répliquer à faible coût grâce aux assets imprimables en 3D.

UEFranka Robotics (Allemagne) est la plateforme centrale de DuoBench, offrant aux laboratoires et équipes R&D européens un benchmark standardisé et reproductible pour évaluer leurs politiques bimanuelle, y compris les approches VLA, sans disposer de ressources matérielles coûteuses.

FR/EU ecosystemePaper
1 source
DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique
2arXiv cs.RO 

DemoBridge : une boîte à outils de simulation en boucle pour le retargeting de démonstrations humaines en vue unique

Une équipe de l'université KU Leuven (Belgique) publie DemoBridge, un outil qui transforme un enregistrement vidéo unique, en stéréo RGB, d'une démonstration manuelle humaine en une trajectoire de bras robotique exécutable et validée par simulation physique. Décrit dans un preprint arXiv daté du 13 juillet 2026 (arXiv:2607.09519), le système repose sur un planificateur unique conscient des collisions qui optimise la trajectoire articulaire complète en une seule passe, en tenant compte simultanément des poses de préhension alternatives, des collisions du bras et de l'objet saisi, et de la fidélité au geste démontré. Un simulateur physique tourne en boucle pendant la génération, valide chaque phase et revient en arrière en cas d'échec plutôt que d'abandonner la démonstration : le geste est replanifié, pas jeté. Le timing de la prise est déduit automatiquement, et les modules de perception, le modèle de robot et les étapes du pipeline sont interchangeables par configuration. L'équipe a testé l'ensemble du pipeline sur trois tâches réelles et évalué le planificateur seul sur un benchmark synthétique contrôlé. Le code est disponible sur le GitLab de KU Leuven. L'enjeu visé est le fossé d'incarnation ("embodiment gap") : un bras robotique, avec ses longs segments articulés, occupe bien plus de volume de collision qu'une main humaine, si bien que la cinématique inverse appliquée telle quelle à une pose de préhension démontrée n'a souvent aucune solution sans collision. Ce verrou freine l'apprentissage par démonstration à bas coût, où une simple vidéo caméra unique remplacerait la téléopération coûteuse utilisée pour collecter des données d'entraînement de modèles vision-langage-action comme Pi-0 ou GR00T N2. En doublant chaque démonstration retargetée d'un rollout de simulation exploitable pour l'apprentissage de politiques, DemoBridge s'inscrit directement dans la course à des données de manipulation moins chères à générer. Il s'agit d'un travail académique préliminaire, non d'un produit commercialisé : l'évaluation reste limitée à trois tâches réelles et un benchmark synthétique, sans déploiement industriel annoncé. Le choix d'une vue unique plutôt qu'un rig multi-caméras vise justement l'accessibilité, un axe que suivent aussi des laboratoires concurrents cherchant à réduire le coût de collecte de données d'imitation face aux approches par téléopération dominantes chez les acteurs américains du secteur.

UEUne équipe universitaire belge (KU Leuven) publie en open-source un outil de retargeting de démonstrations, réduisant potentiellement le coût de collecte de données d'apprentissage par imitation pour les laboratoires robotiques européens.

FR/EU ecosystemePaper
1 source
Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements
3arXiv cs.RO 

Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements

Des chercheurs associés à Siemens ont publié le 28 mai 2026 sur arXiv (2605.27461) une étude de déploiement industriel d'une politique VLA (Vision-Language-Action) dans l'usine Siemens GWE d'Erlangen, en Allemagne. La tâche ciblée est précisément définie : un bras robotique doit saisir un sachet d'accessoires transparent au sein d'un tas encombré, l'insérer dans la cavité restante d'un emballage carton, puis vérifier que le sachet et son contenu restent en dessous du plan de fermeture du carton. Le modèle de base utilisé est Pi0.5, la politique VLA de Physical Intelligence, affinée de manière itérative sur données terrain. L'équipe a accumulé 2535 épisodes d'entraînement, soit environ 10 heures de données collectées directement en conditions d'usine, via un pipeline cyclique comprenant collecte, curation, fine-tuning, évaluation et collecte de données de récupération ciblées. Ce qui rend cette publication notable, c'est son positionnement éditorial délibérément empirique : les auteurs ne communiquent pas sur un taux de succès global, mais documentent les modes de défaillances récurrents et les ajustements nécessaires à chaque cycle. C'est précisément ce type de retour d'expérience qui manque dans la littérature robotique, où les démonstrations sélectionnées occultent souvent le coût réel d'adaptation d'un modèle généraliste à une tâche industrielle spécifique. La gestion d'objets transparents, notoire pour tromper les systèmes de vision par profondeur, illustre ici les limites concrètes du sim-to-real et du transfert zero-shot. L'étude confirme que le fine-tuning dirigé par les échecs terrain, plutôt que la montée en données brutes, reste le levier dominant pour atteindre la fiabilité industrielle. Pi0.5 est le successeur de π0, lancé par Physical Intelligence (San Francisco) fin 2024, conçu comme politique généraliste pour la manipulation dextère. Son déploiement chez Siemens marque une étape significative dans la commercialisation B2B des VLA, un segment que se disputent actuellement Figure AI avec sa pile Helix, 1X Technologies avec NEO, et des initiatives internes comme GR00T N2 de NVIDIA ou les travaux de Boston Dynamics sur Atlas. Aucun acteur européen n'est directement impliqué dans ce déploiement, bien que Wandercraft et Enchanted Tools positionnent des produits complémentaires sur le segment français. La prochaine étape logique de ce type d'étude serait une généralisation multi-tâches ou multi-sites, mais les auteurs restent prudents : l'article conclut sur des leçons méthodologiques, non sur un déploiement à l'échelle.

UELe déploiement de Pi0.5 dans l'usine Siemens d'Erlangen fournit le premier retour d'expérience empirique documenté d'un modèle VLA généraliste en conditions industrielles réelles au sein d'un acteur EU majeur, directement exploitable par les intégrateurs et équipementiers robotiques européens.

FR/EU ecosystemeOpinion
1 source
Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques
4arXiv cs.RO 

Voir et Bifurquer : branchement par vision pour la programmation interactive de compétences robotiques

Une équipe du CIIRC (Czech Institute of Informatics, Robotics and Cybernetics, Prague) publie sur arXiv un framework appelé See & Switch, qui étend la programmation par démonstration (PbD) aux tâches robotiques conditionnelles basées sur la vision. Le système représente une tâche comme un graphe de segments de compétence reliés par des états de décision : lors de l'exécution, un module appelé Switcher analyse les images d'une caméra embarquée dans la main (eye-in-hand) pour sélectionner la branche à suivre ou signaler une situation inconnue nécessitant une nouvelle démonstration. En cas d'erreur ou de cas imprévu, l'opérateur peut intervenir via enseignement kinesthésique, joystick ou gestes manuels. Le système a été évalué sur trois tâches de manipulation dextère impliquant 8 utilisateurs novices, pour un total d'environ 900 séquences d'exécution sur robot réel. Les résultats mesurés sur des fenêtres temporelles définies par l'utilisateur atteignent 90,6 % de précision dans la sélection de branche, et une détection d'anomalies supérieure à 90 % dans 47 des 79 états de décision testés. Ces résultats sont pertinents pour les intégrateurs industriels qui cherchent à déployer la PbD dans des environnements variables sans passer par la programmation explicite de chaque variante. Le principal verrou du secteur est que les systèmes PbD classiques supposent un environnement fixe : un changement de disposition, d'orientation de pièce ou de contexte casse le programme. See & Switch traite ce problème au niveau du graphe de tâche plutôt qu'au niveau du modèle de perception, ce qui le rend modulaire et extensible sans réentraîner un réseau complet. La nuance importante : les performances de branchement sont évaluées en mode offline sur des fenêtres déjà identifiées, ce qui isole le classificateur visuel des erreurs de timing réelles, les chiffres de 90 % ne reflètent donc pas directement la robustesse end-to-end en déploiement non supervisé. La PbD a connu un regain d'intérêt fort depuis 2022 avec les approches VLA (Vision-Language-Action) portées par des systèmes comme Pi-0 (Physical Intelligence), OpenVLA ou ACT (Action Chunking with Transformers). See & Switch se positionne différemment : il n'utilise pas de grand modèle pré-entraîné mais une architecture légère et interprétable, orientée vers l'enseignement interactif sur site par du personnel non expert. Les travaux proviennent du groupe ImitRob au CIIRC, qui publie régulièrement sur la PbD depuis plusieurs années. Le code et les données sont disponibles publiquement. La prochaine étape logique serait de coupler ce graphe de décision avec un backbone de perception plus robuste, ou de tester la scalabilité sur des cellules industrielles multi-postes.

UELe framework See & Switch, issu du groupe ImitRob au CIIRC de Prague (UE), est publié en open source et ne requiert pas de grand modèle pré-entraîné, ce qui le rend directement accessible aux intégrateurs industriels européens souhaitant déployer la programmation par démonstration dans des environnements variables sans expertise en deep learning.

FR/EU ecosystemePaper
1 source