Aller au contenu principal
RecherchearXiv cs.RO 

ORCESTRA : programmation visuelle de robots pilotée par VLM en réalité mixte

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un système de recherche baptisé ORCESTRA, présenté dans un article déposé sur arXiv (2608.00775, catégorie « new »), permet de programmer des robots en réalité mixte sans écrire une ligne de code. L'utilisateur porte un casque à vision traversante (passthrough), place un jumeau numérique du robot sur une surface réelle, puis lui enseigne des trajectoires par démonstration de points de passage, sauvegardées sous forme d'épisodes relatifs au repère du robot. Alternative : il donne une commande vocale ou tapée, qu'un modèle vision-langage (VLM) traduit en plan structuré exécutable par le jumeau numérique. Les deux modes passent par un même backend qui assure l'ancrage métrique, la validation adaptée à la morphologie du robot, la prévisualisation et la confirmation avant exécution. Le système a été testé sur des embodiments hétérogènes : bras manipulateurs à base fixe, base mobile et robot humanoïde.

L'intérêt principal tient à la couche de validation en réalité mixte, qui agit comme filet de sécurité entre une instruction en langage naturel et son exécution physique, un enjeu central alors que les approches VLA (vision-language-action) peinent souvent à passer de la démonstration à un déploiement fiable. Pour les intégrateurs industriels, cela ouvre la voie à une reprogrammation de robots sans compétence en codage, avec vérification visuelle avant tout mouvement réel, réduisant le risque d'erreurs coûteuses sur ligne de production.

ORCESTRA s'inscrit dans une tendance de recherche croissante mêlant réalité augmentée/mixte et VLM pour le contrôle robotique, en alternative aux interfaces de téléopération classiques. L'article ne précise ni affiliation ni calendrier de déploiement commercial ; il s'agit à ce stade d'un prototype académique, dont les suites attendues incluent des études utilisateurs et l'extension à d'autres types de robots.

Dans nos dossiers

À lire aussi

fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM
1arXiv cs.RO 

fARfetch : collaboration homme-robot en réalité augmentée colocalisée dans des environnements visuellement hétérogènes, avec adaptation de contenu par VLM

Des chercheurs ont publié sur arXiv (juin 2026) les résultats de fARfetch, un système de collaboration humain-robot en réalité augmentée conçu pour les environnements extérieurs vastes et visuellement hétérogènes. Le dispositif combine un casque Meta Quest 3 et un robot quadrupède Unitree Go2, et repose sur trois mécanismes : une cartographie sémantique partagée entre le casque et le robot qui visualise des repères de l'environnement pour émettre des commandes de navigation par désignation, une représentation miniaturisée de l'espace (world-in-miniature) pour composer des trajectoires précises, et un module d'adaptation visuelle piloté par un VLM (vision-language model) qui ajuste en temps réel la couleur, la taille et l'orientation des éléments AR afin de maintenir leur lisibilité quelle que soit l'arrière-plan. L'évaluation a été conduite en conditions réelles sur une tâche d'inspection extérieure d'environ 30,5 mètres avec 13 participants en protocole intra-sujets. Par rapport à une baseline sans AR, fARfetch réduit le temps d'exécution de 66 %, la charge mentale de 43 %, la pression temporelle de 34 % et le niveau de frustration de 66 %. Ces résultats sont significatifs pour les intégrateurs de robotique mobile en milieux industriels ouverts (sites de construction, inspection d'infrastructure, logistique extérieure) où la téléopération classique bute sur la désorientation spatiale de l'opérateur et la perte de ligne de vue. L'usage d'un VLM pour l'adaptation du rendu AR constitue une avancée méthodologique : plutôt que de coder des règles statiques de contraste, le système raisonne sur le contexte visuel capturé. Cela suggère que la grille sim-to-real ne se limite plus aux actionneurs physiques mais s'étend à la couche d'interaction humain-machine. L'étude reste toutefois limitée : N=13 est un échantillon restreint, la tâche couvre 30,5 mètres en extérieur contrôlé, et aucune métrique de robustesse en conditions adverses (pluie, contre-jour fort, foule) n'est rapportée. fARfetch s'inscrit dans un champ de recherche actif sur l'AR comme interface de supervision de robots mobiles, aux côtés de travaux portant sur les drones et les AMR en entrepôt. Côté hardware, le Unitree Go2 est un quadrupède grand public à moins de 10 000 dollars, ce qui ancre l'expérimentation dans des configurations accessibles, contrairement aux plateformes à six chiffres de Boston Dynamics. Aucun acteur français ou européen n'est impliqué dans cette étude. Les auteurs n'annoncent pas de pilote industriel ni de timeline de déploiement : il s'agit d'un prototype académique dont les prochaines étapes naturelles seraient des évaluations sur des périmètres plus étendus, avec des opérateurs non entraînés et des robots à mobilité différente (bras, AMR sur roues).

RecherchePaper
1 source
EmbodiedDiffusion : diffusion visuelle guidée par la franchissabilité pour la navigation de robots hétérogènes
2arXiv cs.RO 

EmbodiedDiffusion : diffusion visuelle guidée par la franchissabilité pour la navigation de robots hétérogènes

Des chercheurs présentent EmbodiedDiffusion, un framework basé sur la diffusion qui prédit simultanément des cartes de franchissabilité (traversability) et génère des trajectoires directement à partir d'images RGB, sans carte ni planificateur séparé. Le système distille les connaissances sémantiques d'un modèle vision-langage (VLM) enseignant vers un modèle étudiant léger pendant l'entraînement, ce qui permet une inférence sans prompt, en temps réel, une fois déployé. Un mécanisme de conditionnement modulaire basé sur FiLM isole le raisonnement spécifique à chaque plateforme robotique dans un sous-ensemble compact et entraînable du réseau, sans toucher au backbone visuel ni au modèle de diffusion de trajectoire. Testé en environnements intérieurs sur des robots quadrupèdes et aériens, le système atteint un taux de réussite de navigation de 80 à 100% en régime de données complètes, avec un temps d'inférence de 90 millisecondes, et s'adapte à une nouvelle plateforme robotique avec seulement 10 minutes de collecte de données visuelles. Il s'agit d'une quatrième version révisée d'un article déposé sur arXiv, donc d'un travail académique et non d'un produit commercialisé. L'intérêt principal tient à l'unification de deux tâches habituellement traitées séparément, l'estimation de franchissabilité et la planification de trajectoire, dans un seul modèle bout-en-bout qui se passe de cartographie lourde et de réglage manuel. Pour les intégrateurs travaillant avec des flottes hétérogènes (drones, quadrupèdes, à terme humanoïdes), la promesse clé est la portabilité rapide entre plateformes robotiques sans réentraînement complet, un point de friction connu des pipelines de navigation actuels. Le chiffre de 90 ms d'inférence, s'il se confirme hors laboratoire, positionnerait l'approche comme compatible temps réel sur du matériel embarqué, un critère souvent absent des démonstrations VLM à base de prompts. Les approches dominantes en navigation autonome reposent soit sur des VLM pilotés par prompts, coûteux en latence, soit sur des pipelines découplés associant cartographie SLAM et planificateurs classiques, longs à déployer et à calibrer par robot. EmbodiedDiffusion s'inscrit dans la tendance plus large des modèles vision-action (VLA) qui cherchent à remplacer ces chaînes modulaires par un apprentissage de bout en bout, dans la lignée des travaux sur la généralisation cross-embodiment. Les résultats restent pour l'instant limités à des environnements intérieurs contrôlés avec deux types de plateformes ; leur validation sur des cas industriels réels et sur davantage de morphologies robotiques reste une étape à venir.

RechercheActu
1 source
MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte
3arXiv cs.RO 

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte

Une équipe de chercheurs présente MR-SLAM, un système de supervision en réalité mixte permettant à un opérateur unique de téléopérer simultanément une flotte de robots en cours de cartographie. L'opérateur porte un casque Meta Quest 3 et visualise, via la vue passthrough superposée au monde physique, trois TurtleBot3 simulés naviguer dans l'espace, pendant que des panneaux de tableau de bord ancrés spatialement affichent en temps réel l'état de la cartographie de chaque robot. Côté serveur, chaque robot exécute une instance indépendante de SLAM Toolbox sous ROS 2 (Robot Operating System 2), et leurs grilles d'occupation sont fusionnées en continu. Sur cinq sessions d'évaluation de neuf minutes, le système a maintenu un débit de 8,83 plus ou moins 0,16 Hz, cartographié 17,9 plus ou moins 0,8 m² fusionnés et atteint 94,7 plus ou moins 0,5 % de cohérence inter-instances. Une session additionnelle a enregistré une gigue médiane de transformation de 6,3 ms et une couverture de 26,7 m² sur un espace de référence de 41 m². Il s'agit d'une prépublication arXiv (2605.16432), conduite sur robots simulés en environnement contrôlé, et non d'un produit commercialisé. La contribution adresse un vrai goulet d'étranglement opérationnel : à mesure que les flottes robotiques grandissent, les interfaces 2D classiques imposent une charge cognitive croissante à l'opérateur, contraint de reconstruire mentalement la géométrie de l'espace à partir de plusieurs fenêtres de cartes planaires. La réalité mixte avec ancrage spatial délègue cette reconstruction à la perception naturelle humaine. Le taux de cohérence de 94,7 % est encourageant pour la fusion multi-robots, mais les chiffres restent à nuancer : environnement contrôlé de moins de 30 m², trois robots seulement, et couverture incomplète (65 % de la grille de référence atteinte dans la session additionnelle). Pour les intégrateurs industriels et les décideurs B2B, le signal utile est la validité de principe sur matériel grand public (Meta Quest 3, environ 500 euros), ce qui ouvre une voie à des solutions de supervision moins coûteuses que des postes de contrôle dédiés. Le problème de la supervision spatiale de flottes multi-robots est un chantier actif depuis l'essor des AMR dans la logistique et l'inspection industrielle. Les approches dominantes reposent sur des interfaces RVIZ ou des tableaux de bord web 2D, sans restitution de profondeur ni de contexte spatial. Les stacks concurrentes en SLAM multi-robots incluent Cartographer de Google et Nav2 sous ROS 2 ; côté supervision en réalité mixte, les travaux antérieurs ciblaient surtout les bras manipulateurs plutôt que les flottes mobiles. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé. Les prochaines étapes naturelles sont la validation sur robots physiques réels, à plus grande échelle et dans des espaces industriels non contrôlés.

UEImpact indirect et lointain : les intégrateurs européens d'AMR en logistique pourraient à terme bénéficier d'interfaces de supervision moins coûteuses basées sur du matériel grand public, mais aucun acteur FR/EU n'est impliqué et le système reste au stade de préprint sur robots simulés.

RecherchePaper
1 source
4arXiv cs.RO 

Vérification probabiliste de l'action réalisable des politiques visuomotrices par entraînement basé sur des ensembles

Des chercheurs viennent de publier sur arXiv (papier 2608.02545) une méthode de vérification formelle pour les politiques visuomotrices des robots, celles qui transforment des images caméra en actions de commande via des réseaux VLA (vision-language-action). Le problème qu'ils adressent : l'analyse d'atteignabilité (reachability analysis), qui garantit mathématiquement qu'un robot ne dépassera pas certaines limites d'action, devient ingérable dès qu'on utilise de gros encodeurs visuels, car propager l'incertitude à travers tout le réseau de bout en bout est trop coûteux en calcul et donne des marges de sécurité absurdement larges. Leur solution consiste à geler l'encodeur visuel et à ne propager les ensembles d'incertitude que dans l'interface de basse dimension entre cet encodeur et la politique de décision en aval, calibrée à partir de perturbations de pose de caméra mises à l'écart. Cette propagation utilise des zonotopes (une représentation géométrique d'ensembles) pour produire une largeur d'enveloppe de sortie que l'entraînement dit "set-based" optimise directement. En évaluation, une calibration conforme fractionnée au niveau des trajectoires convertit les écarts d'action mesurés en un rayon d'action atteignable probabiliste, avec une garantie de couverture statistique à échantillon fini. Pour l'industrie robotique, l'enjeu dépasse la curiosité académique : c'est une brique de sécurité qui manquait cruellement aux politiques VLA déployées en usine ou en environnement partagé avec des humains. Aujourd'hui, la plupart des démonstrations de robots humanoïdes ou de bras manipulateurs pilotés par des modèles de type Pi-0, GR00T N2 ou Helix reposent sur la confiance empirique plutôt que sur une preuve mathématique de leurs limites d'action, ce qui freine leur certification pour des tâches critiques. En montrant qu'un entraînement contraint par ensembles réduit le rayon d'incertitude sans sacrifier les performances en boucle fermée, les auteurs suggèrent qu'il est possible d'obtenir des garanties de sécurité formelles sans reconcevoir entièrement l'architecture des politiques, ce qui intéressera directement les intégrateurs et les responsables de certification qui cherchent à faire homologuer des systèmes robotiques autonomes. Cette approche s'inscrit dans un courant de recherche plus large sur la vérification formelle des systèmes d'apprentissage profond, historiquement concentré sur les réseaux de classification ou de contrôle simples, et qui commence seulement à s'attaquer aux politiques visuomotrices modernes à grande échelle. Les auteurs comparent leur méthode à plusieurs contrôles alternatifs, entraînement comportemental seul, cohérence observationnelle, perturbations adversariales ponctuelles, qui produisent tous des rayons d'atteignabilité plus larges, ce qui valide empiriquement l'intérêt de leur approche par ensembles. Le papier ne mentionne pas de déploiement industriel ni de partenariat commercial : il s'agit à ce stade d'une contribution méthodologique testée en expériences de manipulation contrôlées, dont les prochaines étapes logiques seraient l'extension à des politiques plus complexes ou à des robots mobiles et humanoïdes en conditions réelles.

RecherchePaper
1 source