ORCESTRA : programmation visuelle de robots pilotée par VLM en réalité mixte
Un système de recherche baptisé ORCESTRA, présenté dans un article déposé sur arXiv (2608.00775, catégorie « new »), permet de programmer des robots en réalité mixte sans écrire une ligne de code. L'utilisateur porte un casque à vision traversante (passthrough), place un jumeau numérique du robot sur une surface réelle, puis lui enseigne des trajectoires par démonstration de points de passage, sauvegardées sous forme d'épisodes relatifs au repère du robot. Alternative : il donne une commande vocale ou tapée, qu'un modèle vision-langage (VLM) traduit en plan structuré exécutable par le jumeau numérique. Les deux modes passent par un même backend qui assure l'ancrage métrique, la validation adaptée à la morphologie du robot, la prévisualisation et la confirmation avant exécution. Le système a été testé sur des embodiments hétérogènes : bras manipulateurs à base fixe, base mobile et robot humanoïde.
L'intérêt principal tient à la couche de validation en réalité mixte, qui agit comme filet de sécurité entre une instruction en langage naturel et son exécution physique, un enjeu central alors que les approches VLA (vision-language-action) peinent souvent à passer de la démonstration à un déploiement fiable. Pour les intégrateurs industriels, cela ouvre la voie à une reprogrammation de robots sans compétence en codage, avec vérification visuelle avant tout mouvement réel, réduisant le risque d'erreurs coûteuses sur ligne de production.
ORCESTRA s'inscrit dans une tendance de recherche croissante mêlant réalité augmentée/mixte et VLM pour le contrôle robotique, en alternative aux interfaces de téléopération classiques. L'article ne précise ni affiliation ni calendrier de déploiement commercial ; il s'agit à ce stade d'un prototype académique, dont les suites attendues incluent des études utilisateurs et l'extension à d'autres types de robots.
Dans nos dossiers



