iTeach : enseignement interactif en conditions réelles pour l'adaptation de la perception des robots guidée par les échecs
iTeach est un système déployable qui permet à un opérateur présent près du robot, sans expertise ni station de travail, de corriger sur place les erreurs de perception d'un robot mobile. L'opérateur porte un casque de réalité mixte et voit les prédictions de segmentation du robot superposées à la scène réelle. Il corrige ensuite les erreurs sans les mains. Il peut réarranger les objets (mode « HumanPlay »), annoter au regard et à la voix, ou déclencher la propagation arrière de masques de SAM2. Chaque interaction dure environ 20 secondes et produit 150 à 300 images densément annotées. Le modèle est affiné à bord, comparé à la version précédente, puis redéployé si l'affinage l'améliore. La boucle demande seulement une caméra RGB-D, un GPU embarqué et un casque. Sur des scènes encombrées réelles, la segmentation passe de 26,1 à 80,7 après 45 interactions (13 000 images), sans oubli catastrophique. Le résumé ne précise pas la métrique utilisée. Le modèle progresse aussi sur trois benchmarks standard qu'il n'a jamais vus en entraînement. En pick-and-place sur SceneReplica, le système atteint 72 réussites sur 100, devant un pipeline à base de modèles qui exige des CAD. Une étude de 12 participants indique que les non-experts égalent les experts en précision d'annotation (environ 95 % d'IoU des boîtes), en vitesse et en charge cognitive (NASA-TLX de 21/100).
Pour un intégrateur, l'intérêt tient à la fermeture de la boucle sur site, sans envoi de données ni réentraînement hors ligne par une équipe ML. Cela s'attaque directement à l'écart entre démonstration et réalité, car la perception échoue le plus souvent sur des objets et des environnements propres au client. Le gain face à un pipeline avec CAD suggère qu'une perception apprise et adaptée localement peut battre des approches qui demandent une préparation lourde des modèles d'objets. Le cadre est indépendant de l'architecture, ce qui limite le risque de dépendance à un modèle.
Il s'agit d'une publication de recherche (arXiv 2410.09072, cinquième version) et non d'un produit livré. Aucun déploiement industriel n'est annoncé. Les résultats reposent sur des scènes et un protocole choisis par les auteurs, et la robustesse à long terme comme la charge en environnement de production restent à démontrer. Le travail s'inscrit dans l'apprentissage interactif et l'apprentissage par correction humaine, et il exploite la propagation vidéo de SAM2 pour réduire le coût d'annotation. Les suites logiques sont des tests sur des flottes de robots, des tâches plus variées et des comparaisons avec d'autres méthodes d'adaptation continue.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



