Aller au contenu principal
RecherchearXiv cs.RO 

iTeach : enseignement interactif en conditions réelles pour l'adaptation de la perception des robots guidée par les échecs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

iTeach est un système déployable qui permet à un opérateur présent près du robot, sans expertise ni station de travail, de corriger sur place les erreurs de perception d'un robot mobile. L'opérateur porte un casque de réalité mixte et voit les prédictions de segmentation du robot superposées à la scène réelle. Il corrige ensuite les erreurs sans les mains. Il peut réarranger les objets (mode « HumanPlay »), annoter au regard et à la voix, ou déclencher la propagation arrière de masques de SAM2. Chaque interaction dure environ 20 secondes et produit 150 à 300 images densément annotées. Le modèle est affiné à bord, comparé à la version précédente, puis redéployé si l'affinage l'améliore. La boucle demande seulement une caméra RGB-D, un GPU embarqué et un casque. Sur des scènes encombrées réelles, la segmentation passe de 26,1 à 80,7 après 45 interactions (13 000 images), sans oubli catastrophique. Le résumé ne précise pas la métrique utilisée. Le modèle progresse aussi sur trois benchmarks standard qu'il n'a jamais vus en entraînement. En pick-and-place sur SceneReplica, le système atteint 72 réussites sur 100, devant un pipeline à base de modèles qui exige des CAD. Une étude de 12 participants indique que les non-experts égalent les experts en précision d'annotation (environ 95 % d'IoU des boîtes), en vitesse et en charge cognitive (NASA-TLX de 21/100).

Pour un intégrateur, l'intérêt tient à la fermeture de la boucle sur site, sans envoi de données ni réentraînement hors ligne par une équipe ML. Cela s'attaque directement à l'écart entre démonstration et réalité, car la perception échoue le plus souvent sur des objets et des environnements propres au client. Le gain face à un pipeline avec CAD suggère qu'une perception apprise et adaptée localement peut battre des approches qui demandent une préparation lourde des modèles d'objets. Le cadre est indépendant de l'architecture, ce qui limite le risque de dépendance à un modèle.

Il s'agit d'une publication de recherche (arXiv 2410.09072, cinquième version) et non d'un produit livré. Aucun déploiement industriel n'est annoncé. Les résultats reposent sur des scènes et un protocole choisis par les auteurs, et la robustesse à long terme comme la charge en environnement de production restent à démontrer. Le travail s'inscrit dans l'apprentissage interactif et l'apprentissage par correction humaine, et il exploite la propagation vidéo de SAM2 pour réduire le coût d'annotation. Les suites logiques sont des tests sur des flottes de robots, des tâches plus variées et des comparaisons avec d'autres méthodes d'adaptation continue.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

SocioGesture : perception adaptative en temps réel des gestes sociaux pour l'interaction homme-robot
1arXiv cs.RO 

SocioGesture : perception adaptative en temps réel des gestes sociaux pour l'interaction homme-robot

Des chercheurs présentent SocioGesture, un système de perception gestuelle sociale conçu pour l'interaction humain-robot en temps réel, décrit dans un article publié sur arXiv le 4 septembre 2026 (arXiv:2609.04545v1). L'objectif est de faire reconnaître à un robot non seulement des commandes explicites, mais aussi des signaux sociaux comme une invitation, un refus ou un signe d'indisponibilité, à partir de capteurs embarqués imparfaits, sujets aux occlusions partielles et aux changements de point de vue. Le système repose sur une représentation compacte du squelette corps-mains avec score de confiance, couplée à un modèle léger à deux flux qui fusionne le mouvement du corps et l'articulation des mains pour une reconnaissance à faible latence directement sur le robot. Pour renforcer la robustesse, les chercheurs entraînent le modèle avec une méthode de corruption volontaire du squelette simulant des mains manquantes, des bras occultés ou des points-clés instables dans le temps, sans alourdir le coût de calcul à l'inférence. Testé sur un jeu de données de gestes sociaux collecté en environnements mixtes intérieur-extérieur, SocioGesture atteint une bonne reconnaissance sur des sujets non vus à l'entraînement, améliore nettement la robustesse face aux occlusions structurées, et tourne en temps réel sur un dispositif de calcul embarqué (edge). Cette avancée cible un angle mort concret de la robotique de service et industrielle: la plupart des systèmes actuels traitent les gestes comme des commandes isolées, mais ignorent les signaux sociaux implicites qui régulent une interaction naturelle en environnement partagé avec des humains, ce qui limite l'acceptabilité et la fluidité des robots déployés en espace public ou en usine. En prouvant qu'un modèle léger peut tourner en embarqué avec robustesse face à l'occlusion, un problème récurrent en conditions réelles, sans démonstration vidéo sélective ni matériel de calcul déporté, l'étude apporte un signal utile aux intégrateurs qui cherchent à dépasser le stade de la démo contrôlée en laboratoire. Le mécanisme d'apprentissage continu, qui met de côté les séquences ambiguës pour un étiquetage différé et permet d'étendre le vocabulaire gestuel sans dégrader les classes déjà apprises, répond aussi à un frein classique au déploiement long terme des robots sociaux. Le travail s'inscrit dans la lignée des recherches en HRI (human-robot interaction) cherchant à rapprocher la perception gestuelle des conditions réelles de terrain, plutôt que des jeux de données propres en studio, une problématique partagée par les laboratoires travaillant sur les modèles vision-langage-action (VLA) et la navigation sociale de robots mobiles ou d'AMR. L'article ne mentionne ni partenariat industriel, ni date de déploiement pilote, ni comparaison chiffrée directe avec des systèmes concurrents commerciaux: il s'agit à ce stade d'une contribution de recherche publiée en preprint, dont la prochaine étape logique serait une validation sur des plateformes robotiques commerciales et des comparaisons benchmark publiques.

RecherchePaper
1 source
2arXiv cs.RO 

F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots

Des chercheurs proposent F4R (Failure for Rising), un cadre d'apprentissage en boucle fermée « real-to-sim-to-real » qui transforme les échecs observés en conditions réelles en améliorations ciblées d'une politique de type vision-langage-action (VLA). Le système enchaîne quatre étapes : un agent identifie et diagnostique automatiquement les échecs à partir des rollouts, chaque échec est reconstruit sous forme d'environnement de table interactif centré sur les objets, la politique est affinée par un co-entraînement simulation/réel conditionné par l'échec puis par de l'apprentissage par renforcement ciblé dans ces environnements reconstruits, et la politique améliorée est redéployée. Les nouveaux échecs alimentent le cycle suivant. Sur quatre tâches de manipulation testées en conditions réelles, F4R atteint 93,75 % de réussite en distribution et 90,0 % hors distribution (OOD). Il devance de 18,75 points de pourcentage, en OOD, une base de comparaison à budget égal, le Targeted BC (clonage comportemental ciblé), et ce sans collecte de nouvelles démonstrations correctives dans le monde réel. L'enjeu est très concret pour les intégrateurs et les équipes qui déploient des VLA. La réponse habituelle à un échec en production consiste à collecter de nouvelles démonstrations d'experts, ce qui coûte cher, demande du temps opérateur, peut être risqué pour le matériel et se met mal à l'échelle. Déplacer la correction vers la simulation, à partir de scènes reconstruites à partir de l'échec réel, viserait à réduire ce goulot d'étranglement. Si ces résultats se confirment, ils indiqueraient qu'un écart de robustesse hors distribution peut se combler sans téléopération supplémentaire, et que la reconstruction ciblée permet de contourner en partie le problème du sim-to-real, généralement traité avec des simulateurs génériques. Des réserves s'imposent : l'évaluation ne porte que sur quatre tâches de table, avec des objets manipulés simples, et l'article ne détaille pas ici le nombre d'essais ni les modèles de base. Les gains sont mesurés face à une seule base à budget égal, et la transposition à des scènes encombrées, à des objets déformables ou à des cellules industrielles reste à démontrer. Ce travail s'inscrit dans la course à la fiabilité des politiques généralistes de type Pi-0, Helix ou GR00T, dont les performances réelles restent limitées par la couverture des démonstrations et par une compréhension encore partielle des interactions physiques. Il prolonge les approches de real-to-sim et de réglage par renforcement de VLA, ainsi que les boucles de « data flywheel » que les acteurs industriels revendiquent pour leurs flottes. La différence tient ici à l'automatisation du diagnostic et à la reconstruction de chaque échec comme environnement d'entraînement. Il s'agit d'une publication de recherche sur arXiv (version 2 remplaçant la précédente), sans produit ni déploiement commercial annoncé. La suite logique serait de valider la méthode sur des robots plus variés, des tâches plus longues et des cadences industrielles, avant d'envisager une intégration dans des chaînes de déploiement continu.

RecherchePaper
1 source
Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond
3arXiv cs.RO 

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.25031) une nouvelle méthode de suivi humain-robot fondée sur l'apprentissage par renforcement profond (DRL), qui rompt avec les approches classiques imposant une position fixe au robot par rapport à la personne accompagnée, derrière, devant ou à ses côtés. Le système modélise un "espace d'interaction" liant humain, robot et environnement, utilisé comme espace d'état pour l'agent DRL, et s'appuie sur un contrôleur combinant Model Predictive Path Integral (MPPI) et Control Barrier Functions (CBF) pour suivre précisément la position et l'orientation de la cible tout en évitant les obstacles. Testé en conditions réelles, en intérieur comme en extérieur, et comparé à des méthodes existantes, le robot accompagne une personne marchant jusqu'à 1,7 m/s en ajustant dynamiquement sa stratégie de positionnement, avec un taux de réussite amélioré d'au moins 24% et une précision de suivi améliorée d'au moins 47%, tout en respectant l'espace intime de la personne pour garantir sécurité et confort. L'intérêt dépasse la démonstration technique: la plupart des robots d'accompagnement actuels, en logistique, en assistance ou en robotique de service, reposent sur des règles de positionnement figées, peu robustes face aux changements de vitesse, aux couloirs étroits ou à la densité de foule. Un positionnement adaptatif piloté par apprentissage, capable de basculer entre suivi latéral, frontal ou arrière selon le contexte, répond à une limite connue de la navigation sociale robotique, le compromis entre sécurité, fluidité de déplacement et acceptabilité sociale. Pour les intégrateurs travaillant sur des robots mobiles autonomes (AMR) destinés à l'accompagnement de personnes en environnement industriel ou de santé, cette approche laisse entrevoir des systèmes moins rigides et potentiellement plus sûrs en cohabitation avec des humains. Le travail s'inscrit dans un courant de recherche en interaction humain-robot (HRI) qui cherche à dépasser les schémas de suivi rigides documentés dans la littérature existante, et les auteurs comparent directement leurs résultats à ceux d'études antérieures. Comme souvent pour ce type de publication académique, les métriques de réussite et de confort restent définies et mesurées par les auteurs eux-mêmes sur un nombre limité de scénarios, ce qui appelle une validation indépendante avant toute généralisation. Aucune affiliation industrielle ni calendrier de transfert commercial n'est mentionné: il s'agit à ce stade d'une contribution de recherche, sans pilote ni déploiement annoncé, dont la suite logique serait une extension à des scénarios multi-personnes et une validation sur d'autres plateformes robotiques.

RecherchePaper
1 source
Référentiel d'évaluation en conditions réelles de la préhension en vrac pour le tri robotisé des déchets alimentaires
4arXiv cs.RO 

Référentiel d'évaluation en conditions réelles de la préhension en vrac pour le tri robotisé des déchets alimentaires

Des chercheurs ont publié GRAB (Grasping-in-Clutter Benchmark), un protocole d'évaluation en conditions réelles destiné au tri robotisé des déchets alimentaires. Le benchmark mobilise 1 750 tentatives de saisie réparties sur quatre niveaux de désordre aléatoire, en comparant trois modalités de préhenseurs industriels sur des objets déformables représentatifs des contaminants inorganiques présents dans les flux de déchets alimentaires. L'évaluation repose sur une estimation de pose 6D pour chaque tentative de saisie, et introduit des métriques dites de "graspabilité" qui caractérisent explicitement les conditions pré-saisie, au lieu de se limiter au classique taux de succès binaire. Le résultat central contredit une hypothèse fréquente dans la littérature : ce ne sont pas les limites de perception ou de contrôle qui dominent les échecs de saisie en environnement encombré, mais les contraintes d'interaction physique avec les objets. La qualité de l'objet lui-même, son état de déformation, sa position relative dans le tas, s'avèrent être le facteur prédominant sur toutes les modalités de préhenseur testées. Ce constat a des implications directes pour les intégrateurs industriels : optimiser la vision ou le planificateur de trajectoire apporte des gains marginaux si la chaîne amont ne garantit pas une qualité d'objet minimale en entrée de cellule. GRAB fournit ainsi une base méthodologique plus rigoureuse pour concevoir des systèmes de préhension adaptatifs destinés à des flux réels, variables et non structurés. Le tri des déchets alimentaires est un domaine resté largement en dehors des benchmarks robotiques standards, dominés par des objets rigides et des environnements contrôlés. Les approches existantes souffraient d'une dépendance excessive aux datasets simulés et d'une absence d'analyse systématique des modes d'échec. GRAB comble ce vide en s'appuyant sur des datasets d'objets déformables réels, un angle peu couvert par les travaux concurrents centrés sur la manipulation manufacturière. Côté acteurs, des entreprises comme Greyparrot (tri de déchets par vision) ou Zen Robotics (saisie en flux de déchets) opèrent sur des problématiques proches. Les prochaines étapes probables incluent l'intégration du benchmark dans des pipelines d'apprentissage par imitation ou de VLA (Vision-Language-Action models) pour évaluer leur robustesse sur des flux de déchets réels, un cas d'usage encore peu documenté à l'échelle industrielle.

UEZen Robotics (Finlande) travaille sur des problématiques directement couvertes par ce benchmark ; les intégrateurs européens de cellules de tri pourraient s'appuyer sur GRAB pour réorienter leurs budgets R&D vers la qualité amont plutôt que vers la vision ou la planification.

RecherchePaper
1 source