Aller au contenu principal
Suivi humain par nacelle gimbal pour robots compagnons via apprentissage continu
RecherchearXiv cs.RO 

Suivi humain par nacelle gimbal pour robots compagnons via apprentissage continu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente, dans un article soumis sur arXiv le 25 aout 2026 (arXiv:2608.21388), un système de suivi humain pour robots compagnons base sur une camera montée sur une nacelle gimbal motorisée, intégrée a un robot mobile. Le gimbal oriente activement son axe de visée pour garder la personne suivie dans le champ de vision, même lors de déplacements relatifs rapides, la ou les cameras fixes ou les tags portables échouent des que la cible sort de la zone de détection. Une stratégie d'apprentissage continu est appliquée a la reidentification de personnes (ReID) pour s'adapter aux changements d'apparence et d'environnement lors d'un suivi de longue durée. Les expériences couvrent des scenarios allant de la marche a la course, avec reidentification en temps réel, et une étude utilisateur a mesure le gain de confort lie a l'absence de tag porte.

Pour les intégrateurs de robots de service destines aux domiciles, hôpitaux ou espaces commerciaux, la dépendance aux tags portables ou aux cameras fixes reste un frein a l'adoption, en confort comme en cout de déploiement ; supprimer l'accessoire en élargissant la couverture effective du capteur s'attaque directement a ce point de friction. L'apprentissage continu applique a la ReID vise un problème récurrent des systèmes de vision en conditions réelles : la dégradation de la reconnaissance quand l'éclairage, la tenue ou l'arriere-plan changent, un écart classique entre démonstration en laboratoire et fonctionnement continu sur le terrain. Si les résultats se confirment a plus grande échelle, l'approche pourrait lever un obstacle concret a la commercialisation des robots compagnons grand public.

Le suivi de personnes en robotique de service reposait jusqu'ici surtout sur des tags actifs (UWB, RFID) ou sur la détection visuelle via cameras statiques a champ limite, deux approches vulnérables des que la cible sort du cadre ou change d'apparence. L'article ne cite aucun acteur industriel ni déploiement commercial : il s'agit d'un prototype de recherche évalué en conditions contrôlées, avec une étude utilisateur dont l'ampleur n'est pas précisée, ce qui invite a la prudence avant toute extrapolation vers un produit prêt a l'emploi. Aucune suite opérationnelle ni calendrier d'industrialisation n'est annonce ; la contribution se présente comme une brique technique potentiellement reprise par des fabricants de robots d'assistance a la personne.

Dans nos dossiers

À lire aussi

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond
1arXiv cs.RO 

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.25031) une nouvelle méthode de suivi humain-robot fondée sur l'apprentissage par renforcement profond (DRL), qui rompt avec les approches classiques imposant une position fixe au robot par rapport à la personne accompagnée, derrière, devant ou à ses côtés. Le système modélise un "espace d'interaction" liant humain, robot et environnement, utilisé comme espace d'état pour l'agent DRL, et s'appuie sur un contrôleur combinant Model Predictive Path Integral (MPPI) et Control Barrier Functions (CBF) pour suivre précisément la position et l'orientation de la cible tout en évitant les obstacles. Testé en conditions réelles, en intérieur comme en extérieur, et comparé à des méthodes existantes, le robot accompagne une personne marchant jusqu'à 1,7 m/s en ajustant dynamiquement sa stratégie de positionnement, avec un taux de réussite amélioré d'au moins 24% et une précision de suivi améliorée d'au moins 47%, tout en respectant l'espace intime de la personne pour garantir sécurité et confort. L'intérêt dépasse la démonstration technique: la plupart des robots d'accompagnement actuels, en logistique, en assistance ou en robotique de service, reposent sur des règles de positionnement figées, peu robustes face aux changements de vitesse, aux couloirs étroits ou à la densité de foule. Un positionnement adaptatif piloté par apprentissage, capable de basculer entre suivi latéral, frontal ou arrière selon le contexte, répond à une limite connue de la navigation sociale robotique, le compromis entre sécurité, fluidité de déplacement et acceptabilité sociale. Pour les intégrateurs travaillant sur des robots mobiles autonomes (AMR) destinés à l'accompagnement de personnes en environnement industriel ou de santé, cette approche laisse entrevoir des systèmes moins rigides et potentiellement plus sûrs en cohabitation avec des humains. Le travail s'inscrit dans un courant de recherche en interaction humain-robot (HRI) qui cherche à dépasser les schémas de suivi rigides documentés dans la littérature existante, et les auteurs comparent directement leurs résultats à ceux d'études antérieures. Comme souvent pour ce type de publication académique, les métriques de réussite et de confort restent définies et mesurées par les auteurs eux-mêmes sur un nombre limité de scénarios, ce qui appelle une validation indépendante avant toute généralisation. Aucune affiliation industrielle ni calendrier de transfert commercial n'est mentionné: il s'agit à ce stade d'une contribution de recherche, sans pilote ni déploiement annoncé, dont la suite logique serait une extension à des scénarios multi-personnes et une validation sur d'autres plateformes robotiques.

RecherchePaper
1 source
Apprentissage de compétences réactives de football par vision pour robots humanoïdes
2arXiv cs.RO 

Apprentissage de compétences réactives de football par vision pour robots humanoïdes

Une équipe de recherche présente, dans une version mise à jour d'un preprint arXiv (2511.03996v2), un contrôleur basé sur l'apprentissage par renforcement qui permet à des robots humanoïdes d'acquérir des réflexes de football pilotés par la vision, en couplant directement perception visuelle et contrôle locomoteur plutôt que de séparer les deux étapes dans un pipeline modulaire. Entraîné en simulation avec des "adversarial motion priors" pour produire des mouvements naturels, le système repose sur une architecture encodeur-décodeur et un module de perception virtuelle reproduisant le bruit et les échecs de détection d'une caméra embarquée. Le robot exécute ainsi, avec la seule vision embarquée, la recherche du ballon, sa poursuite et des frappes multidirectionnelles. Face à une méthode de référence basée sur des règles fixes, l'erreur d'estimation de la position du ballon chute de 46%, le temps avant frappe diminue jusqu'à 64%, et le taux de réussite atteint environ 90% en zone offensive, testé lors de compétitions RoboCup réelles. Ce résultat contredit une pratique répandue en robotique humanoïde, qui consiste à séparer perception et contrôle ou à supposer une détection quasi parfaite. En intégrant l'incertitude visuelle directement dans l'apprentissage de la politique, les auteurs montrent qu'un contrôleur de bout en bout peut rester réactif malgré un bruit de détection réaliste, fréquent dès la sortie du laboratoire. Pour les équipes travaillant sur des humanoïdes destinés à des environnements dynamiques, au-delà du seul football, cette boucle fermée perception-contrôle suggère une piste généralisable à des tâches de manipulation ou de navigation exigeant une adaptation continue sous perception dégradée, un enjeu clé pour combler l'écart entre simulation et conditions réelles. Il s'agit d'une contribution académique publiée sur arXiv en version révisée, non d'une annonce de produit commercial: aucune entreprise ni modèle de robot n'est nommé, la validation s'appuyant sur une plateforme générique testée dans le cadre de la RoboCup Humanoid League, compétition où plusieurs équipes universitaires confrontent depuis des années leurs algorithmes de locomotion et de perception. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs n'annoncent ni calendrier de déploiement industriel ni partenariat, se limitant à évoquer la poursuite des tests en conditions de compétition réelle.

RecherchePaper
1 source
Ancrages de mémoire pour l'apprentissage continu des robots
3arXiv cs.RO 

Ancrages de mémoire pour l'apprentissage continu des robots

Des chercheurs présentent, dans un article publie le 28 aout 2026 sur arXiv (2608.26545v1), une méthode baptisée "Memory Anchors" pour lutter contre l'oubli catastrophique des robots qui apprennent de nouvelles taches en continu. Le principe s'appuie sur les buffers de rejeu, habituellement échantillonnés au hasard parmi les expériences passées pour reentrainer la politique sur d'anciennes taches en parallèle des nouvelles. Les auteurs montrent qu'un petit sous ensemble de ces expériences, les "ancres mémoire", concentre l'essentiel de la protection: ce sont les cas ou les représentations internes d'observations d'une nouvelle tache s'effondrent sur celles d'une ancienne tache alors que les deux exigent des actions contradictoires, par exemple manipuler différemment un objet déjà connu. Sur la suite de benchmarks LIBERO, exclure seulement 10% de ces ancres du buffer multiplie par plus de 4,5 l'oubli catastrophique mesure. A l'inverse, enrichir le buffer en ancres mémoire réduit de 63% l'oubli sur les taches a fort conflit et permet un apprentissage continu réussi de deux séquences de taches sur un robot réel. Videos et visualisations sont disponibles sur robot-adaptation.github.io/MemoryAnchors. Pour les intégrateurs qui déploient des politiques robotiques de type VLA en production, l'oubli catastrophique reste un frein concret a la mise a jour continue des flottes: chaque nouvelle compétence ajoutée risque de dégrader des comportements déjà valides sur le terrain. En montrant qu'une fraction minime, environ 10%, du buffer de rejeu porte l'essentiel de la stabilité du système, ce travail suggère que le cout mémoire et calcul de l'apprentissage continu peut baisser sans sacrifier la rétention, un enjeu direct pour les couts de stockage et de reentrainement a l'échelle d'une flotte. La validation sur robot réel, au delà de la simulation LIBERO, renforce la crédibilité de l'approche, même si elle reste limitée a deux séquences de taches et ne démontre pas encore un passage a l'échelle vers des dizaines de compétences. L'approche s'inscrit dans la lignée des méthodes de rehearsal en apprentissage continu, ou le problème central est de choisir quelles expériences rejouer sans faire exploser la taille du buffer ni le temps d'entrainement; l'échantillonnage aléatoire restait jusqu'ici la norme faute de critère fiable. Le benchmark LIBERO, standard pour évaluer l'apprentissage continu de politiques robotiques, sert de terrain de comparaison. Aucun acteur industriel ni déploiement commercial n'est associe a cette publication, qui relève pour l'instant de la recherche académique; les prochaines étapes attendues portent sur l'extension a un plus grand nombre de taches et l'intégration éventuelle de ce critère de sélection dans des pipelines d'entrainement de politiques généralistes.

RecherchePaper
1 source
Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes
4arXiv cs.RO 

Apprentissage de compétences de badminton proches de l'humain pour robots humanoïdes

Un article de recherche révisé sur arXiv (2602.08370v2) présente "Imitation-to-Interaction" (I2I), un framework d'apprentissage par renforcement progressif qui apprend à un robot humanoïde à jouer au badminton. La méthode construit d'abord un a priori moteur à partir de données de mouvement humain, le compresse en une représentation d'état compacte basée sur un modèle, puis stabilise la dynamique via des a priori adversariaux. Une stratégie d'expansion de variété (manifold expansion) généralise ensuite les points de frappe, rares dans les démonstrations expertes disponibles, en un volume d'interaction dense permettant d'intercepter le volant dans une zone continue plutôt qu'à des positions figées. En simulation, le robot maîtrise plusieurs coups caractéristiques comme les lifts (dégagés hauts) et les amortis courts (drop shots). Les auteurs revendiquent le premier transfert "zero-shot" simulation-vers-réel de ces gestes sur un robot humanoïde physique, sans préciser dans le résumé la plateforme utilisée, le nombre de degrés de liberté ni de taux de réussite des frappes. Le badminton combine une coordination corporelle explosive proche de la limite biomécanique et une interception où le timing se compte en dizaines de millisecondes, un défi bien supérieur à celui de la marche ou de la préhension statique en usine. L'enjeu dépasse le sport: la recherche en imitation de mouvement produit souvent des démonstrations visuellement convaincantes mais déconnectées de toute interaction physique fonctionnelle avec un objet dynamique. En affichant un transfert sim-to-real zero-shot sur une frappe à haute vitesse, ce travail s'attaque à l'un des goulots d'étranglement les plus cités du secteur humanoïde, l'écart persistant entre performance simulée et robustesse en conditions réelles. Pour les intégrateurs et décideurs évaluant la maturité des humanoïdes au-delà du pick-and-place répétitif, ce résultat suggère que des architectures combinant a priori de mouvement humain et modèles de dynamique commencent à généraliser à des gestes rapides, précis et non répétitifs. Ce travail prolonge une lignée de recherches en apprentissage par renforcement pour humanoïdes s'appuyant sur des a priori de mouvement adversariaux, technique utilisée pour ancrer des politiques de contrôle dans des captures de mouvement humain sans sacrifier le naturel du geste. Publiée en version révisée sur arXiv, la contribution reste académique à ce stade: le résumé ne cite aucun partenaire industriel, aucune plateforme robotique commerciale ni aucun site de déploiement, et rien n'indique de calendrier de mise en production. Elle s'inscrit dans un mouvement plus large de laboratoires testant la dextérité dynamique des humanoïdes via des tâches sportives, en complément des benchmarks classiques de locomotion et de manipulation statique.

RecherchePaper
1 source