Aller au contenu principal
Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs
FR/EU ecosystemearXiv cs.RO 

Gestes robotiques naturels et expressifs via un apprentissage par renforcement itératif avec retours humains et LLMs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en juin 2026 (arXiv:2606.18747) un système permettant au robot humanoïde Pepper de générer des gestes co-verbaux naturels à l'exécution, sans recours à des animations préprogrammées. L'architecture combine ChatGPT pour la génération de code gestuel en langage naturel, couplée à un pipeline d'apprentissage par renforcement à partir de retours humains (RLHF) appliqué de manière itérative. Des utilisateurs évaluent les gestes produits par Pepper lors d'une étude comparative, ces préférences servant de signal de récompense pour affiner le modèle de langage. Résultat annoncé : des mouvements jugés plus expressifs, pertinents et fluides qu'avec le seul pipeline LLM de base.

L'enjeu est significatif pour les intégrateurs de robots sociaux. Aujourd'hui, la quasi-totalité des comportements gestuels déployés en production repose sur des bibliothèques d'animations conçues à la main par des experts, ce qui rend les robots rigides face à des contextes conversationnels imprévus. Les approches par apprentissage automatique peinent à capturer la naturalité perçue, un critère subjectif qui se dégrade à mesure que le nombre de degrés de liberté augmente. Ce travail propose une alternative concrète : utiliser un LLM comme générateur de comportements moteurs au runtime, puis le corriger via RLHF pour coller aux préférences réelles des utilisateurs. C'est une transposition directe de la méthode qui a rendu ChatGPT lui-même plus utile, appliquée ici au domaine de la communication non verbale humain-robot. Les résultats restent néanmoins issus d'une étude utilisateur contrôlée, pas d'un déploiement à grande échelle.

Pepper est le robot social d'Aldebaran Robotics, société française rachetée par SoftBank en 2012, aujourd'hui commercialisé dans les secteurs retail, accueil et éducation. Après une phase de déception commerciale liée précisément à la rigidité comportementale du robot, plusieurs équipes académiques cherchent à relancer son potentiel via des couches IA génératives. Sur ce terrain, Pepper fait face à une concurrence croissante des agents conversationnels incarnés (avatars AR/VR) et de nouvelles plateformes comme Enchanted Tools (France) avec son robot Miroki, conçu dès l'origine pour une expressivité naturelle. La prochaine étape logique serait un déploiement en contexte réel pour mesurer le gap entre l'évaluation en laboratoire et l'acceptation en environnement ouvert, une question que les auteurs n'adressent pas encore.

Impact France/UE

Des travaux académiques sur Pepper (Aldebaran, origine française rachetée par SoftBank) appliquant l'RLHF à la gestualité co-verbale ouvrent une voie concrète pour réhabiliter cette plateforme en production, dans un contexte où Enchanted Tools (France) cherche à s'imposer sur le segment des robots sociaux expressifs avec Miroki.

À lire aussi

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes
1arXiv cs.RO 

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes

Des chercheurs du Dynamic Legged Systems Lab de l'Istituto Italiano di Tecnologia (IIT) proposent sur arXiv (prépublication 2506.25965) une architecture de contrôle modulaire pour robots à pattes conçue pour maintenir la locomotion en cas de panne d'actionneur. Le système repose sur un mélange d'experts (Mixture-of-Experts, MoE) piloté par apprentissage par renforcement : un module de diagnostic identifie en temps réel le type de défaillance (joint bloqué, couple réduit, actionneur hors service), puis active l'expert spécialisé correspondant parmi plusieurs politiques de contrôle distinctes, chacune entraînée pour un mode de panne spécifique. Les expériences menées dans le simulateur IsaacLab montrent que ces politiques modulaires surpassent systématiquement des politiques monolithiques de taille comparable sur l'ensemble des scénarios de panne évalués. L'architecture conserve de surcroît des performances compétitives avec une capacité réseau significativement réduite, un critère déterminant pour les plateformes embarquées à ressources de calcul limitées, notamment en contexte d'exploration planétaire. Ce résultat adresse un angle mort persistant du déploiement hors-laboratoire des robots à pattes : la robustesse aux défaillances matérielles en cours de mission. Les politiques monolithiques entraînées par RL, qui ont produit des performances remarquables sur terrain accidenté (ANYmal d'ETH Zurich, Spot de Boston Dynamics, MIT Cheetah), supposent implicitement l'intégrité de l'ensemble des actionneurs. Injecter explicitement l'état diagnostiqué de panne dans la boucle de décision permet à chaque expert de se spécialiser sur un sous-espace comportemental bien délimité, ce qui explique leur supériorité même à capacité réduite. Pour un intégrateur ou un concepteur de mission, l'architecture MoE trace une voie concrète vers des robots capables de poursuivre une mission malgré une défaillance partielle, sans intervention humaine ni recalibration à distance. L'IIT est l'un des laboratoires européens de référence en robotique à pattes, à l'origine de la lignée hydraulique HyQ et HyQReal. La cible applicative explicitement déclarée par les auteurs est l'exploration planétaire, domaine où l'ESA et la NASA cherchent activement des solutions de mobilité résiliente pour des rovers de nouvelle génération. Les approches concurrentes, notamment les politiques adaptatives basées sur l'estimation d'état développées par le Robotics Systems Lab de l'ETH Zurich sur ANYmal, n'exploitent pas aussi directement l'information de diagnostic pour router dynamiquement vers des experts dédiés par mode de panne. Le code est publié en open source sur GitHub (dépôt iit-DLSLab/fault-locomotion-isaaclab) sous IsaacLab, ce qui facilite la reproductibilité et l'adoption par la communauté. Prochaine étape attendue : validation sur plateforme physique, les résultats actuels étant entièrement en simulation.

UEL'IIT, laboratoire européen de référence en robotique à pattes, publie une architecture MoE open source pour la locomotion tolérante aux pannes, offrant une base directement exploitable pour les programmes de rovers résilients de l'ESA.

FR/EU ecosystemePaper
1 source
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
2Interesting Engineering 

Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement

Mimic Robotics, société suisse de robotique physique, a dévoilé FLUX-mimic, un modèle vidéo-action de nouvelle génération développé avec Black Forest Labs, capable d'enseigner à des robots industriels des tâches de manipulation fine à partir de simples démonstrations vidéo. Le système s'appuie sur FLUX 3, le modèle de génération vidéo de Black Forest Labs, associé à un décodeur d'actions qui traduit les prédictions visuelles en mouvements robotiques exécutables. Selon Mimic Robotics, FLUX-mimic peut être affiné pour certaines tâches avec seulement 30 minutes de démonstrations robotiques, contre 30 heures ou plus pour les pipelines d'apprentissage conventionnels, un écart présenté par l'entreprise elle-même et donc à prendre avec la prudence habituelle réservée aux chiffres communiqués par le fournisseur. La technologie est actuellement déployée chez le constructeur automobile Audi, dans le cadre d'une évaluation portant sur l'automatisation de tâches à haute dextérité impliquant des matériaux flexibles et une manipulation fine. Cette annonce s'inscrit dans un débat plus large sur la viabilité des modèles vidéo-action (VAM) face aux modèles vision-langage-action (VLA) désormais dominants, à l'image de Pi-0 ou GR00T N2. Contrairement à ces derniers, pré-entraînés sur des paires image-texte statiques et devant apprendre la physique quasi exclusivement via des démonstrations robotiques coûteuses, FLUX-mimic part d'un modèle vidéo déjà entraîné à grande échelle sur la dynamique des objets et des mouvements, ce qui réduirait drastiquement le volume de données spécifiques à collecter. Si la promesse se vérifie en production, elle répond directement à l'un des principaux obstacles à la commercialisation de la robotique industrielle par apprentissage: le coût et la lenteur de la collecte de démonstrations pour chaque nouvelle tâche. Une réduction du cycle de déploiement de plusieurs mois à quelques semaines, telle qu'annoncée, changerait significativement le calcul économique pour les intégrateurs face à des tâches variables et peu standardisées, typiquement délaissées par l'automatisation classique programmée manuellement. FLUX-mimic prolonge les travaux antérieurs de Mimic Robotics sur les modèles vidéo-action, avec une architecture désormais pensée spécifiquement pour l'IA physique en environnement industriel. Le partenariat avec Audi, dont les usines affichent déjà un fort taux d'automatisation, sert de banc d'essai pour mesurer si ces systèmes d'apprentissage tiennent la route hors laboratoire, un test que beaucoup d'approches VLA ou VAM concurrentes n'ont pas encore passé à cette échelle. Les deux partenaires évoquent des perspectives d'extension à d'autres opérations de fabrication et de logistique, sans toutefois communiquer de calendrier précis ni de métriques de performance en production, ce qui place pour l'instant cette collaboration au stade du pilote d'évaluation plutôt que du déploiement industriel validé.

UEAudi teste FLUX-mimic dans ses usines allemandes pour automatiser des tâches de manipulation fine, un cas concret d'adoption industrielle en Europe qui pourrait influencer d'autres constructeurs automobiles de l'UE si le pilote se confirme.

FR/EU ecosystemeActu
1 source
Coherence Guard : Palm Garden AI développe une couche décisionnelle relationnelle pour les robots interagissant avec les humains
3The Robot Report 

Coherence Guard : Palm Garden AI développe une couche décisionnelle relationnelle pour les robots interagissant avec les humains

Palm Garden AI, entreprise basée en Allemagne et en Thaïlande, développe Coherence Guard, une couche logicielle décrite comme « agnostique de plateforme » destinée aux robots en interaction directe avec des humains. Selon Joachim Scheuerer, PDG de l'entreprise, ce module ne remplace ni la perception, ni la planification de mouvement, ni l'apprentissage par renforcement, ni les piles de contrôle robotique existantes. Il s'insère plutôt comme une couche d'évaluation pré-action : avant qu'un robot exécute un geste, Coherence Guard évalue si l'action est « relationnellement cohérente » dans un environnement humain réel, en tenant compte du timing, de la proximité, des demandes de limites, du ton émotionnel, de la préservation de la confiance et du retrait respectueux. Le système s'appuie sur l'infrastructure comportementale ANATTA 9 de Palm Garden, bâtie sur le système d'exploitation cloud Transwarp (TCOS), et se positionne au-dessus ou à côté des piles de contrôle robotique classiques (SDK/API, ROS 2, planification, modèles du monde). Baptisé Relational Infrastructure Framework (RIF), ce cadre ajoute une compréhension des rôles, intentions, vulnérabilités et conséquences futures possibles, là où les modèles du monde physique se limitent aux objets, à l'espace et au mouvement. Le RIF est disponible sur demande auprès de Palm Garden AI. À mesure que les robots humanoïdes et robots de service se dirigent vers l'hospitalité, les soins, le commerce de détail, l'éducation, le guidage et le domicile, la gestion des interactions sociales devient un enjeu aussi critique que la mobilité ou la manipulation. Palm Garden AI parie que cette couche relationnelle deviendra une catégorie d'infrastructure nécessaire, au même titre que la perception ou la planification de trajectoire. Pour les intégrateurs et décideurs B2B, l'annonce pointe un angle mort du secteur : la plupart des piles robotiques actuelles savent naviguer, parler et exécuter des tâches, mais ne savent pas juger si un geste techniquement possible est socialement approprié, par exemple continuer une tâche alors qu'une personne exprime un malaise. Ce type de défaillance, plus subtil qu'une panne technique, peut pourtant déterminer l'acceptabilité sociale d'un robot en environnement réel et donc sa commercialisation effective. Reste que Coherence Guard, comme beaucoup d'annonces du secteur, en est au stade du cadre logiciel disponible sur demande plutôt que du produit déployé à grande échelle : aucun chiffre de déploiement, aucun partenaire robotique nommé, aucun benchmark quantitatif indépendant n'accompagne l'annonce, ce qui invite à la prudence sur la portée réelle de la technologie à ce stade. Le concept trouve son origine dans l'expérience de Palm Garden Retreat, un établissement en Thaïlande où l'équipe a observé pendant trois ans des situations d'interaction humaine structurées : arrivée, orientation, silence, vulnérabilité, construction de confiance, malentendu et retrait respectueux. Scheuerer cite comme « benchmark » simple le retrait respectueux : si une personne montre un signe d'inconfort ou demande de l'espace, le robot doit interrompre sa tâche, reconnaître le signal, augmenter la distance si nécessaire, réduire son intensité expressive et revenir à un état neutre. Ces comportements de base couvrent aussi l'accueil et l'orientation, la présence de soutien, l'assistance non intrusive, l'escalade en cas d'incertitude élevée et l'explication préservant la cohérence. Palm Garden AI se positionne ainsi sur un segment encore peu occupé, distinct des efforts des grands acteurs de la robotique humanoïde (Figure, Tesla avec Optimus, ou les modèles VLA comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure), qui se concentrent d'abord sur la manipulation et la mobilité générale. Aucun calendrier de déploiement pilote ni partenaire intégrateur n'a été communiqué à ce stade ; l'entreprise indique seulement que le RIF est accessible sur demande.

UEPalm Garden AI, entreprise basée en Allemagne, développe cette couche logicielle relationnelle, renforçant l'écosystème européen sur un segment encore peu occupé de l'interaction homme-robot.

FR/EU ecosystemeActu
1 source
Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines
4Interesting Engineering 

Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines

La startup française UMA a dévoilé le design de son premier robot humanoïde alimenté par IA lors du Machina Summit à Paris. L'engin affiche des proportions à taille humaine, une visière neutre en guise de visage plutôt qu'un visage anthropomorphe, et des articulations mécaniques volontairement visibles. UMA vise en priorité les usines, les entrepôts et les centres logistiques, avec un usage domestique envisagé à terme, et fait de l'Europe son premier marché de déploiement. La société a présenté en parallèle son architecture "Real-Time Learning", un système d'IA qui permet au robot d'apprendre de nouvelles tâches par démonstration humaine plutôt que par programmation manuelle : il observe une tâche, s'entraîne, s'adapte aux conditions changeantes et améliore ses performances avec l'expérience. Aucune spécification technique détaillée (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade. "Les robots humanoïdes mettront des années à atteindre un déploiement à grande échelle, tout comme Internet et les smartphones ont eu besoin de temps avant de transformer des industries entières", a déclaré Rémi Cadène, PDG et cofondateur d'UMA. L'annonce intervient peu après le dévoilement par l'américain Weave Robotics de son robot domestique Isaac 1, capable de ranger une pièce ou faire la lessive avec assistance humaine à distance. Pour les intégrateurs et décideurs industriels, ce pari sur l'apprentissage par démonstration illustre un basculement plus large du secteur : remplacer la programmation tâche par tâche par des modèles capables de généraliser, la même logique que poursuivent les architectures VLA (vision-language-action) de Physical Intelligence ou de NVIDIA. Si la promesse tient, elle réduirait le temps et le coût d'intégration d'un robot dans une chaîne existante, un frein majeur à l'adoption des humanoïdes en usine. Il faut toutefois noter qu'UMA n'a pour l'instant montré qu'un design et un concept d'architecture, sans vidéo de démonstration ni métrique de performance vérifiable : il s'agit d'une annonce de positionnement, pas d'un produit livré ni d'un déploiement réel. Le choix explicite d'une visière neutre plutôt qu'un visage humain, et l'exposition volontaire des articulations, traduit une volonté de se démarquer des démonstrations spectaculaires façon Tesla Optimus ou Figure, au profit d'un discours centré sur la fiabilité industrielle de long terme plutôt que sur l'effet de démonstration publique. UMA a été cofondée par Rémi Cadène, connu pour avoir dirigé le projet LeRobot chez Hugging Face, une bibliothèque open-source d'apprentissage par imitation qui a contribué à démocratiser l'entraînement de robots par démonstration, un héritage direct dans l'architecture Real-Time Learning présentée aujourd'hui. La startup entre sur un marché déjà occupé par les géants américains (Tesla avec Optimus, Figure et son modèle Helix, Physical Intelligence avec Pi-0) et chinois (Unitree, UBTech), ainsi que par des humanoïdes grand public comme Isaac 1 de Weave Robotics. Face à cette concurrence, UMA mise sur l'écosystème industriel et de recherche européen ainsi que sur la pénurie de main-d'œuvre du continent pour justifier son positionnement. Aucun calendrier précis de commercialisation ni de pilotes clients n'a été communiqué au-delà de cette présentation du design, ce qui laisse ouverte la question du délai entre ce concept et un déploiement industriel effectif.

UEUMA est une startup française qui fait de l'Europe son premier marché de déploiement pour un robot humanoïde industriel, renforçant l'écosystème robotique franco-européen face à la concurrence américaine et chinoise.

FR/EU ecosystemeOpinion
1 source