Aller au contenu principal
Robots humanoïdes expressifs : la confiance grandit, mais les erreurs la font chuter rapidement
RechercheInteresting Engineering 

Robots humanoïdes expressifs : la confiance grandit, mais les erreurs la font chuter rapidement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Robots humanoïdes expressifs : la confiance grandit, mais les erreurs la font chuter rapidement
▶ Voir sur YouTube

Une étude de l'université Drexel montre que la confiance envers les robots humanoïdes expressifs s'effondre plus vite qu'elle ne s'était installée dès la première erreur. Cinquante adultes ont interagi avec Pepper, robot conçu à l'origine par la société française Aldebaran Robotics avant son rachat par SoftBank, décliné en deux versions : l'une expressive, avec contact visuel, hochements de tête, gestes et acquiescements verbaux type "uh-huh" ; l'autre immobile, délivrant le même dialogue scripté sans aucun signal non verbal. Chaque participant a suivi trois sessions, les deux premières sans erreur pour établir la confiance, la troisième introduisant volontairement des ratés conversationnels (réponses hors sujet, interruptions, raisonnements incohérents, demandes de répétition) plutôt que des pannes mécaniques. Fait rare pour ce type d'étude, les chercheurs ont croisé quatre mesures simultanées : activité cérébrale par spectroscopie proche infrarouge fonctionnelle (fNIRS) portable, taux d'ocytocine salivaire, notes de confiance déclarées et décisions comportementales réelles.

Le robot expressif captait davantage l'attention et influençait plus les choix des participants tant qu'il ne se trompait pas. Mais dès l'apparition d'erreurs, sa capacité à peser sur les décisions a chuté de plus de moitié, un effondrement plus marqué que pour la version immobile. Les IRM ont montré que les erreurs du robot expressif activaient le cortex préfrontal dorsolatéral et médian, zones impliquées dans le raisonnement social, signe que les participants traitaient ces ratés comme une trahison sociale plutôt qu'un simple bug technique. À l'inverse, les erreurs du robot immobile étaient perçues comme de simples défaillances système, avec une réaction neurale plus faible. Pour les concepteurs de robots sociaux destinés à la santé, l'éducation, le service client ou le domicile, le message est clair : plus un robot paraît humain, plus l'expérience utilisateur devient fragile face à l'erreur, ce qui interroge directement les stratégies actuelles misant sur l'expressivité pour vendre l'adoption.

Résultat inattendu, l'ocytocine, hormone habituellement associée au lien social, augmentait après les erreurs des deux robots alors même que la confiance chutait. Les chercheurs y voient un signal de vigilance accrue face à un comportement social jugé peu fiable, plutôt qu'un marqueur d'attachement renforcé. Contrairement aux études précédentes sur la confiance homme-robot, majoritairement fondées sur de simples questionnaires déclaratifs, ce protocole multimodal permet d'observer en temps réel la dynamique neurologique, physiologique et comportementale des interactions. L'étude ne fournit pas de calendrier de déploiement ni d'acteur industriel précis pour intégrer ces résultats, mais elle pose un jalon méthodologique pour l'évaluation des interfaces sociales robotiques, à un moment où healthcare, retail et éducation multiplient les pilotes avec des humanoïdes conversationnels.

À lire aussi

Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes
1arXiv cs.RO 

Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes

Des chercheurs de l'IHMC (Institute for Human and Machine Cognition) ont publié une thèse présentant un système de pilotage comportemental pour robots humanoïdes, conçu pour combiner locomotion et manipulation d'objets en temps réel dans des environnements industriels non structurés. Le système, déployé sur cinq plateformes distinctes, le DRC Atlas de Boston Dynamics, le Valkyrie de la NASA, le Nadia d'IHMC et Boardwalk Robotics, le H1-2 d'Unitree et l'Alex d'IHMC, permet à un opérateur de créer, modifier et superviser des comportements directement pendant l'exécution, sans arrêt du robot. La bibliothèque de comportements couvre plus de vingt variantes de tâches réelles : ouverture de portes à poignée rotative, barre anti-panique ou levier, séquences d'exploration multi-étapes, désencombrement d'obstacles et manipulation réactive de surface à surface. Ce travail s'attaque à l'un des verrous fondamentaux de la robotique humanoïde commerciale : la fragilité des comportements face à la variabilité du monde réel. En combinant des "Affordance Templates" centrés sur les objets, une logique inspirée des Behavior Trees et une couche de perception éditable à l'exécution, l'architecture permet d'adapter, d'étendre ou de composer des comportements existants en quelques minutes à quelques heures. C'est une rupture significative par rapport aux pipelines d'apprentissage bout-en-bout, type VLA (Vision-Language-Action), qui nécessitent des cycles d'entraînement longs pour toute nouvelle tâche. Le système repose sur un contrôleur corps-entier autorisant le mouvement des bras pendant la marche, avec un algorithme de superposition d'actions concurrentes pour accélérer les cycles. Le contexte académique est celui du DARPA Robotics Challenge (2013-2015), dont les principes de "Coactive Design", observabilité maximale, prédictibilité, directivité, ont structuré toute l'architecture. Cette thèse constitue une capitalisation de plusieurs années de déploiements multi-robots au sein de l'IHMC, laboratoire fédéral américain historiquement centré sur la locomotion bipède. Face aux approches concurrentes purement end-to-end de Figure AI, Physical Intelligence (pi0) ou Tesla Optimus, ce système positionne un pôle alternatif : contrôle symbolique hybride, intervention opérateur en boucle courte, portabilité multi-plateforme. La prochaine étape naturelle serait une intégration avec des politiques apprises pour les sous-tâches de manipulation fine, comblant le gap sim-to-real que ni l'approche symbolique ni l'apprentissage seul ne résolvent pleinement à ce stade.

RecherchePaper
1 source
Robot humanoïde marche sur sable, gravier et pentes grâce à un cadre d'entraînement plus rapide
2Interesting Engineering 

Robot humanoïde marche sur sable, gravier et pentes grâce à un cadre d'entraînement plus rapide

Des chercheurs du Georgia Institute of Technology ont mis au point un nouveau cadre d'apprentissage automatique baptisé « Learn to Teach » (L2T), qui permet à un robot humanoïde bipède de marcher sur du sable, du gravier, de l'herbe détrempée, des pentes, des escaliers et des surfaces glissantes, tout en réduisant nettement le temps et la puissance de calcul nécessaires à l'entraînement du contrôleur. Contrairement à l'apprentissage classique par renforcement de type enseignant-élève, où un modèle « professeur » est d'abord entraîné en simulation avant de transmettre ses connaissances à un modèle « élève » qui pilote le robot réel, la méthode de Georgia Tech entraîne les deux agents simultanément. Selon Feiyang Wu, chercheur principal du projet, l'approche séquentielle classique pose deux problèmes : elle prend trop de temps et gaspille une partie des informations collectées par le professeur en cours d'apprentissage. Le contrôleur a été testé sur un robot humanoïde grandeur nature dans le laboratoire du professeur associé Ye Zhao, où l'équipe a aussi poussé et tiré la machine pendant les essais pour observer sa capacité à ajuster sa démarche et rester stable. Les travaux ont été présentés à l'ICRA (IEEE International Conference on Robotics and Automation). Cette avancée s'attaque à un goulot d'étranglement bien identifié dans la robotique humanoïde : l'entraînement de contrôleurs en simulation nécessite souvent des heures de calcul sur du matériel GPU coûteux, un frein direct à l'itération rapide et au déploiement à grande échelle. En faisant apprendre le professeur et l'élève en parallèle, et en permettant au professeur de tirer des enseignements de l'expérience de l'élève, l'équipe réduit ce que les roboticiens appellent le « fossé d'imitation » entre les conditions idéalisées de la simulation et la réalité du terrain, un problème central dans le débat sur le fameux « sim-to-real gap ». Fait notable, le même contrôleur généraliste a surpassé le logiciel fourni par le fabricant du robot sur plusieurs types de terrains, sans nécessiter de contrôleurs distincts par environnement, ce qui illustre la valeur d'une recherche en apprentissage automatique directement confrontée au monde réel plutôt qu'à des démonstrations scénarisées. Wu reconnaît que l'équipe ne s'attendait pas elle-même à une telle polyvalence pour un robot humanoïde aussi volumineux, la locomotion agile sur terrain accidenté n'ayant jusqu'ici jamais été véritablement démontrée pour ce type de machine. Au-delà de la marche, les chercheurs estiment que le cadre « Learn to Teach » pourrait s'appliquer à d'autres architectures de robots et à des tâches variées exigeant un déplacement fiable en environnement imprévisible, ouvrant une piste de recherche transférable bien au-delà du seul cas d'usage testé à Atlanta.

RecherchePaper
1 source
MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares
3arXiv cs.RO 

MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares

Des chercheurs ont publié sur arXiv (2606.10288) MARCH, un cadre d'apprentissage par renforcement assisté par modèles pour la locomotion bipedale sur appuis épars. La méthode repose sur trois étapes : générer une trajectoire de référence sûre à partir de modèles dynamiques simplifiés, entraîner une politique "enseignante" guidée par un reward basé sur une Control Lyapunov Function (CLF), puis distiller cette politique dans une politique "étudiante" visuelle déployable sur robot réel. L'ensemble a été validé en simulation et déployé sur un Unitree G1, humanoïde commercialisé autour de 16 000 dollars, naviguant sur des appuis épars avec contraintes latérales. L'enjeu est de réconcilier deux familles de méthodes historiquement opposées : les approches basées modèle (MPC, optimisation de contact) sont précises mais fragiles face à l'incertitude de terrain, tandis que le RL pur est robuste mais peine à découvrir les mouvements finement contraints nécessaires à la locomotion safety-critical, où une erreur de quelques centimètres peut provoquer une chute. Le reward CLF injecte une connaissance physique dans la boucle d'apprentissage sans curriculum d'entraînement complexe, améliorant l'efficacité d'échantillonnage et produisant une locomotion plus fluide. Les performances sur stepping stones sont déclarées comparables aux baselines RL purs, ce qui suggère que l'hybridation modèle/apprentissage est viable à coût computationnel comparable. Ce travail s'inscrit dans l'axe locomotion perceptive porté par ETH Zurich (parkour RL, 2023), Carnegie Mellon et Berkeley. La distillation teacher-student, popularisée par Agility Robotics et ANYbotics dans leurs pipelines de développement, est ici enrichie d'une contrainte CLF théoriquement fondée. Le Unitree G1 est devenu une plateforme quasi-standard dans les labos de locomotion pour sa documentation et son prix accessible. Il s'agit d'un preprint arXiv non évalué par les pairs, sans déploiement industriel ni timeline commerciale annoncés. Les prochaines étapes naturelles seraient une validation sur terrain extérieur non structuré et une comparaison directe avec les approches MPC de nouvelle génération.

UEImpact marginal : ETH Zurich (Suisse, hors UE) est cité en travaux connexes, mais aucun labo ou industriel européen n'est directement impliqué dans ce preprint.

RecherchePaper
1 source
MotionDisco : découverte de mouvements pour la loco-manipulation extrême des robots humanoïdes
4arXiv cs.RO 

MotionDisco : découverte de mouvements pour la loco-manipulation extrême des robots humanoïdes

Des chercheurs ont publié sur arXiv (réf. 2606.06139, juin 2026) MotionDisco, un cadre méthodologique capable de générer automatiquement des séquences de mouvements corps entier pour robots humanoïdes, sans recourir à la téleopération ni au retargeting de mouvements humains. Le système couple une recherche évolutionnaire guidée par un grand modèle de langage (LLM) sur des séquences d'interactions de contact, un optimiseur de trajectoire cinodynamique séquentiel et une stratégie d'élagage. Les trajectoires ainsi découvertes servent à entraîner des politiques de suivi par apprentissage par renforcement (RL), déployées ensuite sur un robot humanoïde physique dans des tâches de loco-manipulation longue durée. Des études d'ablation documentent que la recherche guidée par LLM produit des trajectoires corps entier cohérentes sur plusieurs tâches à long horizon impliquant des contacts riches avec l'environnement. L'enjeu principal est de contourner la téleopération, aujourd'hui le principal mode d'acquisition de données pour les humanoïdes en manipulation, approche coûteuse et difficile à passer à l'échelle. La difficulté est fondamentalement combinatoire: le nombre d'interactions de contact possibles croît exponentiellement avec l'horizon temporel et le nombre d'objets en scène. En automatisant la découverte de compétences, MotionDisco ouvre une voie potentiellement scalable pour les intégrateurs industriels sans infrastructure de téleopération. Le transfert sim-to-real sur robot physique est démontré, ce qui distingue ce travail de nombreuses contributions demeurant en simulation. Les auteurs revendiquent une première mondiale: la découverte et le déploiement de compétences humanoïdes loco-manipulation longue durée par recherche évolutionnaire entièrement automatisée, une affirmation qui reste à valider indépendamment par la communauté. Ce travail s'inscrit dans un paysage où les principaux acteurs humanoïdes, tels que Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Unitree et NVIDIA (GR00T N2), misent massivement sur la téleopération et les démonstrations humaines pour entraîner leurs politiques de manipulation. L'utilisation d'un LLM comme moteur de recherche pour guider l'exploration de contacts s'apparente aux travaux récents sur les VLA (Vision-Language-Action models), mais positionnée en amont comme générateur de curriculum plutôt que comme politique de contrôle direct. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article, qui demeure une contribution de recherche fondamentale sans affiliation ou plateforme matérielle spécifiée. Les extensions naturelles porteraient sur des scènes multi-objets plus complexes et la validation sur une gamme élargie de plateformes humanoïdes commerciales.

RecherchePaper
1 source