Aller au contenu principal
Plasticité neuronale à seuil d'énergie libre pour l'apprentissage moteur en ligne dans l'interaction physique humain-robot
RecherchearXiv cs.RO 

Plasticité neuronale à seuil d'énergie libre pour l'apprentissage moteur en ligne dans l'interaction physique humain-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (identifiant 2608.23000v1) présente Free-Energy-Gated Plasticity (FEGP), un mécanisme de plasticité synaptique appliqué au réseau Predictive-Coding-inspired Variational Recurrent Neural Network (PV-RNN), un modèle récurrent variationnel inspiré du codage prédictif. FEGP ajuste en continu le taux d'apprentissage effectif du réseau en fonction de l'énergie libre variationnelle, c'est-à-dire de l'écart entre les prédictions internes du modèle et les observations réelles. Lors d'une interaction physique homme-robot en temps réel, un réseau initialisé aléatoirement, sans pré-entraînement hors ligne, sans mécanisme de rejeu (replay) et sans signal explicite de changement de tâche, a appris trois motifs moteurs cycliques distincts, les trois réapparaissant ensuite de façon autonome lors de restitutions (rollouts) sans intervention humaine. Les auteurs ont conduit des expériences contrôlées sur dix séquences d'enseignement générées aléatoirement, chacune testée avec cinq initialisations différentes du réseau, montrant que FEGP améliore nettement la couverture du répertoire de mouvements appris ainsi que la rétention des motifs acquis après leur sortie de la fenêtre d'observation récente.

Ce résultat s'attaque à un problème central pour la robotique collaborative et l'apprentissage embarqué en continu: comment un robot peut-il acquérir de nouveaux comportements moteurs pendant une interaction en direct sans effacer ce qu'il a déjà appris, un phénomène connu sous le nom d'oubli catastrophique. Pour les intégrateurs travaillant sur des cobots ou des interfaces d'enseignement par démonstration, cette approche évite le recours coûteux au pré-entraînement hors ligne ou à des bases de rejeu volumineuses, et suggère qu'un simple signal d'erreur de prédiction, correctement synchronisé dans le temps, suffit à arbitrer entre stabilité et plasticité en ligne.

Le travail s'inscrit dans la lignée des réseaux PV-RNN et du cadre théorique de l'énergie libre issu des neurosciences computationnelles. Les auteurs ont testé deux hypothèses alternatives, un taux d'apprentissage constant calibré sur la moyenne temporelle du gâté, et un rejeu des mêmes valeurs de gain mais désynchronisé, aucune ne reproduisant les gains observés. Cela indique que c'est l'allocation temporelle précise de la plasticité, et non sa seule magnitude moyenne, qui conditionne la rétention. L'article ne précise pas d'institution ni de calendrier de suite, mais ouvre la voie à des tests sur des répertoires moteurs plus larges et des interactions humaines plus complexes.

Dans nos dossiers

À lire aussi

Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot
1arXiv cs.RO 

Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot

Une équipe de chercheurs propose dans un article publié sur arXiv (2606.00459) un contrôleur proportionnel-dérivé (PD) adaptatif capable de limiter l'énergie mécanique d'un robot humanoïde lors d'interactions physiques avec des humains. Le système agit sur les deux composantes énergétiques du robot, énergie cinétique et énergie potentielle, sans nécessiter de capteurs de force externes ni d'estimation de couple articulaire. Les gains du contrôleur sont paramétrables : l'opérateur peut définir précisément le seuil d'énergie limite et la "sharpness", c'est-à-dire la brutalité de la transition entre comportement nominal et comportement contraint. Le contrôleur a été validé sur le robot humanoïde TALOS de PAL Robotics (1,75 m, 95 kg, 32 degrés de liberté), d'abord en simulation, puis sur le hardware réel, confirmant le comportement souple attendu et le respect des limites énergétiques définies. L'intérêt de cette approche réside dans son applicabilité large : la majorité des robots industriels et de service ne disposent pas de capteurs de force six axes ou de couple articulaire, conditions requises par les approches classiques de contrôle d'impédance ou de couple. Un contrôleur basé sur l'énergie, implémentable avec des encodeurs standards et un modèle cinématique, ouvre la voie à une couche de sécurité pHRI sur des plateformes à bas coût ou à architecture fermée. Les auteurs fournissent également une preuve formelle de stabilité avec une condition explicite, ce qui distingue cette contribution des schémas énergétiques antérieurs souvent sans garanties théoriques complètes, un point critique pour toute certification industrielle. PAL Robotics, entreprise barcelonaise spécialisée dans les robots de service et de recherche, fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens, notamment dans le cadre de projets H2020 et Horizon Europe. Le contrôle compliant pour la pHRI est un champ en compétition directe avec les approches à apprentissage par renforcement (RL) et les contrôleurs de type whole-body control (WBC) développés par des équipes comme le DLR, ETH Zurich ou Boston Dynamics. Ce travail s'inscrit dans une tendance plus large visant à sécuriser les humanoïdes sans alourdir leur architecture sensorielle, une contrainte clé pour le déploiement en milieu industriel partagé. La prochaine étape logique serait une validation en scénario de collaboration réelle, avec des humains non prévenus, pour éprouver la robustesse du seuil énergétique face à des contacts imprévus.

UEPAL Robotics (Barcelone) fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens financés par H2020/Horizon Europe ; cette couche de sécurité pHRI sans capteurs de force pourrait être directement intégrée dans les projets de collaboration humain-robot en cours au sein de l'écosystème de recherche européen.

RecherchePaper
1 source
Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique
2arXiv cs.RO 

Vers une intelligence physique semblable à l'humain : apprentissage vision-langage-action continu pour la manipulation robotique

Des chercheurs proposent LifelongVLA, un nouveau framework d'apprentissage continu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique, décrit dans un article publié sur arXiv (2607.14852). Le système s'attaque à un problème classique de l'apprentissage séquentiel chez les robots : le compromis plasticité-stabilité, c'est-à-dire la capacité d'apprendre une nouvelle tâche sans effacer les compétences acquises précédemment. Concrètement, LifelongVLA introduit un module de gating LoRA à double échelle temporelle, séparant l'adaptation en deux voies légères : un adaptateur court terme pour la plasticité (apprentissage rapide de nouvelles tâches) et un adaptateur long terme pour la consolidation stable des compétences déjà maîtrisées. Une passerelle "task-aware" arbitre entre les deux. Le framework ajoute aussi une stratégie de rejeu ("replay") stochastique et économe en mémoire cache, qui préserve des signaux de rétention équilibrés sans avoir à stocker les trajectoires complètes des tâches passées. Les auteurs rapportent des résultats supérieurs aux méthodes existantes sur un bras robotique xArm en conditions réelles, avec une expansion efficace des compétences et une meilleure rétention des comportements de manipulation déjà appris. Cette avancée cible un angle mort réel des modèles VLA actuels (type Pi-0, GR00T N2 ou Helix) : la plupart sont entraînés une fois puis figés, ou doivent être ré-entraînés intégralement pour intégrer une nouvelle tâche, ce qui est coûteux et impraticable pour un déploiement industriel évolutif. Si un robot déployé en usine ou en entrepôt doit apprendre continuellement de nouvelles manipulations sans tout ré-apprendre à chaque fois ni oublier les précédentes, une méthode d'adaptation légère et peu gourmande en mémoire comme celle-ci intéresse directement les intégrateurs et décideurs qui cherchent à réduire les coûts de ré-entraînement et les temps d'arrêt liés à la mise à jour des compétences robotiques. C'est un pas vers des flottes de robots capables de monter en compétences sur site plutôt que de dépendre d'un redéploiement complet du modèle depuis un data center. Le travail s'inscrit dans la lignée de la recherche en "continual learning" appliquée à la robotique, un domaine longtemps dominé par les architectures de vision classique avant l'essor des VLA génératifs à grande échelle. Contrairement aux approches de fine-tuning complet ou à certaines méthodes de rejeu qui nécessitent de stocker l'intégralité des trajectoires passées (coûteux en stockage et en calcul), LifelongVLA mise sur des adaptateurs LoRA légers, une technique déjà largement utilisée pour le fine-tuning efficace des grands modèles de langage, ici transposée au contrôle robotique. L'article ne mentionne pas de partenaire industriel ni de déploiement commercial ; il s'agit d'un travail de recherche académique testé sur un seul bras xArm, avec des perspectives de validation à plus grande échelle et sur des plateformes robotiques plus variées à confirmer.

RechercheActu
1 source
L'enseignement comme processus : le cadre TOSS pour modéliser les décisions humaines d'enseignement dans l'apprentissage robotique interactif
3arXiv cs.RO 

L'enseignement comme processus : le cadre TOSS pour modéliser les décisions humaines d'enseignement dans l'apprentissage robotique interactif

Une étude exploratoire menée auprès de 34 participants (N=34) documente pour la première fois la logique intuitive que les humains appliquent lorsqu'ils enseignent à un robot par apprentissage par renforcement (RL). Les chercheurs ont fait observer aux participants deux scénarios distincts de RL robotique et ont analysé 204 réponses d'enseignement intuitif, réparties sur trois phases d'apprentissage du robot (précoce, intermédiaire, tardive). L'analyse révèle que les décisions d'enseignement ne sont pas de simples signaux de récompense ponctuels, mais forment un réseau structuré de quatre composantes: des déclencheurs (situations qui incitent à intervenir), des objectifs (ce que l'enseignant cherche subjectivement à obtenir), des signaux (les actes de communication effectivement produits) et des stratégies (une logique de pilotage de plus haut niveau). Les participants endossent spontanément des rôles différents selon les moments, tantôt coach, tantôt ingénieur, tantôt concepteur, avec des priorités d'objectifs qui varient en conséquence. Ces résultats sont formalisés dans le cadre théorique TOSS (Trigger-Objective-Signal-Strategy), publié le 24 août 2026 sur arXiv (2608.21083). Cette recherche met en évidence un décalage entre la manière dont les algorithmes de RL interactif attendent un retour humain, généralement un signal de récompense simple et homogène, et la façon dont les humains enseignent réellement, de manière contextuelle, changeante et stratégique. Pour les équipes qui conçoivent des pipelines d'apprentissage par démonstration ou des interfaces de feedback humain pour robots, ce constat suggère que les hypothèses simplificatrices actuelles limitent l'efficacité de l'apprentissage interactif et que des architectures capables d'intégrer des rôles et objectifs multiples pourraient mieux exploiter l'expertise humaine. Le travail s'inscrit dans le champ de l'interaction humain-robot appliquée à l'apprentissage par renforcement interactif, où la modélisation du comportement de l'enseignant humain reste peu formalisée malgré son rôle central dans l'apprentissage supervisé par démonstration. Les auteurs mettent à disposition un jeu de données ouvert accompagnant le cadre TOSS, destiné à servir de base pour simuler des oracles humains réalistes et concevoir de nouveaux algorithmes de RL ainsi que des interfaces d'enseignement centrées sur l'humain, au-delà des contraintes des configurations actuelles.

RecherchePaper
1 source
Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques
4arXiv cs.RO 

Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques

Un preprint publié sur arXiv (arXiv:2608.24741v1, août 2026) présente une méthode de Learning from Demonstration (LfD) qui modélise explicitement les interactions physiques entre un robot et son environnement, notamment la création et la rupture de contact pendant une manipulation. Un contrôleur hybride position-force suit la trajectoire démontrée par un humain jusqu'à ce que les conditions de transition liées au contact, identifiées durant cette démonstration, soient atteintes. La méthode a été validée sur un robot réel via quatre tâches riches en contacts, ouverture de portes et de serrures, prise et vissage de boulons, dégagement d'objets coincés et suivi de contour de surface, chacune apprise à partir d'une seule démonstration et sans connaissance préalable de la tâche. Cette approche tranche avec la tendance dominante de la manipulation robotique, où les modèles vision-langage-action (VLA) à grande échelle exigent des milliers de démonstrations pour généraliser. En rendant explicite la physique du contact plutôt que de la confier à un réseau de neurones opaque, les auteurs visent une interprétabilité rare dans la littérature du LfD, où l'on sait précisément pourquoi et quand le robot change de comportement. Pour des intégrateurs industriels confrontés à des tâches d'assemblage ou de maintenance à forte variabilité géométrique, comme le boulonnage ou le verrouillage, l'intérêt tient à une programmation par démonstration unique, robuste aux variations imprévues et généralisable quand ces variations sont connues à l'avance, ce qui contredit l'idée que seule l'échelle des données garantit une manipulation fiable. Le travail s'inscrit dans un courant du LfD qui, selon les auteurs, néglige généralement la modélisation explicite du contact physique, alors que celui-ci est central dans la plupart des tâches de manipulation réelles. Ils présentent leur contribution comme un moyen de combler cette lacune d'interprétabilité en apprentissage à partir de très peu d'exemples, en détaillant comment robustesse, généralisation et adaptabilité peuvent être implémentées explicitement plutôt que laissées à l'apprentissage statistique. Publié comme preprint non encore évalué par les pairs, sans indication d'institution ni de calendrier de valorisation industrielle, il se positionne comme une contribution méthodologique plutôt qu'un produit, dans un paysage de la manipulation robotique dominé par des modèles fondationnels de type VLA entraînés sur de vastes corpus de démonstrations.

RecherchePaper
1 source