Aller au contenu principal
Mind the Context : apprentissage continu d'actions robotiques socialement appropriées via dissociation environnement-social
RecherchearXiv cs.RO 

Mind the Context : apprentissage continu d'actions robotiques socialement appropriées via dissociation environnement-social

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe affiliée au groupe de recherche Cambridge-AFAR a publié le 14 août 2026 sur arXiv (référence 2608.13448) un article présentant EDD, pour Explicit Disentanglement Dual-Branch, un cadre d'apprentissage continu pour robots sociaux capables d'ajuster leurs actions selon le lieu, une conversation étant acceptable dans un salon bondé mais perturbatrice en réunion de bureau. EDD sépare explicitement les connaissances liées à l'environnement (espace ouvert ou encombré de meubles) de celles liées aux agents sociaux (position des personnes autour du robot), et utilise un mécanisme de rejeu pour limiter l'oubli à mesure que le système traverse successivement plusieurs domaines, salon, salle de réunion, bureau et couloir, pour évaluer des actions comme nettoyer, servir ou démarrer une conversation. Les auteurs rapportent qu'EDD surpasse plusieurs méthodes de référence de l'état de l'art, avec des études d'ablation portant sur différentes stratégies de désentrelacement et sur la sensibilité à l'ordre d'apprentissage des domaines. Le code est public sur GitHub, sous Cambridge-AFAR/Mind-the-Context.

Ce travail cible un angle mort de la littérature sur le comportement social robotique: les approches antérieures d'apprentissage continu appliquées à l'appropriateness sociale ne traitaient pas le cas incrémental par domaine, où le robot découvre successivement des environnements très différents sans pouvoir tous les anticiper à l'avance. Pour les intégrateurs de robots sociaux, assistance à domicile, accueil en entreprise, service en établissement, séparer ce qui relève du contexte physique de ce qui relève des normes sociales conditionne directement la fiabilité d'un déploiement multi-site sans réentraînement complet à chaque nouvel environnement. L'étude reste toutefois évaluée sur un nombre restreint de domaines et d'actions, ce qui tempère la portée immédiate des gains annoncés face aux méthodes de référence.

EDD prolonge des travaux antérieurs sur la génération d'actions socialement appropriées par apprentissage continu, en ciblant spécifiquement le réglage incrémental par domaine, jusqu'ici peu exploré malgré sa pertinence pour des robots amenés à circuler entre plusieurs pièces ou bâtiments. Il s'inscrit dans le champ plus large de la robotique sociale et de l'apprentissage continu, où l'oubli catastrophique reste un obstacle central face aux architectures d'apprentissage par renforcement ou aux modèles vision-langage-action déployés dans des environnements changeants. Publié comme preprint arXiv, non encore relu par les pairs à ce stade, l'article n'annonce ni calendrier de déploiement ni partenariat industriel, mais ouvre la voie à des extensions vers un plus grand nombre de domaines et des tests en conditions réelles.

Impact France/UE

Recherche menée par une équipe britannique (Cambridge-AFAR), sans acteur, financement ou déploiement français ou européen (UE) identifié à ce stade.

À lire aussi

StARS : recommandation d'actions robotiques socialement appropriées via un système de recommandation
1arXiv cs.RO 

StARS : recommandation d'actions robotiques socialement appropriées via un système de recommandation

Des chercheurs de l'Université de Cambridge (groupe Cambridge-AFAR) publient StARS, un nouveau cadre pour générer des actions robotiques socialement appropriées en tenant compte de la variabilité des jugements humains. Le constat de départ est simple : deux personnes peuvent juger différemment la même action d'un robot dans une situation identique, ce qui rend obsolète l'idée d'un score d'appropriation universel. Plutôt que d'entraîner un modèle unique censé plaire à tout le monde, l'équipe reformule le problème comme un système de recommandation, en traitant les annotateurs comme des utilisateurs, les scènes ou contextes comme des items, et les scores d'appropriation attribués à un ensemble d'actions candidates comme les cibles à prédire. StARS combine du filtrage collaboratif avec des représentations de scène apprenables, et reste agnostique au modèle sous-jacent : il peut s'intégrer à différents encodeurs de scène et backbones sans redesign complet. Les auteurs l'ont testé sur deux jeux de données de référence en robotique sociale, MannersDB+ et SocNav1, avec une analyse de robustesse en cas de retours de préférence peu nombreux. Le code est disponible publiquement sur GitHub. Pour l'industrie de l'interaction humain-robot, cette approche s'attaque à un angle mort classique des systèmes actuels : la plupart des modèles d'appropriation sociale produisent un score moyen, sans distinguer les préférences individuelles des utilisateurs, ce qui limite leur usage réel en contexte domestique, hospitalier ou en espace public partagé. En montrant des gains constants d'accord avec les annotateurs sur plusieurs jeux de données et plusieurs architectures, StARS suggère qu'une personnalisation légère, sans réentraîner le modèle de base, est possible pour affiner le comportement social des robots selon l'utilisateur. Ce travail s'inscrit dans la lignée des travaux sur l'évaluation de l'appropriation sociale en HRI (notamment les jeux de données MannersDB et SocNav utilisés ici) et dans la tradition plus large des systèmes de recommandation appliqués hors du e-commerce. Il reste à ce stade une contribution académique, publiée en préprint sur arXiv sans annonce de déploiement industriel ni de partenariat commercial ; la suite logique serait une validation sur des interactions robot-humain en conditions réelles, au-delà des jeux de données existants.

RecherchePaper
1 source
EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique
2arXiv cs.RO 

EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique

EDAR (Environment-Dependent Action Representation) est une nouvelle méthode d'apprentissage de représentations d'actions pour la manipulation robotique, présentée dans un article publié sur arXiv (référence 2607.11427v1). Le problème que les auteurs cherchent à résoudre est que les trajectoires de contrôle brutes utilisées pour entraîner des politiques robotiques sont bruitées, redondantes et difficiles à modéliser telles quelles. Les approches existantes se contentent généralement d'encoder la structure du flux d'actions lui-même, sans tenir compte explicitement de l'environnement dans lequel ces actions sont exécutées. EDAR propose au contraire de coupler les commandes moteur avec leurs effets visuels attendus, conditionnés par le contexte de la scène, afin que la représentation apprise capture la sémantique de l'interaction plutôt que de simples motifs au niveau des commandes. Les auteurs ont testé leur méthode sur des bancs d'essai de manipulation à la fois simulés et sur robot réel. Cette approche s'attaque à un angle mort connu des architectures VLA (vision-language-action) actuelles: le même segment d'action peut produire des résultats radicalement différents selon la disposition des objets, les propriétés physiques de la scène ou l'état initial de l'environnement. En ancrant les tokens d'action dans les conséquences visuelles attendues plutôt que dans la seule structure de commande, EDAR vise à améliorer la généralisation des politiques apprises, en particulier sur des tâches de manipulation à long horizon, où les erreurs de représentation s'accumulent au fil des étapes. Pour les équipes qui développent des politiques de manipulation généralistes, ce type de travail illustre une tendance de fond: le passage d'une modélisation purement centrée sur le contrôle vers des représentations conjointes action-perception, jugées nécessaires pour que les modèles de fondation robotiques (dans la lignée de GR00T N2, Pi-0 ou Helix) tiennent leurs promesses au-delà des démonstrations en environnement contrôlé. Le papier s'inscrit dans un courant de recherche plus large sur les représentations d'actions pour la robotique, où plusieurs travaux récents ont exploré la tokenisation d'actions, l'apprentissage par imitation conditionné par la vision, ou les modèles du monde pour anticiper les conséquences des actions. EDAR se positionne comme une contribution méthodologique plutôt qu'un produit ou un système déployé: il n'y a pas d'annonce de déploiement industriel ni de partenariat commercial associé à ce travail, qui reste à ce stade une publication de recherche évaluée sur des bancs d'essai académiques. Les prochaines étapes attendues pour ce type de travaux sont généralement l'intégration dans des pipelines VLA plus larges et des tests de transfert sur des plateformes robotiques commerciales, mais aucune feuille de route de ce type n'est mentionnée dans l'abstract.

RecherchePaper
1 source
Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles
3arXiv cs.RO 

Apprentissage continu de politiques robotiques via des dynamiques neuronales variationnelles

Des chercheurs ont publié en juin 2026 (arXiv:2606.27353) un framework d'apprentissage continu permettant à un robot de s'adapter en temps réel à des dynamiques changeantes et non observées, sans nécessiter de réentraînement complet. Le système combine un modèle de dynamique analytique (prior physique) avec un résidu neuronal entraîné à capturer les effets non modélisés. Un encodeur récurrent infère en ligne la "condition cachée" courante du robot, c'est-à-dire l'état du système non directement mesurable (charge utile variable, usure mécanique, perturbations aérologiques), à partir des trajectoires état-action récentes. Cette condition estimée pilote à la fois le modèle résiduel et la politique de contrôle. Lors de l'apprentissage, la politique est optimisée par simulation différentiable en échantillonnant un ensemble de dynamiques plausibles issues du modèle latent. Sur un quadrotor réel soumis à des vents récurrents, le système récupère une perturbation connue en environ 1 seconde, soit cinq fois plus rapidement qu'un réentraînement résiduel en ligne classique, et réduit les erreurs de vol stationnaire et de suivi de trajectoire respectivement de 65,7 % et 53,3 % par rapport aux approches d'adaptation en ligne de l'état de l'art. L'enjeu industriel est direct : la quasi-totalité des contrôleurs appris actuels sont entraînés une fois, puis déployés statiquement, comme si la dynamique du robot restait constante. En pratique, batteries qui se déchargent, charges qui changent de mission en mission, surfaces de contact qui évoluent, conditions météo variables, tout cela dégrade les performances sans mécanisme de correction. L'originalité de cette approche tient à la distinction entre "reconnaissance" et "réadaptation" : plutôt que de réajuster un modèle depuis zéro à chaque perturbation rencontrée (coûteux en données et en temps), le système reconnaît une dynamique déjà vue et l'applique immédiatement via l'encodeur récurrent. Ce paradigme est particulièrement pertinent pour les intégrateurs de drones industriels, de robots manipulateurs en logistique ou de plateformes mobiles en environnement extérieur, où les cycles de déploiement sont longs et les recalibrages manuels coûteux. Les résultats valident aussi une hypothèse clé du champ sim-to-real : qu'un prior physique structuré couplé à un résidu neuronal permet de généraliser à des conditions non vues lors de l'entraînement, à condition que ces conditions aient été préalablement "vécues" lors d'autres déploiements. Ce travail s'inscrit dans une lignée de recherches sur l'adaptation dynamique de politiques robotiques incluant la randomisation de domaine (popularisée par OpenAI Robotics dès 2018), les approches méta-learning type MAML, et les méthodes d'adaptation en ligne par processus gaussiens. Le réentraînement résiduel en ligne, utilisé comme baseline de comparaison, est une technique établie mais limitée par sa latence de convergence, problème central que ce framework adresse directement par la reconnaissance latente. L'article est à ce stade un preprint non relu par les pairs, et les expériences réelles restent limitées au quadrotor ; la généralisation à des robots à pattes ou à des bras manipulateurs industriels reste à démontrer. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné. Les prochaines étapes probables incluent des tests sur des plateformes à dynamiques plus complexes et une validation sur des dynamiques à distribution plus large.

RecherchePaper
1 source
Politique CoLA-Flow : apprentissage par imitation temporellement cohérent via le flux d'actions latentes continues pour la manipulation robotique
4arXiv cs.RO 

Politique CoLA-Flow : apprentissage par imitation temporellement cohérent via le flux d'actions latentes continues pour la manipulation robotique

Une équipe de chercheurs a publié sur arXiv (2501.23087, version 3 en mai 2026) CoLA-Flow Policy, un framework d'apprentissage par imitation conçu pour la manipulation robotique sur des horizons d'action longs. L'approche combine le flow matching, une technique générative plus rapide que la diffusion, avec un espace d'action latent continu dans lequel les trajectoires sont encodées avant l'apprentissage du flux. Sur bancs de simulation et sur robots réels, les expériences affichent une amélioration de la régularité des trajectoires allant jusqu'à 93,7 % et un gain de taux de succès allant jusqu'à 25 points de pourcentage par rapport aux baselines de flow matching opérant directement dans l'espace d'action brut. L'inférence s'effectue en quasi-un seul pas, soit une vitesse nettement supérieure aux politiques basées sur la diffusion, qui nécessitent plusieurs étapes de débruitage. Le principal apport de CoLA-Flow est de découpler la structure globale du mouvement du bruit de contrôle bas niveau : en encodant les séquences d'actions en trajectoires latentes temporellement cohérentes, le modèle évite les oscillations et incohérences qui affectent les politiques de flow matching en espace brut. Pour un intégrateur ou un décideur industriel, cela signifie qu'une même architecture peut traiter des tâches de manipulation complexes sans latence rédhibitoire ni comportement erratique entre les étapes. Le conditionnement par nuages de points (point cloud) et la modulation multimodale à l'exécution via des indices visuels renforcent la robustesse dans des environnements réels non contrôlés, deux exigences critiques pour tout déploiement hors laboratoire. Ce travail s'inscrit dans une compétition intense entre architectures génératives pour les politiques robotiques. Diffusion Policy (Chi et al., 2023) a établi la référence en termes d'expressivité comportementale, mais son coût computationnel freine l'usage temps réel. Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA ont validé le flow matching comme alternative viable, au prix d'une instabilité accrue sur les horizons longs, précisément le problème que CoLA-Flow tente de résoudre via l'espace latent. Le framework s'apparente conceptuellement aux approches d'action chunking (ACT), mais opère au niveau du flux plutôt que de la prédiction directe. La troisième version de l'article suggère des révisions itératives significatives depuis janvier 2026 ; aucun déploiement industriel ni partenariat commercial n'est mentionné à ce stade, et les benchmarks présentés restent limités à des environnements de manipulation contrôlés.

RechercheOpinion
1 source