Aller au contenu principal
Adaptabilité pour robots suiveurs de groupe : gérer des formations qui changent dynamiquement
RecherchearXiv cs.RO 

Adaptabilité pour robots suiveurs de groupe : gérer des formations qui changent dynamiquement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié le 1er juillet 2026 sur arXiv (référence 2607.01287v1) une nouvelle méthode permettant à des robots sociaux d'accompagner un groupe de personnes dont la formation change en permanence, plutôt que de suivre une disposition fixe. Le système repose sur des modèles vision-langage (VLM) chargés d'inférer en temps réel la position optimale du robot par rapport au groupe, de maintenir des distances sociales appropriées et de comprendre la dynamique collective des déplacements. Concrètement, un module de perception détecte d'abord les membres du groupe puis génère une représentation visuelle de l'espace d'interaction, transmise au VLM ; les décisions de haut niveau sont ensuite converties en trajectoires sûres via un contrôleur MPPI (Model Predictive Path Integral), qui gère la stabilité et évite les collisions. Testée sur cinq scénarios différents, l'approche affiche une amélioration de 15% du taux de réussite et une réduction de 25% du taux de collision par rapport aux méthodes de référence, avec en complément une étude utilisateur jugeant les comportements du robot naturels et socialement appropriés.

Pour l'industrie de la robotique sociale, ce travail s'attaque à un angle mort classique des robots compagnons et guides : la plupart des systèmes existants supposent une formation de groupe stable (file, cercle), une hypothèse qui s'effondre dès que des personnes changent de vitesse, se dispersent ou se regroupent, comme c'est le cas dans un musée, un hall d'exposition ou un espace commercial. Coupler le raisonnement sémantique d'un VLM à un contrôleur de trajectoire classique illustre une tendance plus large du secteur : utiliser les grands modèles pour la compréhension de la scène et la prise de décision, tout en laissant le contrôle bas niveau à des méthodes d'optimisation éprouvées, jugées plus fiables pour la sécurité.

Il s'agit toutefois d'un article de recherche fraîchement mis en ligne, sans mention de partenaire industriel ni de déploiement réel au-delà des scénarios expérimentaux décrits. Le papier s'inscrit dans la lignée des travaux sur la navigation robotique consciente des humains (human-aware navigation), un domaine où academiques et fabricants de robots de service cherchent depuis plusieurs années à dépasser les formations rigides. Les prochaines étapes attendues seraient des tests en conditions réelles avec des groupes plus nombreux et des environnements encombrés.

Dans nos dossiers

À lire aussi

Adaptation résiduelle alignée sur la stabilité pour une récupération rapide après des changements de dynamique
1arXiv cs.RO 

Adaptation résiduelle alignée sur la stabilité pour une récupération rapide après des changements de dynamique

L'article arXiv 2603.07775 (v2), intitulé « Stability-Aligned Residual Adaptation for Rapid Recovery from Dynamics Shifts », décrit une méthode où une correction résiduelle bornée s'ajoute, à l'inférence, à une politique d'apprentissage par renforcement (SAC) figée, sans réentraînement, réinitialisation ni identification explicite du système. Un module appelé Stability Alignment Gate régule cette correction par des contraintes d'amplitude, de cohérence directionnelle et de gain adaptatif, pour rester dans la marge de robustesse du contrôleur nominal. Face à des changements brusques d'actionnement, de masse et de contact en cours d'épisode, la méthode réduit le temps de récupération par rapport à un SAC figé de jusqu'à 87% sur le quadrupède Go1, 48% sur le bipède Cassie, 30% sur l'humanoïde H1 et 20% sur le robot AgileX Scout, en simulation. Sur matériel réel, un bras manipulateur Trossen ViperX et un AgileX Scout Mini gagnent 19,5% de temps de récupération, sans modification du contrôleur embarqué. L'enjeu pour l'industrie tient au problème visé: une politique de RL entraînée en simulation reste fragile face à des glissements de dynamique non observés (usure, charge variable, sol différent) une fois déployée hors environnement contrôlé, même si le contrôleur nominal reste localement stable. En évitant réentraînement, identification du système et information privilégiée sur la perturbation, l'approche cible directement le coût opérationnel des intégrateurs, qui ne peuvent pas recalibrer un robot à chaque aléa. Le maintien d'un gain, certes plus modeste, sur deux plateformes physiques distinctes (bras fixe, robot mobile) suggère une certaine généralité au-delà d'un seul type de robot, même si l'essentiel des chiffres reste obtenu en simulation. La méthode s'inscrit dans la lignée de l'apprentissage résiduel, qui corrige une politique déjà compétente plutôt que de la remplacer, une alternative au réentraînement complet ou aux grands modèles généralistes de type VLA comme Pi-0 ou GR00T N2. Les plateformes d'essai, quadrupède et humanoïde Unitree Go1 et H1, bipède Cassie, AgileX Scout et Scout Mini, bras Trossen ViperX, sont des références académiques standards, sans produit commercial identifié dans le résumé de l'article. Publiée comme simple préprint sur arXiv, la contribution ne mentionne ni partenariat industriel, ni pilote annoncé, ni calendrier de transfert vers un produit; la suite logique, non confirmée, serait une extension à davantage de plateformes physiques et de tâches de manipulation.

RecherchePaper
1 source
Curriculums de dynamique des actionneurs pour tâches à viabilité étroite dans l'apprentissage des robots à pattes
2arXiv cs.RO 

Curriculums de dynamique des actionneurs pour tâches à viabilité étroite dans l'apprentissage des robots à pattes

Boston Dynamics Spot, le robot quadrupède commercial, a servi de plateforme matérielle à une nouvelle méthode d'apprentissage par renforcement baptisée "Actuator Dynamics Curriculum", décrite dans un article publié sur arXiv (référence 2609.09492v1). La méthode consiste à initialiser la rigidité des articulations à une valeur artificiellement élevée, puis à la réduire progressivement vers la valeur réelle mesurée sur le système à mesure que les épisodes d'entraînement durent plus longtemps. Testée d'abord sur un pendule inversé sur chariot comme cas d'école, elle a ensuite été appliquée à une tâche bien plus exigeante : faire passer Spot d'une position de marche à un appui vertical sur ses seules pattes avant, pattes arrière dressées façon poirier. Avec la rigidité fixée à sa valeur réelle identifiée, l'entraînement standard plafonne sur une politique qui ne termine jamais la transition. Avec le curriculum proposé, la politique entraînée réussit le mouvement en simulation sur 10 graines aléatoires différentes et se transfère avec succès sur le robot physique. Le résultat cible un problème précis et non résolu du RL en robotique : certaines tâches échouent à converger non pas faute de signal de récompense, mais parce que presque toutes les trajectoires explorées se terminent par un échec avant de produire un gradient exploitable. En montrant qu'augmenter la fréquence naturelle des articulations en boucle fermée élargit le "noyau de viabilité" du problème de décision markovien sous-jacent, c'est-à-dire la part des états de départ depuis lesquels la tâche reste faisable, les auteurs ouvrent un axe de curriculum orthogonal aux approches classiques comme le domain randomization ou le reward shaping. Pour les équipes qui entraînent quadrupèdes et humanoïdes à des mouvements dynamiques extrêmes, cela offre un levier supplémentaire sur des tâches jusqu'ici jugées hors de portée du RL standard, sans toucher au matériel ni à la fonction de récompense. Ce travail s'inscrit dans la recherche académique en sim-to-real pour la locomotion, où Spot sert de banc d'essai matériel largement utilisé par les laboratoires, sans qu'il s'agisse d'une annonce produit de Boston Dynamics. La validation reste circonscrite à une seule tâche de transfert matériel et à un nombre limité de graines, sans données publiées sur le taux de réussite en conditions réelles variées. Les auteurs présentent leur méthode comme généralisable à toute tâche où l'exploration est bloquée par des conditions de terminaison précoces plutôt que par un signal de récompense insuffisant, ouvrant la voie à d'autres transitions dynamiques difficiles pour robots à pattes.

RecherchePaper
1 source
Appariement de flux conditionné par l'historique pour la dynamique probabiliste des robots continus à tendons
3arXiv cs.RO 

Appariement de flux conditionné par l'historique pour la dynamique probabiliste des robots continus à tendons

Une équipe de recherche présente, dans un article publié sur arXiv (référence 2609.25658v1), un nouveau cadre de modélisation probabiliste pour les robots continuum actionnés par tendons, une famille de bras souples utilisés notamment en chirurgie mini-invasive et en inspection industrielle. La méthode, baptisée "history-conditioned flow matching", combine apprentissage et connaissances physiques pour prédire, à partir de l'historique des mouvements et des commandes d'actionnement, la distribution probable de la configuration articulaire complète du robot à l'instant suivant, plutôt qu'une trajectoire unique déterministe. Le modèle échantillonne ensuite ces prédictions de façon récursive pour projeter le mouvement du robot sur plusieurs secondes. En simulation, sur des trajectoires de cinq secondes, le score d'énergie obtenu (plus il est bas, meilleur c'est) atteint 12,05 mm face à des variations de friction interne et 9,29 mm face à des perturbations d'actionnement non observées à l'entraînement, des résultats supérieurs aux références comparées, un autoencodeur variationnel conditionnel et des modèles de diffusion. Sur un robot physique réel, testé avec deux profils de commandes exclus de l'entraînement, le score atteint 11,91 et 11,42 mm, avec un ratio d'écart entre prédiction et mesure de 1,65 et 1,22, une valeur proche de 1 signalant une bonne calibration. Cette avancée s'attaque à un problème récurrent en robotique souple: contrairement aux bras rigides, les robots continuum souffrent d'incertitudes mécaniques difficiles à modéliser (comportement des matériaux, transmission par tendons, friction, contacts) qui rendent leur comportement partiellement imprévisible même quand la commande et la configuration mesurée sont connues. En remplaçant une prédiction déterministe par une distribution de probabilité, l'approche permet d'anticiper le mouvement le plus probable tout en quantifiant l'incertitude associée, un point clé pour planifier des trajectoires sûres en contexte chirurgical ou industriel où une erreur de positionnement coûte cher. Pour les chercheurs travaillant sur des bras souples ou hyper-redondants, ces résultats indiquent que le flow matching, déjà répandu en génération d'images et de plus en plus utilisé dans le contrôle de robots via des politiques VLA, peut aussi améliorer la modélisation dynamique de systèmes mécaniquement complexes et faiblement instrumentés. Les auteurs comparent leur méthode à deux familles de modèles génératifs probabilistes concurrents, l'autoencodeur variationnel conditionnel et la diffusion, contre lesquelles le flow matching conditionné par l'historique obtient des scores d'énergie plus bas et une couverture de l'incertitude plus proche du niveau nominal attendu, dans les deux scénarios testés. Des études d'ablation confirment que le conditionnement par l'historique des mouvements et par la structure physique du robot contribuent tous deux à la précision des prédictions. L'article ne mentionne aucun partenariat industriel ni calendrier de déploiement: il s'agit d'une contribution de recherche validée en simulation et sur un prototype de laboratoire, dont l'étape suivante serait l'extension à des continuum robots multi-segments et à des tâches de manipulation en conditions réelles.

RecherchePaper
1 source
Formulation sur les groupes de Lie pour les algorithmes de dynamique récursive d'ordre supérieur des robots à base flottante
4arXiv cs.RO 

Formulation sur les groupes de Lie pour les algorithmes de dynamique récursive d'ordre supérieur des robots à base flottante

Des chercheurs ont publié en mai 2026 sur arXiv (réf. 2605.06498) une formulation unifiée basée sur les groupes de Lie permettant de calculer les dérivées temporelles d'ordre supérieur des principaux algorithmes de dynamique pour robots à base flottante. Les méthodes couvertes incluent l'algorithme de Newton-Euler récursif, l'inertie du corps articulé (ABI) et la dynamique hybride, dans un cadre où la base évolue sur SE(3) et le mécanisme attaché est une arborescence cinématique ouverte de configuration sur T^n1 x R^n2. Appliqués à un manipulateur aérien à 12 degrés de liberté (DoF), les algorithmes produisent des expressions analytiques closes pour la dynamique directe et inverse géométrique ainsi que leurs premières dérivées temporelles, avec des simulations numériques validant la méthode jusqu'au 5e ordre de dérivation. L'apport central de ce travail est d'ordre computationnel : les auteurs montrent que le coût de calcul de leurs récursions scale quadratiquement avec l'ordre de dérivation, là où la différentiation automatique (AD) mise en oeuvre via des frameworks courants comme JAX, PyTorch ou CasADi exhibe un scaling exponentiel. Pour les équipes travaillant en commande prédictive (MPC) ou en optimisation de trajectoire pour robots articulés à base libre (drones manipulateurs, humanoïdes sans appui fixe), cette différence de scaling devient critique dès le 3e ou 4e ordre. Les auteurs identifient également une matrice de Coriolis admissible satisfaisant la propriété de passivité, garantie importante pour la synthèse de lois de commande stables, et établissent que le tenseur d'inertie articulé reste invariant à travers toutes les dérivées temporelles, résultat géométriquement non trivial. Ce papier s'inscrit dans une tradition de dynamique spatiale initiée par Featherstone et prolongée notamment par la librairie Pinocchio, développée au LAAS-CNRS (équipe Gepetto, Toulouse), qui implémente déjà des dérivées du premier et second ordre via représentation de Lie. Cette contribution étend explicitement ce cadre aux ordres arbitraires, ouvrant des perspectives pour les méthodes de shooting multiple d'ordre élevé et les approches de sensibilité paramétrique en co-optimisation robot/contrôleur. Les applications directes visées concernent la planification de mouvement pour drones à bras articulés, un segment en croissance rapide dans la logistique et l'inspection industrielle, ainsi que potentiellement les humanoïdes à base flottante dont la dynamique est formellement identique.

UECette contribution étend directement le cadre de la bibliothèque Pinocchio, développée par l'équipe Gepetto du LAAS-CNRS (Toulouse), renforçant le leadership de la recherche française en dynamique robotique différentiable et ouvrant des perspectives concrètes pour les équipes R&D européennes travaillant sur le MPC et l'optimisation de trajectoire pour humanoïdes et drones manipulateurs.

RecherchePaper
1 source