Aller au contenu principal
Estimation simultanée de l'état et apprentissage du modèle en ligne dans un système robotique souple
RecherchearXiv cs.RO 

Estimation simultanée de l'état et apprentissage du modèle en ligne dans un système robotique souple

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans une prépublication arXiv (2602.14092v2), une méthode permettant d'estimer simultanément la pose d'un robot souple et d'apprendre en ligne son modèle de rigidité à la flexion, à partir des seules mesures des forces exercées à la base du robot. L'approche repose sur un filtre particulaire marginalisé (marginalized particle filter) interfacé avec un processus gaussien (GP) chargé de modéliser la rigidité en flexion, sans capteurs proprioceptifs distribués le long du corps du robot. Le modèle nominal utilisé est le classique modèle à courbure constante (constant-curvature), réputé simple mais inexact dès que les charges ou les déformations deviennent hétérogènes. La méthode a été validée sur un robot souple physique, et les résultats montrent une réduction mesurable de l'erreur sur les prédictions multi-pas (multi-step forward predictions), signe que le GP appris améliore effectivement la qualité globale du modèle.

L'enjeu est de taille pour quiconque cherche à déployer des robots souples dans des contextes industriels ou médicaux : ces systèmes sont intrinsèquement difficiles à modéliser car leur rigidité varie avec la charge, la fatigue du matériau et les conditions environnementales. La majorité des schémas de contrôle prédictif (MPC, par exemple) exigent un modèle précis et stable, condition rarement remplie en pratique. En remplaçant l'hypothèse d'une rigidité constante par un GP appris en temps réel, les auteurs montrent qu'il est possible de réduire le sim-to-real gap sans capteurs supplémentaires ni phase de calibration longue. Cela distingue cette approche des méthodes de marche aléatoire sur les paramètres de rigidité, qui permettent l'estimation mais pas la prédiction.

Les robots souples connaissent un regain d'intérêt dans la manipulation de précision, la chirurgie mini-invasive et l'interaction humain-robot, portés notamment par des groupes académiques comme le Soft Robotics Lab de l'ETH Zurich, le CHARM Lab de Stanford ou des acteurs industriels comme Festo (bionic cobotics). Le verrou historique reste la modélisation : un corps déformable infiniment dimensionnel réduit à quelques paramètres discrets. L'identification gray-box, hybride entre modèle physique et apprentissage données, est aujourd'hui l'une des pistes les plus prometteuses pour franchir ce verrou à coût computationnel raisonnable. La prochaine étape naturelle serait d'intégrer cette estimation en boucle fermée dans un contrôleur MPC temps réel et de tester la robustesse sur des charges variables ou des matériaux vieillissants.

Impact France/UE

Festo (Allemagne) et l'ETH Zurich (Suisse) sont explicitement cités comme acteurs clés de la robotique souple ; une meilleure modélisation en ligne bénéficierait directement à leurs programmes de cobotics biologique et de chirurgie mini-invasive.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
1arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source
RLinf-USER : un système unifié et extensible pour l'apprentissage de politiques en ligne en conditions réelles pour l'IA incarnée
2arXiv cs.RO 

RLinf-USER : un système unifié et extensible pour l'apprentissage de politiques en ligne en conditions réelles pour l'IA incarnée

Le préprint arXiv:2602.07837 (quatrième version, publiée en remplacement d'une version antérieure) présente USER, un système conçu pour l'apprentissage de politiques en ligne directement dans le monde réel, et non en simulation. Contrairement à un environnement simulé, où l'on peut accélérer le temps, réinitialiser un robot instantanément ou dupliquer massivement les essais, l'entraînement physique impose des contraintes de vitesse, de coût et d'usure matérielle qui, selon les auteurs, transforment le problème en un défi d'ingénierie systémique autant qu'algorithmique. USER répond à ce constat par deux couches complémentaires. Côté infrastructure, une couche d'abstraction matérielle unifie la gestion de robots hétérogènes, tandis qu'un plan de communication adaptatif organise l'entraînement réparti entre cloud et périphérie (edge). Côté apprentissage, le système repose sur un entraînement entièrement asynchrone, un buffer de rejeu persistant et sensible au cache, ainsi que des abstractions extensibles pour définir récompenses, algorithmes et politiques. Les expériences, menées en simulation et sur du matériel réel, couvrent la coordination multi-robots, des manipulateurs de types différents, l'entraînement cloud-edge avec de grands modèles, et des sessions asynchrones de longue durée. L'abstract ne fournit toutefois aucun chiffre précis de charge utile, de degrés de liberté ou de temps de cycle, ce qui limite l'évaluation indépendante des gains annoncés. Pour l'industrie robotique, ce travail cible un goulot d'étranglement rarement documenté publiquement: faire fonctionner l'apprentissage par renforcement en ligne sur des flottes physiques hétérogènes, à l'heure où les modèles VLA (vision-langage-action) type Pi-0 ou GR00T nécessitent des volumes de données et des cycles d'entraînement continus. Une brique d'orchestration cloud-edge réutilisable, si elle tient ses promesses au-delà du cadre expérimental, réduirait le travail d'intégration pour les équipes qui déploient plusieurs types de bras ou de robots mobiles sous une même boucle d'apprentissage. Mais l'absence de métriques quantitatives comparatives dans l'abstract invite à traiter cette annonce comme une proposition d'architecture logicielle validée en laboratoire, pas comme un système prêt à l'échelle industrielle. Cette publication s'inscrit dans une tendance plus large: à mesure que les modèles fondation pour la robotique (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) gagnent en taille, l'entraînement purement simulé montre ses limites face au fossé sim-to-réel, poussant les laboratoires vers l'apprentissage en ligne sur robot réel. Le statut de préprint en quatrième révision suggère un travail encore en itération académique, sans calendrier de déploiement pilote ni partenaire industriel annoncé à ce stade.

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
3arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde
4arXiv cs.RO 

Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde

Un article publié sur arXiv sous la référence 2609.03927v1 propose une synthèse unifiée de l'apprentissage robotique, en organisant les travaux existants autour de trois axes complémentaires : la compréhension via l'apprentissage de représentation, l'action via les modèles vision-langage-action (VLA), et le raisonnement via les modèles du monde. Les auteurs introduisent une taxonomie structurée qui capture les choix de conception clés en matière de représentation de l'environnement, d'apprentissage de politiques et de modélisation prédictive, et dressent un état des lieux des avancées récentes dans ces trois domaines de recherche. Le papier pointe un problème central pour le secteur : ces trois paradigmes progressent rapidement mais restent développés de façon cloisonnée, ce qui produit des systèmes fragmentés, peu capables de généraliser, de raisonner sur des horizons temporels longs ou de planifier dans des environnements non structurés. C'est un signal utile pour les intégrateurs et décideurs B2B qui misent tout sur un seul bloc technologique, qu'il s'agisse d'un VLA pour l'action ou d'un modèle du monde pour la prédiction. Les auteurs soutiennent que les limites observées sur le terrain, quantification insuffisante de l'incertitude, mauvaise généralisation hors distribution, transfert difficile d'une plateforme robotique à une autre, compréhension limitée du contexte long, planification longue portée fragile, ne viennent pas seulement des composants pris isolément mais du manque d'intégration entre perception, action et raisonnement. Cela nuance l'hypothèse répandue selon laquelle il suffirait de faire grossir un seul type de modèle pour résoudre l'autonomie robotique générale. Cette synthèse arrive alors que les trois courants qu'elle croise, apprentissage de représentation pour la perception, modèles VLA pour le contrôle d'action, modèles du monde pour la prédiction des conséquences, ont chacun connu des avancées rapides ces dernières années dans la recherche robotique sans converger vers une architecture commune. Plutôt que de comparer des produits ou des laboratoires concurrents, l'article se positionne comme une carte du terrain de recherche à destination de la communauté scientifique. Les auteurs esquissent des directions futures vers des systèmes d'apprentissage robotique unifiés, physiquement ancrés et probabilistes, capables de maintenir des représentations internes cohérentes et de soutenir la prise de décision sur des interactions prolongées en conditions réelles, sans toutefois annoncer de calendrier de mise en œuvre ni de prototype déployé.

RecherchePaper
1 source