Aller au contenu principal
RecherchearXiv cs.RO 

Apprendre sur le tas : exécution de tâches sans démonstration sous incertitude paramétrique par commande duale paramétrée par trajectoire

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode de commande duale qui permet à un robot d'exécuter une tâche du premier coup tout en identifiant en ligne les paramètres physiques qu'il ne connaissait pas. Publié sur arXiv (2510.20483, version 2), le travail part d'un constat : la commande basée sur modèle donne de bons résultats tant que le modèle est exact, mais un robot rencontre souvent des charges utiles, des objets ou des dynamiques d'interaction inédits. L'approche classique consiste à lancer d'abord une phase d'excitation dédiée, indépendante de la tâche et du contrôleur, pour estimer les paramètres. Les auteurs suppriment cette étape : l'apprentissage du modèle et la commande se déroulent simultanément pendant la tâche. Ils fixent à l'avance une politique de retour d'état avec une loi d'adaptation explicite des paramètres, puis optimisent la trajectoire de référence à travers la dynamique adaptative en boucle fermée. Deux formulations sont proposées : minimiser le coût attendu de la tâche sous incertitude paramétrique, ou minimiser la perte d'optimalité, c'est-à-dire la dégradation de performance causée par une planification fondée sur une estimation erronée. L'exploration est guidée par une mesure d'information de Fisher.

L'enjeu est très concret pour les intégrateurs et les responsables de production. Aujourd'hui, un bras manipulant une charge inconnue perd du temps en calibration, ou exécute des mouvements d'identification qui n'ont aucun lien avec la tâche et produisent des données peu utiles. Selon les auteurs, leur méthode s'approche d'une borne inférieure de l'incertitude sur les paramètres pertinents pour la tâche, tout en réussissant celle-ci en une seule tentative. Cela réduit les temps morts et évite d'identifier des paramètres sans effet sur le résultat. Les résultats couvrent plusieurs tâches, contrôleurs et lois d'adaptation, ce qui suggère une méthode générique et non un réglage sur un seul cas. Il faut toutefois rester prudent : le résumé ne donne ni chiffres de performance, ni précision de l'identification, ni temps de calcul, ni preuve sur matériel réel. On ne sait donc pas si la méthode tient face aux bruits de capteurs, aux frottements non modélisés ou aux contraintes temps réel d'une cellule industrielle.

Ce travail s'inscrit dans le débat entre approches basées sur modèle et approches apprises, comme les modèles vision-langage-action (VLA), qui généralisent par les données mais offrent moins de garanties. Ici, la commande adaptative et la théorie du contrôle dual, formulée depuis les années 1960, sont réactivées avec une optimisation de trajectoire moderne. Il s'agit d'une préimpression, sans validation par les pairs à ce stade, et la mention « remplacement » indique une révision d'une version antérieure. Les suites logiques seraient des essais sur manipulateurs réels avec charges variables, puis une comparaison directe avec l'identification préalable et les méthodes de méta-apprentissage.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Navigation multi-robots mobile sous incertitude d'exécution : apprentissage par opérateur de Koopman et commande prédictive non linéaire
1arXiv cs.RO 

Navigation multi-robots mobile sous incertitude d'exécution : apprentissage par opérateur de Koopman et commande prédictive non linéaire

Des chercheurs ont développé un système de contrôle prédictif non linéaire (NMPC) pour la navigation de robots mobiles en essaim, en couplant l'optimisation de trajectoire à des modèles dynamiques appris via la théorie de l'opérateur de Koopman. Le cœur de la méthode repose sur un modèle Koopman bilinéaire "relevé" (lifted), capable de prédire le comportement de systèmes à entrées affines soumis à des perturbations, sans connaître le modèle dynamique réel des robots. L'équipe a testé son approche sur deux tâches classiques de robotique en essaim : l'atteinte de cible (target reaching) et le contrôle de formation, avec des robots à roues évoluant dans des environnements encombrés d'obstacles. La validation s'est faite exclusivement par simulations numériques étendues, en faisant varier le degré de glissement aléatoire des roues, une source d'incertitude fréquente en conditions réelles. Aucun déploiement matériel n'est mentionné dans l'article, publié sur arXiv (2609.14058) : il s'agit donc d'une preuve de concept en simulation, pas d'une démonstration sur du hardware physique. L'intérêt pour l'industrie tient à la promesse d'un contrôle robuste sans identification précise du système, un problème récurrent pour les intégrateurs déployant des flottes de robots mobiles ou d'AMR sur des sols glissants, irréguliers ou mal caractérisés. Contourner la modélisation dynamique explicite via un opérateur de Koopman appris permettrait, en théorie, de réduire le travail d'ingénierie nécessaire pour adapter un contrôleur à chaque nouvelle plateforme ou terrain, tout en gardant les garanties de stabilité et de contrainte propres au NMPC. Reste que la démonstration se limite à des glissements de roues simulés dans des environnements contrôlés : l'écart classique entre simulation et réalité n'est pas encore comblé, et la généralisation à des perturbations non modélisées en usine reste à prouver. Cette approche s'inscrit dans un courant de recherche actif combinant apprentissage de dynamiques (Koopman, souvent présenté comme alternative linéarisable aux réseaux de neurones profonds) et commande optimale robuste, pour pallier les limites des modèles physiques classiques en robotique mobile multi-agents. Elle se positionne face à des méthodes concurrentes de contrôle de formation basées sur l'apprentissage par renforcement ou sur des modèles analytiques de glissement. Les auteurs ne mentionnent ni collaboration industrielle, ni calendrier de test sur robots physiques ; les prochaines étapes attendues pour ce type de travaux académiques sont généralement une validation expérimentale sur plateforme réelle et un passage à l'échelle vers des essaims plus nombreux.

RecherchePaper
1 source
Coordination des tâches et exécution de trajectoires par démonstrations few-shot pour systèmes multi-robots
2arXiv cs.RO 

Coordination des tâches et exécution de trajectoires par démonstrations few-shot pour systèmes multi-robots

Des chercheurs proposent DDACE (Demonstration-Driven Action Coordination and Execution), un cadre d'apprentissage capable de coordonner plusieurs robots a partir d'un très petit nombre de démonstrations seulement, selon un article publie sur arXiv (version révisée, v2). Le problème cible est connu dans la robotique multi-agents : apprendre a la fois quand chaque robot doit agir (dépendances temporelles entre taches) et comment il doit se déplacer (trajectoire spatiale) devient instable des que les données sont rares, car les deux aspects sont habituellement appris ensemble par des modèles bout-en-bout. DDACE sépare explicitement ces deux problèmes. Les démonstrations sont d'abord traitées par clustering spectral pour en extraire la structure de coordination et construire des graphes d'interaction entre robots. Un Temporal Graph Network se charge ensuite de prédire les dépendances d'actions et leur séquencement, pendant que des modèles de processus gaussiens génèrent les trajectoires géométriques, paramétrées par la progression de la tache et capables de s'adapter a de nouvelles configurations de départ et d'arrivée. Les auteurs rapportent des tests en simulation ainsi que des expériences sur robots réels, avec une meilleure stabilité et une meilleure cohérence des trajectoires que des approches d'imitation bout-en-bout classiques en régime de données limitées. L'enjeu dépasse l'exercice académique : la coordination multi-robots a partir de peu d'exemples est un frein concret au déploiement de cellules industrielles collaboratives ou de flottes d'AMR, ou collecter des milliers de démonstrations par scenario reste couteux. En introduisant un biais structurel plutôt qu'un apprentissage purement bout-en-bout, DDACE questionne l'hypothèse dominante selon laquelle les architectures end-to-end massives suffisent a généraliser en data-scarce régime, une piste distincte de la tendance actuelle centrée sur les gros modèles VLA mono-robot type Pi-0 ou GR00T N2. Le papier s'inscrit dans une littérature qui cherche des alternatives modulaires a l'imitation pure, combinant clustering, graphes temporels et processus gaussiens plutôt qu'un unique réseau de bout en bout. Il s'agit a ce stade d'une publication de recherche avec validations simulées et réelles limitées, sans indication de partenaire industriel ni de calendrier de transfert vers un produit ; le matériel complémentaire est disponible sur le site du projet associe.

RecherchePaper
1 source
Extrapolation des paramètres de tâche par apprentissage des tâches inverses à partir de démonstrations directes
3arXiv cs.RO 

Extrapolation des paramètres de tâche par apprentissage des tâches inverses à partir de démonstrations directes

Une équipe de recherche propose une nouvelle méthode d'apprentissage par imitation capable d'extrapoler à des configurations de tâches inédites, dans un article disponible sur arXiv (2603.05576v3, version corrigée). Le problème visé est bien connu en robotique : les politiques entraînées par imitation restent cantonnées à leur zone d'entraînement et échouent de façon imprévisible dès qu'elles rencontrent des paramètres hors distribution, tandis que les approches de transfert d'apprentissage, plus robustes aux changements d'environnement, restent gourmandes en données et peu précises en généralisation zero-shot. La méthode proposée construit une représentation commune entre une tâche "directe" et sa version "inverse", et exploite des démonstrations auxiliaires collectées sur des configurations nouvelles pour exécuter la tâche inverse correspondante, sans supervision directe sur cette dernière. Les auteurs valident l'approche par des études d'ablation ainsi que des expériences en simulation et en conditions réelles, sur des tâches de manipulation complexes impliquant une diversité d'objets et d'outils. L'intérêt de ce travail dépasse le cadre académique : la capacité à extrapoler au-delà de la zone d'entraînement, sans multiplier les démonstrations, est précisément le verrou qui limite aujourd'hui le déploiement à grande échelle de politiques de manipulation apprises par imitation, que ce soit en logistique, en assemblage industriel ou pour les bras robotiques collaboratifs. Si les résultats se confirment au-delà du cadre de l'article, cette approche pourrait réduire le coût de collecte de données pour couvrir de nouvelles variantes de tâches, un frein économique majeur pour les intégrateurs qui doivent aujourd'hui redémontrer chaque configuration. Les auteurs indiquent surpasser des alternatives à base de modèles de diffusion et de VAE multimodaux, deux familles d'approches aujourd'hui considérées comme état de l'art pour la génération de trajectoires robotiques, ce qui positionne ce travail comme une contribution directe au débat sur la meilleure architecture pour généraliser au-delà des données d'entraînement. Ce papier s'inscrit dans la lignée des travaux sur l'apprentissage par tâches inverses et le transfert de connaissances en robotique, un axe de recherche actif depuis plusieurs années face aux limites structurelles de l'apprentissage par imitation classique. La comparaison aux baselines diffusion et VAE, plutôt qu'à de simples méthodes de clonage comportemental, indique que les auteurs situent leur contribution parmi les techniques génératives les plus récentes du domaine. L'article ne précise pas de partenariat industriel ni de plateforme robotique commerciale associée : il s'agit à ce stade d'une contribution méthodologique, dont la portée pratique dépendra de sa reproduction sur des plateformes robotiques réelles au-delà des expériences décrites.

RecherchePaper
1 source
WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action
4arXiv cs.RO 

WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action

Des chercheurs présentent WALA (arXiv:2607.11397), un framework qui apprend des actions latentes exécutables à partir de deux types de données distincts : des démonstrations robotiques annotées d'actions et de simples vidéos sans annotation d'action. Le problème visé est bien connu du secteur : les démonstrations robotiques étiquetées coûtent cher à collecter et passent mal à l'échelle, alors que les vidéos humaines et robotiques disponibles en masse restent inexploitables faute d'étiquettes d'action exécutables. WALA fonctionne en deux temps. D'abord, un pré-entraînement d'un modèle d'action latente sémantique-géométrique sur des vidéos, en modélisant l'évolution entre l'observation courante et des observations futures échantillonnées de façon éparse. Plutôt que de reconstruire les pixels bruts, le système prédit les deltas futurs dans l'espace de features DINOv3 et dans l'espace de profondeur dense, ce qui conserve la structure sémantique et géométrique utile à la tâche tout en réduisant la sensibilité aux détails d'apparence. Lors de l'entraînement de la politique, l'encodeur pré-entraîné fournit des cibles d'action latente stables, et le décodeur sert de modèle du monde latent entraînable, avec une supervision conjointe par prédiction d'action robotique, correspondance de cible d'action latente et prédiction de dynamique future. Résultat annoncé : un nouveau record sur RoboCasa avec 75,2% de taux de réussite moyen, ainsi que de bonnes performances sur RoboTwin et en manipulation réelle. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la promesse de découplage entre données d'entraînement et coût d'annotation. Si une politique VLA peut effectivement tirer une supervision de dynamique utile de vidéos non annotées, cela ouvre la voie à des jeux de données d'entraînement bien plus vastes sans multiplier les campagnes de téléopération robotique, un goulot d'étranglement connu pour tout intégrateur ou labo qui cherche à généraliser au-delà d'un jeu de tâches restreint. Cela dit, il s'agit d'un résultat de recherche publié sur arXiv, pas d'un produit déployé : les métriques de succès sur RoboCasa et RoboTwin sont des benchmarks de simulation ou semi-contrôlés, et la mention de "manipulation réelle" reste peu détaillée dans l'abstract, sans précision sur le nombre de tâches, le taux de réussite exact en conditions réelles ni le hardware utilisé. Le travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, langage et contrôle moteur dans un même backbone, et dans la tendance plus large des "world models" latents pour la robotique, où l'usage de features pré-entraînées (ici DINOv3) remplace la reconstruction pixel pour la supervision. Aucun acteur français ou européen n'est mentionné dans cet abstract. Les suites logiques incluraient une publication complète avec code et poids, ainsi que des tests de généralisation croisée entre familles de robots, un point sur lequel l'abstract reste volontairement vague.

RechercheActu
1 source