Aller au contenu principal
MOSAIC : planification de manipulation centrée sur les compétences par simulation physique
RecherchearXiv cs.RO 

MOSAIC : planification de manipulation centrée sur les compétences par simulation physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le fossé entre le nombre potentiellement infini de compétences robotiques disponibles et l'incapacité des robots à les enchaîner de façon fiable sur des tâches longues reste un problème central en robotique. Une équipe de chercheurs présente MOSAIC, une méthode de planification centrée sur les compétences qui s'appuie sur la simulation physique pour estimer, avant exécution, la probabilité de succès de chaque compétence dans un contexte donné. Plutôt que d'explorer pas à pas un espace de séquences quasi infini, comme le font les méthodes incrémentales classiques, ou de raisonner sur des représentations symboliques simplifiées mais fragiles et coûteuses à construire à la main, MOSAIC combine deux familles complémentaires de compétences: les Générateurs, qui identifient des « îlots de compétence », c'est-à-dire des zones où une action donnée réussit de façon démontrable, et les Connecteurs, qui relient ces trajectoires entre elles en résolvant des problèmes aux limites. L'équipe a testé l'approche sur des tâches de manipulation longues et complexes, en simulation comme sur un robot réel, en mobilisant un ensemble hétérogène d'outils: modèles de diffusion génératifs, algorithmes classiques de planification de mouvement et modèles spécialisés en manipulation. Le papier, une version révisée publiée sur arXiv, est accompagné d'un site de démonstrations (skill-mosaic.github.io).

L'enjeu dépasse la seule performance algorithmique. Le planning long-horizon par composition de compétences est considéré depuis des années comme un verrou pour des robots véritablement généralistes, capables d'assembler des briques génériques pour résoudre des tâches nouvelles sans reprogrammation dédiée. En concentrant l'effort de recherche sur les régions où chaque compétence est réellement fiable, plutôt que de faire confiance à une couverture uniforme de l'espace des possibles, MOSAIC apporte une réponse concrète à la fragilité chronique des approches symboliques et à l'explosion combinatoire des méthodes purement incrémentales, un sujet sensible à l'heure où l'industrie mise massivement sur les modèles vision-langage-action pour la généralisation.

Cette contribution s'inscrit dans la lignée des travaux de planification tâche-et-mouvement (TAMP), où la tension entre robustesse symbolique et flexibilité des méthodes apprises est documentée de longue date. L'essor récent des politiques de diffusion et des modèles génératifs comme briques de bas niveau change la donne: MOSAIC propose justement un cadre capable d'orchestrer ce type d'outils hétérogènes sans passer par une couche symbolique rigide. La publication d'une troisième version sur arXiv suggère un travail encore en cours de révision, avec des démonstrations concrètes disponibles pour les équipes de recherche souhaitant évaluer la méthode sur leurs propres bancs d'essai.

À lire aussi

UniCross : synthèse unifiée de manipulation dextérique multi-compétences
1arXiv cs.RO 

UniCross : synthèse unifiée de manipulation dextérique multi-compétences

Un preprint arXiv publié fin juillet 2026 (arXiv:2607.28198v1) présente UniCross, un cadre unifié pour la manipulation dextre robotique qui traite en une seule formulation les quatre compétences de base identifiées par les auteurs : la préhension (grasping), le déplacement d'objet (relocation), la rotation dans la main et la translation dans la main. Ces quatre gestes partagent les mêmes espaces d'état et d'action ainsi qu'une structure d'objectif commune, ce qui permet de distiller une politique unique capable d'exécuter chacune de ces compétences séparément, tout en généralisant à des objets jamais vus pendant l'entraînement et en restant robuste face à des perturbations externes. Le système chaîne également ces compétences pour réaliser des tâches de manipulation de plus long horizon, et transfère, selon les auteurs, à différentes morphologies de main robotique. L'abstract ne détaille pas de chiffres précis (taux de réussite, nombre d'objets testés, plateformes matérielles) : ces éléments restent à vérifier dans le corps du papier. L'enjeu dépasse la simple prouesse technique. Aujourd'hui, la manipulation dextre en robotique est presque toujours traitée comme un empilement de modules spécialisés, chacun avec ses propres contraintes d'action et parfois sa propre conception de main, ce qui casse la continuité nécessaire pour enchaîner plusieurs gestes dans une tâche complexe. Si une formulation partagée permet réellement d'obtenir une seule politique performante sur les quatre compétences, cela validerait l'idée qu'un modèle généraliste peut remplacer les pipelines fragmentés propres à chaque geste, une piste proche de l'esprit des approches VLA généralistes en manipulation robotique, mais appliquée ici spécifiquement à la dextérité de la main plutôt qu'aux bras et pinces classiques. Cette publication s'inscrit dans un courant de recherche plus large cherchant à unifier les politiques de manipulation dextre, un domaine longtemps dominé par des méthodes spécifiques à chaque tâche et à chaque morphologie de main, en particulier dans les travaux sur l'apprentissage par renforcement pour mains robotiques multi-doigts. S'agissant d'un preprint tout juste annoncé, sans mention d'un laboratoire ou d'une entreprise identifiable dans le résumé, il s'agit à ce stade d'une contribution académique et non d'un produit ou d'un déploiement industriel ; les prochaines étapes attendues sont la publication du code, des benchmarks détaillés et, potentiellement, des démonstrations sur du matériel physique au-delà de la simulation.

RecherchePaper
1 source
DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences
2arXiv cs.RO 

DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences

DROM, un cadre génératif décrit dans un préprint arXiv (v1), vise un problème classique de la manipulation robotique : apprendre à partir de peu de démonstrations des politiques robustes, capables d'enchaîner plusieurs compétences sur des tâches longues. Les auteurs utilisent des Dynamic Movement Primitives (DMP) pour multiplier un petit nombre de démonstrations expertes en jeux de données multi-compétences. Ils affirment que cela réduit la collecte de données et étend la généralisation spatiale au-delà de la zone démontrée. Le modèle prolonge Motion Planning Diffusion (MPD) avec une attention croisée conditionnée par le langage. Un seul réseau génère alors des trajectoires cohérentes pour plusieurs primitives, y compris des comportements sensibles à l'orientation, difficiles à programmer avec un planificateur classique ou un contrôleur codé en dur. Pour les tâches longues, un grand modèle de langage (LLM) découpe la demande d'un opérateur en séquence de compétences exécutables. La validation a eu lieu sur un Franka Emika Panda, un FANUC CRX25ia et en simulation MuJoCo. Selon les auteurs, DROM dépasse les références MPD et Behavior Cloning. Le résumé ne donne aucun chiffre : ni taux de réussite, ni nombre de démonstrations, ni nombre de compétences, ni temps de cycle. Les jeux de données, les environnements de simulation et le code sont publiés sur GitHub. L'intérêt tient d'abord à la combinaison de trois briques déjà connues, DMP, diffusion et LLM, dans une architecture unique et exploitable en atelier. Pour un intégrateur, la promesse est de réduire le coût de programmation et de téléopération à chaque nouvelle variante de tâche. Un opérateur pourrait piloter une cellule en langage naturel, sans écrire de trajectoires. La présence d'un FANUC CRX25ia, cobot industriel de 25 kg de charge, est un signal plus pertinent que le seul Panda, plateforme de laboratoire. Elle indique une volonté de transfert vers du matériel de production. Il faut toutefois rester prudent. Sans métriques publiées, sans précision sur le sim-to-real, sur la robustesse face aux perturbations ni sur la latence d'inférence de la diffusion, le gain sur les références reste invérifiable à ce stade. L'écart entre une démonstration de laboratoire et une cadence industrielle n'est pas comblé. Ce travail s'inscrit dans une course où dominent les modèles vision-langage-action (VLA) entraînés sur de grands volumes de données, comme Pi-0, GR00T ou Helix. DROM prend le parti inverse : un pipeline modulaire et frugal en données, où le LLM planifie et la diffusion exécute, avec des trajectoires plus interprétables. Ce compromis intéressera les cellules à faible volume et à forte variété. La suite dépendra de la reproduction par des tiers, grâce au dépôt ouvert, et d'essais sur des tâches réelles plus contraintes que celles d'un banc de test académique. Aucun pilote industriel ni calendrier n'est annoncé.

RecherchePaper
1 source
Replanification ancrée dans le corps pour une manipulation physiquement adaptative
3arXiv cs.RO 

Replanification ancrée dans le corps pour une manipulation physiquement adaptative

Publié sur arXiv le 25 septembre 2026 sous la référence 2609.30024, un article présente le « body-grounded replanning », une méthode qui permet à un bras manipulateur d'ajuster sa stratégie d'exécution selon son propre état physique interne, et non plus seulement selon la géométrie de l'environnement. Le système surveille l'état articulaire du robot, charge sur les joints et mobilité disponible, et déclenche une replanification dès qu'un événement corporel survient, comme une surcharge ou une contrainte de mobilité asymétrique. Un grand modèle de langage interprète alors cet état, les statistiques d'exécution récentes et l'historique des actions pour choisir une stratégie alternative, sans toucher à l'objectif de la tâche ni au contrôleur bas niveau. L'approche est validée sur une tâche d'atteinte sous charge contrôlée et contraintes de mobilité asymétriques, en simulation puis sur un robot réel, avant d'être étendue à des manipulations avec contacts. Cette approche cible un angle mort des architectures de manipulation actuelles : une stratégie peut rester géométriquement valide tout en devenant physiquement inadaptée, par exemple quand un bras accumule de la fatigue articulaire ou perd en amplitude de mouvement, un signal qui ne remonte d'ordinaire jamais au-delà du contrôle bas niveau. En faisant remonter l'état corporel jusqu'à la couche de décision de haut niveau, généralement réservée à la perception externe, les auteurs montrent qu'un robot peut réduire son effort physique et gagner en efficacité d'adaptation tout en gardant un taux de réussite élevé. Pour les intégrateurs qui déploient des modèles vision-langage-action sur des plateformes réelles, ce travail ouvre une piste pour limiter l'usure mécanique et les échecs liés à des contraintes physiques imprévues, sans réentraîner la politique de contrôle bas niveau. Cette proposition s'inscrit dans la tendance consistant à confier à un LLM le rôle d'orchestrateur au-dessus de politiques de contrôle bas niveau spécialisées, une architecture déjà explorée par plusieurs travaux de planification robotique assistée par langage. Sa spécificité tient à l'usage de signaux purement internes au robot, joints, charge, mobilité, plutôt que des seules entrées visuelles habituellement utilisées pour décider d'un changement de stratégie. Classé comme nouvelle soumission sur arXiv, l'article ne mentionne aucun partenariat industriel ni déploiement hors laboratoire : les essais se limitent à une tâche de reaching et à des manipulations avec contacts, en simulation et sur un seul robot réel, sans calendrier de transfert vers un produit commercial.

RecherchePaper
1 source
Apprentissage rapide sur robot pour compétences de manipulation dynamique : le jonglage robotique
4arXiv cs.RO 

Apprentissage rapide sur robot pour compétences de manipulation dynamique : le jonglage robotique

Un article publié sur arXiv (2608.26800v1) présente un cadre d'apprentissage en ligne permettant à un robot bimanuel d'apprendre à jongler directement sur du matériel physique, en moins de cinq minutes d'interaction réelle. Équipé de deux bras, de mains multi-doigts et d'une vision embarquée, le robot maîtrise cinq figures classiques de jonglage à trois balles : cascade, tennis, demi-douche, douche et boîte. La méthode, dite d'apprentissage régularisé par mémoire, combine un modèle local construit à partir de l'expérience accumulée sur le robot avec un modèle global préalable qui sert à extrapoler là où les données manquent. Un mécanisme de sécurité, appelé ensemble mutuellement atteignable, garantit que chaque transition entre lancer et rattrapage reste dans les limites articulaires et d'actionneurs des deux bras. Ce résultat s'attaque à l'écart persistant entre simulation et réalité en robotique : plutôt que de chercher à améliorer la fidélité du simulateur, les auteurs montrent qu'un modèle imparfait suffit comme socle à un apprentissage rapide directement sur le robot. Cela contredit l'hypothèse répandue selon laquelle un pré-entraînement massif ou une collecte de données prolongée est nécessaire pour des tâches de manipulation dynamique exigeant une coordination fine entre perception et action en temps réel. Pour les intégrateurs et décideurs industriels, l'approche suggère des robots capables de s'adapter en quelques minutes à une nouvelle tâche sur site plutôt qu'après des semaines de réentraînement hors ligne, ce qui réduirait le coût et les délais de déploiement de systèmes manipulateurs dextres. Le jonglage sert ici de banc d'essai à des compétences de manipulation dynamique et rapide, un registre distinct des tâches quasi statiques comme la préhension ou le tri qui dominent les démonstrations commerciales actuelles. L'abstract ne précise ni l'affiliation des auteurs ni la plateforme robotique utilisée, au-delà de sa description fonctionnelle. Ce travail s'inscrit dans une tendance de recherche visant à dépasser les politiques figées apprises hors ligne, au profit de robots capables d'affiner en continu leur comportement au contact du monde réel. Les auteurs présentent ce résultat comme une preuve de concept, une étape vers des systèmes qui exploitent des connaissances préalables imparfaites tout en s'améliorant continuellement par leur propre expérience physique.

RecherchePaper
1 source