Aller au contenu principal
GaP : un système multi-agents auto-apprenant à graphe-politique pour l'automatisation variationnelle
RecherchearXiv cs.RO 

GaP : un système multi-agents auto-apprenant à graphe-politique pour l'automatisation variationnelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (référence 2607.05369, version 1) un système baptisé GaP, pour Graph-as-Policy, destiné à un type de tâches qu'elle définit sous le terme d'"automatisation variationnelle" (VA) : des opérations industrielles où la géométrie et la position des objets varient davantage que dans l'automatisation fixe classique, mais sans atteindre la complexité totale d'un environnement ouvert. Concrètement, GaP est un harnais multi-agents qui génère automatiquement des graphes de calcul dirigés combinant des nœuds de perception, de planification et de contrôle, puisés dans une bibliothèque modulable de compétences robotiques ouverte baptisée MORSL. Le système crée ensuite un environnement de simulation interne pour rejouer en parallèle différentes variantes de graphes sur une même tâche, affinant progressivement leur structure et leurs paramètres afin d'améliorer le taux de réussite et le débit. Les auteurs annoncent des résultats sur huit nouveaux bancs d'essai qu'ils ont eux-mêmes conçus, quatre en simulation et quatre en conditions réelles, avec des performances qui surpasseraient nettement les méthodes de référence, sans toutefois préciser lesquelles ni détailler l'écart chiffré, un point qui mérite prudence tant que les données ne sont pas vérifiées indépendamment.

L'intérêt de l'approche tient à sa tentative de réconcilier deux écoles longtemps opposées dans la robotique industrielle : la programmation interprétable héritée du Task and Motion Planning et de ROS, et l'adaptabilité des politiques apprises sans modèle, du type de celles qui alimentent les modèles VLA récents. Pour les intégrateurs et décideurs industriels, la promesse est celle d'une fiabilité d'exécution proche de l'automatisation fixe, tout en gérant les variations de pose et de géométrie que les lignes rigides ne tolèrent pas, sans dépendre entièrement d'une politique de bout en bout dont le comportement reste difficile à auditer.

Le travail s'inscrit dans la continuité des recherches sur le TAMP et l'écosystème ROS, en réponse implicite aux limites de fiabilité observées chez les politiques génératives pures. Code, données et bancs d'essai sont publiés en accès libre sur graph-robots.github.io/gap, ce qui ouvre la voie à des comparaisons indépendantes avec d'autres architectures avant toute adoption industrielle.

Dans nos dossiers

À lire aussi

EquiBim : apprentissage d'une politique équivariante par symétrie pour la manipulation bimanuelle
1arXiv cs.RO 

EquiBim : apprentissage d'une politique équivariante par symétrie pour la manipulation bimanuelle

Des chercheurs présentent EquiBim, un cadre d'apprentissage par imitation qui impose une contrainte de symétrie bilatérale aux politiques de manipulation bimanuelle. Publié sur arXiv (2603.08541, version 3, une révision d'un article déjà soumis), le travail part d'un constat simple: les bras robotiques à deux membres partagent souvent une symétrie morphologique gauche-droite, tout comme de nombreuses tâches qu'ils exécutent, mais les politiques entraînées par imitation classique ne l'exploitent pas et produisent des comportements incohérents face à des observations pourtant symétriques. EquiBim formalise cette symétrie physique comme une action de groupe sur les espaces d'observation et d'action, puis impose une contrainte d'équivariance aux prédictions du modèle pendant l'entraînement. Le framework se veut agnostique au modèle sous-jacent: il s'intègre à des pipelines variés, qu'ils reposent sur des nuages de points ou des images, et que les actions soient paramétrées dans l'espace cartésien de l'effecteur ou dans l'espace articulaire. Les auteurs valident l'approche sur RoboTwin, une plateforme de simulation à cinématique bimanuelle symétrique, avant de la tester sur un système bras double réel. L'intérêt pour l'industrie tient à la nature du gain rapporté: une amélioration constante des performances et de la robustesse face aux changements de distribution, en simulation comme en conditions réelles. C'est un signal utile dans un secteur où l'écart entre démonstrations impressionnantes et fiabilité en déploiement reste un point de friction majeur pour les intégrateurs de robots bimanuels et humanoïdes. Injecter un biais inductif structurel, plutôt que de compter uniquement sur le volume de données de démonstration, est une piste que plusieurs laboratoires explorent pour réduire le besoin en données coûteuses tout en stabilisant le comportement des politiques VLA. Le contexte est celui d'une littérature déjà riche sur l'équivariance en apprentissage robotique, jusqu'ici surtout appliquée aux bras uniques. EquiBim l'étend au cas bimanuel, dans un paysage où des architectures comme GR00T N2, Pi-0 ou Helix cherchent aussi à généraliser au-delà des données d'entraînement. À ce stade, il s'agit d'un résultat académique reproductible sur banc d'essai et sur un prototype réel, pas d'un produit commercial: la suite logique serait son adoption ou son adaptation par des équipes développant des piles de contrôle bimanuelles en conditions industrielles.

RecherchePaper
1 source
Du déploiement à la réinitialisation : un système d'évaluation par graphe pour la manipulation autonome à long horizon
2arXiv cs.RO 

Du déploiement à la réinitialisation : un système d'évaluation par graphe pour la manipulation autonome à long horizon

Publié sur arXiv (2609.19413v1) le 18 septembre 2026, l'article présente HALTER, un système qui automatise l'évaluation de politiques de manipulation robotique sur des tâches longues, en particulier la remise à zéro de la scène entre essais, jusqu'ici confiée à un opérateur humain. Testé sur un bras Franka pour quatre tâches longues, HALTER restaure correctement la scène dans 76% des épisodes, contre 52% pour AutoEval et 65% pour un reset par planification de mouvement classique. Il estime juste la fraction de compétences accomplies dans 90% des cas, contre 76% pour AutoEval, et son verdict de vérification du reset est correct dans 91% des épisodes contre 78%. Le système réduit aussi de 72% le temps d'opérateur d'une campagne d'évaluation par rapport à un reset manuel, et sur trois tâches inédites testant la généralisation compositionnelle, il réussit le reset dans 74,7% des épisodes contre seulement 1,3% pour une politique de reset entraînée tâche par tâche. Cette avancée cible un vrai goulot d'étranglement de la recherche en robotique: l'évaluation sur robot réel reste la référence des progrès en manipulation, mais reset la scène à la main coûte du temps et laisse la distribution des états initiaux mal définie, ce qui nuit à la reproductibilité des résultats. En automatisant reset et notation pour des tâches multi-étapes sans images de succès annotées, HALTER change l'économie des campagnes de test: le coût de démonstration croît avec la taille d'une bibliothèque de compétences de reset réutilisables, et non plus avec le nombre combinatoire d'états terminaux possibles. Pour les équipes qui entraînent des modèles vision-langage-action à grande échelle, cela ouvre la voie à des benchmarks continus moins gourmands en supervision humaine, dans un secteur qui cherche justement à distinguer démonstrations triées et performance réellement mesurée. HALTER prolonge AutoEval, système antérieur capable d'automatiser reset et notation mais seulement pour des tâches à une étape, un essai long pouvant se terminer dans un nombre combinatoirement grand de configurations qu'aucune politique de reset apprise ne couvre seule. La solution construit en ligne un graphe de scène à partir de nuages de points et de modèles de vision, qu'un grand modèle de langage utilise pour noter la tâche, planifier le reset via une bibliothèque de compétences atomiques, et vérifier sa réussite. Les auteurs ont aussi testé différentes représentations de la scène et fréquences de mise à jour du graphe, sans annoncer de calendrier de déploiement au-delà de ce cadre expérimental sur bras Franka.

RecherchePaper
1 source
ULOHA : un système robotique bimanuel sous-marin pour l'apprentissage robotique
3arXiv cs.RO 

ULOHA : un système robotique bimanuel sous-marin pour l'apprentissage robotique

Une équipe de recherche présente ULOHA, une plateforme robotique bimanuelle sous-marine dédiée à l'apprentissage de politiques par imitation, décrite dans un article publié sur arXiv (référence 2609.19200, septembre 2026). Le système associe du matériel maison en configuration leader-suiveur pour la téléopération à des extensions logicielles du framework open source LeRobot, couvrant toute la chaîne : téléopération, capture vidéo multi-angles, collecte de démonstrations, entraînement de politiques et déploiement autonome. Les expériences sur robot réel montrent des comportements bimanuels coordonnés sous l'eau, dont le transfert d'objet entre les deux bras, la manipulation partagée d'un même objet et l'interception d'objets mis en mouvement par la flottabilité. Trois méthodes d'apprentissage ont été testées sur la plateforme : ACT, Diffusion Policy et le modèle vision-langage-action SmolVLA. Une étude complémentaire à un seul bras a par ailleurs examiné le transfert de politiques entre l'air et l'eau, montrant que des démonstrations mélangeant les deux milieux permettent l'exécution dans les deux, dans les conditions testées. Pour le secteur, ULOHA comble un angle mort : la quasi-totalité des travaux sur l'apprentissage visuomoteur par imitation et sur les modèles VLA a été développée et validée en air, pour la manipulation domestique comme industrielle, alors que la robotique bimanuelle sous-marine restait peu étudiée. Le papier documente les perturbations propres au milieu aquatique, comme les bulles, les mouvements d'objets induits par la flottabilité, les horizons d'exécution d'action et le chunking temps réel, qui dégradent les politiques conçues pour l'air. C'est un test de robustesse notable pour des architectures qui, jusqu'ici, avaient surtout prouvé leur généralisation en environnement sec et contrôlé. Pour les intégrateurs concernés par l'inspection sous-marine, la maintenance offshore, l'aquaculture ou la robotique marine scientifique, cela suggère qu'un apprentissage par démonstration déjà mature en air pourrait être transposé sous l'eau moyennant des adaptations ciblées, plutôt qu'un retour au contrôle classique. ULOHA s'appuie sur LeRobot, le framework open source de robotique publié par Hugging Face, que les auteurs étendent à un scénario bimanuel immergé non couvert nativement. Le projet se présente comme un outil expérimental partagé avec la communauté de recherche plutôt que comme un produit commercial : l'article ne mentionne ni volume de déploiement, ni prix, ni partenaire industriel. Le matériel, le code et les données de démonstration sont annoncés comme disponibles via une page dédiée, ce qui laisse présager une adoption par d'autres laboratoires travaillant sur la manipulation sous-marine ou le transfert de politiques entre domaines physiques distincts. Les suites logiques, non détaillées dans l'article, porteraient vraisemblablement sur l'élargissement du jeu de démonstrations et le passage à des tâches plus complexes.

RecherchePaper
1 source
Attribution de tâches multiples à bundle variable avec estimation sélective des coûts pour les systèmes multi-agents
4arXiv cs.RO 

Attribution de tâches multiples à bundle variable avec estimation sélective des coûts pour les systèmes multi-agents

Une équipe de chercheurs a publié le 24 juin 2026 sur arXiv (arXiv:2606.24462) un framework distribué pour l'allocation réactive de tâches dans les systèmes multi-robots. L'approche repose sur des enchères combinatoires à deux niveaux de fidélité : chaque robot explore localement l'espace des bundles de tâches via un arbre de recherche guidé par une heuristique légère (distance euclidienne), puis applique une planification de chemin haute-fidélité uniquement aux candidats les plus prometteurs, selon une stratégie best-first. Les offres raffinées sont ensuite soumises à un coordinateur central qui résout un problème de set packing pour garantir la faisabilité globale et maximiser l'utilité collective. Des simulations dans plusieurs environnements confirment que le framework améliore les performances par rapport aux enchères combinatoires conventionnelles, avec des tailles de bundles variables et sans exposer l'état interne des agents. L'obstacle que ce travail attaque est bien connu dans les flottes de robots mobiles autonomes (AMR) : les enchères combinatoires garantissent des allocations efficaces, mais la génération exhaustive de bundles croît exponentiellement avec le nombre de tâches et d'agents, rendant la méthode inutilisable en temps réel dès que la planification de chemin précise est nécessaire pour valider les coûts. Le découplage en deux étapes - exploration rapide bas-fidélité, raffinement sélectif haute-fidélité - permet de conserver les garanties théoriques tout en restant tractable pour des réallocations dynamiques en cours d'opération. Pour les intégrateurs de flottes industrielles, cela ouvre une voie concrète vers des systèmes capables de gérer des arrivées de tâches imprévues sans replanification globale, et sans exposer les modèles de coût propriétaires des agents - un point de confidentialité non négligeable dans des environnements multi-opérateurs. L'allocation multi-robot de tâches est un problème de recherche opérationnelle actif depuis les années 2000, avec des références comme le CBBA (Consensus-Based Bundle Algorithm) ou les approches de marché distribué. La complexité combinatoire reste le principal frein à la commercialisation d'un ordonnancement véritablement dynamique pour les flottes d'entrepôt, secteur où des acteurs comme Exotec (France), 6 River Systems ou Locus Robotics opèrent avec des systèmes souvent limités en réactivité. Ce papier reste toutefois au stade simulation : aucune validation sur robots physiques n'est rapportée, laissant le gap sim-to-real non résolu. Les suites naturelles incluraient des tests sur flottes réelles, la gestion des pannes d'agents en cours d'exécution, et l'extension à des environnements partiellement observables.

UEExotec (France), acteur majeur des flottes AMR d'entrepôt, est citée comme bénéficiaire potentiel de ce framework pour la réallocation dynamique de tâches, mais l'absence de validation sur robots physiques limite l'impact concret à court terme.

RecherchePaper
1 source