Aller au contenu principal
MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile
RecherchearXiv cs.RO 

MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un travail de recherche en robotique publié sur arXiv le 23 septembre 2026 sous la référence 2609.26378v1 présente MAVP (Map-Aware Visuomotor Policies), un framework destiné à fiabiliser l'exécution des robots à manipulation mobile, c'est-à-dire combinant base roulante et bras articulé. Le constat de départ : les politiques entraînées par démonstration peinent souvent à reproduire fidèlement le déplacement de la base, ce qui provoque un désalignement spatial et fait échouer la manipulation qui suit. MAVP reconstruit une carte statique à partir de démonstrations téléopérées, exprime les trajectoires de base démontrées dans ce référentiel cartographique commun, puis, à l'exécution, prédit conjointement des poses cibles de base, des actions du bras et de la pince à partir d'images RGB, de l'état des articulations et de la pose courante du robot sur la carte. Un contrôleur de bas niveau suit ensuite ces cibles par anticipation de mouvement et retour d'erreur de pose, avec un bruit ajouté sur la pose pendant l'entraînement pour renforcer la robustesse. Sur six tâches de manipulation réelles et trois familles de politiques testées, MAVP obtient un taux de succès supérieur au contrôle de vitesse "non ancré" dans l'ensemble des cas, sans que le résumé ne publie de chiffres agrégés précis.

Le résultat cible un point de friction bien identifié dans l'apprentissage par imitation appliqué à la manipulation mobile : le contrôle de vitesse pur de la base dérive avec le temps et casse la coordination entre déplacement et geste de préhension, un problème qui freine aujourd'hui le passage des démonstrations de laboratoire à des déploiements fiables en usine ou en entrepôt. En ancrant explicitement chaque politique à une carte et à une pose absolue plutôt qu'à une commande de vitesse relative, MAVP s'attaque directement à l'écart documenté entre démonstrations réussies et exécution robuste en conditions réelles, un enjeu central pour les intégrateurs qui évaluent des politiques génératives type VLA pour des robots mobiles manipulateurs ou des humanoïdes à base roulante. Pour les décideurs B2B, l'apport n'est pas un nouveau modèle de fondation mais une brique de contrôle complémentaire, validée sur trois familles de politiques différentes, ce qui suggère une méthode transposable plutôt qu'une solution propriétaire liée à un seul modèle.

Le travail s'inscrit dans la lignée des recherches académiques cherchant à corriger les limites du contrôle de vitesse non ancré, pratique héritée de la robotique mobile classique et transposée telle quelle aux politiques d'apprentissage par imitation. Le site dédié au projet, hébergé sous une adresse GitHub Pages anonymisée, suggère un papier soumis en évaluation en double aveugle à une conférence de robotique ou d'apprentissage automatique, sans que les auteurs ni leur affiliation ne soient révélés à ce stade : il s'agit donc d'une contribution de recherche et non d'un produit commercial. Aucun acteur français ou européen n'apparaît dans ces travaux. Les auteurs annoncent la mise à disposition de vidéos et de résultats complémentaires en ligne, mais ne communiquent ni feuille de route produit ni partenariat industriel ; la suite logique, en cas d'acceptation, sera l'extension de la méthode à davantage de tâches et de plateformes pour confirmer sa généralité au-delà des six cas testés.

Dans nos dossiers

À lire aussi

Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile
1arXiv cs.RO 

Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile

Des chercheurs publient SBP (Seeing the Bigger Picture), une méthode d'apprentissage de politiques pour la manipulation mobile fondée sur une carte 3D de caractéristiques latentes plutôt que sur de simples images, documentée sur arXiv sous la référence 2510.03885 en quatrième version. La méthode fusionne de manière incrémentale des observations multi-vues dans une grille de caractéristiques propre à chaque scène ; un décodeur pré-entraîné reconstruit des embeddings cibles à partir de ces caractéristiques, permettant d'optimiser la carte en ligne pendant l'exécution de la tâche. La politique, entraînable par clonage comportemental ou apprentissage par renforcement, traite cette carte comme variable d'état. Sur une tâche de manipulation séquentielle sur table, SBP améliore le taux de réussite de 15 % par rapport à une politique fondée uniquement sur des images, dans des scènes déjà vues comme inédites. Ce résultat cible une limite connue des politiques de type VLA (vision-language-action), qui raisonnent généralement image par image et perdent toute mémoire de ce qui sort du champ de la caméra. Pour un robot mobile devant se souvenir d'un objet vu dans une autre pièce ou enchaîner des sous-tâches dans la durée, cette absence de mémoire spatiale persistante est un frein concret. En montrant qu'une représentation 3D explicite et réoptimisable en continu surpasse une politique purement image-vers-action, l'étude suggère que le raisonnement spatial long-terme ne se résoudra pas seulement en augmentant modèles et données : la structure de la représentation d'état compte, un signal utile pour les intégrateurs de robots mobiles et humanoïdes. Ce travail s'inscrit dans une recherche plus large combinant cartographie 3D (voxels, champs de caractéristiques, représentations type NeRF) et apprentissage de politiques, en alternative aux approches VLA tout-image qui dominent les annonces du secteur. Le résumé ne précise ni institution ni plateforme robotique commerciale associée : il s'agit d'une contribution académique publiée sur arXiv, déjà révisée au moins quatre fois, signe d'un travail encore en affinement plutôt que d'un produit fini. Aucune date de déploiement ni partenariat industriel n'est mentionné ; la portée reste celle d'une preuve de concept en laboratoire, sans indication de transfert vers un robot physique déployé à grande échelle.

RecherchePaper
1 source
Mobile UMI : politique de diffusion multi-vues à cinématique découplée pour la manipulation mobile
2arXiv cs.RO 

Mobile UMI : politique de diffusion multi-vues à cinématique découplée pour la manipulation mobile

Mobile UMI, soumis sur arXiv (arXiv:2605.20894) en mai 2026, présente un framework de collecte de démonstrations sans robot dédié pour l'apprentissage par imitation sur manipulateur mobile. Le dispositif repose sur trois composants: un rig à deux caméras portées par l'opérateur humain (poitrine pour la navigation globale, poignet pour l'interaction locale), une ancre spatiale ChArUco en prise unique qui recale les deux repères visuels-inertiels et découple la trajectoire de manipulation en SE(3) de celle de navigation en SE(2), et un exécuteur asynchrone à horizon glissant (receding-horizon) qui réaligne en temps réel chaque chunk d'actions généré sur la pose physique courante du robot. Sur quatre tâches domestiques longue-séquence évaluées à 100 essais chacune, le système atteint un taux de réussite moyen de 83,8%, devançant les baselines ACT et Diffusion Policy testées dans les mêmes conditions. Ce résultat s'attaque à deux goulots structurels du mobile manipulation: les labels d'action contaminés par la locomotion humaine lors de la collecte, et la latence d'inférence des politiques de diffusion (plusieurs centaines de millisecondes), pendant laquelle la base avance et rend les waypoints planifiés caducs. En découplant cinématiquement la main du torse, les trajectoires d'entraînement deviennent cohérentes indépendamment de la démarche de l'opérateur. L'approche est architecturalement agnostique, ce qui est un point fort concret pour les intégrateurs: aucune modification de la politique sous-jacente n'est requise, et les ablations confirment que le référentiel thoracique seul comble l'essentiel de l'écart de performance, la synchronisation d'état fermant le reste. Mobile UMI étend l'Universal Manipulation Interface (UMI) de Chi et al. (Stanford/Columbia, 2023), interface poignet à bas coût qui a popularisé la collecte téléopérée pour la manipulation sur table. L'extension à la base mobile était un verrou reconnu: les approches dominantes comme RT-2, OpenVLA ou Pi-0 de Physical Intelligence ciblent essentiellement des bras fixes ou des déplacements très contraints. Des acteurs comme Boston Dynamics avec Spot et son bras, ou des projets académiques comme MoMa (Mobile Manipulation), opèrent dans ce même espace concurrentiel. Le travail reste un preprint non évalué, sans déploiement industriel annoncé ni partenaire matériel cité; les conditions précises des essais (charge utile, vitesse de base, surface de test) ne sont pas détaillées dans l'abstract, ce qui limite la comparabilité directe avec d'autres benchmarks publiés.

RechercheOpinion
1 source
AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique
3arXiv cs.RO 

AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique

Des chercheurs proposent AffordTrajDP, un nouveau framework d'apprentissage par imitation guidé par affordances pour la manipulation robotique, publié en préprint sur arXiv début août 2026. Contrairement aux approches classiques qui figent un point de contact statique entre l'effecteur et l'objet cible, ce système construit une trajectoire d'affordance dynamique : à partir d'une observation RGB-D, un point d'ancrage est propagé dans le temps en suivant la pose SE(3) de l'objet, ce qui donne une guidance cohérente tout au long du geste plutôt qu'une simple instruction figée en début de tâche. Sur le benchmark simulé ManiSkill3, la méthode atteint un taux de réussite moyen de 70,0 %, soit jusqu'à 17,8 points de mieux que les meilleures méthodes concurrentes. Des essais en conditions réelles ont été menés sur des bras robotiques Galaxea A1 et UR7e, sur six tâches de précision (empilement de cubes, prise de gobelet, insertion d'adaptateur, anneau sur tige, dépôt en bol, insertion USB), avec des tests sur objets vus et non vus pour le bras Galaxea A1. L'enjeu dépasse la simple performance chiffrée : les affordances statiques dérivent souvent après le contact initial, surtout dans les tâches de précision ou quand la position de l'objet varie légèrement, un problème classique de fossé entre démonstration en labo et robustesse en conditions réelles. En rendant la guidance sensible à l'état de l'objet plutôt qu'à un point fixe défini à l'avance, AffordTrajDP s'attaque directement à ce goulot d'étranglement, un signal pertinent pour les intégrateurs qui cherchent des politiques visuo-motrices capables de tolérer le désordre réel d'un poste de production ou d'entrepôt, plutôt que des démonstrations calibrées en environnement contrôlé. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation guidées par affordances, qui cherchent à compresser la perception visuelle en contraintes géométriques exploitables pour réduire les besoins en données d'entraînement. Les auteurs présentent des ablations pour isoler la contribution de chaque composant du système. À ce stade, il s'agit d'un résultat de recherche en préprint, non d'un produit commercial ni d'un déploiement industriel annoncé.

RecherchePaper
1 source
SafeLoop : retour arrière tenant compte du risque pour la manipulation vision-langage-action
4arXiv cs.RO 

SafeLoop : retour arrière tenant compte du risque pour la manipulation vision-langage-action

Des chercheurs présentent SafeLoop, un mécanisme de sécurité externe destiné aux modèles vision-langage-action (VLA) utilisés en manipulation robotique, détaillé dans un article arXiv (2609.26313v1) publié fin septembre 2026. Le système fonctionne comme une surcouche non invasive: il ne modifie pas les paramètres du modèle VLA de base, mais entraîne un prédicteur de risque distinct, alimenté par la vision et la proprioception du robot, qui calcule quatre valeurs en continu, la probabilité et le délai avant un risque de collision du corps du robot, ainsi que la probabilité et le délai avant un échec de manipulation d'objet. Un contrôleur léger déclenche ensuite l'une de trois actions selon ce risque prédit: poursuivre l'exécution normalement, enregistrer un point de contrôle de sécurité, ou reculer dans l'espace articulaire jusqu'à ce point avant d'interroger à nouveau la politique de base pour tenter une autre trajectoire. Testé sur 24 tâches du benchmark simulé LIBERO (16 essais aléatoires chacune) et sur trois tâches réelles avec un robot physique (25 essais chacune), SafeLoop réduit les cas dangereux d'environ 70% tout en préservant le taux de réussite des tâches et le rythme de contrôle de la politique de base. Le code du projet est disponible sur GitHub. Ce travail s'attaque directement à une faiblesse reconnue des modèles VLA généralistes: leur fragilité sur des horizons d'exécution longs, où de petites erreurs d'estimation d'état ou de contrôle peuvent provoquer des échecs irréversibles comme des collisions ou des chutes d'objets. Pour les intégrateurs et décideurs industriels qui évaluent le déploiement de politiques VLA en environnement réel, l'enjeu est central: ces modèles impressionnent en démonstration mais restent risqués en production sans garde-fous. En proposant une couche de sécurité détachable du modèle de base, capable de s'ajouter à n'importe quelle politique VLA existante sans réentraînement complet, SafeLoop répond à un besoin pratique d'ingénierie de sécurité modulaire plutôt qu'à une promesse de performance brute, une approche qui contraste avec la tendance du secteur à surtout communiquer sur les capacités des modèles plutôt que sur leur fiabilité opérationnelle. Le projet s'inscrit dans la lignée des benchmarks de manipulation robotique comme LIBERO, largement utilisés pour évaluer les politiques VLA génériques telles que Pi-0 ou GR00T, et répond à une limite documentée de ces architectures en environnement réel. L'approche par rollback, retour à un point de sécurité récent suivi d'une nouvelle tentative via la politique existante, se distingue des méthodes alternatives évaluées dans l'étude par un meilleur compromis entre sécurité et taux de réussite. Le code est publié en accès ouvert sur GitHub, ce qui permettra à d'autres équipes de recherche de reproduire et d'étendre les tests au-delà des 24 tâches simulées et des trois tâches réelles couvertes par l'article, sans qu'aucun calendrier de déploiement industriel ne soit pour l'instant annoncé.

RecherchePaper
1 source