Aller au contenu principal
Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile
RecherchearXiv cs.RO 

Voir plus grand : cartographie latente 3D pour l'apprentissage de politiques de manipulation mobile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient SBP (Seeing the Bigger Picture), une méthode d'apprentissage de politiques pour la manipulation mobile fondée sur une carte 3D de caractéristiques latentes plutôt que sur de simples images, documentée sur arXiv sous la référence 2510.03885 en quatrième version. La méthode fusionne de manière incrémentale des observations multi-vues dans une grille de caractéristiques propre à chaque scène ; un décodeur pré-entraîné reconstruit des embeddings cibles à partir de ces caractéristiques, permettant d'optimiser la carte en ligne pendant l'exécution de la tâche. La politique, entraînable par clonage comportemental ou apprentissage par renforcement, traite cette carte comme variable d'état. Sur une tâche de manipulation séquentielle sur table, SBP améliore le taux de réussite de 15 % par rapport à une politique fondée uniquement sur des images, dans des scènes déjà vues comme inédites.

Ce résultat cible une limite connue des politiques de type VLA (vision-language-action), qui raisonnent généralement image par image et perdent toute mémoire de ce qui sort du champ de la caméra. Pour un robot mobile devant se souvenir d'un objet vu dans une autre pièce ou enchaîner des sous-tâches dans la durée, cette absence de mémoire spatiale persistante est un frein concret. En montrant qu'une représentation 3D explicite et réoptimisable en continu surpasse une politique purement image-vers-action, l'étude suggère que le raisonnement spatial long-terme ne se résoudra pas seulement en augmentant modèles et données : la structure de la représentation d'état compte, un signal utile pour les intégrateurs de robots mobiles et humanoïdes.

Ce travail s'inscrit dans une recherche plus large combinant cartographie 3D (voxels, champs de caractéristiques, représentations type NeRF) et apprentissage de politiques, en alternative aux approches VLA tout-image qui dominent les annonces du secteur. Le résumé ne précise ni institution ni plateforme robotique commerciale associée : il s'agit d'une contribution académique publiée sur arXiv, déjà révisée au moins quatre fois, signe d'un travail encore en affinement plutôt que d'un produit fini. Aucune date de déploiement ni partenariat industriel n'est mentionné ; la portée reste celle d'une preuve de concept en laboratoire, sans indication de transfert vers un robot physique déployé à grande échelle.

Dans nos dossiers

À lire aussi

Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP
1arXiv cs.RO 

Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP

Une équipe de recherche présente VolumeDP, une nouvelle architecture pour l'apprentissage par imitation en robotique manipulatrice, décrite dans une version révisée d'un article arXiv (2603.17720v2). Le problème visé est concret : la plupart des méthodes actuelles font correspondre directement des observations d'images 2D à des sorties d'action 3D, un décalage géométrique qui nuit au raisonnement spatial et fragilise la robustesse des politiques apprises. VolumeDP corrige ce défaut en raisonnant explicitement en trois dimensions : les features issues des images sont d'abord projetées dans une représentation volumétrique via un mécanisme d'attention croisée, puis un module apprenable sélectionne les voxels pertinents pour la tâche et les convertit en un ensemble compact de tokens spatiaux, ce qui réduit fortement le calcul sans perdre la géométrie utile à l'action. Un décodeur multi-tokens exploite ensuite l'ensemble de ces tokens pour prédire les actions, évitant l'agrégation destructrice qui réduit plusieurs indices spatiaux à un seul descripteur. Résultat chiffré : 88,8% de taux de réussite moyen sur le benchmark de simulation LIBERO, soit 14,8 points de mieux que la meilleure méthode concurrente, avec des gains également marqués sur ManiSkill et LIBERO-Plus. Des essais en conditions réelles confirment la généralisation à de nouvelles dispositions spatiales, de nouveaux points de vue caméra et de nouveaux environnements. Pour les équipes qui développent des politiques de manipulation robotique, ce travail illustre une limite structurelle des architectures VLA qui traitent la 3D comme un simple sous-produit d'un flux d'images : sans représentation spatiale explicite, la robustesse aux changements de caméra ou de décor s'effondre, un problème récurrent dès qu'on sort du laboratoire. VolumeDP montre qu'ajouter un raisonnement volumétrique explicite, plutôt que de compter uniquement sur l'échelle des données ou du modèle, améliore sensiblement la généralisation, ce qui nuance l'idée reçue selon laquelle scaler les VLA suffirait à résoudre le problème spatial. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation ayant précédemment tenté d'intégrer une composante 3D, comme les approches de type Diffusion Policy en 3D, mais en visant une représentation volumétrique plus efficiente en calcul. Il s'agit à ce stade d'une contribution académique, publiée sur arXiv avec code et vidéos disponibles sur une page projet dédiée, et non d'un produit ou d'un système déployé commercialement. Les benchmarks utilisés (LIBERO, ManiSkill) restent des environnements de recherche standard, ce qui laissera aux prochaines étapes le soin de confirmer la tenue de ces résultats sur des tâches industrielles plus complexes.

RecherchePaper
1 source
MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile
2arXiv cs.RO 

MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile

Un travail de recherche en robotique publié sur arXiv le 23 septembre 2026 sous la référence 2609.26378v1 présente MAVP (Map-Aware Visuomotor Policies), un framework destiné à fiabiliser l'exécution des robots à manipulation mobile, c'est-à-dire combinant base roulante et bras articulé. Le constat de départ : les politiques entraînées par démonstration peinent souvent à reproduire fidèlement le déplacement de la base, ce qui provoque un désalignement spatial et fait échouer la manipulation qui suit. MAVP reconstruit une carte statique à partir de démonstrations téléopérées, exprime les trajectoires de base démontrées dans ce référentiel cartographique commun, puis, à l'exécution, prédit conjointement des poses cibles de base, des actions du bras et de la pince à partir d'images RGB, de l'état des articulations et de la pose courante du robot sur la carte. Un contrôleur de bas niveau suit ensuite ces cibles par anticipation de mouvement et retour d'erreur de pose, avec un bruit ajouté sur la pose pendant l'entraînement pour renforcer la robustesse. Sur six tâches de manipulation réelles et trois familles de politiques testées, MAVP obtient un taux de succès supérieur au contrôle de vitesse "non ancré" dans l'ensemble des cas, sans que le résumé ne publie de chiffres agrégés précis. Le résultat cible un point de friction bien identifié dans l'apprentissage par imitation appliqué à la manipulation mobile : le contrôle de vitesse pur de la base dérive avec le temps et casse la coordination entre déplacement et geste de préhension, un problème qui freine aujourd'hui le passage des démonstrations de laboratoire à des déploiements fiables en usine ou en entrepôt. En ancrant explicitement chaque politique à une carte et à une pose absolue plutôt qu'à une commande de vitesse relative, MAVP s'attaque directement à l'écart documenté entre démonstrations réussies et exécution robuste en conditions réelles, un enjeu central pour les intégrateurs qui évaluent des politiques génératives type VLA pour des robots mobiles manipulateurs ou des humanoïdes à base roulante. Pour les décideurs B2B, l'apport n'est pas un nouveau modèle de fondation mais une brique de contrôle complémentaire, validée sur trois familles de politiques différentes, ce qui suggère une méthode transposable plutôt qu'une solution propriétaire liée à un seul modèle. Le travail s'inscrit dans la lignée des recherches académiques cherchant à corriger les limites du contrôle de vitesse non ancré, pratique héritée de la robotique mobile classique et transposée telle quelle aux politiques d'apprentissage par imitation. Le site dédié au projet, hébergé sous une adresse GitHub Pages anonymisée, suggère un papier soumis en évaluation en double aveugle à une conférence de robotique ou d'apprentissage automatique, sans que les auteurs ni leur affiliation ne soient révélés à ce stade : il s'agit donc d'une contribution de recherche et non d'un produit commercial. Aucun acteur français ou européen n'apparaît dans ces travaux. Les auteurs annoncent la mise à disposition de vidéos et de résultats complémentaires en ligne, mais ne communiquent ni feuille de route produit ni partenariat industriel ; la suite logique, en cas d'acceptation, sera l'extension de la méthode à davantage de tâches et de plateformes pour confirmer sa généralité au-delà des six cas testés.

RecherchePaper
1 source
Politique de carte d'action : apprentissage de la manipulation 3D en boucle fermée par classification de pixels
3arXiv cs.RO 

Politique de carte d'action : apprentissage de la manipulation 3D en boucle fermée par classification de pixels

Des chercheurs viennent de publier sur arXiv (2607.10706, 14 juillet 2026) un nouveau cadre baptisé Action Map Policy (AMP), qui reformule l'apprentissage de politiques de manipulation robotique en boucle fermée comme un problème de classification dans l'espace image plutôt que comme une régression continue. L'idée centrale consiste à projeter les actions 3D du bras robotique sur le plan de la caméra et à traiter chaque pixel comme une classe discrète à prédire, ce qui limite l'explosion combinatoire du vocabulaire tout en conservant une précision de l'ordre du millimètre. Contrairement aux approches par diffusion, qui nécessitent un débruitage itératif coûteux en temps de calcul, AMP prédit l'intégralité d'un segment d'actions en une seule passe avant, ce qui accélère nettement l'inférence. Les auteurs rapportent des taux de réussite supérieurs à plusieurs méthodes de référence sur diverses tâches de manipulation, ainsi qu'un raisonnement spatial amélioré. Le choix de la représentation d'action reste l'un des obstacles majeurs des politiques robotiques modernes, notamment pour les modèles vision-langage-action (VLA) qui cherchent à généraliser au-delà des tâches d'entraînement. La classification par pixels s'inspire du succès des modèles génératifs de langage, où la prédiction du prochain token a supplanté les approches par régression directe. En robotique, cette analogie est plus délicate car l'espace d'action est continu et de haute dimension, avec des solutions optimales souvent multimodales. En résolvant le compromis entre discrétisation fine et vocabulaire gérable, AMP répond directement à une limite pratique des politiques par diffusion, jugées précises mais lentes, un frein pour les applications nécessitant un contrôle réactif en temps réel. Il s'agit pour l'instant d'un travail de recherche académique, sans lien annoncé avec un produit commercial ou un déploiement industriel. AMP s'inscrit dans une lignée d'alternatives aux politiques par diffusion (popularisées par Diffusion Policy) et aux approches autorégressives de type VLA (Pi-0, GR00T N2, OpenVLA). Les prochaines étapes attendues incluent une validation sur robots physiques au-delà des expériences en simulation ou banc de test décrites dans l'article, ainsi qu'un examen par les pairs.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
4arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source