LEAP : rendre efficace la supervision géométrique privilégiée pour l'apprentissage visuomoteur
Des chercheurs publient sur arXiv (2610.07015) LEAP, pour Latent Encoding with Aligned Privileged Geometry, un cadre d'entraînement qui exploite la géométrie 3D pendant l'apprentissage de politiques visuomotrices, sans l'exiger au déploiement. Le principe : un décodeur auxiliaire reconstruit des nuages de points de l'espace de travail à partir des seules caractéristiques visuelles, tandis que la proprioception reste réservée à la prédiction d'actions. Deux ajouts complètent la reconstruction complète : un « wrist-view dropout », qui masque aléatoirement la caméra poignet, et des cibles de reconstruction partielles alignées sur la vue poignet conservée, pour pousser l'encodeur à capter une géométrie locale complémentaire. Le décodeur est retiré à l'inférence : la politique ne reçoit que des images RGB et l'état du robot. Les tests couvrent les benchmarks RoboTwin et ManiSkill ainsi que des tâches réelles, face à Diffusion Policy et ACT. Les auteurs annoncent des gains « consistants et substantiels », avec un faible surcoût en paramètres et sans perte de vitesse d'inférence. L'extrait disponible ne chiffre ni les taux de succès, ni les tâches réelles, ni le matériel utilisé.
L'intérêt pratique tient à la nature du problème visé. Ajouter une supervision 3D à l'entraînement évite d'équiper chaque robot de capteurs de profondeur ou de nuages de points en production, ce qui préserve coût, calibration et latence. Mais l'étude conteste une hypothèse implicite : une faible erreur de reconstruction ne garantit pas que les représentations visuelles encodent la géométrie utile au contrôle. Les auteurs identifient trois défaillances : des raccourcis proprioceptifs (le réseau s'appuie sur l'état du robot plutôt que sur la vision), une dépendance à la vue dominante, et des objectifs de reconstruction dominés par une géométrie sans rapport avec la tâche. Pour un intégrateur, le message est que la qualité de la supervision auxiliaire compte autant que sa présence, et qu'un gain « gratuit » à l'inférence rend l'approche facilement transférable à des politiques existantes. Reste à vérifier la robustesse hors benchmarks simulés.
Ce travail s'inscrit dans la course aux politiques d'imitation par diffusion, popularisées par Diffusion Policy, et aux architectures à découpage d'actions comme ACT, devenues des références de base pour la manipulation bimanuelle. Les approches 3D, qui consomment directement des nuages de points, gagnent en précision mais alourdissent le matériel ; LEAP vise un compromis en gardant l'entrée RGB. Les comparaisons se limitent ici à ces deux bases, sans VLA de grande échelle comme Pi-0 ou GR00T, et il s'agit d'un preprint non évalué par les pairs. La suite logique serait un test sur des modèles généralistes et des déploiements industriels plus larges.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




