EquivDP3 : un encodeur de nuages de points invariant SIM(3) pour la loco-manipulation humanoïde à faible besoin de données
Des chercheurs proposent EquivDP3, une politique visuomotrice hiérarchique pour la loco-manipulation du humanoïde Unitree G1 (43 articulations), décrite dans un preprint arXiv (2609.36575v1). Le système est en deux étages. Un planificateur de haut niveau, basé sur une diffusion, utilise un encodeur de nuages de points équivariant SIM(3) de type Vector Neuron Network (VNN). Il émet des blocs de commandes corps entier à 6 Hz. Ces commandes sont exécutées à 50 Hz par une politique de locomotion pré-entraînée par apprentissage par renforcement, gelée, et par un module de cinématique inverse différentielle pour les bras. L'ensemble est entraîné de bout en bout par clonage comportemental. SIM(3) désigne le groupe des rotations, translations et changements d'échelle. Les tests couvrent deux benchmarks simulés sous IsaacLab et quatre références non équivariantes, avec 5 à 100 démonstrations, en distribution et hors distribution. Avec 5 à 10 démonstrations, EquivDP3 atteint 67,1 % de succès, contre 38,2 à 52,4 % pour les références. À 50-100 démonstrations, tous les encodeurs convergent (74,3 à 85,2 %). Le surcoût est de 0,8 ms par bloc d'actions par rapport à l'encodeur PointNet remplacé.
L'intérêt tient à la rareté des données. Collecter des démonstrations de loco-manipulation humanoïde par téléopération coûte cher, et un gain de robustesse avec 5 à 10 exemples est un levier concret pour les équipes qui déploient des humanoïdes sur des tâches variables. Les auteurs ajoutent un contrôle utile : en retirant le nuage de points, le succès tombe à 31 % contre 60 % pour EquivDP3 avec 5 démonstrations, et à 78 % contre 99 % avec 10. L'écart est donc bien d'origine perceptive et ne vient pas de la seule proprioception. Le plateau à forte quantité de données traduit selon eux un plafond du benchmark, pas cinq encodeurs qui apprendraient la même invariance. Il faut donc relativiser : les résultats sont uniquement simulés, aucun test sur robot réel n'est rapporté, et l'ordre des méthodes n'a plus de sens au-delà de 50 démonstrations. Le résultat suggère toutefois que injecter la symétrie géométrique dans le backbone de perception est presque gratuit en calcul.
Ce travail prolonge deux lignes existantes. 3D Diffusion Policy (DP3) conditionne un générateur d'actions par diffusion sur des caractéristiques de nuages de points, mais son encodeur de type PointNet n'a pas d'équivariance intégrée aux transformations SIM(3). EquiBot avait comblé cette lacune avec un encodeur VNN équivariant, mais seulement pour des manipulateurs mobiles à roues. EquivDP3 transpose l'approche à un humanoïde bien plus complexe, en s'appuyant sur une architecture hiérarchique qui sépare planification lente et contrôle rapide. Les prochaines étapes évidentes sont le transfert sim-to-real sur un G1 physique, des benchmarks moins saturés et une comparaison avec les politiques VLA généralistes, qui misent sur l'échelle des données plutôt que sur les priors géométriques.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




