Fermeture de la boucle en VLA humanoïde : jetons d'objets 3D persistants pour une loco-manipulation vérifiable
Des chercheurs viennent de publier sur arXiv (2607.18016v1) une nouvelle méthode baptisée Persistent Object Tokenization (POT), testée sur un robot humanoïde Unitree G1 dans le cadre d'un système appelé POT-VLA. Le problème ciblé est ce que les auteurs nomment la "divergence d'état objet" : dans les politiques vision-langage-action (VLA) actuelles, l'état de l'objet utilisé pour décider d'un mouvement du corps entier peut différer de celui utilisé ensuite pour vérifier si l'action a bien produit la relation physique voulue, un décalage qui devient critique lors de déplacements, contacts, occlusions ou phases de récupération. POT maintient des enregistrements 3D d'objets indexés par rôle, construits à partir d'observations RGB-D, et les convertit en tokens exploitables par un module d'action corps entier. Sur huit familles de tâches réelles, POT-VLA fait passer le taux de réussite de 39 sur 80 à 71 sur 80 par rapport à une base directe GR00T-N1.7 comparable. Sur un protocole externe aligné sur le benchmark Being-0, le système obtient 44 succès sur 50 tâches de service, contre 37 sur 50 rapportés dans l'article Being-0 original.
Pour l'industrie de la robotique humanoïde, ce travail s'attaque à un angle mort souvent glissé sous le tapis dans les démonstrations impressionnantes : la capacité réelle à maintenir une relation géométrique correcte entre un bras et un objet pendant une tâche longue, plutôt que la seule génération d'une trajectoire plausible. En rendant l'état objet à la fois exploitable et vérifiable via des contrôles de prédicats géométriques, le système ferme la boucle entre perception et exécution, un point sensible pour les intégrateurs qui cherchent des garanties de fiabilité au-delà des vidéos de démonstration soigneusement sélectionnées. Les gains les plus marqués concernent justement les tâches nécessitant le maintien prolongé d'une relation 3D, ce qui suggère que l'abstraction d'objet persistant comble une limite structurelle des architectures VLA actuelles plutôt qu'un simple réglage fin.
Ce papier s'inscrit dans la course actuelle autour des politiques VLA pour humanoïdes, dominée par des architectures comme GR00T (NVIDIA), utilisée ici comme base de comparaison directe, et des benchmarks de référence comme Being-0 pour les tâches de service. L'usage d'un Unitree G1, plateforme largement adoptée dans la recherche académique en loco-manipulation, ancre les résultats dans un cadre reproductible plutôt que propriétaire. Les auteurs ne mentionnent pour l'instant ni déploiement pilote ni calendrier de commercialisation : il s'agit d'une contribution de recherche, destinée à être étendue à davantage de familles de tâches et potentiellement intégrée à d'autres piles VLA que GR00T.
Dans nos dossiers




