
EMPIRE : planification de manipulation, une représentation apprenable pour prédire les mouvements de main égocentriques
Une équipe de recherche publie EMPIRE, un framework en deux étapes pour prédire les mouvements bimanuels futurs des mains à partir de vidéo égocentrique, accompagné d'un nouveau dataset baptisé EMPIRE-651K. La première étape apprend un plan de manipulation explicite par main à partir du contexte multimodal ; la seconde synthétise les trajectoires futures en se conditionnant sur ces représentations gelées, sans les réapprendre. EMPIRE-651K compte 650 910 fenêtres d'entraînement réparties sur 111 tâches, chacune annotée d'un plan de manipulation par main. Sur les protocoles d'évaluation standards, EMPIRE atteint une erreur MPJPE de 84,53 mm et une erreur relative aux doigts de 38,97 mm, présentées comme état de l'art face aux méthodes existantes. Le code et le dataset sont publiés en accès libre sur GitHub (wangwen-banban/EMPIRE) ; le papier, référencé arXiv:2608.22449, reste un preprint de recherche.
L'enjeu cible directement les approches VLM actuelles, qui associent généralement l'observation brute à la trajectoire future en une seule passe, sans étape intermédiaire de planification. Ce couplage pose un problème bien identifié : les gradients issus de la génération de mouvement viennent perturber les représentations de manipulation déjà apprises. En séparant explicitement planification et génération, EMPIRE isole ces deux apprentissages, un enjeu qui concerne l'ensemble des architectures vision-langage-action utilisées en robotique de manipulation, dans la lignée de Pi-0 ou GR00T N2. Pour les intégrateurs travaillant sur la téléopération, la capture de mouvement ou l'imitation learning, l'apport reste surtout méthodologique et un outil de benchmark : les gains annoncés sont mesurés sur des métriques de recherche, pas sur des taux de réussite en conditions réelles.
La démarche s'inscrit dans la lignée des travaux récents sur la prévision de mouvement égocentrique, nourris par la multiplication des modèles VLA entraînés sur des démonstrations humaines. En découplant planification et synthèse de mouvement plutôt que d'opter pour un apprentissage end-to-end comme la plupart des méthodes existantes, les auteurs positionnent EMPIRE en alternative architecturale à ce courant dominant. La publication conjointe du code et d'un dataset de plus de 650 000 fenêtres annotées vise à en faire une référence réutilisable par d'autres laboratoires travaillant sur la dextérité bimanuelle. Aucune feuille de route de déploiement industriel n'est mentionnée à ce stade : le travail reste un jalon de recherche publié sur arXiv, pas une brique intégrée à un pipeline robotique commercial.
Dans nos dossiers




