Praxis : des a priori d'interaction physique de vidéos égocentriques pour une manipulation généralisable du corps entier
Un preprint publié le 28 septembre 2026 sur arXiv (2609.30735) décrit Praxis, un framework de manipulation corps-entier pour robots humanoïdes mobiles, capable d'apprendre une compétence à partir d'une seule démonstration vidéo égocentrique, sans réentraînement de politique spécifique à la tâche. Le système enchaîne trois étapes : une navigation guidée par un modèle vision-langage vers l'objet cible, une calibration de posture en boucle fermée qui aligne l'espace de travail bras-main, puis une manipulation dextre avec coordination synchronisée du haut et du bas du corps. Un retour visuel en ligne réajuste la géométrie d'interaction démontrée face à de nouvelles poses d'objets, tandis qu'un retour tactile adapte les mouvements de la main aux conditions de contact réelles. Testé sur cinq tâches de manipulation à horizon long, le système montre une généralisation spatiale, visuelle et inter-objets, ainsi qu'une récupération après perturbation physique externe à chacune des trois étapes.
L'intérêt pour l'industrie tient à la réduction du coût de collecte de données : la plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action ou sur l'apprentissage par renforcement, exigent des centaines de démonstrations téléopérées par tâche pour généraliser correctement. En ne nécessitant qu'un seul enregistrement vidéo humain par compétence et aucune caméra embarquée sur robot pendant la collecte, Praxis s'attaque directement au goulot d'étranglement qui freine le déploiement d'humanoïdes polyvalents chez les intégrateurs. La combinaison de retours visuel et tactile pour récupérer d'une perturbation en conditions réelles, plutôt que de rejouer une trajectoire figée, touche un point sensible du secteur : l'écart persistant entre démonstrations soignées et robustesse en usage industriel réel.
Praxis s'inscrit dans la lignée des recherches sur l'apprentissage par imitation à partir de vidéos humaines, une alternative moins coûteuse à la téléopération massive utilisée par les grands modèles vision-langage-action. Il s'agit à ce stade d'un résultat de recherche publié en preprint, sans nom de produit ni partenaire industriel annoncé, testé sur cinq tâches en conditions expérimentales contrôlées et non en déploiement réel chez un client. L'étape suivante, non détaillée dans le résumé, consisterait à étendre le nombre de compétences apprises simultanément et à valider l'approche sur des plateformes robotiques commerciales avant toute évaluation par des intégrateurs.
Dans nos dossiers




