
PredActor : diffusion d'action prédictive pour un contrôle humanoïde embarqué et pilotable
PredActor, une politique de diffusion d'action prédictive pour le contrôle embarqué d'humanoïdes, est détaillée dans une publication arXiv de septembre 2026 (2609.24840). À la différence des architectures hiérarchiques classiques, qui séparent trajectoire de référence et tracker de suivi, elle s'exécute seule, conditionnée sur l'historique proprioceptif et un contexte de tâche optionnel, sans état corporel complet mesuré en externe, et génère à la fois les actions et une trajectoire d'état futur interne, guidée par classifier-free guidance pour le texte et par guidage de classifieur pour les objectifs de test. En simulation, elle atteint les 15 cibles testées, avec un score de récupération de texte de 0,580 contre 0,373 pour une diffusion d'action classique, et une résistance aux perturbations comparable. Sur une carte Jetson Orin NX, le cycle de calcul tombe à 16,790 ms en médiane et 19,383 ms au 95e percentile, sous les 20 ms requis ; déployée sur un robot Unitree G1, elle a démontré mouvement piloté par texte, réaction aux perturbations, contrôle au joystick et interpolation sémantique.
Ce résultat répond à un point de friction du secteur : les politiques de diffusion pour humanoïdes fonctionnent bien hors ligne mais restent rarement pilotables en temps réel embarqué. En tenant le calcul sous les 20 ms sur du matériel edge accessible, sans tracker séparé ni perception externe de l'état corporel complet, PredActor allège la pile logicielle qu'un intégrateur doit maintenir et contredit l'idée qu'un pilotage sémantique par texte ou joystick exige une architecture hiérarchique lourde. Pour des décideurs industriels évaluant des humanoïdes pour des tâches réelles, la robustesse conservée malgré cette contrainte est encourageante, même si les métriques reposent sur un nombre limité de cibles et un score de récupération de texte propre au papier, peu comparable aux autres benchmarks du secteur.
PredActor s'inscrit dans la lignée des politiques de diffusion pour le contrôle robotique et des modèles vision-langage-action, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, dont il se distingue en évitant tout tracker de mouvement ou état privilégié externe. Classée comme nouvelle soumission sur arXiv, la publication ne précise ni laboratoire porteur ni entreprise associée et ne mentionne aucun calendrier de déploiement commercial : il s'agit d'un travail de recherche validé en simulation et sur un seul robot physique, sans pilote industriel annoncé.
Dans nos dossiers




