Dextérité à l'aveugle : manipulation humanoïde corps entier par proprioception pure
Des chercheurs publient sur arXiv (arXiv:2608.29487v1, fin août 2026) une étude intitulée « Blind Dexterity », qui démontre des compétences de manipulation corporelle complète sur un humanoïde Unitree G1 sans aucune caméra, marqueur, capteur de force-couple ni capteur tactile. Le robot s'appuie uniquement sur sa proprioception embarquée, c'est-à-dire les retours des encodeurs articulaires. Les politiques entraînées réalisent quatre tâches distinctes : une marche bipède résistante aux poussées sans retour IMU, le contrôle actif d'un ballon de football arrêté du pied, la recherche puis le levage d'une valise par sa poignée, et la montée sur un skateboard positionné aléatoirement. Les auteurs attribuent ces résultats à un signal sous-exploité : l'évolution des lectures des encodeurs pendant un contact compliant et intentionnel, qui forme un canal tactile de tout le corps. Des estimateurs d'état entraînés séparément des politiques de contrôle confirment que la position des objets manipulés devient rapidement décodable à partir de courts historiques proprioceptifs, avec une chute nette de l'erreur de prédiction après un contact informatif.
Ce résultat pèse sur un débat central du secteur humanoïde : faut-il empiler caméras, peau tactile et capteurs de force-couple pour obtenir de la dextérité, comme le font la plupart des piles vision-langage-action actuelles (Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure AI) ? L'étude suggère que la proprioception par encodeurs, combinée à un actionnement compliant déjà présent sur des robots commerciaux et des moteurs bas coût, forme à elle seule un socle pratique pour la manipulation dextre. Pour les intégrateurs, l'intérêt est d'abord économique : une architecture qui ne dépend pas d'une pile vision coûteuse pourrait alléger la nomenclature matérielle, tout en restant compatible avec un enrichissement sensoriel ultérieur. Il ne s'agit cependant ni d'un produit livré ni d'un déploiement industriel, mais de démonstrations en laboratoire dont la robustesse hors scénarios contrôlés reste à prouver.
Le travail s'inscrit dans la course plus large aux compétences humanoïdes, dominée par les approches vision-langage-action de Figure AI (Figure 03, modèle Helix), Physical Intelligence (Pi-0) ou Nvidia (GR00T N2), qui misent sur caméras embarquées et vastes jeux de données vidéo. Le choix du Unitree G1, plateforme commerciale bas coût largement adoptée par les laboratoires académiques, illustre une tendance à tester ces hypothèses sur du matériel accessible plutôt que sur des prototypes propriétaires. Publié en preprint non encore relu par les pairs, l'article esquisse la proprioception pure comme brique de base, sur laquelle vision ou tact pourraient se greffer ensuite, sans calendrier de pilote industriel annoncé à ce stade.
Dans nos dossiers




