HiFi-UMI : des politiques de manipulation déployables apprises uniquement à partir de données UMI haute fidélité
Une équipe de recherche a présenté HiFi-UMI, un système portable de capture de démonstrations manipulatoires sans robot, conçu pour atteindre une précision de 3 mm au niveau du poignet dans l'espace de travail local, sans infrastructure de suivi externe. Le dispositif, monté sur la tête de l'opérateur, combine du SLAM stéréo-inertiel hors ligne, un calcul natif (et non reconstruit) de la pose relative entre les deux pinces, un déclencheur GPIO partagé à la microseconde et deux caméras grand angle par main couvrant environ 200 degrés. À partir de ce corpus, les chercheurs démontrent un post-entraînement "zéro robot réel" : une politique entraînée uniquement sur des données HiFi-UMI, déployée directement sur un robot physique, égale les performances d'une téléopération réelle sur trois architectures différentes, StarVLA-QwenPI, OpenPI-pi_0.5 et LingBot-VA, avec des écarts de taux de réussite de -2,5, +3,1 et -0,6 point de pourcentage. La politique la plus performante atteint 85 % sur une tâche d'insertion de précision. Un pré-entraînement sur 4 000 heures issues du même corpus réduit de 41 % l'erreur d'action sur dix tâches inédites et ajoute 18,1 points de réussite supplémentaires pour StarVLA-QwenPI. Les auteurs publient HiFi-UMI-2K, 2 000 heures de démonstrations synchronisées à la microseconde et validées par rejeu en simulation.
Ce résultat s'attaque directement à un goulot d'étranglement central de l'apprentissage par imitation en robotique : la téléopération réelle est précise mais coûteuse à faire passer à l'échelle, tandis que la capture "sans robot" de type UMI scale facilement mais servait jusqu'ici surtout au pré-entraînement, avec un ancrage réel systématique en aval. Si la fidélité des données de capture suffit vraiment à supprimer cet ancrage, cela change la logique de coûts pour tout intégrateur ou laboratoire cherchant à entraîner des politiques VLA sans multiplier les heures de téléopération sur robot physique, un poste de dépense important dans la course humanoïde et manipulatoire actuelle. Il faut toutefois noter que les gains varient selon l'architecture (un des trois modèles recule légèrement) et que le chiffre de 85 % porte sur une seule tâche de précision, ce qui appelle à la prudence avant de généraliser.
Le principe UMI (Universal Manipulation Interface), popularisé ces dernières années comme alternative légère à la téléopération robotique classique, souffrait jusqu'ici d'un déficit de fidélité géométrique justifiant son cantonnement au pré-entraînement. HiFi-UMI s'inscrit dans la lignée des travaux sur les modèles vision-langage-action (VLA) et sur les modèles monde-action, dans un paysage où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) investissent aussi sur la généralisation de politiques manipulatoires. La publication ouverte du jeu de données HiFi-UMI-2K devrait permettre à la communauté de vérifier indépendamment ces résultats et d'étendre l'approche à d'autres tâches et robots.
La publication ouverte du jeu de donnees HiFi-UMI-2K peut indirectement beneficier aux laboratoires de recherche europeens en robotique, mais aucun acteur francais ou europeen n'est implique dans ces travaux.
Dans nos dossiers




