IronMind : passage à l'échelle de la manipulation dextérique humanoïde par pré-entraînement égocentrique dans l'espace caméra
IronMind, un modèle vision-langage-action (VLA) décrit dans un preprint arXiv (v1, non évalué par les pairs), vise à entraîner des humanoïdes à la manipulation dextre à partir de vidéos égocentriques humaines, c'est-à-dire filmées depuis le point de vue de l'opérateur, combinées à des données robotiques hétérogènes. Les auteurs contournent le retargeting corporel explicite en adoptant une représentation d'action dans l'espace caméra, référentiel natif de ces vidéos, et en alignant sémantiquement les dimensions d'action humaines et robotiques. Sur des budgets de pré-entraînement de 250 à 10 000 heures, la perte de validation décroît approximativement de façon log-linéaire avec le volume de données. Après post-entraînement, sur six tâches difficiles impliquant objets, affordances et consignes de raisonnement inédits, le modèle à 10 000 heures atteint 55,0 % de réussite. Les budgets inférieurs ou égaux à 5 000 heures plafonnent à 11,7 % au mieux, et l'absence de pré-entraînement donne 5,0 %. À budget égal, la représentation en espace caméra surpasse aussi la référence en repère du torse.
L'intérêt tient à deux points. D'abord, la manipulation dextre humanoïde commence à montrer une loi d'échelle comparable à celle observée en langage : la perte baisse régulièrement avec les données, et la généralisation en conditions réelles progresse. Ensuite, la source de données change d'économie. Les vidéos égocentriques bon marché, sans cinématique du torse, deviennent exploitables, alors que la téléopération robotique reste lente et coûteuse à collecter. Pour un intégrateur, cela suggère que le goulot d'étranglement se déplace vers la curation et l'alignement de données humaines plutôt que vers le parc de robots. Quelques réserves s'imposent : le saut brutal entre 5 000 et 10 000 heures (de 11,7 % à 55,0 %) repose sur six tâches seulement, sans indication du nombre d'essais ni de l'intervalle de confiance. Le robot utilisé, les temps de cycle et les conditions de test ne sont pas précisés dans le résumé. Il s'agit de résultats de laboratoire, sans déploiement industriel.
Ce travail s'inscrit dans la course aux VLA généralistes, où Pi-0 de Physical Intelligence, GR00T de NVIDIA et Helix de Figure exploitent surtout des données téléopérées ou synthétiques. L'usage de vidéo humaine égocentrique à grande échelle est une piste concurrente, déjà explorée par plusieurs laboratoires, que IronMind cherche à rendre praticable en supprimant l'étape de retargeting. Les prochaines étapes à surveiller sont la publication du code et des poids, la réplication sur d'autres plateformes humanoïdes, et la mesure du point de saturation au-delà de 10 000 heures. Aucun acteur français ou européen n'est mentionné dans le résumé.
Dans nos dossiers




