Aller au contenu principal
IA physiquearXiv cs.RO 

IronMind : passage à l'échelle de la manipulation dextérique humanoïde par pré-entraînement égocentrique dans l'espace caméra

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

IronMind, un modèle vision-langage-action (VLA) décrit dans un preprint arXiv (v1, non évalué par les pairs), vise à entraîner des humanoïdes à la manipulation dextre à partir de vidéos égocentriques humaines, c'est-à-dire filmées depuis le point de vue de l'opérateur, combinées à des données robotiques hétérogènes. Les auteurs contournent le retargeting corporel explicite en adoptant une représentation d'action dans l'espace caméra, référentiel natif de ces vidéos, et en alignant sémantiquement les dimensions d'action humaines et robotiques. Sur des budgets de pré-entraînement de 250 à 10 000 heures, la perte de validation décroît approximativement de façon log-linéaire avec le volume de données. Après post-entraînement, sur six tâches difficiles impliquant objets, affordances et consignes de raisonnement inédits, le modèle à 10 000 heures atteint 55,0 % de réussite. Les budgets inférieurs ou égaux à 5 000 heures plafonnent à 11,7 % au mieux, et l'absence de pré-entraînement donne 5,0 %. À budget égal, la représentation en espace caméra surpasse aussi la référence en repère du torse.

L'intérêt tient à deux points. D'abord, la manipulation dextre humanoïde commence à montrer une loi d'échelle comparable à celle observée en langage : la perte baisse régulièrement avec les données, et la généralisation en conditions réelles progresse. Ensuite, la source de données change d'économie. Les vidéos égocentriques bon marché, sans cinématique du torse, deviennent exploitables, alors que la téléopération robotique reste lente et coûteuse à collecter. Pour un intégrateur, cela suggère que le goulot d'étranglement se déplace vers la curation et l'alignement de données humaines plutôt que vers le parc de robots. Quelques réserves s'imposent : le saut brutal entre 5 000 et 10 000 heures (de 11,7 % à 55,0 %) repose sur six tâches seulement, sans indication du nombre d'essais ni de l'intervalle de confiance. Le robot utilisé, les temps de cycle et les conditions de test ne sont pas précisés dans le résumé. Il s'agit de résultats de laboratoire, sans déploiement industriel.

Ce travail s'inscrit dans la course aux VLA généralistes, où Pi-0 de Physical Intelligence, GR00T de NVIDIA et Helix de Figure exploitent surtout des données téléopérées ou synthétiques. L'usage de vidéo humaine égocentrique à grande échelle est une piste concurrente, déjà explorée par plusieurs laboratoires, que IronMind cherche à rendre praticable en supprimant l'étape de retargeting. Les prochaines étapes à surveiller sont la publication du code et des poids, la réplication sur d'autres plateformes humanoïdes, et la mesure du point de saturation au-delà de 10 000 heures. Aucun acteur français ou européen n'est mentionné dans le résumé.

À lire aussi

Passage à l'échelle de la manipulation bimanuelle domestique : de 1 500 heures de démonstrations aux corrections en ligne
1arXiv cs.RO 

Passage à l'échelle de la manipulation bimanuelle domestique : de 1 500 heures de démonstrations aux corrections en ligne

Une équipe de recherche a publié le 3 septembre 2026 sur arXiv (2609.03591) un corpus ouvert de 1500 heures de démonstrations de manipulation bimanuelle sur des tâches domestiques courantes, collecté via un pipeline de données à haut débit. Ce corpus sert à entraîner XR-2, un modèle vision-langage-action (VLA) pilotant des bras robotiques à deux mains, via un entraînement en plusieurs étapes. Les auteurs testent deux leviers de mise à l'échelle, le volume de démonstrations expertes et le post-entraînement sur des corrections DAgger issues d'interventions humaines en temps réel, et observent dans les deux cas une amélioration régulière du taux de réussite, sans chiffres précis dans le résumé. Modèle et jeu de données sont diffusés en open source pour une recherche reproductible. Cette publication cible le principal goulot d'étranglement de la robotique généraliste, la rareté de démonstrations humaines de qualité à grande échelle, particulièrement critique en manipulation bimanuelle où la coordination des deux bras complique l'apprentissage. La tendance de scaling observée, sur le volume de données comme sur les corrections DAgger, appuie l'hypothèse que les politiques VLA suivent des lois d'échelle proches de celles des grands modèles de langage, un point encore débattu face au fossé fréquent entre démonstrations et fiabilité réelle. Pour les intégrateurs et laboratoires travaillant sur des bras collaboratifs ou des humanoïdes à deux bras, la mise à disposition gratuite du corpus réduit le coût d'entrée pour entraîner des politiques bimanuelles. Ce travail s'inscrit dans la lignée des modèles vision-langage-action misant sur une politique généraliste entraînée sur de larges corpus plutôt que sur des comportements programmés tâche par tâche, à côté d'initiatives comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Sa particularité tient à l'ampleur du corpus rendu public et à l'usage des corrections DAgger comme second levier de progression, une piste connue en apprentissage par imitation mais rarement documentée à cette échelle sur des tâches domestiques bimanuelles. Le papier ne mentionne ni déploiement industriel ni calendrier commercial : il s'agit d'une contribution de recherche destinée à la communauté académique, avec code et données fournis pour vérification externe.

IA physiqueActu
1 source
Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle
2Interesting Engineering 

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle

Genesis AI a présenté GENE-26.5, un modèle de fondation robotique conçu pour doter les robots de capacités de manipulation au niveau humain. La vidéo de démonstration publiée par l'entreprise montre des robots accomplissant une séquence culinaire de 20 étapes (couper des tomates, casser un oeuf d'une seule main, coordonner les deux bras pendant la cuisson), ainsi que la préparation d'un smoothie avec service en l'air, des tâches de laboratoire (pipettage, transfert de liquides), du câblage pour assemblage électronique, la résolution d'un Rubik's Cube en manipulation aérienne continue, et l'interprétation d'une pièce de piano rapide. Pour alimenter l'entraînement du modèle, l'entreprise a développé un gant haptique équipé d'une peau électronique à capteurs tactiles, établissant une correspondance 1:1:1 entre la main humaine, le gant et la main robotique. Genesis revendique un coût matériel cent fois inférieur aux solutions de télé-opération conventionnelles, et une efficacité de collecte de données cinq fois supérieure. Le moteur de données associé intègre également des vidéos égocentriques issues de caméras portables et des vidéos publiques centrées sur l'activité humaine. Ces résultats, s'ils se confirment en environnement réel non contrôlé, représentent une avancée potentiellement significative sur l'un des verrous les plus tenaces de la robotique : l'écart d'incarnation (embodiment gap) entre les mains humaines et robotiques, qui limite depuis des années la transférabilité des données d'entraînement. La cartographie 1:1 glove-to-robot est une approche déjà explorée par des acteurs comme Physical Intelligence (pi-0) et plusieurs laboratoires académiques, mais Genesis revendique une démonstration à une échelle et une polyvalence inédites. Pour les intégrateurs industriels et les décideurs cherchant à automatiser des tâches non structurées (assemblage fin, préparation culinaire en volume, logistique d'entrepôt), la promesse d'un système généraliste capable d'apprendre directement des gestes humains quotidiens, sans retraining extensif, représenterait un changement de paradigme. Il faut toutefois noter que les démonstrations sont des vidéos éditées, sans données indépendantes sur le taux d'échec, les conditions d'éclairage, ou la reproductibilité en cycle de production continu. Genesis AI s'inscrit dans un segment en forte concurrence avec Physical Intelligence (pi-0, Berkeley), Figure AI (Figure 03, déployé avec BMW), Tesla (Optimus Gen 3), NVIDIA (GR00T N2) et Apptronik (Apollo). L'approche par gant haptique à bas coût rappelle les travaux d'Enchanted Tools, acteur français du service robotique, qui mise également sur la capture de mouvement humain pour réduire le coût d'entraînement. Genesis n'a pas encore annoncé de déploiements industriels confirmés ni de partenariats nominatifs : GENE-26.5 reste à ce stade une annonce de produit accompagnée d'une démonstration vidéo, pas un système disponible commercialement. L'entreprise indique prévoir le déploiement de ses gants en milieu de travail réel via des partenariats industriels, avec pour objectif de constituer une bibliothèque de compétences humaines à grande échelle pour l'entraînement robotique.

IA physiqueActu
1 source
ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes
3arXiv cs.RO 

ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes

Une équipe de chercheurs a publié fin juin 2026 ROVE (Reinforcement learning for humanoid VLA post-training with imperfect human interventions), un framework de renforcement dédié à l'amélioration des modèles Vision-Language-Action (VLA) sur robots humanoïdes à partir d'interventions humaines imparfaites. Le principe : un opérateur prend la main sur le robot lors des phases d'échec, générant des trajectoires correctives qui servent ensuite à affiner le modèle. Le problème bien identifié par les auteurs est que ces interventions humaines sont souvent hésitantes, sous-optimales, voire erronées, ce qui rend l'imitation naïve contre-productive. ROVE introduit deux mécanismes centraux : un pipeline human-in-the-loop capable de collecter simultanément des données de déploiement autonome et d'intervention, et une méthode d'estimation de valeur dite "optimiste" (Optimistic Value Estimation, OVE) qui filtre les comportements à haute valeur depuis des trajectoires de qualité mixte. Le framework intègre également des vidéos d'expériences humaines cross-embodiment pour enrichir la supervision sur les modes de défaillance et de récupération rares. Sur des tâches réelles de manipulation à contact-riche et fine-grained, ROVE surpasse les baselines par apprentissage par expérience et s'améliore de manière consistante à chaque itération rollout-intervention. L'enjeu central ici est la scalabilité du déploiement humanoïde en conditions réelles. Les modèles VLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA -- ont démontré des capacités de généralisation remarquables, mais leur post-training sur hardware humanoïde reste un goulot d'étranglement : la cinématique whole-body et le contrôle de mains dextères compliquent radicalement la collecte de données téléopérées de qualité. ROVE invalide l'hypothèse selon laquelle l'intervention humaine doit être experte pour être utile : OVE permet d'extraire un signal d'avantage informatif même depuis des démonstrations imparfaites, ce qui signifie qu'on peut utiliser des opérateurs non-spécialistes pour améliorer continûment le modèle en production. C'est un changement de paradigme potentiellement significatif pour les intégrateurs : la qualité du déploiement n'est plus bornée par la disponibilité d'experts en téléopération. Ce travail s'inscrit dans une vague de recherches sur le RLHF appliqué à la robotique physique, après les travaux pionniers sur l'imitation par intervention (HATO, HITL-TAMER) et les approches par feedback correctif. Les humanoïdes ciblés restent non précisés dans l'abstract (preprint arXiv, les détails hardware seront à vérifier dans le papier complet), mais les résultats sur tâches contact-rich suggèrent une applicabilité aux plateformes type Figure 03, Unitree H1/G1 ou Agility Digit. Le positionnement concurrentiel est clair : là où Physical Intelligence mise sur la qualité des données téléopérées en amont, ROVE parie sur la rectification en boucle fermée en aval. Les prochaines étapes probables incluent des tests à plus grande échelle et une évaluation sur plusieurs architectures VLA, mais en l'état de preprint, aucun déploiement commercial n'est annoncé.

IA physiqueOpinion
1 source
GAP : pré-entraînement par ancrage géométrique pour un apprentissage visuomoteur économe en données des tâches de manipulation
4arXiv cs.RO 

GAP : pré-entraînement par ancrage géométrique pour un apprentissage visuomoteur économe en données des tâches de manipulation

Des chercheurs ont publié sur arXiv (référence 2605.15836) une méthode baptisée GAP (Geometric Anchor Pre-training), conçue pour améliorer l'apprentissage visuomoteur en manipulation robotique à partir d'un très faible nombre de démonstrations d'experts. L'approche repose sur une étape de pré-entraînement légère et sans actions, qui régularise l'adaptateur spatial d'un modèle de vision pré-entraîné (Vision Foundation Model, VFM) avant la phase d'imitation proprement dite. Cette étape de préchauffage entraîne la couche de pooling à produire des points-clés géométriquement stables, ancrés sur les objets, couvrant leur étendue spatiale et reproductibles dans le temps, à partir de masques simulés disponibles sans coût d'annotation. Le VFM reste gelé tout au long du processus. Évaluée sur les benchmarks RoboMimic et ManiSkill dans des conditions de pénurie sévère de données (15 à 50 démonstrations), GAP atteint 62 % de taux de réussite sur la tâche RoboMimic Can avec seulement 15 démonstrations (soit +16 points par rapport à la méthode AFA), 63 % sur la tâche longue et haute précision Tool Hang avec 50 démonstrations, et 61 % sur ManiSkill StackCube avec 30 démonstrations (+11 points face au fine-tuning complet). L'enjeu est considérable pour le déploiement industriel des robots manipulateurs : collecter des milliers de démonstrations humaines reste coûteux et difficile à mettre à l'échelle. GAP cible explicitement le régime peu de données (few-shot imitation learning) en corrigeant un défaut structurel des pipelines actuels. L'adaptateur spatial, censé extraire les caractéristiques pertinentes pour le contrôle depuis des représentations visuelles génériques, tend à s'accrocher à des raccourcis visuels non pertinents lorsqu'il est entraîné avec peu d'exemples, et perd son ancrage géométrique au moindre changement de scène. En forçant cet adaptateur à produire des ancres stables via une tâche proxy simulée, GAP améliore la robustesse aux perturbations de domaine, un problème bien documenté dans la littérature VLA. L'étape de pré-entraînement est entièrement découplée des tâches en aval, ce qui signifie qu'elle peut être réutilisée sans modification pour différentes compétences de manipulation, réduisant le coût marginal d'adaptation à de nouveaux environnements. Ce travail s'inscrit dans la dynamique récente d'intégration des Vision Foundation Models (tels que DINOv2 ou SigLIP) dans les pipelines de robotique, où le gel du backbone et l'adaptation légère par pooling spatial sont devenus une pratique courante pour limiter le besoin en données. GAP se positionne directement face aux poolers à base d'attention comme AFA (Attention Feature Aggregation), qu'il surpasse sur l'ensemble des benchmarks testés, ainsi que contre le fine-tuning bout-en-bout. Point de vigilance : toutes les expériences sont conduites en simulation, et aucune validation sur hardware physique n'est reportée, ce qui laisse ouverte la question du transfert sim-to-real à grande échelle. Aucun calendrier de déploiement ni partenariat industriel n'est mentionné. Les équipes européennes travaillant sur la manipulation à faibles données, notamment autour de l'INRIA ou des laboratoires de robotique cognitive, pourraient intégrer directement cette approche plug-and-play dans leurs pipelines d'imitation existants.

UELes équipes françaises et européennes travaillant sur la manipulation robotique (notamment autour de l'INRIA et des labos de robotique cognitive) pourraient intégrer directement cette approche plug-and-play dans leurs pipelines d'imitation existants pour réduire drastiquement le coût de collecte de démonstrations.

💬 15 démonstrations pour apprendre une tâche de manipulation, là où les pipelines classiques en réclament des milliers, c'est le chiffre qui compte. La méthode est légère, réutilisable entre tâches, et ça se branche directement sur les modèles de vision déjà en place. Tout se passe en simulation pour l'instant, et le transfert sur du vrai hardware reste la question sans réponse.

IA physiqueOpinion
1 source