
ReWeight : post-entraînement des VLA via récupération et pondération de démonstrations humaines
Une équipe de recherche publie ReWeight dans un preprint arXiv daté du 15 septembre 2026 (arXiv:2609.13851v1) : un framework de post-entraînement pour les modèles vision-langage-action (VLA) qui combine récupération de démonstrations et pondération d'échantillons pour exploiter des démonstrations humaines égocentriques. Testé avec le modèle π0.5 sur huit tâches en simulation et quatre tâches réelles, en conditions propres et randomisées, ReWeight fait passer le taux de réussite moyen en simulation de 39% (données robot seules) et 44% (mélange humain-robot aléatoire) à 57%. En conditions physiques réelles, il atteint 68,8% de réussite moyenne, soit 28,8 et 13,8 points de plus que ces deux références. Le projet est documenté sur reweight-vla.github.io.
L'enjeu est concret pour l'industrie : collecter des données robotiques coûte cher, alors que les vidéos égocentriques humaines sont abondantes, mais les mélanger aux données robot dégrade les performances à cause des écarts d'incarnation entre gestes humains et robotiques. ReWeight répond à ce problème en apprenant une représentation visuomotrice commune, associant observations visuelles et actions futures, puis en utilisant le transport optimal pour retenir les démonstrations humaines les plus proches du comportement cible et pondérer les échantillons en conséquence. Pour les laboratoires misant sur les VLA, à l'image de Pi-0, GR00T N2 ou Helix, ce travail offre une méthode reproductible pour exploiter des données humaines à grande échelle sans multiplier les campagnes de téléopération, même si les résultats reposent encore sur un nombre restreint de tâches.
Cette approche s'inscrit dans une tendance de fond : face au coût de la téléopération pour diversifier les données robotiques, plusieurs équipes explorent les démonstrations humaines égocentriques comme source complémentaire, un mélange naïf s'étant jusqu'ici heurté aux différences de morphologie entre mains humaines et effecteurs robotiques. ReWeight s'appuie sur π0.5, le modèle de Physical Intelligence déjà utilisé comme référence dans plusieurs travaux académiques sur les VLA, sans qu'aucun partenariat industriel ne soit mentionné. Il s'agit d'une contribution de recherche publiée sur arXiv, dont la validation sur davantage de plateformes et de tâches reste l'étape à venir avant une éventuelle adoption par des équipes produit.
Dans nos dossiers




