Au-delà du passage à l'échelle des données : le pré-entraînement continu centré sur la représentation pour les modèles vision-langage-action
Des chercheurs ont publie sur arXiv le modèle VLAct, un système vision-langage-action (VLA) fonde sur un pré-entrainement continu qui privilégié la qualité de représentation plutôt que le seul volume de données robotiques. Le backbone VLM généraliste est étendu sur des trajectoires multi-robots hétérogènes, en préservant le prior du VLM et en unifiant partiellement les actions entre morphologies avant un fine-tuning par tache. Sur LIBERO-Plus et RoboTwin 2.0, VLAct devance les systèmes industriels ABot-M0 et LingBot-VLA avec 82,6% et 92,5% de réussite, et se classe sixième sur RoboDojo devant toutes les entrées "world-action model". Sur la morphologie humanoïde inédite RoboCasa-GR1, il bat le GR00T-N1.6 entraine sur 100% des données en n'en utilisant que 20%, le tout avec des données open-source et seulement 16 GPU d'entrainement.
Ce résultat nuance l'hypothèse dominante selon laquelle la performance des VLA dépend surtout du volume de trajectoires collectées, sur le modèle du scaling des grands modèles de langage. En rivalisant avec des systèmes industriels grâce a seulement 16 GPU et des données publiques, les auteurs montrent que la qualité du transfert entre morphologies pèse davantage que la taille brute des données, un axe accessible a des équipes aux moyens plus modestes. Le résultat sur RoboCasa-GR1, ou une morphologie jamais vue est généralisée avec un cinquième des données habituelles, s'attaque directement au frein du transfert cross-embodiment. Ces résultats restent toutefois obtenus sur des bancs d'essai simules, sans déploiement industriel réel documente: une contribution de recherche, pas un produit commercialise.
Les références choisies, les systèmes chinois ABot-M0 et LingBot-VLA et le GR00T-N1.6 de NVIDIA, situent VLAct dans une compétition dense entre modèles VLA généralistes, aux cotes d'acteurs comme Physical Intelligence (Pi-0) ou Figure AI (Helix), absents toutefois des baselines testées ici. Le modèle se positionne comme une alternative sobre en calcul face a la course a l'échelle des données menée par les grands laboratoires. Publie pour l'instant en preprint, l'article ne mentionne ni partenariat industriel ni calendrier de déploiement; les étapes attendues restent la revue par les pairs et, le cas échéant, la publication du code et des poids, les données d'entrainement étant déjà open-source.
Dans nos dossiers




