Mieux entraîner les VLA : les leçons du défi REAL-I à l'ICRA 2026
La première édition du REAL-I Challenge (Real-world Embodied AI Learning) s'est déroulée lors de la conférence ICRA 2026, en trois étapes : évaluation en simulation, tests sur robot réel, puis une finale sur site disputée sur une même plateforme humanoïde bimanuelle. L'objectif était précis : entraîner des politiques robotiques le plus efficacement possible à partir d'un budget de démonstrations fixe, et non d'un jeu de données illimité. L'article, publié sur arXiv (2609.13679v1), compare les approches de trois équipes finalistes, NUS-CLEAR, RCL-Lab et Deeptouch.ai, qui ont toutes combiné un modèle vision-langage-action (VLA) pré-entraîné à des politiques d'imitation spécifiques à la tâche, en variant la curation des données, l'adaptation par étapes, la sélection des points de contrôle et la conception de l'espace d'action.
Les enseignements dépassent le cadre du concours et s'adressent directement aux intégrateurs et aux chercheurs appliqués. Les auteurs identifient trois facteurs opérationnels : la capacité à s'adapter à l'environnement de déploiement sans effacer les compétences acquises en amont, la prise en compte de la qualité des démonstrations à la bonne échelle temporelle, et la correction des erreurs sur les composants du robot momentanément inactifs. Un bras qui dérive alors qu'il n'est pas sollicité peut suffire à faire échouer une tâche entière. Point le plus significatif pour la communauté VLA : les métriques hors ligne de prédiction d'action, standard pour évaluer ces modèles, se révèlent peu fiables pour anticiper le succès réel en boucle fermée sur robot physique, ce qui nuance l'idée qu'un pré-entraînement à grande échelle suffirait à résoudre le transfert vers le monde réel.
Ce travail s'inscrit dans un paysage où des modèles généralistes comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI servent de socles censés généraliser à de nouvelles tâches avec peu de données ; REAL-I offre un banc d'essai indépendant, sur une plateforme partagée, plutôt que des métriques auto-rapportées par les fabricants. Les auteurs appellent à traiter curation des données, adaptation, évaluation et déploiement comme un seul pipeline plutôt que comme des problèmes séparés, une orientation qui devrait structurer les prochaines éditions du challenge et les benchmarks à venir dans la communauté ICRA.
Dans nos dossiers




