Rapport technique : têtes d'action à dérive en une étape pour GR00T N1.7
Des chercheurs publient un rapport technique sur arXiv (2609.18108) décrivant une variante de GR00T N1.7, le modèle vision-langage-action (VLA) de NVIDIA pour la robotique, dans laquelle la tête d'action par diffusion itérative est remplacée par une tête dite "one-step drifting", complétée par une extension conditionnée au chevauchement pour le remplacement asynchrone de segments d'action. Tous les entraînements multi-graines ont tourné sur deux GPU NVIDIA A800. Sur le benchmark de simulation LIBERO, le temps de calcul de la seule tête d'action tombe d'environ 45,3 ms à 5,0 ms, et le temps combiné backbone plus tête passe d'environ 70,0 ms à 30,6 ms. Ce gain de vitesse s'accompagne toutefois d'une baisse systématique du taux de réussite des tâches : sur trois graines d'entraînement, les scores atteignent 64,0±4,0% sur LIBERO-Spatial, 52,0±1,0% sur LIBERO-Goal et seulement 26,0±2,6% sur LIBERO-Long. La faible variance entre graines indique que cette dégradation n'est pas due au hasard de l'initialisation.
Pour l'industrie robotique, ce résultat documente noir sur blanc un compromis vitesse-précision que beaucoup de communiqués commerciaux passent sous silence. Fait notable, les auteurs eux-mêmes refusent de présenter ce travail comme une amélioration globale et le qualifient explicitement de compromis vitesse-réussite plutôt que de progrès. Pour les intégrateurs qui envisagent des têtes d'action à une seule étape pour réduire le coût d'inférence des politiques VLA en conditions temps réel, ce papier rappelle qu'accélérer le passage avant d'un modèle d'action ne garantit pas la préservation du comportement en boucle fermée, surtout sur les tâches longues comme LIBERO-Long où la chute est la plus marquée. C'est aussi un rappel que LIBERO reste une évaluation en simulation synchrone, incapable de mesurer l'apport réel de l'extension asynchrone conçue par l'équipe.
GR00T N1.7 s'inscrit dans la lignée des modèles fondation de NVIDIA pour la robotique généraliste, dans un paysage VLA qui compte notamment Pi-0 de Physical Intelligence, Helix de Figure AI ou GR00T N2, génération suivante de la même famille. La tête de diffusion itérative visée par ce rapport est le composant qui pèse le plus lourd sur le temps d'inférence dans la plupart des VLA actuels, d'où l'intérêt croissant des laboratoires pour des architectures à une ou quelques étapes. Les auteurs avancent plusieurs pistes pour expliquer la dégradation observée : moyennage déterministe du mode en une seule étape, estimation de géométrie dépendante du batch, et exécution en boucle ouverte de segments d'action longs. Le rapport ne mentionne aucun pilote industriel ni déploiement réel : il s'agit d'un travail de recherche exploratoire évalué uniquement en simulation, dont la suite logique serait de tester l'extension asynchrone dans des conditions qui l'exercent réellement.
Dans nos dossiers




