DATAFARM : planification des tâches et mouvements alignée sur la distribution pour l'entraînement des modèles vision-langage-action
Des chercheurs du PRPL Group ont publié le 14 septembre 2026 sur arXiv (2609.12316v1) DATAFARM, une méthode de planification tâche-mouvement (TAMP) alignée sur la distribution de pré-entraînement pour affiner des modèles vision-langage-action (VLA). Le constat de départ est frappant : les trajectoires TAMP brutes, bien qu'elles exécutent correctement les tâches visées, apportent très peu de gain une fois utilisées pour affiner un VLA déjà pré-entraîné, en raison d'un décalage entre leur distribution comportementale et celle des données de pré-entraînement du modèle. DATAFARM corrige ce décalage en alignant les trajectoires générées sur trois axes du modèle pré-entraîné : la configuration des articulations du robot, le style de mouvement et le profil temporel d'exécution. Testée sur trois tâches de manipulation sur table accessibles à TAMP et une tâche de pliage de linge hors de sa portée, la méthode atteint un taux de réussite moyen de 56,7%, contre seulement 8,3% pour les trajectoires TAMP brutes, se rapprochant des 61,7% obtenus par téléopération humaine. Sur la manipulation d'objets déformables, une tâche située hors de la distribution d'affinage, le modèle affiné conserve 85% de réussite, contre 90% pour le modèle pré-entraîné seul.
Ce résultat cible un goulot d'étranglement central pour l'entraînement des modèles fondation en robotique : la collecte de démonstrations de qualité. Pour les intégrateurs et laboratoires qui cherchent à affiner des VLA sans multiplier les sessions de téléopération humaine, coûteuses et difficiles à mettre à l'échelle, DATAFARM montre que la planification automatisée peut redevenir une source de données exploitable, à condition de traiter explicitement l'écart de distribution plutôt que d'utiliser les trajectoires brutes telles quelles. L'étude contredit une hypothèse répandue dans le secteur selon laquelle toute trajectoire réussissant la tâche visée constitue automatiquement une bonne donnée d'entraînement : le succès de la tâche ne suffit pas, la façon dont le mouvement est exécuté compte tout autant. Le maintien d'un taux de réussite élevé sur une tâche totalement hors distribution suggère aussi que cet alignement ne dégrade pas les capacités générales du VLA, un risque fréquent avec un fine-tuning ciblé.
La génération de démonstrations reste le principal frein à l'échelle pour les modèles VLA généralistes du type Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus de trajectoires collectées majoritairement par téléopération humaine. Le TAMP est utilisé de longue date en robotique classique pour produire des plans d'action vérifiés, mais son adoption pour le fine-tuning de VLA restait jusqu'ici limitée faute de preuve d'efficacité, ce que confirme précisément l'échec documenté des trajectoires TAMP brutes dans cette étude. DATAFARM se présente ainsi comme une alternative complémentaire aux pipelines de données synthétiques par simulation, plutôt qu'un remplacement de la téléopération. Code et détails expérimentaux sont disponibles sur prpl-group.com/datafarm ; à ce stade, le travail reste une publication de recherche, sans déploiement sur des robots commerciaux ni calendrier de mise en production annoncé.
Dans nos dossiers




