Même scène, tâche différente : alignement des compétences pour la généralisation compositionnelle des modèles VLA
Des chercheurs, dont l'équipe derrière le site taegeunyang.github.io/craft, publient sur arXiv (2610.00524) CRAFT, une méthode d'entraînement destinée à améliorer la généralisation compositionnelle des modèles VLA (vision-language-action). Le problème visé est précis: un VLA affiné sur des démonstrations échoue souvent à exécuter des combinaisons de compétences absentes de ces démonstrations, même si chaque compétence prise isolément a bien été démontrée. Les auteurs testent CRAFT sur trois modèles VLA et deux benchmarks en simulation, et sur un robot réel. Ils annoncent une hausse du taux de succès sur les combinaisons non démontrées, sans perte notable sur les combinaisons démontrées. Le résumé ne fournit aucun chiffre de gain, ni le nom des modèles ou des benchmarks, ni le type de robot, ce qui empêche pour l'instant de mesurer l'ampleur réelle de l'amélioration.
L'intérêt tient au diagnostic autant qu'au remède. Les auteurs identifient un « raccourci visuel »: pendant le fine-tuning, l'observation visuelle sert de substitut à l'instruction. La politique reconnaît une scène déjà vue et rejoue la combinaison associée, au lieu de suivre la consigne donnée. Si ce mécanisme se confirme à grande échelle, il remet en cause l'idée que des VLA robustes en démonstration suivent réellement le langage. Pour un intégrateur, la conséquence est concrète: un robot qui réussit « poser la pièce puis visser » dans une cellule peut échouer sur « visser puis poser » dans la même cellule, sans qu'aucun test de démonstration ne le révèle. Cela renforce l'exigence de bancs d'essai qui varient l'instruction à scène constante, plutôt que de mesurer la seule réussite sur des tâches vues. À ce stade, les résultats restent ceux d'un preprint, sans revue par les pairs.
Techniquement, CRAFT construit des paires contrefactuelles: l'observation d'une démonstration est conservée, l'instruction est changée pour désigner une combinaison jamais démontrée. Ces paires n'ont pas d'action cible. Les actions de la compétence requise ne peuvent pas être copiées telles quelles, car une même compétence exige des gestes différents selon la scène. La méthode transfère donc la supervision à partir de représentations de compétences réutilisables d'une exécution à l'autre. Elle s'inscrit dans le travail sur la généralisation compositionnelle des VLA, face aux approches qui comptent sur davantage de données ou de diversité de scènes. Les prochaines étapes à surveiller sont la publication du code, les chiffres détaillés et la validation sur des tâches longues et des plateformes industrielles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




