Unifier l'apprentissage de politiques et la prédiction d'états grâce à la modélisation spatiale du langage
Des chercheurs proposent, dans un preprint arXiv (2610.12172), le « Spatial Language Modeling », une approche qui fait apprendre à un seul Transformer autorégressif à la fois la génération d'actions et la prédiction des états futurs d'une scène. Le principe consiste à représenter les contours de la scène, les objectifs, les cibles d'action et les états futurs avec un vocabulaire commun de coordonnées discrètes et de tokens sémantiques. Une grammaire propre à chaque tâche organise ces éléments en séquences spatiales, de sorte qu'un même objectif de prédiction du token suivant couvre le contrôle et la modélisation de l'état. Le modèle est entraîné de zéro en deux temps : un pré-entraînement sur des transitions issues de jeu aléatoire, puis un entraînement conjoint actions et états sur des démonstrations expertes. Pendant le pré-entraînement, les coordonnées d'action enregistrées servent de condition aux prédictions d'état suivantes, mais sont exclues de la perte. En phase de contrôle, le modèle ne décode que les cibles d'action exécutables et met à jour son historique avec les états réellement observés. L'évaluation porte sur la tâche Push-T, en simulation et sur un robot réel. Les auteurs annoncent des performances compétitives en simulation, et un taux de réussite ainsi qu'une couverture de la cible supérieurs à ceux des politiques de référence testées sur robot réel.
Pour les équipes qui travaillent sur les politiques de manipulation, l'intérêt tient à la supervision complémentaire apportée par l'apprentissage des effets géométriques des actions. Les ablations indiquent que l'entraînement sur des séquences conjointes action-état améliore le contrôle, et que le pré-entraînement sur du jeu aléatoire apporte un gain supplémentaire. Ce dernier point est pertinent en pratique : ces données sont bon marché à collecter, sans téléopérateur expert. Le même modèle, alimenté avec des trajectoires d'actions fournies, prédit aussi les états successifs de la scène et reproduit les effets du poussage. Il joue donc à la fois le rôle de politique et de modèle du monde léger. Il faut toutefois rester prudent sur la portée de ces résultats. Push-T est un benchmark de poussage planaire d'un objet en forme de T, relativement simple, et le texte ne chiffre pas, dans son résumé, l'écart avec les baselines ni la taille de l'échantillon d'essais réels. La généralisation à des tâches à contacts riches, à de la 3D ou à des préhenseurs multi-doigts reste à démontrer, de même que le passage à l'échelle d'un vocabulaire de coordonnées discrètes.
Ce travail s'inscrit dans un mouvement plus large visant à unifier perception, action et prédiction dans des architectures de type langage. Il se distingue des approches VLA (vision-langage-action) dominantes, qui reposent sur de grands modèles pré-entraînés, par un entraînement de zéro, sans pré-entraînement web, et par une représentation entièrement spatiale. Parmi les références habituelles de Push-T figurent les politiques de diffusion, qui servent souvent de base de comparaison, ainsi que les modèles du monde appris pour la planification. Le résumé ne précise ni l'équipe, ni le code, ni d'éventuelles extensions annoncées. Il s'agit à ce stade d'un preprint non évalué par des pairs, sans déploiement industriel associé. La suite logique sera de tester la méthode sur des tâches plus longues, sur des scènes 3D et sur des manipulations avec contacts complexes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers


