PSR : apprentissage de représentations sensorimotrices prédictives pour la manipulation en contact riche
Une équipe de recherche a mis en ligne sur arXiv, le 21 septembre 2026 (référence 2609.21753), un framework baptise PSR (Predictive Sensorimotor Representation), qui entraine un Transformer multimodal a prédire activement la dynamique future des contacts plutôt que de simplement réagir au retour de force, pour améliorer la manipulation robotique dite "contact-rich". Cette hiérarchie de représentations prédictives est ensuite injectée dans le flux d'actions d'une politique visuomotrice, ici un modèle Vision-Language-Action baptise PSR-VLA. Teste sur six taches réelles de manipulation avec contact, PSR-VLA atteint 91,7% de réussite globale, soit 30,0 points de mieux que le modèle de référence pi-0.5, 22,5 points de mieux que ForceVLA-pi-0.5 et 19,2 points de mieux que ForceVLA2-pi-0.5; des vidéos des taches et des tests de stabilité sont en ligne sur psr-vla.pages.dev.
Ce résultat cible un angle mort des modèles VLA généralistes actuels, tels Pi-0, GR00T N2 ou Helix, qui peinent sur les taches ou le toucher compte autant que la vue: vissage, insertion avec jeu serre, manipulation d'objets déformables. Pour les intégrateurs industriels évaluant ces modèles pour l'assemblage ou la logistique fine, cette précision est ce qui sépare une démonstration de laboratoire d'une cellule de production fiable. Un gain de 20 a 30 points face a des variantes déjà "force-aware" comme ForceVLA suggère que prédire activement la dynamique des contacts, plutôt que seulement réagir au retour de force, comble une partie de l'écart entre démo et déploiement réel. Les chiffres restent toutefois ceux d'une seule équipe, sur six taches qu'elle a choisies, sans validation indépendante ni test sur d'autres plateformes robotiques.
PSR s'inscrit dans la suite de travaux comme ForceVLA, qui ajoutaient déjà un signal de force en entrée sans le rendre prédictif; la comparaison directe avec pi-0.5, ForceVLA-pi-0.5 et ForceVLA2-pi-0.5 positionne le framework comme une amélioration architecturale plutôt qu'un nouveau modèle fondation concurrent de ceux de Physical Intelligence ou NVIDIA. Il s'agit a ce stade d'un simple dépôt de recherche sur arXiv, sans annonce produit ni partenariat industriel: aucun calendrier de déploiement ni d'intégration dans un robot commercial n'est mentionne. La suite logique serait une validation sur d'autres plateformes robotiques, terrain suivi de près par des acteurs européens comme Pollen Robotics ou Wandercraft.
Aucun acteur européen n'est implique dans cette recherche, mais elle concerne un axe de R&D (manipulation VLA contact-riche) suivi par des intégrateurs européens comme Pollen Robotics et Wandercraft.




