Aller au contenu principal
IA physiquearXiv cs.RO 

PSR : apprentissage de représentations sensorimotrices prédictives pour la manipulation en contact riche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a mis en ligne sur arXiv, le 21 septembre 2026 (référence 2609.21753), un framework baptise PSR (Predictive Sensorimotor Representation), qui entraine un Transformer multimodal a prédire activement la dynamique future des contacts plutôt que de simplement réagir au retour de force, pour améliorer la manipulation robotique dite "contact-rich". Cette hiérarchie de représentations prédictives est ensuite injectée dans le flux d'actions d'une politique visuomotrice, ici un modèle Vision-Language-Action baptise PSR-VLA. Teste sur six taches réelles de manipulation avec contact, PSR-VLA atteint 91,7% de réussite globale, soit 30,0 points de mieux que le modèle de référence pi-0.5, 22,5 points de mieux que ForceVLA-pi-0.5 et 19,2 points de mieux que ForceVLA2-pi-0.5; des vidéos des taches et des tests de stabilité sont en ligne sur psr-vla.pages.dev.

Ce résultat cible un angle mort des modèles VLA généralistes actuels, tels Pi-0, GR00T N2 ou Helix, qui peinent sur les taches ou le toucher compte autant que la vue: vissage, insertion avec jeu serre, manipulation d'objets déformables. Pour les intégrateurs industriels évaluant ces modèles pour l'assemblage ou la logistique fine, cette précision est ce qui sépare une démonstration de laboratoire d'une cellule de production fiable. Un gain de 20 a 30 points face a des variantes déjà "force-aware" comme ForceVLA suggère que prédire activement la dynamique des contacts, plutôt que seulement réagir au retour de force, comble une partie de l'écart entre démo et déploiement réel. Les chiffres restent toutefois ceux d'une seule équipe, sur six taches qu'elle a choisies, sans validation indépendante ni test sur d'autres plateformes robotiques.

PSR s'inscrit dans la suite de travaux comme ForceVLA, qui ajoutaient déjà un signal de force en entrée sans le rendre prédictif; la comparaison directe avec pi-0.5, ForceVLA-pi-0.5 et ForceVLA2-pi-0.5 positionne le framework comme une amélioration architecturale plutôt qu'un nouveau modèle fondation concurrent de ceux de Physical Intelligence ou NVIDIA. Il s'agit a ce stade d'un simple dépôt de recherche sur arXiv, sans annonce produit ni partenariat industriel: aucun calendrier de déploiement ni d'intégration dans un robot commercial n'est mentionne. La suite logique serait une validation sur d'autres plateformes robotiques, terrain suivi de près par des acteurs européens comme Pollen Robotics ou Wandercraft.

Impact France/UE

Aucun acteur européen n'est implique dans cette recherche, mais elle concerne un axe de R&D (manipulation VLA contact-riche) suivi par des intégrateurs européens comme Pollen Robotics et Wandercraft.

À lire aussi

SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique
1arXiv cs.RO 

SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique

Optimisée pour le contrôle plutôt que pour la richesse visuelle, une nouvelle politique vision-langage-action baptisée SLIM (Self-supervised Latent Interaction Model) vient d'être présentée dans un article publié le 11 août 2026 sur arXiv (arXiv:2608.09771v1). Développée pour la manipulation robotique, SLIM ne compte que 0,5 milliard de paramètres, un ordre de grandeur en dessous des backbones multimodaux massifs habituellement utilisés par les modèles VLA de référence. Le système apprend des représentations latentes ancrées dans l'action, capables à la fois de prédire les transitions futures conditionnées par une action et d'inférer l'action ayant produit un changement observé. L'entraînement repose sur une prédiction de trajectoire masquée auto-supervisée, combinant reconstruction d'action et prédiction de latent futur, le tout porté par une architecture compacte de type Mixture-of-Transformers (MoT) qui modélise les interactions entre latents d'observation et tokens d'action. La génération d'action conditionnée par le langage utilise ensuite le flow matching. Selon les auteurs, SLIM égale ou dépasse des baselines VLA et des modèles monde-action à grande échelle sur des benchmarks en simulation et en conditions réelles, sans pré-entraînement embarqué supplémentaire. L'intérêt pour les intégrateurs et décideurs industriels tient moins à la performance brute qu'à l'efficacité: les auteurs revendiquent une latence d'inférence réduite et une empreinte mémoire GPU nettement plus faible que les architectures VLA massives actuelles. Cela répond directement à une critique récurrente du secteur, à savoir que les backbones multimodaux surdimensionnés consacrent l'essentiel de leur capacité à une sémantique ouverte peu utile au contrôle moteur continu, alors que la manipulation robotique nécessite surtout des représentations compactes des observations, actions et transitions. Si les résultats se confirment au-delà des benchmarks académiques, cela ouvrirait la voie à des politiques VLA déployables sur du matériel embarqué moins coûteux, un enjeu direct pour l'industrialisation des humanoïdes et bras robotiques dont le calcul embarqué reste un goulot d'étranglement économique. SLIM se positionne comme alternative aux modèles monde pixel-level, jugés coûteux car ils prédisent des détails visuels non pertinents pour le contrôle, ainsi qu'aux grandes politiques VLA généralistes du type Pi-0 ou GR00T N2. L'article ne précise pas de partenariat industriel, de date de déploiement pilote ni d'acteur commercial associé: il s'agit à ce stade d'une contribution de recherche publiée en preprint, sans validation industrielle indépendante ni comparaison chiffrée détaillée avec les principales baselines nommées dans le texte.

IA physiqueActu
1 source
Apprendre à sentir le futur : DreamTacVLA pour la manipulation riche en contacts
2arXiv cs.RO 

Apprendre à sentir le futur : DreamTacVLA pour la manipulation riche en contacts

Des chercheurs ont publié DreamTacVLA, un framework qui dote les modèles Vision-Language-Action (VLA) d'un sens du toucher anticipatif. Ces architectures, parmi lesquelles Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralisent des comportements robotiques à partir de connaissances web-scale, mais restent aveugles à la physique du contact : force, texture et glissement. DreamTacVLA introduit une perception hiérarchique à trois niveaux : images tactiles haute résolution (micro-vision), caméra poignet (vision locale) et vue tierce (macro-vision), le tout aligné par une perte baptisée Hierarchical Spatial Alignment (HSA). Le système est ensuite affiné par un modèle de monde tactile prédisant des états de contact futurs, ce qui lui permet de conditionner ses décisions à la fois sur des observations réelles et sur des conséquences anticipées ; sur des benchmarks de manipulation contact-riche (vissage, pelage, textiles), il atteint jusqu'à 95 % de succès face aux baselines VLA état de l'art, appuyé par un dataset hybride combinant simulation haute-fidélité (digital twin) et expériences en monde réel. Ce résultat quantifie concrètement le "gap tactile" des VLA modernes : intégrer des signaux de contact haute résolution est discriminant pour des tâches industrielles entières, de l'assemblage de précision au conditionnement de composants déformables. Conditionner les décisions sur des conséquences tactiles anticipées, et non seulement sur des observations en temps réel, rapproche les VLA du raisonnement physique implicite des opérateurs expérimentés. Pour les intégrateurs B2B, cela laisse entrevoir une prochaine génération de politiques robotiques capables de manipulation fine sans capteurs de force-couple coûteux, à condition d'embarquer des capteurs tactiles conformes haute résolution. La démonstration reste cependant purement académique : aucun déploiement industriel ni partenariat de production n'est annoncé dans le papier. Le travail s'inscrit dans un mouvement d'enrichissement des VLA au-delà du seul canal vision-langage, aux côtés d'approches intégrant proprioception, retour de force ou audio. DreamTacVLA se distingue par l'application au domaine tactile de techniques issues des modèles de monde visuels (Dreamer, RSSM), une transposition méthodologiquement originale. L'article est à sa troisième révision arXiv (v3), signe d'une évaluation par les pairs active. Parmi les acteurs à surveiller : Sanctuary AI et Agility Robotics sur les politiques de manipulation, GelSight et Contactile sur les capteurs tactiles, et en Europe, Pollen Robotics qui explore des effecteurs sensoriellement enrichis.

UEPollen Robotics, identifié comme acteur européen explorant des effecteurs sensoriellement enrichis, est directement positionné pour intégrer ce type d'avancée tactile dans ses politiques de manipulation VLA.

IA physiqueOpinion
1 source
Apprentissage par imitation tactile multi-résolution pour la manipulation robotique en contact intensif
3arXiv cs.RO 

Apprentissage par imitation tactile multi-résolution pour la manipulation robotique en contact intensif

Des chercheurs ont publié en juin 2026 MiTaS (Multi-Resolution Tactile Sensing), un cadre de représentation sensorielle pour la manipulation robotique à contact riche (arXiv:2606.06281). L'architecture fusionne trois modalités : un flux caméra RGB, un capteur tactile visuel GelSight Mini (basse fréquence) et un capteur événementiel haute fréquence Evetac. Des réseaux convolutifs dédiés traitent chaque flux avant une fusion par transformeur, produisant une représentation multi-résolution temporelle qui conditionne une politique apprise par flow-matching. Sur cinq tâches de manipulation à contact, MiTaS atteint un taux de réussite moyen de 80 %, contre 31 % pour la vision seule et 54 % pour une fusion vision-tactile à capteur unique. L'entraînement conjoint multi-tactile permet en outre un gain de plus de 10 % sur certaines tâches, même lorsque le capteur Evetac est absent à l'inférence. Ces résultats isolent empiriquement la contribution de la résolution temporelle hétérogène entre capteurs tactiles : les 26 points d'écart entre vision seule et MiTaS quantifient l'apport du toucher, et les points supplémentaires gagnés sur une fusion mono-capteur montrent que la complémentarité temporelle est effectivement exploitée par le transformeur. Pour les intégrateurs robotiques travaillant sur l'assemblage de précision ou l'insertion de connecteurs, cela suggère qu'associer un capteur événementiel rapide à un capteur optique classique apporte un gain mesurable sans nécessairement disposer du capteur haute fréquence au déploiement. L'analyse d'attention incluse dans l'article identifie quels capteurs dominent à chaque phase de tâche, ce qui aide à dimensionner un setup expérimental. Ces chiffres restent toutefois issus d'un laboratoire : leur robustesse face à l'usure des capteurs ou à la variabilité des surfaces industrielles n'est pas encore documentée. La manipulation à contact riche constitue l'un des verrous persistants de la robotique, où des politiques généralisées comme Pi-0 (Physical Intelligence) progressent vite sur les tâches visuelles mais peinent sur les contacts fins. GelSight, développé au MIT, est depuis plusieurs années le capteur de référence en recherche tactile, tandis qu'Evetac représente une génération plus récente de capteurs événementiels appliqués au toucher. MiTaS se positionne à l'intersection de ces deux domaines, avec une page projet et du code disponibles sur mitas-touch.github.io. Les suites naturelles incluraient des évaluations en transfert sim-to-real et une extension à des politiques sans démonstration humaine directe.

IA physiquePaper
1 source
Politique de force : apprentissage d'un contrôle hybride force-position en cadre d'interaction pour la manipulation en contact
4arXiv cs.RO 

Politique de force : apprentissage d'un contrôle hybride force-position en cadre d'interaction pour la manipulation en contact

Des chercheurs ont publié sur arXiv (2602.22088v2) "Force Policy", une architecture de contrôle pour la manipulation robotique en contact prolongé. L'approche repose sur une séparation architecturale nette entre deux régimes d'action : un module global guidé par la vision qui pilote les mouvements en espace libre, et un module local haute fréquence qui prend le relais dès qu'un contact est établi, en exploitant le retour d'effort pour exécuter un contrôle hybride force-position. Le coeur du système est ce que les auteurs appellent un "interaction frame" : un repère local instantané, récupéré automatiquement à partir de démonstrations humaines, qui découple la régulation de force de l'exécution du mouvement. Les expériences en conditions réelles couvrent plusieurs tâches à contact riche (assemblage, insertion, vissage) et démontrent des gains mesurables en stabilité de contact, précision de régulation de force et généralisation à des objets aux géométries et propriétés physiques variées. L'enjeu industriel est direct : la manipulation en contact riche reste le principal goulot d'étranglement des robots de production et d'assemblage. Les politiques d'apprentissage actuelles, qu'il s'agisse de Diffusion Policy, d'ACT ou des approches VLA, sont conçues pour l'espace libre et degradent significativement dès qu'un outil touche une pièce. En injectant le retour d'effort dans une boucle locale haute fréquence distincte de la boucle visuelle, Force Policy adresse structurellement ce découplage plutôt que de le noyer dans un réseau monolithique. La capacité à estimer le repère d'interaction à partir de démonstrations, sans hypothèse sur la structure de la tâche, réduit l'ingénierie manuelle nécessaire au déploiement. Ce travail s'inscrit dans une ligne de recherche active sur le contrôle hybride appris, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur le compliance learning chez CMU et Stanford. Il reste à ce stade une démonstration académique, sans déploiement industriel annoncé ni partenariat constructeur mentionné. L'étape suivante naturelle serait une validation sur des cellules d'assemblage réelles, avec des volumes de cycle et des tolérances conformes aux standards industriels. Le code et les démonstrations vidéo sont disponibles sur force-policy.github.io.

IA physiquePaper
1 source