
PEARS : adaptation efficace guidée par des connaissances physiques via raisonnement sur les échecs et pilotage de diffusion pour la manipulation tactile
Des chercheurs ont publié sur arXiv (v1, octobre 2026) PEARS, un cadre d'apprentissage par renforcement hybride qui adapte en ligne une politique robotique préentraînée grâce au retour tactile. Il combine deux mécanismes. Après chaque épisode, un module de raisonnement sur les forces (PFR) interroge un modèle vision-langage (VLM) et exploite les connaissances physiques qu'il encode. Le VLM analyse le résultat visuel et l'historique des interactions tactiles pour diagnostiquer l'échec, puis ajuste les bornes de force de contact adaptées à la tâche. Un contrôleur hybride force-position haute fréquence applique ces bornes pendant le contact. En parallèle, une méthode de « diffusion steering » conditionnée par le tactile modifie le bruit latent d'une politique flow-matching gelée. Elle corrige les erreurs de mouvement en espace libre et de timing du contact sans toucher aux poids du modèle de base. En simulation, PEARS gagne 12,4 à 37,4 points de taux de succès face au meilleur baseline de chaque tâche. Il réduit aussi jusqu'à 53,2 % le nombre d'épisodes nécessaires pour atteindre un seuil de succès donné, par rapport au baseline le plus rapide. Sur robot réel, il atteint 95 % de succès pour l'effacement de tableau blanc et 90 % pour l'aspiration de liquide à la pipette.
L'enjeu est le coût de l'adaptation en conditions réelles. Une politique préentraînée se dégrade sensiblement hors distribution, et le post-entraînement par RL classique exige beaucoup d'interactions. En manipulation, chaque essai est lent, coûteux, voire destructeur. Séparer le réglage des contraintes physiques (forces, confié à un VLM) de la correction de trajectoire (bruit latent, confié au RL) indique une voie pour déployer des politiques de type VLA ou flow-matching sans les réentraîner. Le gel du modèle de base limite aussi le risque d'oubli et le coût de calcul. Pour un intégrateur, la perspective est une mise en service plus rapide sur des tâches riches en contact, comme le nettoyage ou la manipulation en laboratoire. Des réserves s'imposent toutefois. Il s'agit d'un préprint non évalué par les pairs. Le texte ne précise ni les baselines, ni le nombre d'essais réels, ni le robot utilisé. Les deux tâches réelles restent étroites et les résultats chiffrés viennent des auteurs eux-mêmes.
PEARS s'inscrit dans deux tendances. La première est le post-entraînement efficace des politiques génératives préentraînées, par exemple du type Pi-0, notamment par le pilotage du bruit d'une politique de diffusion ou de flow-matching. La seconde est l'intégration du toucher, longtemps absent des grands modèles de manipulation centrés sur la vision. Le projet dispose d'un site dédié (song-kun.github.io/pears). Les prochaines étapes à surveiller sont le code, la validation sur d'autres plateformes et des tâches plus variées, et la mesure du coût et de la latence des appels au VLM, qui reste le point faible d'une boucle à haute fréquence.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




