Aller au contenu principal
PEARS : adaptation efficace guidée par des connaissances physiques via raisonnement sur les échecs et pilotage de diffusion pour la manipulation tactile
RecherchearXiv cs.RO 

PEARS : adaptation efficace guidée par des connaissances physiques via raisonnement sur les échecs et pilotage de diffusion pour la manipulation tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (v1, octobre 2026) PEARS, un cadre d'apprentissage par renforcement hybride qui adapte en ligne une politique robotique préentraînée grâce au retour tactile. Il combine deux mécanismes. Après chaque épisode, un module de raisonnement sur les forces (PFR) interroge un modèle vision-langage (VLM) et exploite les connaissances physiques qu'il encode. Le VLM analyse le résultat visuel et l'historique des interactions tactiles pour diagnostiquer l'échec, puis ajuste les bornes de force de contact adaptées à la tâche. Un contrôleur hybride force-position haute fréquence applique ces bornes pendant le contact. En parallèle, une méthode de « diffusion steering » conditionnée par le tactile modifie le bruit latent d'une politique flow-matching gelée. Elle corrige les erreurs de mouvement en espace libre et de timing du contact sans toucher aux poids du modèle de base. En simulation, PEARS gagne 12,4 à 37,4 points de taux de succès face au meilleur baseline de chaque tâche. Il réduit aussi jusqu'à 53,2 % le nombre d'épisodes nécessaires pour atteindre un seuil de succès donné, par rapport au baseline le plus rapide. Sur robot réel, il atteint 95 % de succès pour l'effacement de tableau blanc et 90 % pour l'aspiration de liquide à la pipette.

L'enjeu est le coût de l'adaptation en conditions réelles. Une politique préentraînée se dégrade sensiblement hors distribution, et le post-entraînement par RL classique exige beaucoup d'interactions. En manipulation, chaque essai est lent, coûteux, voire destructeur. Séparer le réglage des contraintes physiques (forces, confié à un VLM) de la correction de trajectoire (bruit latent, confié au RL) indique une voie pour déployer des politiques de type VLA ou flow-matching sans les réentraîner. Le gel du modèle de base limite aussi le risque d'oubli et le coût de calcul. Pour un intégrateur, la perspective est une mise en service plus rapide sur des tâches riches en contact, comme le nettoyage ou la manipulation en laboratoire. Des réserves s'imposent toutefois. Il s'agit d'un préprint non évalué par les pairs. Le texte ne précise ni les baselines, ni le nombre d'essais réels, ni le robot utilisé. Les deux tâches réelles restent étroites et les résultats chiffrés viennent des auteurs eux-mêmes.

PEARS s'inscrit dans deux tendances. La première est le post-entraînement efficace des politiques génératives préentraînées, par exemple du type Pi-0, notamment par le pilotage du bruit d'une politique de diffusion ou de flow-matching. La seconde est l'intégration du toucher, longtemps absent des grands modèles de manipulation centrés sur la vision. Le projet dispose d'un site dédié (song-kun.github.io/pears). Les prochaines étapes à surveiller sont le code, la validation sur d'autres plateformes et des tâches plus variées, et la mesure du coût et de la latence des appels au VLM, qui reste le point faible d'une boucle à haute fréquence.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)
1arXiv cs.RO 

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)

Une équipe de chercheurs a publié sur arXiv (référence 2604.15938) une proposition architecturale baptisée VADF (Vision-Adaptive Diffusion Policy Framework), visant à corriger deux défauts structurels des politiques de diffusion appliquées à la manipulation robotique. Le premier défaut est le déséquilibre de classe dû à l'échantillonnage uniforme lors de l'entraînement : le modèle traite indistinctement les exemples faciles et difficiles, ce qui ralentit la convergence. Le second est le taux d'échec à l'inférence par dépassement de délai, un problème opérationnel concret dès qu'on sort du laboratoire. VADF intègre deux composants : l'ALN (Adaptive Loss Network), un MLP léger qui prédit en temps réel la difficulté de chaque pas d'entraînement et applique un suréchantillonnage des régions à forte perte via du hard negative mining ; et l'HVTS (Hierarchical Vision Task Segmenter), qui décompose une instruction de haut niveau en sous-tâches visuellement guidées, en assignant des schedules de bruit courts aux actions simples et des schedules longs aux actions complexes, réduisant ainsi la charge computationnelle à l'inférence. L'architecture est conçue model-agnostic, c'est-à-dire intégrable à n'importe quelle implémentation existante de politique de diffusion. L'intérêt pour un intégrateur ou un responsable R&D est avant tout pratique : les politiques de diffusion souffrent de coûts d'entraînement élevés et d'une fiabilité insuffisante en déploiement réel, ce qui freine leur adoption industrielle. Si les gains annoncés par VADF se confirment sur des benchmarks indépendants, la réduction des étapes de convergence représenterait un levier significatif sur les coûts GPU, et la diminution des timeouts à l'inférence améliorerait directement la cadence opérationnelle. Il faut toutefois noter que ce travail est un preprint non évalué par des pairs, sans chiffres de performance comparatifs publiés dans l'article lui-même. Les politiques de diffusion ont émergé comme méthode de choix pour l'imitation comportementale en robotique depuis les travaux de Chi et al. en 2023 (Diffusion Policy, Columbia), avant d'être intégrées dans des architectures plus larges comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La principale tension du domaine reste le sim-to-real gap et la robustesse à l'inférence en conditions réelles, terrain sur lequel VADF prétend apporter une contribution. Les prochaines étapes logiques seraient une validation sur des benchmarks standard (RLBench, LIBERO) et une comparaison directe avec ACT ou Diffusion Policy de référence.

RecherchePaper
1 source
Manipulation robotique riche en contacts dans la construction par apprentissage zero-shot : contrôle adaptatif guidé par politique de diffusion
2arXiv cs.RO 

Manipulation robotique riche en contacts dans la construction par apprentissage zero-shot : contrôle adaptatif guidé par politique de diffusion

Une équipe de chercheurs présente un nouveau framework combinant des politiques de diffusion (diffusion policies) entraînées sur des données de pose et de force/couple générées par simulation, couplées à un contrôleur adaptatif inspiré de la méthode L1 qui corrige en ligne les actions prédites par la politique pour compenser les dynamiques de contact non modélisées. Le système a été testé sur trois tâches d'assemblage robotique dans le bâtiment : l'assemblage de charpente bois (timber joinery), le raccordement de tuyauterie (pipe fitting), et l'assemblage séquentiel d'une ferme de toit (truss) à échelle réelle. Les résultats rapportés font état de 100% de réussite sur les tâches d'assemblage isolées et de 90 à 100% de réussite sur les sous-tâches de l'assemblage séquentiel de ferme, avec des forces de contact plus faibles et plus stables que les méthodes de référence. Le papier, publié sur arXiv (2608.22100v1) fin août 2026, revendique un transfert "zero-shot" de la simulation vers le réel, c'est-à-dire sans réentraînement ni collecte de données supplémentaires sur le robot physique. Cette avancée cible un problème central et jusqu'ici mal résolu de la robotique du BTP : l'assemblage riche en contacts, où les tolérances serrées, les imprécisions de fabrication et la dynamique incertaine des contacts rendent les approches classiques peu fiables. Si les chiffres se confirment au-delà du benchmark, la méthode réduirait fortement le coût et le temps de collecte de données réelles nécessaires à l'entraînement des politiques, un frein majeur au déploiement de robots autonomes sur chantier. Elle apporte aussi un indice supplémentaire que les politiques de diffusion, combinées à un contrôle adaptatif classique, peuvent généraliser à des tâches de manipulation physique fine sans long cycle d'essais réels, un argument qui intéresse directement les intégrateurs et décideurs cherchant à automatiser des tâches d'assemblage répétitives et physiquement pénibles. Le travail s'inscrit dans la lignée des recherches en apprentissage par imitation et en contrôle robuste appliquées à la construction, un secteur confronté à une pénurie de main-d'oeuvre et à des cadences de chantier difficiles à automatiser avec des approches purement scriptées. Il se positionne face à des méthodes de référence comparées directement dans ses benchmarks, sans toutefois nommer de plateforme robotique commerciale ni de site de déploiement industriel : il s'agit à ce stade d'une démonstration de recherche en laboratoire et en simulation, pas d'un produit livré ou déployé sur un chantier réel. Les auteurs annoncent vouloir étendre l'approche à un éventail plus large de tâches de manipulation riches en contacts dans la construction, ce qui laisse présager des travaux de suite plutôt qu'un calendrier de commercialisation.

UEAucun acteur ni déploiement européen n'est cite, mais la méthode vise un problème (pénurie de main-d'oeuvre, assemblage BTP) directement pertinent pour le secteur de la construction en France et en UE.

RecherchePaper
1 source
Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision
3arXiv cs.RO 

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision

Des chercheurs ont publié le 23 juin 2026 une étude comparative systématique (arXiv:2606.18594) évaluant quatre types d'espaces d'action en apprentissage par renforcement (RL) pour la manipulation robotique visuelle : l'incrément de pose, la vitesse de pose, l'incrément de position articulaire, et la vitesse articulaire. Les politiques ont été entraînées en simulation puis déployées sur robot réel via transfert sim-to-réel, sur deux tâches benchmark : la saisie d'objet et la poussée d'objet. Résultat principal : l'espace d'action en vitesse articulaire (joint velocity) surpasse les trois autres alternatives, aussi bien en fluidité de mouvement qu'en performance finale sur les deux tâches testées. Ce résultat a une portée pratique directe pour les ingénieurs qui conçoivent des systèmes de manipulation autonome. Le choix de l'espace d'action est une décision d'architecture souvent sous-documentée dans la littérature RL appliquée, et les praticiens se retrouvent fréquemment à tâtonner empiriquement. En démontrant que la vitesse articulaire favorise à la fois la sécurité (mouvements plus lisses, moins de à-coups) et la performance sur des tâches visuelles, l'étude fournit une recommandation actionnable. Elle confirme aussi que le gap sim-to-réel dépend non seulement de la politique apprise, mais de la représentation même des actions, un levier souvent négligé dans les pipelines de transfert. Pour les intégrateurs travaillant avec des bras industriels ou des cobots, cette granularité de contrôle peut directement influer sur la durée de vie mécanique et la robustesse opérationnelle. L'étude s'inscrit dans un courant de recherche croissant sur la robustesse du transfert sim-to-réel pour la manipulation visuelle, aux côtés de travaux sur les politiques visuomotrices à base de transformeurs (VLA) comme pi-0 de Physical Intelligence ou les approches diffusion-policy popularisées par Columbia et Toyota Research Institute. Contrairement à ces méthodes qui s'intéressent à l'architecture du modèle, ce papier intervient en amont, au niveau du signal de commande lui-même. Les auteurs annoncent des recommandations pratiques pour le choix d'espace d'action selon le contexte (simulation seule ou déploiement réel), ce qui en fait une référence méthodologique utile pour les équipes démarrant un projet RL sur hardware.

RecherchePaper
1 source
F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots
4arXiv cs.RO 

F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots

Des chercheurs proposent F4R (Failure for Rising), un cadre d'apprentissage en boucle fermée « real-to-sim-to-real » qui transforme les échecs observés en conditions réelles en améliorations ciblées d'une politique de type vision-langage-action (VLA). Le système enchaîne quatre étapes : un agent identifie et diagnostique automatiquement les échecs à partir des rollouts, chaque échec est reconstruit sous forme d'environnement de table interactif centré sur les objets, la politique est affinée par un co-entraînement simulation/réel conditionné par l'échec puis par de l'apprentissage par renforcement ciblé dans ces environnements reconstruits, et la politique améliorée est redéployée. Les nouveaux échecs alimentent le cycle suivant. Sur quatre tâches de manipulation testées en conditions réelles, F4R atteint 93,75 % de réussite en distribution et 90,0 % hors distribution (OOD). Il devance de 18,75 points de pourcentage, en OOD, une base de comparaison à budget égal, le Targeted BC (clonage comportemental ciblé), et ce sans collecte de nouvelles démonstrations correctives dans le monde réel. L'enjeu est très concret pour les intégrateurs et les équipes qui déploient des VLA. La réponse habituelle à un échec en production consiste à collecter de nouvelles démonstrations d'experts, ce qui coûte cher, demande du temps opérateur, peut être risqué pour le matériel et se met mal à l'échelle. Déplacer la correction vers la simulation, à partir de scènes reconstruites à partir de l'échec réel, viserait à réduire ce goulot d'étranglement. Si ces résultats se confirment, ils indiqueraient qu'un écart de robustesse hors distribution peut se combler sans téléopération supplémentaire, et que la reconstruction ciblée permet de contourner en partie le problème du sim-to-real, généralement traité avec des simulateurs génériques. Des réserves s'imposent : l'évaluation ne porte que sur quatre tâches de table, avec des objets manipulés simples, et l'article ne détaille pas ici le nombre d'essais ni les modèles de base. Les gains sont mesurés face à une seule base à budget égal, et la transposition à des scènes encombrées, à des objets déformables ou à des cellules industrielles reste à démontrer. Ce travail s'inscrit dans la course à la fiabilité des politiques généralistes de type Pi-0, Helix ou GR00T, dont les performances réelles restent limitées par la couverture des démonstrations et par une compréhension encore partielle des interactions physiques. Il prolonge les approches de real-to-sim et de réglage par renforcement de VLA, ainsi que les boucles de « data flywheel » que les acteurs industriels revendiquent pour leurs flottes. La différence tient ici à l'automatisation du diagnostic et à la reconstruction de chaque échec comme environnement d'entraînement. Il s'agit d'une publication de recherche sur arXiv (version 2 remplaçant la précédente), sans produit ni déploiement commercial annoncé. La suite logique serait de valider la méthode sur des robots plus variés, des tâches plus longues et des cadences industrielles, avant d'envisager une intégration dans des chaînes de déploiement continu.

RecherchePaper
1 source