Aller au contenu principal
Quel est le meilleur curriculum : façonner le comportement de préhension guidé par un contrôleur pour la manipulation sensible à la force de contact
RecherchearXiv cs.RO 

Quel est le meilleur curriculum : façonner le comportement de préhension guidé par un contrôleur pour la manipulation sensible à la force de contact

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La manipulation d'objets fragiles où des forces de contact inférieures au newton peuvent causer des dommages irréversibles pose un problème spécifique pour l'apprentissage de politiques robotiques, selon un article publié sur arXiv (2609.25887v1). Les chercheurs montrent que le goulot d'étranglement ne se situe pas dans la politique elle-même mais en amont, lors de la collecte des démonstrations : le contrôle manuel d'une pince est trop lent et trop grossier pour maintenir la fenêtre de force étroite nécessaire à une prise stable. Leur solution consiste à utiliser un contrôleur réflexe tactile déterministe fonctionnant à 25 Hz comme "professeur" au moment de la collecte de données, produisant des démonstrations façonnées par ce contrôleur pour entraîner ensuite des politiques sans capteur tactile. Sur l'architecture Action Chunking with Transformers (ACT), les politiques entraînées sur ces démonstrations reproduisent le profil de prise du contrôleur et atteignent 95% de prises stables sur une tâche de référence avec une tasse en plastique, un net progrès par rapport aux démonstrations manuelles simplement filtrées visuellement. Le même principe améliore aussi la stabilité en distribution du modèle π_0.5 et montre une tendance encourageante sur une variante non vue, une tasse en papier.

Ce travail nuance une hypothèse répandue dans la robotique manipulatrice actuelle, celle selon laquelle intégrer le tactile directement comme entrée de politique serait la voie naturelle vers une manipulation fine. Il propose à la place de réserver le tactile au moment de la collecte, comme enseignant qui façonne le comportement démontré, une distinction utile pour les équipes qui conçoivent des pipelines de téléopération et d'annotation pour des tâches sensibles à la force. Mais l'étude révèle aussi une limite nette : sous perturbation externe aléatoire, la politique π_0.5 entraînée sur données réflexes échoue tout de même dans 45% des essais lorsqu'elle agit seule, alors qu'un arbitre réflexe activé au déploiement conserve toutes les prises. Autrement dit, le rejet de perturbations reste dépendant d'un contrôleur explicite, ce qui trace une frontière claire pour ce qu'une politique purement visuelle peut espérer accomplir sans capteur tactile embarqué.

Le constat de départ, la lenteur et l'imprécision de la téléopération manuelle face à des contraintes de force strictes, s'inscrit dans la littérature existante sur l'apprentissage de politiques visuo-tactiles, où le signal tactile est généralement traité comme une entrée supplémentaire du modèle plutôt que comme un outil de collecte. En testant leur approche sur deux architectures différentes, ACT et π_0.5, les auteurs cherchent à généraliser leur conclusion au-delà d'un seul modèle. L'article ne mentionne ni déploiement industriel ni partenaire commercial ; il s'agit d'un travail de recherche méthodologique dont les suites logiques porteraient sur l'extension à d'autres objets fragiles et sur des stratégies hybrides combinant arbitrage réflexe et politique visuelle au moment de l'exécution.

À lire aussi

TAO-Force : unifier perception sensible à la force et contrôle rapide-lent pour la manipulation à contacts riches
1arXiv cs.RO 

TAO-Force : unifier perception sensible à la force et contrôle rapide-lent pour la manipulation à contacts riches

TAO-Force, présenté dans un papier de recherche publié sur arXiv en septembre 2026 (arXiv:2609.18497v1), s'attaque aux limites des modèles Vision-Language-Action (VLA) pour la manipulation robotique riche en contact, comme l'insertion de pièces ou l'assemblage fin. Le système ajoute une perception sensible à la force via F-FiLM (Force-conditioned Feature-wise Linear Modulation), un module qui injecte un retour de force encodé dans les représentations d'un backbone vision-langage pré-entraîné et gelé, sans altérer ses connaissances sémantiques. Côté contrôle, une architecture "fast-slow" déclenchée par la détection de contact fait alterner une branche lente en position, qui suit la trajectoire nominale hors contact, et une branche rapide en admittance, qui régule l'interaction physique dès le contact. L'approche est validée par une tâche dédiée de perception de force et par des essais réels sur quatre tâches de manipulation riches en contact ; l'abstract ne précise ni taux de réussite chiffrés, ni plateforme robotique, ni affiliation des auteurs. Le travail cible un angle mort documenté des VLA génériques actuels, de Pi-0 à Helix : leur perception, essentiellement visuelle, détecte mal l'amorce et l'intensité d'un contact, et leur exécution en boucle de position ne s'adapte pas en temps réel aux dynamiques de contact qui évoluent vite, ce qui cantonne ces modèles à la préhension grossière plutôt qu'aux gestes fins comme l'insertion de connecteurs. Pour les intégrateurs et les équipes robotique industrielles, l'intérêt tient à la méthode : injecter un retour de force dans un backbone VLA gelé, sans réentraîner tout le modèle, offre une adaptation moins coûteuse, dans un secteur où l'écart entre démonstrations léchées et fiabilité en usine reste le principal frein à l'adoption de politiques génériques de manipulation. TAO-Force s'inscrit dans une tendance de recherche plus large consistant à ajouter des capteurs de force et de couple aux politiques de manipulation. Ces politiques, entraînées surtout sur des flux caméra, sont ici adaptées via un backbone gelé plutôt que par un réentraînement complet. Publié sur arXiv sans revue par les pairs et sans partenaire industriel ni calendrier de déploiement annoncés, le travail devra être reproduit par d'autres laboratoires avant toute intégration dans des piles logicielles pour bras industriels ou mains de robots humanoïdes.

RecherchePaper
1 source
TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
2arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source
TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact
3arXiv cs.RO 

TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact

Cette étude, publiée sur arXiv en juillet 2026, présente TAC-LOCO, un cadre d'apprentissage par renforcement qui unifie pour la première fois le contrôle corporel complet d'un robot quadrupède doté d'un bras manipulateur en intégrant un retour tactile dans la boucle de commande. Le système encode les données d'un réseau de capteurs tactiles montés sur une pince compliante en une représentation latente compacte, fusionnée avec la proprioception du robot pour piloter simultanément les pattes, le bras et la pince. Les chercheurs ont déployé la politique sans réentraînement supplémentaire (zero-shot) sur un quadrupède Unitree Go2 équipé d'un bras Interbotix WidowX 250 et d'une pince tactile. Les résultats chiffrés sont précis : une réduction de 47% de la force de préhension appliquée et un taux de chute d'objet inférieur à 1%, y compris lors de changements de charge progressifs et de relâchements brusques. L'apport principal tient à ce que le système régule activement la force de préhension en fonction de l'interaction physique réelle, plutôt que de simplement serrer fermement l'objet comme le font la plupart des approches existantes en loco-manipulation dynamique. Pour l'industrie robotique, cela répond à une limite concrète des robots à pattes actuels : la capacité à transporter des charges tout en se déplaçant dynamiquement sans les endommager ni les laisser tomber, un enjeu direct pour la logistique, l'inspection industrielle ou les interventions en environnement non structuré. Ce résultat illustre aussi que l'intégration tactile n'est plus cantonnée aux tâches de manipulation statique en laboratoire, mais devient exploitable dans des scénarios de contrôle corporel complet à haute dynamique, un signal notable pour les intégrateurs qui évaluent la maturité des architectures VLA et RL appliquées à la robotique mobile. Le travail s'inscrit dans la continuité des recherches sur la loco-manipulation, un domaine où la coordination entre stabilité locomotrice et précision de manipulation reste un défi ouvert, généralement traité sans capteurs tactiles faute de méthodes robustes pour exploiter ce signal en temps réel. TAC-LOCO se positionne ainsi face aux approches de contrôle corporel complet sans tactile, en démontrant un gain mesurable sur la robustesse aux perturbations externes. La validation reste toutefois limitée à une plateforme de recherche (Go2 plus bras WidowX), sans indication de calendrier vers un déploiement industriel ou une plateforme commerciale.

RecherchePaper
1 source
Rêver le son du contact : générer vidéo et audio pour la manipulation sensible à la force en zero-shot
4arXiv cs.RO 

Rêver le son du contact : générer vidéo et audio pour la manipulation sensible à la force en zero-shot

Un article déposé sur arXiv (référence 2609.19137, catégorie "new") début septembre 2026, intitulé "Dreaming the Sound of Contact", décrit une méthode pour doter les robots manipulateurs d'une perception de la force lors de tâches de contact. Les modèles de génération vidéo utilisés pour apprendre des trajectoires de manipulation ne produisent que des mouvements cinématiques, sans information de force, et échouent donc dès qu'un contact adéquat est requis pour réussir la tâche. Les auteurs augmentent la vidéo générée avec de l'audio: le volume des sons de contact synthétisés façonne un profil de force désirée, borné et variable dans le temps, dérivé conjointement avec la trajectoire à partir d'un simple prompt textuel structuré. Exécutées sur un bras Franka Panda via un régulateur de force en boucle fermée qui suit ce profil audio pendant le contact, ces trajectoires réussissent plusieurs tâches là où une base purement cinématique échoue, sans qu'un taux de réussite chiffré ne soit précisé dans le résumé. Le pipeline sert aussi de générateur de données pour entraîner des politiques exécutant ces tâches en boucle fermée, avec code, vidéos et jeu de données promis sur dreamingcontactsound.github.io. Le travail cible un angle mort des approches génératives aujourd'hui dominantes en manipulation robotique, notamment les modèles vision-langage-action qui imitent des mouvements visuellement plausibles mais ignorent la dynamique de contact, pourtant indispensable pour pousser, essuyer, visser ou insérer une pièce. Montrer qu'un signal audio généré, et non mesuré par un capteur réel, peut suffire à façonner une consigne de force exploitable en boucle fermée ouvre une piste peu coûteuse pour réduire l'écart entre démonstration vidéo et exécution physique réelle. Pour les intégrateurs et les équipes de R&D en manipulation industrielle, l'intérêt est double: moins dépendre de démonstrations réelles coûteuses à collecter, et étendre le champ des politiques apprises par vidéo, aujourd'hui cantonnées aux tâches sans contact critique, vers l'assemblage ou la manipulation fine. Cette méthode s'inscrit dans une lignée de recherches qui exploitent la génération vidéo comme source de trajectoires de manipulation robotique, une alternative à la téléopération ou à l'apprentissage par renforcement en simulation pour collecter des données d'entraînement. L'absence de force dans ces trajectoires générées, et l'échec conséquent sur les tâches à contact riche, est une limite connue depuis l'essor des architectures vision-langage-action à grande échelle. Le choix du bras Franka Panda, plateforme standard des laboratoires de recherche en manipulation, situe ce travail au stade de validation expérimentale plutôt que de déploiement industriel: aucun partenariat commercial, licence ou calendrier de mise en production n'est mentionné. Les seules suites annoncées sont la mise à disposition du code, des vidéos et du jeu de données sur le site du projet, ouvrant la voie à une réplication par la communauté robotique.

RecherchePaper
1 source