Aller au contenu principal
Combiner supervision manuelle et par téléopération pour la manipulation riche en contacts via des experts guidés par l'état
RecherchearXiv cs.RO 

Combiner supervision manuelle et par téléopération pour la manipulation riche en contacts via des experts guidés par l'état

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (réf. 2606.26603) une méthode hybride de collecte de données pour la manipulation robotique en contact, baptisée BRIDGE (Bi-modal Routing for Imitation Data via Gated Experts). L'approche combine deux modalités d'apprentissage par imitation: les systèmes portables de type UMI (Universal Manipulation Interface), qui permettent une collecte à grande échelle mais ne capturent que des "actions observées" depuis le démonstrateur humain, et la téléopération, qui fournit des "actions désirées" directement exploitables par le contrôleur robot, mais dont la collecte est coûteuse en temps. Sur trois tâches de manipulation riche en contacts, BRIDGE améliore le taux de succès jusqu'à 36,7% par rapport à une politique entraînée uniquement sur données portables. L'architecture repose sur un mélange d'experts en diffusion policy, routés dynamiquement selon la phase de tâche courante détectée à partir de l'état du robot.

Le résultat le plus contre-intuitif mérite attention: mélanger naïvement des données portables et des démonstrations de téléopération dégrade les performances par rapport aux données portables seules. Ce n'est qu'en ségréguant explicitement les deux sources via un routeur conditionné sur l'état robot que le gain émerge. Pour les ingénieurs et intégrateurs en robotique industrielle, cela pointe une réalité souvent ignorée: la qualité de la supervision varie selon la phase de tâche, et une augmentation de données mal calibrée peut nuire à la politique apprise. En phase libre, les trajectoires portables sont valides; en phase de contact, le suivi de trajectoires observées à haute rigidité génère des forces de contact importantes et potentiellement dangereuses. BRIDGE résout ce mismatch sans exiger une téléopération complète de la tâche, réduisant significativement le coût de collecte tout en ciblant les segments réellement critiques.

Le système UMI, issu des travaux de Cheng Chi et al. (Stanford/Columbia), s'est imposé comme référence pour la collecte scalable en manipulation; les diffusion policies, popularisées par ces mêmes travaux en 2023, forment le socle algorithmique de BRIDGE. Dans le panorama actuel de l'imitation learning, cette recherche se positionne face à des approches à grande échelle comme les VLA (pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA), qui misent sur des volumes massifs de données hétérogènes. BRIDGE fait un pari différent: la qualité ciblée plutôt que l'échelle brute. Il s'agit d'une prépublication arXiv, non encore évaluée par les pairs, et les trois tâches testées restent des benchmarks de laboratoire. La généralisation à des environnements industriels réels, avec variabilité de pièces et contraintes de cycle time, reste entièrement à démontrer.

À lire aussi

ZeroTouch : estimation visuelle du contact supervisée par le tactile pour la manipulation riche en contacts
1arXiv cs.RO 

ZeroTouch : estimation visuelle du contact supervisée par le tactile pour la manipulation riche en contacts

Des chercheurs publient ZeroTouch, un système de préhension robotique qui prédit la déformation de contact, le torseur d'effort à six axes et une cible de compression optimale à partir de la seule vision embarquée au poignet, de l'état de la pince et de la direction de la gravité locale, sans capteur tactile physique au moment de l'exécution. Décrit dans un article déposé sur arXiv (2609.21726v1), le modèle est entraîné avec des mesures tactiles réelles comme supervision privilégiée, puis s'en passe totalement en déploiement. Sur l'ensemble de validation complet, l'erreur moyenne de force normale chute de 2,017 N pour une base de référence n'utilisant que l'état du système à 0,531 N avec l'architecture complète. En évaluation physique, avec vingt essais par condition, ZeroTouch atteint 95% de réussite sur un objet inédit, 80% sur une combinaison objet connu et prise inédite, et 90% en cas de changement de contenu ou de charge. Sous le même protocole, deux modèles génération vision-langage-action de référence, OpenVLA et SmolVLA, plafonnent respectivement à 25%, 40% et 55%, puis 10%, 25% et 35%. L'écart de performance, jusqu'à quatre fois supérieur à OpenVLA sur certaines conditions, pointe une limite concrète des politiques VLA généralistes actuelles: la régulation fine de la force de préhension et de la compression reste un point faible, alors qu'elle conditionne la manipulation d'objets fragiles ou déformables en logistique et en industrie. L'intérêt de ZeroTouch tient surtout à son architecture: transférer l'information tactile en phase d'entraînement seulement supprime la dépendance à un matériel dédié coûteux et fragile au déploiement, ce qui simplifie l'intégration sur des bras ou des mains déjà équipés d'une simple caméra poignet. Ces résultats restent toutefois issus d'un cadre de laboratoire, avec seulement vingt essais par condition et sans validation industrielle annoncée. Le problème de la régulation de force sans capteur tactile dédié touche l'ensemble des approches VLA récentes, de Pi-0 à GR00T N2 en passant par Helix, qui s'appuient historiquement sur des capteurs tactiles embarqués type GelSight pour ce type de retour. ZeroTouch s'inscrit dans une tendance plus large consistant à utiliser le tactile comme professeur à l'entraînement plutôt que comme dépendance matérielle permanente. L'article ne précise ni laboratoire ni feuille de route produit, et reste à ce stade une contribution de recherche publiée sans revue par les pairs.

RecherchePaper
1 source
ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts
2arXiv cs.RO 

ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts

Des chercheurs présentent ViTacWorld, un modèle de monde visuo-tactile conditionné par l'action, conçu pour la manipulation robotique riche en contacts, décrit dans une prépublication arXiv (2607.22530v1). Le système s'appuie sur des jeux de données tactiles réels publics combinés à un environnement de simulation construit spécifiquement pour l'occasion, afin de générer à grande échelle des trajectoires visuo-tactiles-actions. Le modèle est d'abord préentraîné sur de larges volumes de trajectoires réelles et simulées, puis affiné avec des rollouts de politiques collectés en conditions réelles pour mieux coller aux comportements de manipulation visés. À partir d'une séquence d'actions du robot, ViTacWorld prédit conjointement les observations visuelles et le retour tactile correspondants, permettant de générer des rollouts visuo-tactiles-actions complets. Les auteurs présentent cela comme le premier cadre exploitant un modèle de monde pour la génération de trajectoires visuo-tactiles-actions et l'évaluation de politiques robotiques. L'enjeu central est le coût et la rareté des données tactiles réelles, qui freinent l'apprentissage robotique basé sur le toucher : matériel spécifique, collecte coûteuse, diversité de tâches et de scènes limitée. En misant sur le fait que le signal tactile, directement ancré dans le contact physique, souffre d'un écart simulation-vers-réel plus faible que la seule vision, ViTacWorld propose une voie pour combler ce manque de données sans multiplier les campagnes de collecte sur robot réel. Pour les équipes de recherche en manipulation fine (assemblage, insertion, préhension d'objets déformables), cela ouvre deux usages concrets : générer des données synthétiques pour améliorer des politiques tactiles en aval, et évaluer des politiques existantes en prédisant leurs résultats visuo-tactiles sous des séquences d'actions contrôlées, sans passer systématiquement par des essais physiques. C'est un signal de plus que les modèles de monde, déjà répandus en vision, commencent à s'étendre à d'autres modalités sensorielles pour la robotique de contact. Ce travail s'inscrit dans la lignée des modèles de monde appliqués à la robotique, jusqu'ici centrés presque exclusivement sur la modalité visuelle, et dans la continuité des efforts pour réduire la dépendance de l'apprentissage tactile aux capteurs propriétaires et aux collectes sur site. Les expériences menées par les auteurs sur des tâches de manipulation riches en contacts montrent que ViTacWorld génère des rollouts physiquement cohérents, améliore les performances de politiques via une augmentation de données scalable, et permet une évaluation de politiques conditionnée par l'action. Le projet est documenté sur vitacworld.github.io. L'article ne mentionne aucun partenariat industriel ni déploiement commercial à ce stade : il s'agit d'une contribution de recherche dont la portée réelle dépendra de sa reproduction sur des plateformes robotiques variées et de son adoption par des équipes travaillant sur l'assemblage ou la manipulation fine en environnement industriel.

RecherchePaper
1 source
TACIT : la supervision par contact tactile guide l'attention spatiale en manipulation dextérique
3arXiv cs.RO 

TACIT : la supervision par contact tactile guide l'attention spatiale en manipulation dextérique

Une équipe de recherche publie TACIT (Tactile Contact Informs Attention), une méthode qui utilise les contacts tactiles mesurés pendant des démonstrations téléopérées pour superviser l'attention spatiale de politiques visuomotrices de manipulation, sans annotation de points supplémentaire. Décrite dans un article déposé sur arXiv (2609.24507v1), la méthode place des cibles gaussiennes sur les nuages de points de caméra précédant le contact pour entraîner une tête d'attention, dont la sortie agrégée conditionne une politique de diffusion visuotactile ; ces cibles ne servent qu'à l'entraînement, le signal tactile restant une entrée au moment de l'inférence. Sur le banc d'essai principal, avec dix démonstrations par tâche et cinq zones de placement différentes, TACIT atteint 66,7% de réussite sur une tâche de placement de balle et 73,3% sur une tâche d'insertion de goupille, contre respectivement 10,0% et 20,0% pour une fusion visuotactile 3D à entrées équivalentes, et 20,0% et 43,3% pour la politique vision seule DP3. Sur les 30 essais de chaque tâche, TACIT atteint systématiquement la zone d'approche à 150 mm de l'objet en moins de 12 secondes, tous les échecs restants survenant après cette arrivée. Ce résultat cible un problème connu de l'apprentissage par imitation à partir de peu de démonstrations : les politiques entraînées sur un faible nombre d'exemples ont tendance à rejouer des trajectoires figées plutôt qu'à suivre réellement la position changeante des objets. En s'appuyant sur un signal déjà présent dans les données de téléopération plutôt que sur des annotations humaines ou des modèles de vision externes pour définir les priors spatiaux, TACIT réduit le coût de collecte de données pour les intégrateurs travaillant sur des piles de manipulation few-shot. Le fait que les échecs surviennent après l'arrivée sur zone, et non pendant l'approche, indique que la méthode résout spécifiquement le ciblage spatial, pas la saisie ou la manipulation fine elle-même. L'étude s'inscrit dans le champ des politiques de diffusion et de l'apprentissage visuomoteur par imitation, confronté à la généralisation à partir de peu de démonstrations. Les comparaisons incluent DP3, une politique de diffusion 3D vision seule, une fusion visuotactile à entrées équivalentes, et un contrôle à architecture identique sans supervision d'attention explicite, afin d'isoler la contribution propre du signal tactile. Les tests, menés sur robot réel pour la tâche de balle et en simulation pour l'insertion de goupille sur trois graines d'entraînement, restent un travail de recherche académique sans déploiement commercial ni plateforme nommée, les auteurs limitant eux-mêmes leurs conclusions à l'espace de travail évalué.

RecherchePaper
1 source
Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade
4arXiv cs.RO 

Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade

Des chercheurs ont publié sur arXiv (référence 2605.27972) un cadre d'optimisation en cascade baptisé SCSP, pour Simultaneous Contact Selection and Planning, dédié à la manipulation robotique en contact riche. Ce type de manipulation regroupe les tâches où le bras doit gérer plusieurs points de contact dynamiques : pivotement d'objet, manipulation en main, assemblage serré. Le système repose sur deux modules séquentiels : CSO (Contact Selection Optimization), qui détermine automatiquement les localisations de contact optimales sur l'objet cible, et CPO (Contact Planning Optimization), qui génère ensuite les trajectoires de manipulation correspondantes en temps réel pour des bras redondants à sept degrés de liberté ou plus. Les auteurs valident l'approche en simulation et sur robot physique, sur des tâches décrites comme complexes, sans que l'abstract ne fournisse de métriques de temps de cycle ou de taux de succès chiffrés. Le verrou que SCSP prétend lever est structurant pour la manipulation autonome : la quasi-totalité des méthodes contact-implicit existantes suppose que la séquence de points de contact est définie à l'avance par l'opérateur. Le robot optimise la trajectoire, pas l'endroit où il entre en contact. CSO contourne les deux obstacles qui rendaient la sélection active difficile, à savoir la complémentarité dans la dynamique de contact et les gradients parcimonieux, en substituant un modèle de contact approché et différentiable au modèle physique discontinu, couplé à une optimisation discrète-continue. CPO exploite ensuite ces localisations comme prior pour planifier en temps réel. Si le comportement se généralise hors simulation, le framework permettrait d'aborder des tâches de manipulation substantiellement plus complexes sans paramétrage manuel des modes de contact, ce qui est aujourd'hui l'un des goulots d'étranglement principaux en intégration industrielle. Le champ de la manipulation en contact riche est partagé entre deux grandes familles : l'optimisation classique (contact-implicit trajectory optimization, MPC) et l'apprentissage (VLA, diffusion policies), portées notamment par Physical Intelligence avec Pi-0, Covariant et Figure AI. SCSP s'inscrit dans la ligne optimisation, plus interprétable et potentiellement plus robuste hors distribution que les approches end-to-end. L'identité institutionnelle des auteurs n'apparaît pas dans l'abstract arXiv, ce qui complique l'évaluation de la maturité et du soutien financier derrière le travail. Les démonstrations vidéo disponibles sur le site projet constitueront le vrai test de crédibilité avant tout positionnement industriel.

RecherchePaper
1 source