Aller au contenu principal
RecherchearXiv cs.RO 

Touch2Robot : le toucher robotique intégré à la boucle de démonstration humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Touch2Robot, un framework de collecte de démonstrations pour la manipulation robotique dextre, est présenté dans un preprint publié sur arXiv (arXiv:2609.24660v1, soumission nouvelle). Le système capture simultanément le mouvement de la main humaine, les mesures d'un gant tactile et le déplacement de l'objet manipulé, puis entraîne des politiques de renforcement spécifiques à chaque objet pour reproduire ce mouvement en privilégiant des contacts cohérents avec le toucher humain enregistré. Ces comportements sont distillés dans un retargeter temps réel unique qui convertit observations humaines et géométrie de l'objet en configurations pour la main du robot cible, dont le contact simulé est affiché au démonstrateur pendant la collecte. Sur quatre tâches réelles, le taux de réussite du rejeu sur robot passe de 37,9% avec un simple retour visuel à 72,1% avec Touch2Robot, tandis que le temps de collecte par démonstration réussie chute de 58,6 à 18,2 secondes. Les contacts reconstruits atteignent un score F1 de 44,2% face aux mesures tactiles réelles du robot, et des politiques de type Diffusion Policy entraînées sur ces données gagnent 29,1 points de pourcentage par rapport à l'approche purement visuelle.

Ce travail s'attaque à un goulot d'étranglement connu de l'apprentissage par démonstration dextre: les données humaines sont faciles à collecter en volume mais leurs contacts ne se transposent pas toujours à une main robotique aux cinématiques différentes, alors que la téléopération directe sur le robot cible garantit un contact réaliste mais coûte cher en temps d'ingénieur et en usure matérielle. Touch2Robot propose une voie intermédiaire susceptible d'intéresser les équipes qui construisent des jeux de données pour des politiques vision-langage-action à grande échelle, en réduisant le coût par démonstration exploitable sans immobiliser en permanence le robot physique. Les chiffres restent toutefois ceux d'un cadre limité à quatre tâches et à un score de contact modeste (44,2% F1), ce qui invite à la prudence: il s'agit d'un résultat de recherche en preprint, non revu par les pairs, pas d'un produit ni d'un déploiement commercial.

La démarche prolonge les méthodes de collecte par gants tactiles et capture de mouvement, alternative moins coûteuse que la téléopération robot mais qui bute historiquement sur l'écart d'incarnation entre main humaine et main robotique articulée. En rendant visible au démonstrateur, pendant l'enregistrement, le contact que la main cible établirait réellement avec l'objet, Touch2Robot cherche à combler cet écart sans sacrifier la scalabilité des démonstrations humaines. Le code et les ressources du projet sont annoncés sur la page Touch2Robot.github.io, sans partenariat industriel ni calendrier de production mentionnés à ce stade; les auteurs présentent leurs résultats comme une preuve que l'intégration du retour tactile robot dans la boucle de démonstration humaine améliore qualité et efficacité de la collecte, au-delà des seuls essais en laboratoire.

À lire aussi

Générer des mains robotiques à partir de démonstrations humaines
1arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
La pratique fait la politique : construire et consolider des capacités robotiques sans démonstration humaine
2arXiv cs.RO 

La pratique fait la politique : construire et consolider des capacités robotiques sans démonstration humaine

HERO (Heuristic-Exemplar-Reflexive Orchestration) est un cadre robotique proposé dans un article arXiv publié fin juillet 2026, conçu pour permettre à un bras ou un robot manipulateur d'apprendre des tâches de manipulation sans aucune démonstration humaine préalable. Le système combine trois mécanismes dans une architecture hiérarchique unifiée : un raisonnement heuristique pour explorer et amorcer de nouvelles tâches, une réutilisation d'exemplaires pour transférer rapidement des comportements déjà appris à des situations similaires, et une exécution réflexive qui corrige les erreurs en temps réel pendant l'interaction physique. L'idée centrale est que le robot collecte lui-même ses données d'entraînement en agissant dans l'environnement, puis consolide progressivement les interactions récurrentes en politiques visuomotrices en boucle fermée, c'est-à-dire des comportements appris directement à partir des flux caméra et capteurs, sans supervision humaine continue. Les auteurs rapportent, via des expériences étendues, une réduction substantielle de l'intervention humaine lors de la collecte de données, avec une manipulation jugée robuste sur des tâches variées. L'intérêt pour l'industrie tient au problème que HERO cherche à résoudre : la plupart des systèmes de manipulation robotique actuels apprennent des compétences figées, calibrées pour une tâche ou un environnement précis, et ne s'améliorent pas de façon autonome au fil de l'usage réel. Un mécanisme qui transforme l'expérience accumulée en capacités réutilisables, sans démonstrations humaines coûteuses à collecter, s'attaque directement au goulot d'étranglement des données qui freine le déploiement à grande échelle des politiques de type VLA (vision-language-action) chez les intégrateurs et fabricants de robots généralistes. Ce travail s'inscrit dans une lignée de recherche plus large sur l'auto-amélioration des agents incarnés, où plusieurs laboratoires explorent des boucles fermées entre collecte de données, entraînement de politiques et exécution. Il s'agit ici d'une publication de recherche, pas d'un produit commercialisé ni d'un déploiement industriel documenté : les résultats proviennent d'expériences en laboratoire, et l'article ne précise ni le matériel utilisé ni de comparaison chiffrée avec des systèmes concurrents nommés.

RecherchePaper
1 source
KnowDemo : génération de démonstrations robotiques guidée par la connaissance à partir de vidéos humaines
3arXiv cs.RO 

KnowDemo : génération de démonstrations robotiques guidée par la connaissance à partir de vidéos humaines

Des chercheurs présentent KnowDemo, un framework décrit dans une prépublication arXiv (2609.21229, fin septembre 2026) qui génère des démonstrations robotiques diversifiées à partir de vidéos humaines, sans collecte réelle coûteuse. Un modèle vision-langage (VLM) extrait de chaque vidéo une connaissance structurée de la tâche, distinguant conditions requises et variations d'exécution admissibles des choix propres au geste filmé. Cette connaissance est recalée sur la géométrie de la scène cible pour guider la génération et le filtrage de candidats, avant planification de mouvement et simulation. Les démonstrations obtenues montrent un comportement multimodal, avec stratégies de contact alternatives et ordres de sous-tâches variés, étiquetés de façon structurée. Pour les valider, les auteurs affinent le modèle pré-entraîné π0.5, architecture vision-langage-action de Physical Intelligence, sur des données simulées, et démontrent un transfert sim-to-real sur trois tâches de manipulation, projet documenté sur zhiyuan-gao.github.io/knowdemo. Pour l'industrie robotique, l'enjeu dépasse le produit : il touche un goulot d'étranglement central de l'apprentissage par imitation, la collecte de démonstrations réelles restant coûteuse et lente. Les méthodes existantes, qui adaptent des trajectoires extraites de vidéos humaines, reproduisent souvent la stratégie de contact et l'ordre des sous-tâches observés, ce qui limite la diversité utile à l'entraînement des politiques. En conditionnant la génération sur une compréhension explicite des contraintes de tâche plutôt que sur la seule référence de mouvement, KnowDemo augmente le taux de candidats valides et le nombre de modes d'exécution vérifiés. Le transfert sim-to-real obtenu après fine-tuning de π0.5 appuie l'hypothèse que des données synthétiques structurées, plutôt que massivement collectées, peuvent faire progresser les modèles vision-langage-action à l'échelle, un enjeu suivi par les intégrateurs cherchant à réduire le coût de l'apprentissage robotique. Le travail prolonge une lignée de méthodes générant des démonstrations par adaptation de mouvements extraits de vidéos humaines puis validées en simulation, une piste explorée pour contourner la téléopération. KnowDemo répond aux limites de ces approches centrées sur la seule reproduction du geste de référence, en y ajoutant un raisonnement sémantique via VLM. Le choix de π0.5 situe le travail dans l'écosystème des VLA génériques, aux côtés d'architectures comme GR00T de NVIDIA ou Helix de Figure. Sans affiliation d'entreprise indiquée dans le résumé, l'étude reste à ce stade une validation de laboratoire sur trois tâches, sans calendrier de déploiement industriel ni partenariat annoncé.

RecherchePaper
1 source
RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique
4arXiv cs.RO 

RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique

Un article publié sur arXiv (référence 2609.03199v1, catégorie « cross-listing » signalant un intérêt à la fois pour la robotique et la vision par ordinateur) présente RoboTok, un moteur de données conçu pour exploiter des vidéos humaines à l'échelle d'internet afin d'entraîner des politiques robotiques de manipulation dextre. Le système part d'une vidéo requête montrant une manipulation humaine, puis recherche dans de vastes collections de vidéos web des démonstrations pertinentes pour la même tâche. Techniquement, RoboTok apprend un espace de mouvement latent à partir de trajectoires 3D de la main, exprimées dans des repères centrés sur l'acteur estimés automatiquement, ce qui permet de comparer des gestes de manipulation malgré des différences de point de vue caméra, d'apparence de scène ou d'occlusions partielles de l'acteur. Cette représentation reste suffisamment compacte pour permettre une recherche efficace et une indexation continue sur des corpus vidéo de très grande taille. Les auteurs comparent RoboTok à des méthodes existantes de récupération de données robotiques, sur des benchmarks de recherche et sur la performance de politiques robotiques en aval, sans toutefois préciser dans le résumé les chiffres exacts de gain, ni les tâches ou plateformes robotiques testées. L'enjeu principal visé par ce travail est le goulot d'étranglement bien identifié de l'apprentissage robotique : collecter des données directement sur robot reste coûteux et ne permet pas de couvrir la longue traîne des tâches réelles rencontrées en manipulation. En proposant une méthode de récupération sensible à la pose de la main plutôt qu'à l'apparence brute, RoboTok cherche à transformer la vidéo web, ressource déjà abondante et en croissance continue, en une source de supervision exploitable et évolutive pour l'entraînement de politiques. Pour les intégrateurs et équipes de recherche en robotique dextre, cela s'inscrit dans une tendance plus large consistant à s'appuyer sur des données humaines non robotiques pour réduire la dépendance à la téléopération coûteuse, sans toutefois démontrer ici un déploiement matériel réel ni un produit commercialisé : il s'agit d'une contribution méthodologique et expérimentale, évaluée sur benchmarks académiques. Le papier se positionne dans la lignée des approches récentes de pré-entraînement robotique à partir de vidéos humaines à grande échelle, une direction de recherche active pour contourner la rareté des données robot réelles. Le résumé ne mentionne ni entreprise, ni laboratoire nommé, ni calendrier de suite ; il s'agit à ce stade d'une publication de recherche, pas d'une annonce produit ou d'un pilote industriel.

RecherchePaper
1 source