Aller au contenu principal
roto 2.0 : l'Olympiade de robotique tactile
RecherchearXiv cs.RO 

roto 2.0 : l'Olympiade de robotique tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié roto 2.0, deuxième version du Robot Tactile Olympiad, un benchmark standardisé pour l'apprentissage par renforcement (RL) basé sur le toucher. La plateforme, accélérée GPU en parallèle, couvre quatre morphologies robotiques de 16 à 24 degrés de liberté (DOF) et impose un régime de manipulation strictement "aveugle" : les agents n'ont accès qu'à la proprioception et aux capteurs tactiles, sans information d'état, sans vision, sans distillation depuis un teacher model. Le résultat phare : les agents entraînés atteignent 13 rotations de boules Baoding en 10 secondes, que les auteurs décrivent comme un ordre de grandeur supérieur aux performances actuelles de l'état de l'art sur cette tâche. Les environnements, configurations et baselines sont publiés en open source.

Ce travail pointe un problème structurel reconnu dans la communauté : la recherche en manipulation tactile reste morcelée, avec une concentration excessive sur des tâches d'orientation surexploitées et peu de benchmarks permettant des comparaisons rigoureuses entre approches. En forçant l'absence totale de perception visuelle, roto 2.0 adresse une contrainte concrète pour les intégrateurs industriels : un manipulateur opérant uniquement par retour tactile et proprioceptif peut fonctionner dans des environnements où les caméras sont inutilisables (assemblage en aveugle, poussière, occlusion totale). L'affirmation d'"un ordre de grandeur plus rapide" mérite cependant d'être nuancée : elle s'applique à cette tâche spécifique en simulation, et le gap sim-to-real reste entièrement à démontrer sur hardware réel.

La manipulation dextère sans vision est un défi porté depuis des années par des laboratoires majeurs, notamment OpenAI avec Dactyl (équipe robotique dissoute en 2021) et Stanford avec ses travaux sur la préhension en contact riche, ainsi que par des fabricants de capteurs tactiles comme Xela Robotics ou GelSight MIT. roto 2.0 s'inscrit dans une dynamique de benchmarking plus rigoureux qui traverse la communauté, dans le sillage de ManiSkill et Isaac Lab. En France, le LAAS-CNRS mène des recherches sur des approches similaires de manipulation par contact. En open-sourçant les environnements et des baselines correctement tuned, les auteurs visent explicitement à libérer les chercheurs du coût en temps lié au réglage RL pour qu'ils se concentrent sur les défis algorithmiques fondamentaux.

Impact France/UE

Le LAAS-CNRS mène des travaux sur la manipulation par contact similaires à ceux que roto 2.0 cherche à benchmarker ; la publication open-source des environnements et baselines peut directement accélérer ces recherches françaises et réduire leur coût de réglage RL.

Dans nos dossiers

À lire aussi

Un bout dextérique tactile durable pour la manipulation robotique
1arXiv cs.RO 

Un bout dextérique tactile durable pour la manipulation robotique

Une équipe de chercheurs décrit, dans une prépublication arXiv du 26 août 2026, un embout de doigt tactile robotique à vision conçu pour résister à l'usure, point faible connu des capteurs commerciaux. Il associe un gel de silicone souple, un film protecteur en polyuréthane thermoplastique (TPU) texturé et non pigmenté, et une cartouche de détection remplaçable. Deux tests accélérés ont mesuré sa durabilité : un ponçage sur tambour rotatif, et une sonde répétitive appliquant 39,2 N (4,0 kgf) à 45 cycles par minute. Le film protecteur du nouveau capteur a cédé après 2 à 3 heures de ponçage, tandis que les neuf exemplaires testés sous charge répétitive restaient tous fonctionnels à l'arrêt des essais : sept après 5 jours, un après 6 jours, un après 8 jours. Les capteurs commerciaux GelSight Mini et DIGIT, eux, ont vu leur film se rompre après seulement 24 à 30 secondes de ponçage et 25 à 35 minutes de charge répétitive. La dégradation du nouveau capteur restait progressive, sans gêner l'imagerie tactile. Cette amélioration de plus de deux ordres de grandeur, obtenue dans des conditions de vieillissement accéléré définies par les auteurs eux-mêmes, vise un angle mort de la manipulation robotique : les capteurs tactiles à vision comme GelSight ou DIGIT livrent une image de contact riche mais s'usent vite sous charges concentrées et frottements répétés, ce qui freine leur usage hors laboratoire. Pour les intégrateurs qui veulent faire passer la préhension robotisée de la démonstration au déploiement industriel, une cartouche remplaçable plutôt qu'un capteur à jeter pèse autant sur le coût total de possession que la résolution du signal tactile. Ces chiffres restent toutefois issus de protocoles de laboratoire propres à l'étude, et non d'une validation en usage prolongé sur un bras ou une main robotique en production. GelSight, issu de recherches du MIT, et DIGIT, le capteur tactile ouvert développé par Meta AI, sont devenus des références de facto pour la recherche en préhension et en manipulation fine ; l'usure rapide de leur film de silicone freine depuis longtemps leur adoption au-delà des bancs d'essai académiques, notamment pour des tâches répétitives de tri ou d'assemblage visées par les mains robotiques humanoïdes actuellement en développement. La prépublication ne mentionne aucun partenariat industriel ni calendrier de commercialisation : il s'agit à ce stade d'une validation en laboratoire, dont la suite logique serait un essai en conditions réelles sur un bras ou une main robotique en fonctionnement continu, avant toute intégration dans un produit commercial.

RecherchePaper
1 source
CONTACT : apprentissage tactile sensible au contact pour le démontage robotique
2arXiv cs.RO 

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique

Une équipe de recherche présente CONTACT (CONtact-aware TACTile learning), un cadre d'apprentissage qui évalue systématiquement le rôle du toucher dans le désassemblage robotique, tâche qui reste l'un des points faibles de la robotique industrielle car elle implique des contacts serrés et des transitions d'état dépendantes de la force, contrairement au montage où la vision seule suffit souvent. Les chercheurs ont construit cinq tâches de désassemblage rigide en simulation, avec des contraintes géométriques croissantes, et cinq tâches réelles (trois rigides, deux déformables). Dans un même cadre d'apprentissage, ils comparent trois configurations de perception : vision seule, vision plus capteur tactile RGB (TacRGB), et vision plus champ de force tactile (TacFF). Résultat constant en simulation comme en réel : les politiques basées sur TacFF obtiennent les meilleurs taux de réussite, avec des gains particulièrement marqués sur les scénarios à fort contact et sur les objets déformables. Fait notable, la simple fusion de TacRGB et TacFF donne de moins bons résultats que chaque modalité utilisée seule, ce qui suggère qu'une concaténation naïve dilue l'information de force pertinente pour la tâche. Pour l'industrie robotique, ce travail apporte une preuve empirique que la perception visuelle seule, sur laquelle reposent la plupart des politiques de manipulation de type VLA aujourd'hui, atteint ses limites dès que la tâche devient contact-dominante ou implique des matériaux déformables comme des câbles ou des joints souples. Le désassemblage, contrairement à l'assemblage en usine où les tolérances et les pièces sont contrôlées, correspond justement aux cas d'usage en forte demande : recyclage de batteries, réparation, économie circulaire électronique, où les géométries sont variables et non calibrées à l'avance. Le résultat sur la fusion naïve des modalités est aussi un signal utile pour les équipes qui intègrent des capteurs tactiles sur leurs bras robotiques : ajouter du tactile brut sans architecture dédiée peut dégrader la performance plutôt que l'améliorer, ce qui remet en question des approches de fusion multimodale trop simplistes actuellement déployées dans certains systèmes VLA génériques. Ce travail s'inscrit dans une vague de recherche récente cherchant à dépasser les limites du "sim-to-real" purement visuel qui domine les VLA comme GR00T N2 ou Pi-0, en réintroduisant des modalités proprioceptives et tactiles jugées indispensables pour la manipulation fine. Les capteurs de champ de force tactile restent coûteux et peu standardisés industriellement comparés aux capteurs RGB tactiles de type GelSight, ce qui limite pour l'instant un déploiement à grande échelle. Les auteurs ne précisent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'un travail de recherche fondamentale publié sur arXiv, sans démonstration en usine réelle ni chiffres de cycle de production.

RecherchePaper
1 source
Peau miroir : visualisation en temps réel de l'intention tactile du robot sur sa peau robotique
3arXiv cs.RO 

Peau miroir : visualisation en temps réel de l'intention tactile du robot sur sa peau robotique

Des chercheurs présentent Mirror Skin, un concept de communication tactile pour l'interaction physique homme-robot, décrit dans un article déposé sur arXiv (2512.11472). Inspiré des céphalopodes capables de projeter des motifs visuels sur leur propre peau, le système affiche en temps réel, directement sur la région de la peau robotique qui va entrer en contact, une représentation visuelle de la partie du corps humain concernée. L'objectif est de répondre à trois questions simultanément : qui initie le contact, où il va se produire précisément sur le robot, et quand il devient imminent. La conception a été guidée par une étude structurée menée avec des experts du domaine, puis validée par un prototype fonctionnel de preuve de concept. Deux séries de tests utilisateurs, l'une en réalité virtuelle, l'autre sur le prototype physique réel, montrent des gains significatifs en précision d'interprétation de l'intention tactile et en temps de réponse, ainsi qu'une amélioration perçue de l'expérience utilisateur. L'enjeu dépasse la simple curiosité de laboratoire : la communication de l'intention tactile est un verrou de sécurité pour toute interaction physique homme-robot, qu'il s'agisse de cobots industriels, de robots d'assistance ou d'humanoïdes appelés à travailler à proximité immédiate d'opérateurs. Les signaux actuels, LED clignotantes, sons, écrans génériques, manquent selon les auteurs de spécificité spatiale et de profondeur sémantique pour indiquer précisément où et quand un contact va survenir. En démontrant qu'un affichage localisé sur la peau elle-même améliore mesurablement la compréhension et la réactivité humaines, ces travaux apportent un argument concret pour repenser les interfaces de sécurité des robots collaboratifs, au-delà des indicateurs lumineux ou sonores standards utilisés aujourd'hui dans l'industrie. Le travail s'inscrit dans le courant de la robotique bio-inspirée, qui puise dans le camouflage dynamique et la signalisation visuelle des céphalopodes pour concevoir des surfaces robotiques communicantes. Il reste à ce stade un prototype de recherche validé en environnement contrôlé, sans annonce de partenaire industriel ni de calendrier d'intégration sur une plateforme commerciale. Les auteurs présentent ce travail comme une première démonstration de faisabilité, ouvrant la voie à des évaluations sur des robots humanoïdes ou collaboratifs complets plutôt qu'un prototype localisé.

RecherchePaper
1 source
Principes de l'autonomie robotique
4arXiv cs.RO 

Principes de l'autonomie robotique

Un nouveau manuel intitulé "Principles of Robot Autonomy" vient d'être publié sur arXiv (2608.03496v1, début août 2026). L'ouvrage est issu de plusieurs décennies d'enseignement à Stanford et propose une introduction unifiée aux méthodes qui composent les piles logicielles d'autonomie robotique modernes, de la perception à la planification en passant par le contrôle. Chaque chapitre est accompagné de notebooks Jupyter et d'exercices d'implémentation, pensés pour que les lecteurs construisent une intuition pratique en parallèle des fondements théoriques. Le texte s'adresse aux étudiants, ingénieurs et chercheurs qui entrent dans le domaine, et vise explicitement à faire le pont entre la robotique classique (odométrie, SLAM, planification de trajectoire, commande) et ce que les auteurs appellent l'IA physique, c'est à dire les architectures d'apprentissage qui pilotent aujourd'hui les robots déployés sur route, en entrepôt, dans les airs ou en environnement spatial. L'intérêt de ce manuel dépasse le cadre académique. Il acte un changement de statut de l'autonomie robotique, qui n'est plus seulement un sujet de recherche mais un ensemble de méthodes éprouvées sur le terrain, utilisées quotidiennement par des praticiens. Pour les ingénieurs et les décideurs B2B qui recrutent ou forment des équipes robotique, disposer d'un cadre conceptuel commun, couvrant aussi bien les fondamentaux classiques que les briques modernes d'IA physique, répond à un vrai manque : la formation universitaire peine souvent à suivre le rythme d'un secteur où les modèles VLA (vision language action) et les stacks d'autonomie évoluent plus vite que les programmes d'enseignement. Ce manuel s'inscrit dans une lignée de références historiques de la robotique universitaire, à un moment où le secteur connaît une accélération commerciale sans précédent, portée par des architectures d'IA physique et des humanoïdes déployés en usine ou en entrepôt par plusieurs acteurs industriels. Ce contexte de bascule rapide entre recherche et déploiement réel rend d'autant plus utile un ouvrage qui structure les principes fondamentaux plutôt que de courir après chaque nouvelle démonstration. Le texte ne mentionne pas de suite ou de version imprimée prévue au delà de cette publication arXiv.

RecherchePaper
1 source