Aller au contenu principal
RecherchearXiv cs.RO 

Une représentation minimale par flux optique pour classer la rotation tactile par vision en manipulation robotique, sous différentes gravités

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une représentation minimale du mouvement tactile pour classer le sens de rotation d'un objet saisi, en testant sa robustesse face à différentes gravités. Le travail repose sur un capteur tactile optique GelSight Mini simulé. Le flux optique dense est agrégé sur une grille de 7x9 cellules, ce qui donne 126 caractéristiques. Ces caractéristiques servent à classer la direction de la rotation induite par la charge sous quatre gravités : Terre, Mars, Lune et orbite. L'effet de la gravité sur ces caractéristiques est faible mais statistiquement significatif, puisqu'il n'explique que 1,6 % de leur variance (R² = 0,016). Il suffit pourtant à dégrader les modèles entraînés uniquement sur des données terrestres. La précision de XGBoost passe de 94,4 % sur Terre à 75,9 % en orbite. Un modèle unique entraîné sur les quatre domaines atteint 96,3 % de précision globale, et entre 95,1 % et 97,0 % selon le domaine. Il n'utilise pas la gravité comme entrée. La représentation peut être réduite à 40 caractéristiques tout en conservant 95,7 % de précision, avec une inférence de 0,14 ms pour XGBoost.

Ces résultats mettent en cause une hypothèse implicite de la perception tactile : une bonne performance sous gravité terrestre ne garantit pas le transfert vers l'espace. Un écart de près de 19 points entre la Terre et l'orbite suffit à rappeler qu'un décalage de domaine peut passer inaperçu quand la variance expliquée est minime. Pour les concepteurs de robots spatiaux, la validation doit donc inclure explicitement les conditions de gravité cibles. L'approche répond aussi à une contrainte de ressources. Une inférence de 0,14 ms sur 40 caractéristiques laisse penser qu'il est possible de se passer du traitement d'images haute résolution sur des plateformes à calcul et énergie limités, comme les robots embarqués en orbite ou sur des surfaces planétaires. Le fait qu'un modèle multi-gravité n'ait pas besoin de connaître la gravité en entrée suggère qu'un entraînement diversifié suffit à absorber le décalage. Ces conclusions restent limitées : tout a été obtenu en simulation, sans validation sur matériel réel, ni mesure en microgravité ou en gravité réduite.

Le contexte est celui de la manipulation spatiale, où les capteurs tactiles optiques de type GelSight, très riches en information de contact, sont coûteux à traiter en images brutes. Les travaux d'apprentissage tactile sont en grande majorité menés et validés sous gravité terrestre, ce qui laisse peu de données sur le comportement de ces représentations ailleurs. L'étude s'inscrit dans cette lacune, avec une tâche volontairement étroite : la classification de la direction de rotation, et non le contrôle complet de la préhension. Les prochaines étapes logiques seraient une validation sur capteur physique, par exemple en vol parabolique ou en banc de microgravité, puis une extension à d'autres tâches de manipulation et à des gravités intermédiaires. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné, et la publication relève de la recherche préliminaire sous forme de prépublication arXiv.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche
1arXiv cs.RO 

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche

Le capteur tactile reste le parent pauvre des politiques vision-langage-action (VLA) pour la manipulation robotique, alors que les phases de contact critiques (préhension, insertion, glissement) échappent souvent à la caméra. Une équipe de recherche propose dans un article publié sur arXiv (2607.14609) une méthode pour mieux exploiter le toucher: au lieu de prédire directement le signal tactile brut, souvent bruité, le système apprend à anticiper de futurs états tactiles à partir des représentations internes du modèle. Par une analyse en sonde linéaire (linear probe), les chercheurs montrent que ce sont les caractéristiques intermédiaires de l'expert en action, la partie du réseau qui traduit une décision en mouvement, qui prédisent le mieux l'état tactile futur, bien mieux que les couches de perception vision-langage ou que l'état d'action final. Sur cette base, ils introduisent le Latent Tactile Predictor (LTP), un module léger qui prédit des embeddings tactiles compacts à partir de cette couche intermédiaire plutôt que le signal tactile brut. Des expériences sur des tâches de manipulation réelles à fort contact confirment que cet alignement représentationnel surpasse les approches de prédiction tactile moins ciblées ou multi-interfaces. Cette contribution touche à un point sensible du secteur robotique: la plupart des politiques VLA actuelles (Pi-0, GR00T N2, Helix) reposent presque exclusivement sur la vision et le langage, avec un toucher traité comme un canal secondaire greffé après coup. Montrer qu'il existe un endroit précis, dans l'architecture, où la supervision tactile est réellement utile change la manière de concevoir ces modèles multimodaux: cela suggère que brancher un capteur tactile n'importe où dans le réseau, sans réflexion sur l'alignement des représentations, gaspille l'information. Pour les intégrateurs travaillant sur des tâches à contact fin, assemblage, insertion de connecteurs, manipulation d'objets déformables, c'est un signal que la robustesse ne viendra pas seulement de plus de données mais d'une meilleure architecture de fusion des modalités. Le travail s'inscrit dans la lignée des VLA tactiles apparus ces deux dernières années pour combler l'angle mort de la seule vision. L'article ne détaille pas de déploiement industriel ni de partenariat avec un fabricant de robots, il s'agit d'une contribution de recherche fondamentale destinée à orienter la conception des futures générations de politiques VLA plutôt qu'un produit prêt à l'emploi.

RechercheActu
1 source
ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile
2arXiv cs.RO 

ViTacFormer : apprentissage de représentations cross-modales pour la manipulation dextérique vision-tactile

Une équipe de chercheurs a publié en juin 2025 ViTacFormer, une architecture d'apprentissage de représentations multi-modales pour la manipulation dextre robotique. Le système couple un encodeur cross-attention fusionnant vision haute résolution et données tactiles avec une tête de prédiction autoregressive des signaux de contact futurs, entraîné selon un curriculum progressif allant des tâches simples aux plus complexes. La représentation apprise pilote un module d'imitation learning pour des mains anthropomorphes multi-doigts. Sur des benchmarks réels en laboratoire, ViTacFormer dépasse les systèmes état de l'art précédents d'environ 50 %, enchaîne jusqu'à 11 étapes séquentielles sans intervention humaine et maintient une opération continue de 2,5 minutes sur des tâches de manipulation de précision. L'architecture répond à un verrou concret de la manipulation fine : les occlusions visuelles rendent la vision seule insuffisante lorsque la main cache l'objet, un problème que les capteurs tactiles résolvent mais que peu de systèmes intègrent de façon apprenante. La prédiction anticipée des contacts plutôt que leur simple détection réactive réduit la latence de contrôle, décisive pour les gestes de précision. La capacité à enchaîner 11 sous-tâches ouvre une voie pour l'assemblage multi-étapes industriel, où les robots classiques nécessitent actuellement une programmation explicite à chaque étape. Ces résultats restent cependant des benchmarks de laboratoire contrôlés ; la distance avec un déploiement en ligne de production réelle, où la variabilité des pièces et la robustesse du capteur tactile dans le temps sont critiques, demeure entière. ViTacFormer s'inscrit dans une vague de travaux combinant modèles VLA (Vision-Language-Action) et retour haptique, explorée également par Google DeepMind (Robotic Transformer), Physical Intelligence (Pi-0) et des startups comme Dexterous AI. Côté matériel, la dépendance aux mains anthropomorphes multi-doigts reste un frein à la commercialisation : Shadow Robot (UK) et Inspire-Robots (CN) dominent ce segment, mais à des coûts et avec une fiabilité mécanique qui limitent encore les déploiements industriels à grande échelle. Le travail est publié sous forme de preprint arXiv (arXiv:2506.15953), sans code ni dataset public annoncé à ce stade ; la transition vers des résultats reproductibles et des pilotes hors laboratoire constitue l'étape critique à surveiller.

RechercheOpinion
1 source
EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique
3arXiv cs.RO 

EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique

EDAR (Environment-Dependent Action Representation) est une nouvelle méthode d'apprentissage de représentations d'actions pour la manipulation robotique, présentée dans un article publié sur arXiv (référence 2607.11427v1). Le problème que les auteurs cherchent à résoudre est que les trajectoires de contrôle brutes utilisées pour entraîner des politiques robotiques sont bruitées, redondantes et difficiles à modéliser telles quelles. Les approches existantes se contentent généralement d'encoder la structure du flux d'actions lui-même, sans tenir compte explicitement de l'environnement dans lequel ces actions sont exécutées. EDAR propose au contraire de coupler les commandes moteur avec leurs effets visuels attendus, conditionnés par le contexte de la scène, afin que la représentation apprise capture la sémantique de l'interaction plutôt que de simples motifs au niveau des commandes. Les auteurs ont testé leur méthode sur des bancs d'essai de manipulation à la fois simulés et sur robot réel. Cette approche s'attaque à un angle mort connu des architectures VLA (vision-language-action) actuelles: le même segment d'action peut produire des résultats radicalement différents selon la disposition des objets, les propriétés physiques de la scène ou l'état initial de l'environnement. En ancrant les tokens d'action dans les conséquences visuelles attendues plutôt que dans la seule structure de commande, EDAR vise à améliorer la généralisation des politiques apprises, en particulier sur des tâches de manipulation à long horizon, où les erreurs de représentation s'accumulent au fil des étapes. Pour les équipes qui développent des politiques de manipulation généralistes, ce type de travail illustre une tendance de fond: le passage d'une modélisation purement centrée sur le contrôle vers des représentations conjointes action-perception, jugées nécessaires pour que les modèles de fondation robotiques (dans la lignée de GR00T N2, Pi-0 ou Helix) tiennent leurs promesses au-delà des démonstrations en environnement contrôlé. Le papier s'inscrit dans un courant de recherche plus large sur les représentations d'actions pour la robotique, où plusieurs travaux récents ont exploré la tokenisation d'actions, l'apprentissage par imitation conditionné par la vision, ou les modèles du monde pour anticiper les conséquences des actions. EDAR se positionne comme une contribution méthodologique plutôt qu'un produit ou un système déployé: il n'y a pas d'annonce de déploiement industriel ni de partenariat commercial associé à ce travail, qui reste à ce stade une publication de recherche évaluée sur des bancs d'essai académiques. Les prochaines étapes attendues pour ce type de travaux sont généralement l'intégration dans des pipelines VLA plus larges et des tests de transfert sur des plateformes robotiques commerciales, mais aucune feuille de route de ce type n'est mentionnée dans l'abstract.

RecherchePaper
1 source
OccluDex : apprentissage hiérarchique de représentations visuo-tactiles 3D pour la manipulation dextérique égocentrique sous auto-occlusion
4arXiv cs.RO 

OccluDex : apprentissage hiérarchique de représentations visuo-tactiles 3D pour la manipulation dextérique égocentrique sous auto-occlusion

Des chercheurs publient sur arXiv OccluDex, un cadre d'apprentissage de représentations visuo-tactiles 3D destiné à la manipulation dextre en vision égocentrique, c'est-à-dire avec une caméra placée du point de vue du robot. Le problème visé est que la main occulte elle-même les surfaces de l'objet et les zones de contact, ce qui prive l'estimation d'état d'une partie de l'information visuelle. L'encodeur repose sur un autoencodeur masqué multi-échelle qui encode progressivement la géométrie 3D partielle. Des jetons tactiles de contact sont ensuite fusionnés avec les caractéristiques géométriques de haut niveau par attention croisée. Il est préentraîné sur des démonstrations humaines visuo-tactiles synchronisées, puis transféré gelé comme backbone perceptif pour de l'apprentissage par renforcement. Deux tâches servent à l'évaluation : la rotation d'un robinet (un tour complet de poignée dans le sens horaire) et la réorientation d'un objet posé sur une table de 180 degrés, sans le renverser. En simulation, les auteurs annoncent une précision supérieure de 12,6 % sur objets inconnus et de 8,3 % sur objets déjà vus, par rapport au meilleur modèle de référence. Des essais physiques avec une main Shadow Hand montrent un transfert sim-to-real zero-shot sur des objets inconnus. Pour les équipes qui développent des mains dextres, l'intérêt tient à l'angle choisi. La plupart des travaux traitent l'occultation comme un bruit à tolérer, alors qu'elle est ici le cœur du problème, et c'est elle qui domine dès que la main se referme sur un objet. Le tactile compense la vision justement là où elle manque. Le préentraînement sur démonstrations humaines et le backbone gelé réduisent aussi le coût de l'apprentissage par renforcement, car l'encodeur n'a pas à être réappris pour chaque tâche. À nuancer toutefois : les gains en simulation sont modestes, et les auteurs ne précisent pas le nombre d'essais réels, le taux de réussite physique ni la variété des objets. Le test se limite à deux tâches et à une seule main, très coûteuse. Le passage vers des mains d'humanoïdes de série reste donc une extrapolation, et l'affirmation sur la manipulation humanoïde est une projection, pas un résultat démontré. Ces travaux s'inscrivent dans la ligne des représentations 3D visuo-tactiles et des autoencodeurs masqués, appliqués à la manipulation dextre, souvent évaluée en simulation puis sur Shadow Hand. Ils se positionnent face à des approches qui combinent nuages de points et tactile sans hiérarchie entre structure globale et contact local. Les modèles VLA généralistes, qui exploitent surtout des images RGB, traitent peu le tactile et l'occultation. Aucun pilote industriel ni calendrier n'est annoncé, et il s'agit d'une publication de recherche préliminaire (v1), non évaluée par les pairs. La suite logique serait une validation sur davantage de tâches, de mains et de capteurs tactiles, avec des statistiques de réussite en conditions réelles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source