Aller au contenu principal
RecherchearXiv cs.RO 

TransMASK : représentation d'état masquée grâce à une transformation apprise

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TransMASK, une méthode d'apprentissage auto-supervisé publiée sur arXiv (2603.05670, version 2) qui apprend un masque multiplié aux caractéristiques d'image observées, afin de ne conserver que celles utiles à la tâche. Le dispositif se greffe sur divers cadres d'apprentissage par imitation, diffusion policies comprises, sans annotation supplémentaire ni modification de la fonction de perte. Pendant l'entraînement, le masque appris instaure une « pression compétitive » entre les caractéristiques visuelles, ce qui pousse la politique à ne s'appuyer que sur celles qui sont systématiquement pertinentes. Les auteurs affirment que les masques obtenus sont interprétables et rejettent des facteurs parasites connus, comme la position d'objets distracteurs ou la couleur du fond. Face à d'autres méthodes d'apprentissage de représentations pour l'imitation, TransMASK atteindrait au moins 30 % d'amélioration sur des environnements hors distribution. Un site de projet est associé au papier (transmask.github.io/TransMASK).

L'enjeu touche l'un des points faibles les plus coûteux de la manipulation robotique apprise : la fragilité face à de petits changements d'environnement. Lumière, instance d'objet, configuration initiale ou simple couleur de table suffisent souvent à dégrader une politique entraînée sur quelques centaines de démonstrations. Pour un intégrateur, c'est ce qui sépare un pilote réussi d'un déploiement multi-sites, car chaque variation oblige à recollecter des données. Une solution qui ne demande ni labels ni changement de loss est donc attractive sur le plan de l'ingénierie. Le résumé reste toutefois limité : le « 30 % » est un gain minimal relatif aux baselines retenues, sans que l'on connaisse les tâches, le nombre d'essais, les robots ni si les tests ont eu lieu en simulation ou sur matériel réel. Les distributions de test sont choisies par les auteurs, et la robustesse à des décalages non anticipés reste à démontrer. Rien n'indique non plus un passage à l'échelle sur des modèles vision-langage-action (VLA) de grande taille.

Ce travail s'inscrit dans une littérature déjà fournie sur la généralisation des politiques visuomotrices : augmentation de données, encodeurs visuels pré-entraînés, représentations centrées objet ou apprentissage de représentations invariantes. L'approche par masque appris offre une alternative légère et lisible, ce qui compte pour le débogage et la certification. Il s'agit d'une publication de recherche, sans produit, pilote ni calendrier annoncé. Il s'agit ici d'une version révisée (v2), signe d'un travail encore en cours d'évaluation. La suite logique serait une validation sur des politiques généralistes de type Pi-0 ou sur des plateformes industrielles, avec des protocoles de test plus larges et des comparaisons plus standardisées.

À lire aussi

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle
1arXiv cs.RO 

ResTacVLA : manipulation riche en contacts grâce à une représentation tactile résiduelle

Les modèles Vision-Language-Action (VLA), qui pilotent la nouvelle génération de bras robotiques et d'humanoïdes, souffrent d'un défaut connu quand on y ajoute du tactile : le signal visuel, beaucoup plus riche en données, écrase systématiquement les informations de contact, un phénomène que les chercheurs appellent "l'effondrement de modalité". Une équipe propose ResTacVLA, une architecture publiée le 3 juillet 2026 sur arXiv (2607.03387), qui s'inspire du codage prédictif, un mécanisme neuronal par lequel le cerveau ignore ce qui est prévisible pour se concentrer sur l'inattendu. Au lieu d'injecter les données tactiles brutes dans le modèle, ResTacVLA calcule une "représentation tactile résiduelle" : l'écart entre ce que la vision laissait prévoir et ce que le capteur de contact ressent réellement. Ce résidu est ensuite compressé via un goulot d'étranglement à quantification vectorielle (VQ) en "primitives de contact latentes", puis injecté de façon adaptative dans le modèle, avec un gain renforcé précisément lorsque la vision devient incertaine ou obstruée. L'enjeu dépasse la prouesse technique. Pour les intégrateurs qui visent des tâches à fort contact physique, insertion de précision, assemblage, manipulation d'objets déformables ou glissants, le tactile est le signal qui distingue une démonstration en laboratoire d'un geste fiable en production. Or la plupart des VLA actuels traitent le tactile comme un flux secondaire noyé par la caméra. En démontrant qu'un filtrage inspiré de la neuroscience permet de rendre ce signal rare mais décisif exploitable sans le diluer, les auteurs répondent directement à l'un des angles morts récurrents des architectures multimodales pour la robotique manipulatrice, où l'ajout de capteurs supplémentaires improve rarement les performances sans repenser la fusion des modalités. Le travail reste à ce stade un article de recherche, sans affiliation industrielle citée dans le résumé ni déploiement annoncé : il s'agit d'un préprint arXiv, testé sur un ensemble de tâches de manipulation en contact selon les auteurs, avec une page de projet dédiée mais pas encore de publication en conférence confirmée. Il s'inscrit dans une dynamique plus large de recherche sur l'intégration tactile en apprentissage robotique, un axe que plusieurs laboratoires explorent en parallèle pour combler l'écart entre robots qui voient et robots qui, littéralement, sentent ce qu'ils touchent.

RecherchePaper
1 source
CloSE : une représentation d'état du tissu indépendante de la forme géométrique
2arXiv cs.RO 

CloSE : une représentation d'état du tissu indépendante de la forme géométrique

Des chercheurs ont publié sur arXiv (arXiv:2504.05033, version 3) une nouvelle représentation de l'état de déformation des textiles pour la manipulation robotique, baptisée CloSE (Cloth StatE). La méthode repose d'abord sur un intermédiaire appelé dGLI disk : une grille circulaire sur laquelle sont calculés des indices topologiques pour chaque segment de bord du tissu. La carte de chaleur (heatmap) ainsi générée fait apparaître des motifs stables qui caractérisent l'état du tissu indépendamment de sa forme, de sa taille ou de son orientation. Ces motifs sont ensuite condensés en une représentation circulaire compacte et continue : CloSE. Les auteurs démontrent que cette représentation prédit correctement l'emplacement des plis sur plusieurs jeux de données de simulation de vêtements, et qu'elle s'applique à deux tâches concrètes : l'étiquetage sémantique des parties du vêtement et la planification de tâches à haut et bas niveau. Le code et les données sont disponibles publiquement. La manipulation de textiles reste l'un des problèmes non résolus de la robotique industrielle : contrairement aux objets rigides, un tissu peut prendre un nombre quasi infini de configurations déformées, ce qui rend la prise de décision et la planification de trajectoire extrêmement difficiles. L'apport principal de CloSE est d'être agnostique à la géométrie du vêtement, ce qui signifie qu'un même pipeline de perception et de planification peut théoriquement s'appliquer à un T-shirt, une chemise ou un pantalon sans réentraînement. Pour un intégrateur ou un équipementier du secteur textile, c'est une propriété clé : elle réduit le coût de généralisation entre références produits. La représentation compacte facilite également son intégration dans des boucles de contrôle temps réel. Ce travail s'inscrit dans un effort académique soutenu autour de la manipulation de tissus, aux côtés d'approches comme les réseaux de points déformables (DenseFusion, FlingBot) ou les méthodes basées sur les graphes de tissu. La plupart des résultats présentés ici restent en simulation, ce que les auteurs n'occultent pas, mais la nature topologique des indices dGLI est conçue pour faciliter le transfert sim-to-real. Aucun déploiement industriel ou partenariat n'est annoncé à ce stade. Les prochaines étapes naturelles seraient une validation sur robot physique et une extension aux tissus opaques ou fortement déformés.

RecherchePaper
1 source
3arXiv cs.RO 

SMART : manipulation d'objets articulés en transfert simulation-réel sans entraînement préalable, grâce à un pré-entraînement synthétique à grande échelle

Des chercheurs présentent SMART, un système qui s'appuie sur des démonstrations synthétisées à grande échelle pour apprendre aux robots à manipuler des objets articulés (portes, tiroirs, charnières). Son noyau est SMART-Sim, une plateforme de simulation conçue pour représenter la sémantique des parties d'objet et leurs contraintes d'articulation. Elle permet de générer des tâches de façon agentique, c'est-à-dire par des agents logiciels qui proposent eux-mêmes les scénarios, et de collecter des démonstrations efficacement. Un système de synthèse distribué alimente le jeu de données SMART-Data, qui compte plus d'un million de démonstrations couvrant 44 types de tâches atomiques, 5 configurations de robots et 2 507 objets articulés. Un modèle vision-langage-action (VLA) pré-entraîné sur ces données obtient des résultats compétitifs sur les benchmarks de simulation. Il réalise aussi un transfert zéro-shot de la simulation vers le réel et montre une performance qui progresse avec le volume de données sur des tâches réelles. Les travaux sont publiés sur arXiv (v1) et sont pour l'instant une préimpression, sans produit commercialisé ni déploiement industriel associé. Le résumé ne donne ni taux de réussite, ni nombre d'essais réels, ni liste des robots physiques testés. Si ces résultats se confirment, ils touchent un des verrous de la robotique générale : la collecte de démonstrations réelles pour les interactions riches en contacts est lente, coûteuse et difficile à standardiser. Ouvrir une porte ou tirer un tiroir impose de suivre une contrainte cinématique précise, et la téléopération y produit des données bruitées. Un transfert zéro-shot, sans aucune donnée réelle de réglage, irait à l'encontre de l'idée répandue selon laquelle la simulation seule ne suffit pas pour la manipulation fine. Il suggérerait aussi que les lois d'échelle des VLA peuvent s'appuyer sur des données synthétiques structurées. Pour les intégrateurs et les décideurs B2B, l'enjeu est concret : armoires, fours, vannes, portes d'entrepôt ou équipements de laboratoire sont des objets articulés omniprésents. Le coût d'adaptation d'un robot à un nouveau site pourrait baisser si le pré-entraînement synthétique se généralise. Les chiffres publiés ne permettent toutefois pas encore de mesurer l'écart entre démonstration et conditions réelles. Il faudra examiner la diversité des objets réels, des éclairages et des robots dans les expériences. Cette approche s'inscrit dans une tendance où les VLA généralistes (famille Pi-0, GR00T, Helix et autres) sont entraînés sur des mélanges de téléopération, de vidéo humaine et de simulation. Les jeux de données synthétiques existants ont couvert un nombre limité de catégories d'objets articulés, tandis que les pipelines de synthèse généralistes ignoraient les contraintes de parties. SMART vise précisément cette lacune. Les prochaines étapes à surveiller sont la publication du code, de la plateforme et des données, des évaluations indépendantes sur d'autres robots, et une comparaison avec des modèles entraînés sur données réelles. Aucun acteur européen n'est cité dans le résumé.

RecherchePaper
1 source
InterMASH : une représentation géométrique unifiée pour la synthèse de préhension
4arXiv cs.RO 

InterMASH : une représentation géométrique unifiée pour la synthèse de préhension

La synthèse de préhension (grasp synthesis), qui vise à générer des interactions main-objet stables et physiquement plausibles, reste freinée par l'absence de représentation commune entre mains humaines et mains robotiques, en raison de leurs différences de morphologie et de modélisation de surface. Un nouveau papier de recherche, publié sur arXiv sous la référence 2609.18504, propose InterMASH, une représentation géométrique unifiée fondée sur des ancres fixées à la surface de sphères qui établissent une correspondance entre différentes morphologies de main. À chaque ancre, des harmoniques sphériques de faible degré encodent de façon compacte la géométrie locale de la main, celle de l'objet et le contact entre les deux, formant une séquence de tokens explicite et interprétable. Sur cette base, les auteurs entraînent un Diffusion Transformer conditionnel qui opère directement dans cet espace pour générer conjointement la géométrie de la main et les points de contact. Le système atteint des performances comparables à l'état de l'art sur les métriques de faisabilité physique d'un benchmark à grande échelle basé sur la main robotique ShadowHand, permet un entraînement conjoint sur plusieurs types de mains, et montre qu'un fine-tuning cross-embodiment avec des données de préhension humaine améliore le taux de succès et la diversité des préhensions générées pour des mains robotiques. L'intérêt pour l'industrie tient au format de représentation lui-même: les approches précédentes reposaient soit sur des cartes de contact, soit sur des descripteurs implicites denses, jugés incomplets ou coûteux en calcul et redondants. En rendant la représentation nativement tokenisée et compatible avec les architectures de diffusion transformer désormais standard en robotique générative, InterMASH facilite l'entraînement de modèles de manipulation sur des données hétérogènes, humaines et robotiques combinées. Pour les chercheurs en manipulation dextre et les concepteurs de politiques type VLA, le résultat le plus concret est la preuve que des données de préhension humaine, généralement plus abondantes et moins coûteuses à collecter que des données robotiques réelles, peuvent effectivement transférer vers de meilleures performances robotiques, une piste régulièrement évoquée pour réduire la dépendance à la téléopération ou à la simulation coûteuse. Il s'agit d'une publication de recherche fraîchement mise en ligne, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement: l'abstract ne mentionne aucune date de disponibilité de code au-delà de la page projet dédiée, inter-mash.github.io. Le travail s'inscrit dans la lignée des efforts combinant modélisation de la main humaine et manipulation robotique dextre, avec pour référence de comparaison le benchmark ShadowHand, largement utilisé dans la recherche académique sur la préhension. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source