Aller au contenu principal
Apprentissage par imitation sensible au contact grâce à la factorisation du contact
RecherchearXiv cs.RO 

Apprentissage par imitation sensible au contact grâce à la factorisation du contact

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire RCILab de l'université Kyung Hee (Corée du Sud) présentent FACE, un cadre d'apprentissage par imitation « factorisé par le contact », décrit dans un preprint arXiv (2610.09533). Le principe consiste à séparer le comportement de tâche voulu des facteurs de contact propres à l'environnement. Les efforts d'interaction sont exprimés dans des coordonnées normalisées, relatives au contact. Deux estimateurs complètent ce dispositif : un estimateur de normale de contact, appris, et un estimateur de friction en ligne, qui détermine l'échelle de friction effective. À l'exécution, les observations d'effort sont encodées et les sorties de la politique sont décodées en commandes de mouvement et d'effort physiques. L'adaptation se fait donc sans aucune mise à jour des paramètres de la politique. Les essais ont été menés sur robot réel, en manipulation riche en contacts, avec des variations inédites de propriétés de surface et de géométrie. Les auteurs comparent FACE à des variantes qui adaptent des approches antérieures à leur cadre. Le résumé ne chiffre ni taux de réussite, ni nombre d'essais, ni plateforme robotique, et ces éléments restent à vérifier dans l'article complet et sur la page du projet.

L'enjeu est un verrou connu de la manipulation de précision, celle de l'essuyage, du ponçage, de l'insertion ou du polissage. Les efforts mesurés varient fortement pour de faibles changements de géométrie, d'orientation ou de friction de la surface. Une politique entraînée sur des mesures brutes de force apprend donc en partie les particularités des démonstrations et se transfère mal. Déplacer cette variabilité dans des estimateurs légers, sans réentraîner la politique, serait précieux pour les intégrateurs. Ils pourraient réutiliser une même politique sur des pièces, des matériaux ou des outillages différents, sans recollecter de démonstrations à chaque changement de référence. Ces résultats restent des essais de laboratoire. La robustesse face à des surfaces courbes, à des frottements non stationnaires ou à des cadences industrielles n'est pas établie, et les comparaisons portent sur des variantes adaptées par les auteurs, non sur des systèmes tiers inchangés.

Ce travail s'inscrit dans le virage des politiques visuo-motrices (diffusion, VLA) vers la prise en compte du toucher et de l'effort. Les premières versions de ces modèles, comme Pi-0 ou Helix, s'appuient surtout sur la vision et la proprioception. La commande en force et en impédance, issue de la robotique classique, offre une adaptation fine au contact, mais elle exige des modèles d'environnement qu'il faut régler à la main. FACE vise un compromis : conserver l'apprentissage par imitation et déléguer au contact une partie de la physique, estimée en ligne. La suite logique serait de brancher ce principe sur des politiques généralistes plus grandes et de le valider sur plusieurs plateformes. Le preprint, publié en version 1, n'a pas encore passé de relecture par les pairs.

Dans nos dossiers

À lire aussi

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique
1arXiv cs.RO 

CONTACT : apprentissage tactile sensible au contact pour le démontage robotique

Une équipe de recherche présente CONTACT (CONtact-aware TACTile learning), un cadre d'apprentissage qui évalue systématiquement le rôle du toucher dans le désassemblage robotique, tâche qui reste l'un des points faibles de la robotique industrielle car elle implique des contacts serrés et des transitions d'état dépendantes de la force, contrairement au montage où la vision seule suffit souvent. Les chercheurs ont construit cinq tâches de désassemblage rigide en simulation, avec des contraintes géométriques croissantes, et cinq tâches réelles (trois rigides, deux déformables). Dans un même cadre d'apprentissage, ils comparent trois configurations de perception : vision seule, vision plus capteur tactile RGB (TacRGB), et vision plus champ de force tactile (TacFF). Résultat constant en simulation comme en réel : les politiques basées sur TacFF obtiennent les meilleurs taux de réussite, avec des gains particulièrement marqués sur les scénarios à fort contact et sur les objets déformables. Fait notable, la simple fusion de TacRGB et TacFF donne de moins bons résultats que chaque modalité utilisée seule, ce qui suggère qu'une concaténation naïve dilue l'information de force pertinente pour la tâche. Pour l'industrie robotique, ce travail apporte une preuve empirique que la perception visuelle seule, sur laquelle reposent la plupart des politiques de manipulation de type VLA aujourd'hui, atteint ses limites dès que la tâche devient contact-dominante ou implique des matériaux déformables comme des câbles ou des joints souples. Le désassemblage, contrairement à l'assemblage en usine où les tolérances et les pièces sont contrôlées, correspond justement aux cas d'usage en forte demande : recyclage de batteries, réparation, économie circulaire électronique, où les géométries sont variables et non calibrées à l'avance. Le résultat sur la fusion naïve des modalités est aussi un signal utile pour les équipes qui intègrent des capteurs tactiles sur leurs bras robotiques : ajouter du tactile brut sans architecture dédiée peut dégrader la performance plutôt que l'améliorer, ce qui remet en question des approches de fusion multimodale trop simplistes actuellement déployées dans certains systèmes VLA génériques. Ce travail s'inscrit dans une vague de recherche récente cherchant à dépasser les limites du "sim-to-real" purement visuel qui domine les VLA comme GR00T N2 ou Pi-0, en réintroduisant des modalités proprioceptives et tactiles jugées indispensables pour la manipulation fine. Les capteurs de champ de force tactile restent coûteux et peu standardisés industriellement comparés aux capteurs RGB tactiles de type GelSight, ce qui limite pour l'instant un déploiement à grande échelle. Les auteurs ne précisent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial ; il s'agit à ce stade d'un travail de recherche fondamentale publié sur arXiv, sans démonstration en usine réelle ni chiffres de cycle de production.

RecherchePaper
1 source
RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états
2arXiv cs.RO 

RoboSSM : apprentissage par imitation contextuel et extensible via les modèles à espace d'états

Des chercheurs ont publié sur arXiv (réf. 2509.19658v2) RoboSSM, une architecture d'apprentissage par imitation en contexte (ICIL, pour in-context imitation learning) qui remplace les Transformers par des modèles à espace d'état (SSM, state-space models), et plus précisément par Longhorn, un SSM récent présenté comme état de l'art. L'apprentissage par imitation en contexte permet à un robot d'apprendre une nouvelle tâche à partir d'une poignée de démonstrations fournies à l'inférence, sans aucune mise à jour des paramètres du modèle. Les expériences ont été conduites sur le benchmark LIBERO, référence standard pour l'évaluation des politiques robotiques multi-tâches, et montrent que RoboSSM dépasse les méthodes ICIL à base de Transformers sur les tâches non vues à l'entraînement ainsi que sur les tâches à horizon long. L'enjeu est architectural : les Transformers ont une complexité quadratique en fonction de la longueur du contexte, ce qui les pénalise dès que le prompt contient de nombreuses démonstrations ou des séquences longues. Les SSM, eux, offrent une inférence en temps linéaire et une capacité d'extrapolation à des contextes plus longs que ceux vus à l'entraînement, deux propriétés directement utiles pour l'ICIL en conditions réelles, où l'on peut vouloir fournir cinq ou dix démonstrations plutôt qu'une seule. Les auteurs affirment démontrer pour la première fois qu'un SSM peut servir de colonne vertébrale efficace et scalable pour l'ICIL. Les résultats restent toutefois confinés au simulateur LIBERO ; aucun transfert sim-to-real ni déploiement industriel n'est documenté dans ce travail. L'ICIL s'est imposée ces deux dernières années comme alternative aux politiques entraînées tâche par tâche, portée notamment par des travaux comme ICRT ou HPT, tous basés sur des Transformers. RoboSSM s'inscrit dans une tendance plus large de remplacement des Transformers par des SSM (famille Mamba, Longhorn) dans les pipelines séquentiels, tendance déjà observée en NLP et en vision. Le code est publié sur GitHub, ce qui ouvre la voie à une reproduction communautaire. Les prochaines étapes attendues sont une validation sur robot physique et une comparaison à l'échelle avec des VLA (vision-language-action) de plus grande taille.

RecherchePaper
1 source
Laboratoire compact : apprentissage par imitation aligné sur la tâche pour l'automatisation
3arXiv cs.RO 

Laboratoire compact : apprentissage par imitation aligné sur la tâche pour l'automatisation

L'équipe de recherche à l'origine de l'article présente TVF-DiT, un système compact d'apprentissage par imitation destiné à l'automatisation de laboratoires. Le modèle aligne un modèle de vision auto-supervisé avec un modèle vision-langage via un adaptateur compact, puis couple l'ensemble à un expert d'action basé sur un Diffusion Transformer. L'architecture complète totalise moins de 500 millions de paramètres, ce qui permet une inférence sur des GPU à faible VRAM, contrairement aux modèles fondation classiques utilisés en robotique. Testé sur trois tâches réelles de laboratoire, nettoyage de tubes à essai, rangement de tubes à essai et transfert de poudre, le système atteint un taux de réussite moyen de 86,6%, nettement supérieur aux autres approches légères comparées dans l'étude. Les chercheurs notent également que des prompts de tâche plus détaillés améliorent l'alignement vision-langage et les performances globales. Ce résultat compte parce qu'il attaque un vrai goulot d'étranglement de l'automatisation de laboratoire: les techniques d'apprentissage par imitation les plus performantes reposent en général sur de gros modèles fondation, gourmands en calcul, difficiles à déployer sur du matériel de laboratoire standard. En démontrant qu'un modèle compact, correctement aligné, peut approcher les performances de systèmes plus lourds sur des tâches réelles et non simulées, l'étude apporte un argument concret contre l'idée que seule l'échelle garantit la généralisation. Pour les intégrateurs et décideurs qui équipent des laboratoires automatisés, cela ouvre la porte à des déploiements moins coûteux en infrastructure GPU, sans sacrifier la flexibilité promise par l'apprentissage par imitation face aux pipelines de mouvement codés à la main. L'automatisation de laboratoire s'est longtemps appuyée sur des pipelines de mouvement conçus sur mesure et des interfaces matérielles spécifiques à chaque tâche, coûteuses à développer et peu adaptables à de nouveaux protocoles. Les approches récentes d'apprentissage par imitation, popularisées dans la robotique générale par des modèles vision-langage-action, ont montré qu'un robot pouvait apprendre des comportements généraux à partir de démonstrations, mais au prix de ressources de calcul importantes. TVF-DiT s'inscrit dans cette lignée en cherchant à réduire ce coût computationnel tout en conservant l'essentiel des capacités. L'article, publié en version révisée sur arXiv, ouvre la voie à des validations sur davantage de tâches et de configurations matérielles avant d'envisager un déploiement plus large en environnement industriel ou académique.

RecherchePaper
1 source
SAIL : le passage à l'échelle au moment du test pour l'apprentissage par imitation en contexte avec VLM
4arXiv cs.RO 

SAIL : le passage à l'échelle au moment du test pour l'apprentissage par imitation en contexte avec VLM

Des chercheurs présentent SAIL, un framework qui reformule l'apprentissage par imitation en contexte (in-context imitation learning) comme un problème de raffinement itératif capable de tirer parti du calcul disponible au moment de l'inférence, ou "test-time compute". SAIL s'appuie sur une recherche arborescente Monte Carlo (MCTS) où chaque nœud représente une trajectoire complète et chaque arête correspond à un raffinement de cette trajectoire. Le système repose sur trois composants : une archive automatisée des trajectoires réussies pour la récupération contextuelle pertinente, un mécanisme de notation basé sur un modèle vision-langage (VLM) pour évaluer les trajectoires, et un retour au niveau de chaque étape (step-level feedback) qui fournit des scores alignés sur la trajectoire pour guider le raffinement itératif. Testé sur six tâches de manipulation distinctes, en simulation et en conditions réelles, SAIL montre qu'augmenter le calcul au moment du test améliore de manière constante le taux de réussite, atteignant jusqu'à 95 % sur les tâches les plus complexes. Le papier est publié sur arXiv sous une version révisée (arXiv:2603.08269v2, type "replace"). Ce résultat intéresse les équipes qui travaillent sur les modèles vision-langage-action (VLA) et l'apprentissage par imitation en manipulation robotique, un domaine où la génération de trajectoire en un seul essai reste fragile dès que l'environnement s'écarte des démonstrations d'entraînement. En transposant au bras robotique la logique de "test-time scaling" déjà démontrée dans les grands modèles de langage, où davantage de calcul à l'inférence améliore la qualité des réponses, SAIL suggère qu'une partie du problème de généralisation en robotique peut se traiter en allouant plus de calcul par tâche à l'exécution, via recherche, notation et raffinement, plutôt qu'en entraînant des modèles toujours plus gros. Pour les intégrateurs et décideurs B2B, cela pointe vers un compromis latence-fiabilité : accepter un temps de cycle plus long contre un taux de réussite plus élevé sur des tâches complexes, un arbitrage pertinent pour des applications où l'échec d'une manipulation coûte cher. Le travail reste toutefois académique : les 95 % de réussite portent sur six tâches définies en laboratoire, sans indication de temps de cycle ni de surcoût de calcul lié aux itérations MCTS, deux données déterminantes pour toute application industrielle. Cette publication s'inscrit dans un courant de recherche sur l'apprentissage par imitation en contexte, où un robot reproduit une tâche à partir d'un petit nombre de démonstrations sans réentraînement complet du modèle, une approche distincte des politiques VLA entraînées de bout en bout à la manière de Pi-0 ou GR00T N2. L'usage d'un VLM comme juge de qualité de trajectoire rejoint aussi une tendance récente consistant à mobiliser des modèles multimodaux généralistes comme mécanisme d'évaluation plutôt que comme contrôleur direct du robot. Aucun acteur européen n'apparaît dans ces travaux, qui n'annoncent ni partenariat industriel, ni pilote de déploiement, ni calendrier de commercialisation : la "validation monde réel" décrite correspond à des essais de laboratoire, pas à un déploiement en production.

RecherchePaper
1 source