Aller au contenu principal
RecherchearXiv cs.RO 

SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent SARI (Simulated Approach, Real Interaction), un cadre de co-entraînement simulation-réel « à phases séparées » destiné à adapter des modèles vision-langage-action (VLA) à des tâches de manipulation riches en contacts. Le principe : générer les trajectoires d'approche, en espace libre, dans un jumeau numérique photoréaliste, et ne collecter en conditions réelles que les phases de contact, sur un petit nombre de positions d'objets. Une seule politique est ensuite post-entraînée sur ces démonstrations segmentées par phase. Elle enchaîne approche simulée et interaction réelle grâce à un alignement de l'apparence visuelle et à une représentation d'action partagée, exprimée par rapport à la caméra. Elle n'utilise ni étiquettes de phase explicites ni commutateurs codés à la main. Testé sur cinq tâches de manipulation réelles, SARI réduit de 34,3 % le temps de collecte de données réelles et atteint 27,5 % de réussite sur des positions jamais vues, là où toutes les approches de référence sim-réel entraînées sur la tâche complète échouent totalement (0 %). Le travail est publié sur arXiv (2610.02804).

Ces résultats comptent pour les équipes qui adaptent des VLA à des tâches d'assemblage ou d'insertion, où le coût des démonstrations téléopérées est le principal frein. L'intérêt tient à la répartition du travail : la diversité spatiale, gourmande en données mais tolérante aux écarts de simulation, est confiée à la synthèse. La physique du contact, sensible aux erreurs de modèle mais peu dépendante de la position de l'objet, reste réelle. Cela nuance l'idée d'un transfert sim-vers-réel de bout en bout et suggère qu'un découpage par phase est plus rentable. Il faut toutefois relativiser les chiffres. Un taux de 27,5 % sur positions inédites reste très loin d'un seuil industriel, et un gain de 34,3 % sur le temps de collecte est modeste. Les résultats portent sur cinq tâches, avec un échantillon et des conditions de laboratoire dont l'article ne détaille pas ici la variabilité. Le contraste avec les références à 0 % est parlant, mais il dépend du choix de ces références.

L'article s'inscrit dans la série de travaux sur le co-entraînement sim-réel pour les politiques VLA, qui cherchent à réduire la dépendance aux démonstrations réelles, aujourd'hui l'un des principaux postes de coût du déploiement de modèles généralistes. Les approches concurrentes, qui mélangent simulation et réel sur la tâche entière, se heurtent à l'écart de réalité dès que le contact intervient, ce que SARI cherche à contourner. Il s'agit ici d'un résultat de recherche et non d'un produit ni d'un déploiement : aucun partenaire industriel, calendrier de pilote ni code disponible n'est mentionné dans le résumé. Les suites probables sont des validations sur davantage de tâches, de robots et de géométries d'objets, ainsi que des comparaisons avec les VLA généralistes actuels, afin de vérifier si le gain tient hors du cadre expérimental initial.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

Apprentissage de comportements réflexes pour la manipulation riche en contacts

Des chercheurs publient sur arXiv (2610.02811) une politique « réflexe » proprioceptive pour la manipulation riche en contacts. Elle est entraînée uniquement en simulation, sur trois primitives d'interaction très simples : un ressort, un plan et un rail. Elle convertit des commandes exprimées dans l'espace tâche en consignes de position articulaire, à partir de l'historique d'état du robot. Elle n'utilise aucune mesure directe de force ni de géométrie. Une fois entraînée, elle est figée et placée sous des contrôleurs de plus haut niveau, comme une couche d'exécution. Les tests couvrent le levage de caisse à deux bras, l'insertion de pion et le suivi de surface. Pour la caisse, la force reste sous le seuil fixé, alors que la référence échoue. Sur surface rugueuse, elle reste sous la référence de 10 N, au niveau d'un contrôle hybride force-position réglé à la main. Pour l'insertion de pion avec un jeu de 0,02 mm, la force de contact moyenne estimée est divisée par plus de deux, et le taux de réussite sur matériel passe d'au plus 22 % à 36-58 %. L'intérêt tient à la séparation entre génération de commande et réponse au contact. Les approches courantes, contrôle en position, hybride force-position ou impédance cartésienne, imposent une raideur, un objectif de suivi ou des directions de force qui ne correspondent pas toujours à la géométrie locale. Ici, une même couche réflexe peut servir sous un planificateur de mouvement, une politique apprise (type VLA) ou un opérateur en téléopération, sans réglage propre à chaque tâche. Si le résultat se confirme, il va dans le sens d'un transfert sim-to-real réussi pour le contact avec des primitives minimales. Il permet aussi un contrôle sans capteur de force, donc moins coûteux, ce qui intéresse les intégrateurs de cellules d'assemblage. Les limites sont nettes : les taux d'insertion de 36-58 % restent loin des exigences industrielles, la force de contact est estimée et non mesurée, et le résumé ne précise ni la plateforme ni le nombre d'essais. Ce travail s'inscrit dans le débat entre contrôle classique du contact (impédance, admittance, hybride force-position) et apprentissage par renforcement en simulation, jusqu'ici surtout appliqué à la locomotion. Il ne s'agit pas d'un produit mais d'une prépublication v1, non évaluée par les pairs, sans calendrier de déploiement. Les suites logiques sont une validation sur davantage de tâches et de robots, une comparaison avec des politiques de manipulation de bout en bout, et une intégration sous des modèles VLA, qui produisent des commandes de haut niveau peu sensibles aux contraintes de contact.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?

Des chercheurs publient SimpleTouch, une extension du modèle vision-langage-action (VLA) π0.5 qui lui ajoute un « expert tactile ». Cet expert exploite tous les tokens d'un encodeur tactile préentraîné et gelé. Il apprend à partir de la supervision des actions et de la prédiction à plusieurs horizons de représentations latentes tactiles futures. L'entraînement tient en une seule étape et n'utilise que les démonstrations de la tâche, sans préentraînement tactile de la politique ni alignement visuotactile séparé. Avec 50 démonstrations par tâche, SimpleTouch obtient le meilleur taux de succès parmi les méthodes évaluées sur les six tâches du benchmark UniVTAC, avec une moyenne de 77,5 %. FTP-π0.5 atteint 45,2 % et FTP-1 66,7 %, soit des écarts de 32,3 et 10,8 points de pourcentage. Sur quatre tâches réelles, la moyenne est de 71,3 %, soit 8,8 points au-dessus de FTP-1. Le papier, disponible sur arXiv avec une page projet, ne précise pas dans cet extrait le capteur tactile utilisé, le robot ni le nombre d'essais par tâche. L'enjeu est la chaîne d'entraînement de la manipulation riche en contacts. Beaucoup d'équipes partent du principe que greffer le toucher sur un VLA préentraîné uniquement sur la vision et le langage, au moment du réglage fin, creuse un écart intermodal et donne peu de gains, voire dégrade les résultats. Elles ajoutent donc des corpus tactiles à grande échelle ou une étape d'alignement dédiée, ce qui alourdit la collecte de données et le pipeline. SimpleTouch suggère que, si l'on dispose déjà d'un VLA et d'un encodeur tactile solides, ces étapes ne sont pas indispensables pour ces tâches. Pour un intégrateur, cela abaisse le coût d'entrée : une cinquantaine de démonstrations par tâche suffiraient pour doter une politique existante de sensibilité tactile. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par les pairs, d'un nombre limité de tâches (six en simulation, quatre en réel), et la comparaison porte sur des références choisies par les auteurs. Rien n'indique une généralisation à d'autres capteurs, morphologies ou tâches. Ce travail s'inscrit dans la montée des VLA fondés sur la famille π de Physical Intelligence, qui servent de base à de nombreuses extensions de recherche. La question de la modalité tactile y reste ouverte : les approches concurrentes, comme FTP-1, misent sur un préentraînement tactile de la politique, tandis que SimpleTouch teste l'hypothèse inverse, celle de la simplicité. Le benchmark UniVTAC fournit un terrain commun de comparaison, mais les résultats en conditions industrielles, avec cadences, variabilité des pièces et usure des capteurs, restent à démontrer. Les prochaines étapes probables sont des réplications par d'autres laboratoires, des tests sur davantage de tâches et de capteurs, et une confrontation directe avec des modèles préentraînés sur de grands volumes de données tactiles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade
3arXiv cs.RO 

Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade

Des chercheurs ont publié sur arXiv (référence 2605.27972) un cadre d'optimisation en cascade baptisé SCSP, pour Simultaneous Contact Selection and Planning, dédié à la manipulation robotique en contact riche. Ce type de manipulation regroupe les tâches où le bras doit gérer plusieurs points de contact dynamiques : pivotement d'objet, manipulation en main, assemblage serré. Le système repose sur deux modules séquentiels : CSO (Contact Selection Optimization), qui détermine automatiquement les localisations de contact optimales sur l'objet cible, et CPO (Contact Planning Optimization), qui génère ensuite les trajectoires de manipulation correspondantes en temps réel pour des bras redondants à sept degrés de liberté ou plus. Les auteurs valident l'approche en simulation et sur robot physique, sur des tâches décrites comme complexes, sans que l'abstract ne fournisse de métriques de temps de cycle ou de taux de succès chiffrés. Le verrou que SCSP prétend lever est structurant pour la manipulation autonome : la quasi-totalité des méthodes contact-implicit existantes suppose que la séquence de points de contact est définie à l'avance par l'opérateur. Le robot optimise la trajectoire, pas l'endroit où il entre en contact. CSO contourne les deux obstacles qui rendaient la sélection active difficile, à savoir la complémentarité dans la dynamique de contact et les gradients parcimonieux, en substituant un modèle de contact approché et différentiable au modèle physique discontinu, couplé à une optimisation discrète-continue. CPO exploite ensuite ces localisations comme prior pour planifier en temps réel. Si le comportement se généralise hors simulation, le framework permettrait d'aborder des tâches de manipulation substantiellement plus complexes sans paramétrage manuel des modes de contact, ce qui est aujourd'hui l'un des goulots d'étranglement principaux en intégration industrielle. Le champ de la manipulation en contact riche est partagé entre deux grandes familles : l'optimisation classique (contact-implicit trajectory optimization, MPC) et l'apprentissage (VLA, diffusion policies), portées notamment par Physical Intelligence avec Pi-0, Covariant et Figure AI. SCSP s'inscrit dans la ligne optimisation, plus interprétable et potentiellement plus robuste hors distribution que les approches end-to-end. L'identité institutionnelle des auteurs n'apparaît pas dans l'abstract arXiv, ce qui complique l'évaluation de la maturité et du soutien financier derrière le travail. Les démonstrations vidéo disponibles sur le site projet constitueront le vrai test de crédibilité avant tout positionnement industriel.

RecherchePaper
1 source
VISTA : attention spatiale de contact inférée visuellement pour la manipulation à contacts riches
4arXiv cs.RO 

VISTA : attention spatiale de contact inférée visuellement pour la manipulation à contacts riches

Un article arXiv publié fin août 2026 (2608.25872) présente VISTA-Policy, une méthode d'apprentissage par imitation pour la manipulation robotique en contact avec des objets. Plutôt que d'ajouter des capteurs tactiles ou de force, coûteux à calibrer et déployer, l'approche utilise le Visual Deformation Field (VDF), une représentation 3D des déformations d'un gripper compliant captée par caméra, comme signal de contact. Le système combine un module de décodage du VDF en temps réel, un mécanisme de débruitage isolant les vrais signaux de contact, et un réseau de politique pilotant des corrections incrémentales du gripper en boucle fermée. Il a été testé sur trois tâches, la préhension d'objets d'échelles variables, le dévissage de bouchons et l'écriture calligraphique, face à la référence vision pure 3D Diffusion Policy et à une référence tactile. L'enjeu dépasse la démonstration technique : en manipulation fine, la seule caméra peine à distinguer des états de contact subtils, notamment sous occlusion, tandis que les capteurs tactiles dédiés ajoutent du matériel, de la calibration et des coûts de déploiement. En montrant qu'un signal visuel dérivé de la déformation du gripper égale ou dépasse un capteur tactile physique, l'étude ouvre une voie moins coûteuse vers une manipulation généraliste en environnement non structuré. Les auteurs rapportent une généralisation à des objets d'échelles inédites et une robustesse à des perturbations dynamiques, deux points faibles fréquents des politiques vision seule. Pour des intégrateurs évaluant des piles VLA pour la préhension fine, cela suggère qu'un retour de contact riche est possible sans multiplier les capteurs embarqués. Le travail s'inscrit dans la tendance de l'apprentissage par imitation centré vision, où des politiques par diffusion comme 3D Diffusion Policy dominent mais restent limitées par l'ambiguïté des retours visuels purs ; la comparaison directe avec une référence tactile positionne VISTA-Policy comme alternative, plutôt que complément, aux capteurs de force dédiés. À ce stade, il s'agit d'une publication de recherche sur arXiv, pas d'un produit commercialisé : les résultats reposent sur des évaluations de laboratoire sur trois tâches, avec vidéos et matériel supplémentaire en ligne. Aucun calendrier de transfert industriel ni partenariat n'est communiqué.

RecherchePaper
1 source