Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage de comportements réflexes pour la manipulation riche en contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02811) une politique « réflexe » proprioceptive pour la manipulation riche en contacts. Elle est entraînée uniquement en simulation, sur trois primitives d'interaction très simples : un ressort, un plan et un rail. Elle convertit des commandes exprimées dans l'espace tâche en consignes de position articulaire, à partir de l'historique d'état du robot. Elle n'utilise aucune mesure directe de force ni de géométrie. Une fois entraînée, elle est figée et placée sous des contrôleurs de plus haut niveau, comme une couche d'exécution. Les tests couvrent le levage de caisse à deux bras, l'insertion de pion et le suivi de surface. Pour la caisse, la force reste sous le seuil fixé, alors que la référence échoue. Sur surface rugueuse, elle reste sous la référence de 10 N, au niveau d'un contrôle hybride force-position réglé à la main. Pour l'insertion de pion avec un jeu de 0,02 mm, la force de contact moyenne estimée est divisée par plus de deux, et le taux de réussite sur matériel passe d'au plus 22 % à 36-58 %.

L'intérêt tient à la séparation entre génération de commande et réponse au contact. Les approches courantes, contrôle en position, hybride force-position ou impédance cartésienne, imposent une raideur, un objectif de suivi ou des directions de force qui ne correspondent pas toujours à la géométrie locale. Ici, une même couche réflexe peut servir sous un planificateur de mouvement, une politique apprise (type VLA) ou un opérateur en téléopération, sans réglage propre à chaque tâche. Si le résultat se confirme, il va dans le sens d'un transfert sim-to-real réussi pour le contact avec des primitives minimales. Il permet aussi un contrôle sans capteur de force, donc moins coûteux, ce qui intéresse les intégrateurs de cellules d'assemblage. Les limites sont nettes : les taux d'insertion de 36-58 % restent loin des exigences industrielles, la force de contact est estimée et non mesurée, et le résumé ne précise ni la plateforme ni le nombre d'essais.

Ce travail s'inscrit dans le débat entre contrôle classique du contact (impédance, admittance, hybride force-position) et apprentissage par renforcement en simulation, jusqu'ici surtout appliqué à la locomotion. Il ne s'agit pas d'un produit mais d'une prépublication v1, non évaluée par les pairs, sans calendrier de déploiement. Les suites logiques sont une validation sur davantage de tâches et de robots, une comparaison avec des politiques de manipulation de bout en bout, et une intégration sous des modèles VLA, qui produisent des commandes de haut niveau peu sensibles aux contraintes de contact.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Data et apprentissage là où ça compte pour la manipulation à contact riche
1arXiv cs.RO 

Data et apprentissage là où ça compte pour la manipulation à contact riche

Des chercheurs proposent une nouvelle méthode de collecte de données pour l'apprentissage de tâches de manipulation robotique à contact riche, où la précision est critique (insertion, assemblage, etc.). Décrite dans un article publié sur arXiv (arXiv:2607.15982v1), l'approche part d'un constat : les politiques apprises de bout en bout sur de larges jeux de données restent fragiles sur les tâches de haute précision et généralisent mal, notamment parce que la collecte de données manque de structure et de ciblage. Les auteurs proposent donc de concentrer la collecte dense de données uniquement sur le segment critique de contact, en s'appuyant sur une planification classique pour les mouvements simples en espace libre. Un schéma de collecte automatisée, combiné à de l'apprentissage par renforcement profond hors ligne, traite spécifiquement la phase de contact, sans dépendre de la dextérité d'un téléopérateur humain ni de mises à jour de politique en ligne. Sur quatre tâches réelles jugées difficiles, seulement 2 à 2,5 heures de collecte de données autonome suffisent pour atteindre un taux de réussite moyen de 96 %, contre 55 % pour la meilleure référence testée. Pour l'industrie robotique, ce résultat s'attaque directement à un problème central de la manipulation fine par apprentissage : le fossé entre démonstration et performance réelle, en particulier en dehors des conditions d'entraînement. Les approches de bout en bout perdent généralement en fiabilité sur des scénarios hors distribution, alors que la méthode proposée conserve un taux de réussite élevé dans ces conditions, ce qui suggère que cibler la collecte de données sur la phase de contact, plutôt que de tout apprendre uniformément, réduit la dépendance à des volumes massifs de démonstrations. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des déploiements de politiques d'assemblage ou d'insertion nécessitant beaucoup moins d'heures d'acquisition de données, et sans mobiliser un opérateur expert pendant tout le processus. Ce travail s'inscrit dans une tendance récente de la recherche en apprentissage par renforcement appliqué à la robotique, qui cherche à réduire le coût et la complexité de la téléopération humaine tout en conservant les gains de robustesse permis par l'apprentissage profond. En combinant planification traditionnelle et RL hors ligne de façon segmentée plutôt que de miser sur un unique modèle bout en bout, les auteurs proposent une piste concrète pour industrialiser les tâches de précision, un domaine où la robotique humanoïde et les bras manipulateurs peinent encore à passer de la démonstration en laboratoire au déploiement fiable en usine.

RecherchePaper
1 source
Représentation d'action par champ de potentiel pour l'apprentissage par renforcement en manipulation à contacts riches
2arXiv cs.RO 

Représentation d'action par champ de potentiel pour l'apprentissage par renforcement en manipulation à contacts riches

Des chercheurs décrivent, dans un préprint publié sur arXiv fin septembre 2026 (arXiv:2609.21609v1), PA-RL, un framework de reinforcement learning qui remplace les commandes cartésiennes directes par des champs de potentiel artificiels comme représentation d'action: la politique ajuste les paramètres d'un champ de potentiel énergétique, qui génère une direction de guidage exécutée par un contrôleur d'impédance cartésien. Testé en simulation sur l'insertion de cheville dans un trou (peg-in-hole), tâche de référence à contacts riches et transitions discontinues, PA-RL bat, avec le même algorithme RL, trois espaces d'action concurrents (vitesse cartésienne, pose cartésienne, impédance variable): 100% de réussite contre 92,6% pour la meilleure référence, avec 55,4% de variation de couple articulaire en moins et 70,8% de variation d'accélération cartésienne en moins. Transférée sans réentraînement, la politique entraînée uniquement en simulation réussit 9 insertions sur 9 sur robot réel. Ce résultat s'attaque à deux limites connues du RL appliqué à la manipulation industrielle: le couplage entre stratégie de tâche et génération de mouvement bas niveau, et l'écart persistant entre simulation et réel. En faisant agir la politique sur les paramètres d'un champ de potentiel plutôt que sur des commandes de trajectoire brutes, PA-RL allège l'apprentissage et produit des mouvements mécaniquement plus doux, un point concret pour les intégrateurs soucieux de limiter l'usure des actionneurs sur les lignes d'assemblage. Le transfert vers le réel sans fine-tuning est la donnée la plus significative pour les décideurs B2B: elle suggère qu'une représentation d'action mieux choisie peut réduire le besoin de réentraînement coûteux sur matériel physique, même si l'échantillon réel reste modeste, neuf essais sur une seule tâche, ce qui appelle à la prudence avant toute généralisation. Ce travail s'inscrit dans l'effort de recherche visant à rendre le RL exploitable pour l'assemblage industriel, où l'insertion de pièces sert de cas d'école face à des interfaces d'action plus directes déjà étudiées, comme la commande cartésienne en vitesse ou en pose et l'impédance variable. En s'appuyant sur les champs de potentiel artificiels, une technique historiquement utilisée en planification de mouvement classique plutôt qu'en apprentissage de bout en bout, les auteurs proposent une voie intermédiaire entre contrôle réactif et apprentissage profond. L'article ne mentionne ni partenaire industriel ni pilote de déploiement annoncé; les suites attendues porteraient sur l'extension à d'autres tâches de contact et sur une validation à plus grande échelle en conditions réelles, afin de confirmer la généralisation au-delà du seul scénario peg-in-hole testé ici.

RecherchePaper
1 source
PredTac : apprentissage de la manipulation en contact riche par prédiction du toucher
3arXiv cs.RO 

PredTac : apprentissage de la manipulation en contact riche par prédiction du toucher

Des chercheurs présentent PredTac, un cadre qui remplace les capteurs tactiles physiques par une estimation visuelle du contact lors de la manipulation robotique. Le système entraîne d'abord un prédicteur tactile supervisé par des données de contact réelles, puis utilise ses inférences comme substitut au toucher mesuré pendant l'apprentissage et l'exécution de politiques, à partir de simples observations visuelles et de l'état du robot. L'équipe teste PredTac sur trois tâches à fort contact, en simulation et sur robot réel : insertion USB, extraction d'un objet barbelé (Barbed-spike) et rotation de vanne (Valve). En simulation, les politiques à toucher prédit atteignent 27,0%, 52,0% et 44,7% de réussite selon la tâche, soit un gain de 8,0 à 13,7 points de pourcentage par rapport à une politique purement visuelle. Sur robot réel, avec l'architecture ACT, les taux grimpent à 70,0%, 50,0% et 90,0% (moyenne de 70,0% sur les trois tâches), un score proche des 72,2% obtenus avec un toucher réellement mesuré et largement supérieur aux 21,1% d'une politique vision seule. Ce résultat s'attaque à un point de friction connu de la robotique de manipulation fine : les capteurs tactiles physiques ajoutent du coût matériel, des contraintes de calibration, de synchronisation et de maintenance qui freinent le déploiement en dehors des laboratoires. Si le toucher peut être inféré de façon fiable à partir de la vision et de la proprioception, cela lève un obstacle matériel pour les intégrateurs qui veulent équiper des bras robotiques de compétences fines (insertion de connecteurs, manipulation d'objets irréguliers, actionnement de vannes) sans multiplier les capteurs embarqués et leurs pannes associées. Les auteurs nuancent toutefois la promesse : des tests d'intervention montrent que la performance reste sensible à la structure spatiale du contact prédit, une simple réorganisation spatiale des valeurs prédites faisant chuter le succès sur la tâche Valve de 10,7 points. Le toucher prédit n'égale donc pas encore totalement le toucher mesuré, mais s'en approche suffisamment pour être une alternative crédible plutôt qu'un pis-aller. Ce travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) et des politiques comme ACT, qui cherchent à réduire la dépendance des robots manipulateurs à des capteurs spécialisés coûteux. Il complète les approches à toucher mesuré directement, en proposant une alternative bas coût sans capteur tactile dédié. L'étude, publiée en préprint sur arXiv le 15 septembre 2026, reste à ce stade une validation en laboratoire sur trois tâches ciblées et un unique bras robotique réel, sans indication de partenariat industriel ni de déploiement au-delà du cadre expérimental ; les prochaines étapes attendues concernent l'extension à davantage de tâches et de plateformes pour confirmer la généralisation de l'approche.

RecherchePaper
1 source
TWINS : un système bras isomorphique portable à retour tactile en réseau pour l'apprentissage de la manipulation à contacts riches
4arXiv cs.RO 

TWINS : un système bras isomorphique portable à retour tactile en réseau pour l'apprentissage de la manipulation à contacts riches

TWINS (Tactile Wearable Isomorphic Arm Networked System) est un système robotique présenté dans un article publié sur arXiv (2608.01733v1) et conçu pour l'apprentissage de tâches de manipulation impliquant un contact avec la surface du corps du robot, et pas seulement avec ses pinces. Le système repose sur deux éléments : un dispositif bras double porté par l'opérateur humain, et un robot isomorphe reproduisant exactement la même configuration articulaire et les mêmes dimensions externes. Des capteurs tactiles distribués, intégrés au niveau du torse et des bras, mesurent en continu le contact avec la surface du corps, synchronisé avec le mouvement des articulations. À l'aide du dispositif porté, les chercheurs ont collecté des démonstrations pour quatre tâches de manipulation impliquant ce type de contact corporel. Des politiques d'apprentissage par imitation ont ensuite été entraînées sur ces données puis déployées sur le robot isomorphe, permettant une exécution autonome guidée par les retours tactiles du torse et des bras. L'intérêt de TWINS tient à un angle mort connu des pipelines actuels de collecte de données : la plupart des systèmes de téléopération (gants, manettes VR, exosquelettes) ne capturent que les trajectoires de l'effecteur terminal, ce qui limite les robots à des tâches de préhension et de dépose. Or, une manipulation réaliste, en particulier chez les humanoïdes, exige souvent d'utiliser tout le bras ou le torse pour porter, stabiliser ou déplacer des objets volumineux, des gestes que les pipelines existants ne peuvent tout simplement pas enregistrer. En rendant le dispositif de démonstration isomorphe au robot cible et en ajoutant une détection tactile répartie au-delà du bout des doigts, TWINS démontre, à petite échelle, qu'un apprentissage par imitation de gestes de manipulation à contact corporel étendu est possible. C'est un signal utile pour les futurs pipelines de données destinés aux humanoïdes appelés à manipuler des charges encombrantes en logistique ou en assistance. Il s'agit d'un article de recherche académique (soumission arXiv de type "new"), sans mention d'entreprise ni de financement industriel dans le résumé, accompagné d'une page projet dédiée. Le travail s'inscrit dans une vague plus large de systèmes de téléopération pour l'apprentissage par imitation chez les humanoïdes, mais se distingue par son approche isomorphe et sa détection tactile distribuée, un axe encore peu exploré face aux méthodes centrées sur l'effecteur seul. Le résumé ne précise ni le nombre de degrés de liberté ni la charge utile du robot, et seules quatre tâches ont été testées : la généralisation au-delà du laboratoire reste donc à démontrer avant toute perspective de déploiement industriel.

RecherchePaper
1 source