Apprentissage de comportements réflexes pour la manipulation riche en contacts
Des chercheurs publient sur arXiv (2610.02811) une politique « réflexe » proprioceptive pour la manipulation riche en contacts. Elle est entraînée uniquement en simulation, sur trois primitives d'interaction très simples : un ressort, un plan et un rail. Elle convertit des commandes exprimées dans l'espace tâche en consignes de position articulaire, à partir de l'historique d'état du robot. Elle n'utilise aucune mesure directe de force ni de géométrie. Une fois entraînée, elle est figée et placée sous des contrôleurs de plus haut niveau, comme une couche d'exécution. Les tests couvrent le levage de caisse à deux bras, l'insertion de pion et le suivi de surface. Pour la caisse, la force reste sous le seuil fixé, alors que la référence échoue. Sur surface rugueuse, elle reste sous la référence de 10 N, au niveau d'un contrôle hybride force-position réglé à la main. Pour l'insertion de pion avec un jeu de 0,02 mm, la force de contact moyenne estimée est divisée par plus de deux, et le taux de réussite sur matériel passe d'au plus 22 % à 36-58 %.
L'intérêt tient à la séparation entre génération de commande et réponse au contact. Les approches courantes, contrôle en position, hybride force-position ou impédance cartésienne, imposent une raideur, un objectif de suivi ou des directions de force qui ne correspondent pas toujours à la géométrie locale. Ici, une même couche réflexe peut servir sous un planificateur de mouvement, une politique apprise (type VLA) ou un opérateur en téléopération, sans réglage propre à chaque tâche. Si le résultat se confirme, il va dans le sens d'un transfert sim-to-real réussi pour le contact avec des primitives minimales. Il permet aussi un contrôle sans capteur de force, donc moins coûteux, ce qui intéresse les intégrateurs de cellules d'assemblage. Les limites sont nettes : les taux d'insertion de 36-58 % restent loin des exigences industrielles, la force de contact est estimée et non mesurée, et le résumé ne précise ni la plateforme ni le nombre d'essais.
Ce travail s'inscrit dans le débat entre contrôle classique du contact (impédance, admittance, hybride force-position) et apprentissage par renforcement en simulation, jusqu'ici surtout appliqué à la locomotion. Il ne s'agit pas d'un produit mais d'une prépublication v1, non évaluée par les pairs, sans calendrier de déploiement. Les suites logiques sont une validation sur davantage de tâches et de robots, une comparaison avec des politiques de manipulation de bout en bout, et une intégration sous des modèles VLA, qui produisent des commandes de haut niveau peu sensibles aux contraintes de contact.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




