
Optimiser, apprendre, affiner : préhension du corps entier et lancer avec un robot souple en spirale
Des chercheurs ont mis au point un cadre d'optimisation qui permet à un robot continu souple en spirale de saisir et de lancer des objets avec tout son corps, à partir d'un état initial où rien n'est encore saisi. La méthode, décrite dans un preprint arXiv (v1, non évalué par les pairs), repose sur une optimisation dans l'espace d'actionnement guidée uniquement par le résultat. La saisie est mesurée par le balayage angulaire de la pointe et par l'enveloppement de l'objet par le corps du robot. Le lancer ajoute l'alignement de la direction de relâchement et une vitesse minimale à la libération. Aucune force de contact, position de contact ou configuration du corps n'est prescrite : saisie, accélération et relâchement émergent de l'interaction compliante. En simulation, le système réussit 492 saisies sur 500 (98,4 %) et affiche 98 %, 97 % et 94 % de réussite sur trois directions de lancer. Sur le matériel, les auteurs rapportent 100 % de réussite sur 50 saisies et sur 30 lancers (10 par direction).
L'intérêt tient à la difficulté de fond : la manipulation corps entier par des robots souples, où les contacts changent en permanence, échappe aux méthodes de planification classiques. La relation entre commande et résultat est non lisse, d'où le recours à CMA-ES, un algorithme d'optimisation sans dérivées. Le cadre « optimiser, apprendre, affiner » fonctionne en trois temps : CMA-ES produit des solutions pour des conditions échantillonnées, un prédicteur conditionné par la tâche apprend des points de départ, puis CMA-ES les raffine pour des conditions inédites. Le gain est mesurable : le taux de saisie passe de 78,6 % à 98,4 % et le nombre médian de simulations par optimisation chute de 1184 à 816. Il faut toutefois relativiser. Les scores de 100 % reposent sur de petits échantillons (30 à 50 essais), le résumé ne précise ni les objets, ni leur masse, ni leur diversité, et l'écart entre simulation et matériel n'est pas chiffré. Il s'agit d'un résultat de laboratoire, sans produit ni déploiement associé.
Ce travail s'inscrit dans l'essor des robots continus et souples, qui visent des tâches où la compliance répartie est un avantage : objets fragiles, environnements encombrés, contacts incertains. Il se distingue de la ligne dominante des humanoïdes et des modèles vision-langage-action (VLA), qui apprennent des politiques par imitation ou par apprentissage par renforcement sur des préhenseurs rigides. Ici, l'apprentissage reste léger : il sert uniquement à initialiser une optimisation. Le résumé ne mentionne ni acteur industriel ni calendrier de transfert. Les suites probables sont des tests avec des objets plus variés, des charges plus lourdes et une validation en boucle fermée avec retour perceptif, étapes nécessaires avant toute application logistique ou industrielle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




