
Apprentissage par renforcement résiduel hybride pour l'insertion robotique de livres en environnement à contacts multiples
Une étude publiée en septembre 2026 sur arXiv (référence 2609.19962) s'attaque à l'insertion robotique de livres dans une étagère serrée, une tâche de manipulation en contact riche où une erreur de pose de l'ordre du millimètre peut provoquer un blocage, un échec de relâchement ou un mauvais positionnement de l'objet. La méthode proposée est hybride: un contrôleur nominal dans l'espace de la tâche gère l'insertion et le positionnement structurés, pendant qu'une politique d'apprentissage par renforcement résiduel (PPO) apporte des corrections locales bornées et décide du moment du relâchement; seule la brève séquence d'ouverture-retrait-refermeture reste scriptée. En simulation calibrée sur le déploiement réel, sur 512 conditions fixes et trois entraînements indépendants, le taux de succès moyen atteint 98,50% (écart-type de 0,23 point) contre 37,89% pour le contrôleur nominal seul. Sur un bras robotique physique xArm7 à 7 degrés de liberté, 60 essais répartis sur 30 conditions appariées montrent un succès passant de 26,7% à 63,3% avec l'approche résiduelle, les échecs chutant de 22 à 11 cas, avec une victoire sur 13 des 15 conditions où les deux méthodes divergent.
L'écart marqué entre les résultats en simulation (98,5%) et ceux obtenus en conditions réelles (63,3%) illustre concrètement le fossé sim-to-real qui reste un obstacle pour la manipulation robotique en contact riche, au-delà des tâches de navigation ou de préhension simple déjà largement maîtrisées. Pour les intégrateurs et décideurs en logistique, entrepôts ou service, ce résultat confirme qu'une architecture hybride, combinant contrôle géométrique fiable pour la structure globale de la tâche et correction apprise concentrée sur les phases sensibles au contact, surpasse nettement le contrôle purement scripté, tout en restant plus économe en données que des politiques bout-en-bout entraînées sur de vastes corpus de démonstrations. Les tests de robustesse, avec des performances maintenues au-dessus de 87% sous des perturbations d'initialisation jusqu'à 1,5 fois la normale, nuancent toutefois les promesses de généralisation totale par apprentissage pur: sur des espaces très serrés, la limite géométrique de la correction locale réapparaît.
Ce travail s'inscrit dans la lignée des architectures hybrides associant contrôle classique et apprentissage résiduel, une alternative aux politiques vision-langage-action entraînées de bout en bout comme Pi-0, GR00T N2 ou Helix, qui cherchent à remplacer entièrement les contrôleurs structurés par des réseaux appris. En ne déléguant à l'apprentissage que la phase de contact la plus délicate, insertion et relâchement, tout en conservant la structure géométrique du reste de la tâche, les auteurs proposent une voie intermédiaire de fiabilisation pour des manipulateurs comme le xArm7 d'UFactory. L'étude, de nature académique, ne mentionne ni partenaire industriel ni calendrier de déploiement commercial.
Dans nos dossiers




