Exploitation de l'expertise humaine pour l'assemblage robotique de précision dans la construction industrialisée : un cadre d'apprentissage par renforcement interactif avec installateur dans la boucle, économe en échantillons
Une équipe de recherche a publié sur arXiv, en septembre 2026, un cadre d'apprentissage par renforcement interactif pour l'assemblage robotique de fenêtres préfabriquées en construction industrialisée (arXiv:2609.13234). Le système combine démonstrations téléopérées hors ligne, reprises en main binaires de l'installateur aux seuls échecs de contact, et récompenses terminales alignées sur les critères d'acceptation, pilotées par une politique d'action séquentielle fondée sur Q-chunking et Flow Q-Learning. Testé dans le simulateur MuJoCo, de la préhension par ventouse jusqu'au positionnement à jeu serré, le pipeline atteint 100% de pose autonome réussie avec 12 à 15 minutes de supervision humaine cumulée sur 3 heures d'entraînement en ligne, pour un jeu de 2 mm par côté avec pose et frottement randomisés. Le seuil de 95% de réussite est atteint en 0,5 puis 1,5 heure selon les deux configurations testées.
Ce résultat cible un verrou classique de la robotique de construction: convertir le savoir-faire tacite d'un installateur en autonomie exploitable malgré un retour d'acceptation rare et une forte variabilité de contact. En ramenant à quelques minutes la supervision nécessaire pour approcher une fiabilité totale sur des tolérances millimétriques, l'étude suggère qu'un apprentissage par renforcement guidé par l'humain reste efficace même à récompense très sparse, un enjeu direct pour les intégrateurs visant l'automatisation d'assemblages jugés jusqu'ici trop précis pour la robotique classique. Une réserve s'impose: tous les résultats proviennent de simulation, sans essai sur robot physique ni déploiement réel rapporté, et le transfert sim-to-réel sur un jeu de 2 mm reste l'inconnue principale avant toute application industrielle.
La méthode prolonge les travaux récents sur l'apprentissage hors ligne vers en ligne et sur les politiques d'action segmentées (Q-chunking), associées ici à Flow Q-Learning pour capturer des manœuvres de récupération multimodales en cas d'échec de contact, avec une phase de warm-start pour stabiliser la transition. Elle se distingue des approches tout-autonome ou tout-téléopérées en ne sollicitant l'opérateur qu'aux frontières d'échec de contact. L'article ne cite ni partenaire industriel, ni site de déploiement, ni concurrent nommé, ni calendrier de pilote: il s'agit d'une contribution méthodologique validée par ablations isolant les apports de l'abstraction temporelle, de l'intervention humaine et du calibrage du warm-start, sans feuille de route de production précisée.
Dans nos dossiers




