WeaveRL : entrelacer la reconstruction dans des tissus sensibles à la scène pour l'apprentissage par renforcement perceptif
Un preprint publié sur arXiv en septembre 2026 (référence 2609.18685) présente WeaveRL, une méthode accélérée par GPU qui reconstruit une scène de manipulation sous forme de surfels, en parallèle dans des milliers d'instances de simulation pendant l'entraînement par renforcement. Elle remplace les représentations de scène statiques et codées à la main des contrôleurs anti-collision dits "geometric fabrics" par une géométrie dérivée directement des capteurs. Sur une série de tâches de manipulation denses en collisions, ces "surfel fabrics" réussissent là où des méthodes de référence à primitives géométriques échouent, tout en conservant un transfert sim-to-real fonctionnel. Face à des obstacles inédits introduits au moment du test, le taux de complétion de tâche sans collision passe de 35% à 61%. Les auteurs publient en accès libre le système de reconstruction, le code d'entraînement et un jeu de données de test.
Cette avancée s'attaque à un verrou connu du RL en robotique: jusqu'ici, intégrer une perception 3D active et en ligne dans un entraînement massivement parallélisé sur GPU restait hors de portée faute de méthode de reconstruction assez rapide, ce qui obligeait les équipes à coder la géométrie des scènes à la main, une pratique mal adaptée à des environnements réels où objets et obstacles varient. En démontrant que la reconstruction par surfels tient la cadence sur des milliers de simulations simultanées, WeaveRL déplace cette limite technique. Pour les intégrateurs et les équipes robotiques industrielles, l'écart mesuré entre 35% et 61% de réussite face à des obstacles inédits illustre concrètement le fossé récurrent entre démonstrations en environnement contrôlé et généralisation en conditions réelles, et suggère que coupler perception active et contrôle anti-collision est une piste crédible pour le réduire, sans pour autant régler la question du passage à l'échelle hors laboratoire.
Le travail prolonge la lignée des "geometric fabrics", des contrôleurs anti-collision déjà utilisés comme socle du RL en manipulation mais jusqu'ici cantonnés à des scènes statiques faute de perception embarquée compatible avec l'entraînement massivement parallèle. WeaveRL se positionne explicitement face aux méthodes à primitives géométriques, qu'il surpasse sur les tâches denses en collisions, sans toutefois se comparer dans ce preprint aux approches génériques de type vision-langage-action employées par ailleurs dans le secteur humanoïde. Il s'agit à ce stade d'une publication de recherche non encore relue par les pairs, et non d'un produit ou d'un système déployé en usine: aucun pilote industriel ni calendrier de commercialisation n'est annoncé. En publiant leur code d'entraînement, leur système de reconstruction et leur jeu de données de test, les auteurs cherchent explicitement à ce que d'autres laboratoires reproduisent et prolongent cette approche.
Dans nos dossiers




