POIL : apprentissage par imitation en un essai basé sur des points et systèmes dynamiques stables
Une équipe de recherche présente POIL (Point-based One-Shot Imitation Learning), décrit dans un preprint arXiv (2609.30404v1) : un framework permettant à un bras robotique de reproduire une tâche de manipulation à partir d'une seule démonstration. La méthode repose sur un ensemble de points 3D placés sur la partie fonctionnelle de l'objet, identifiée automatiquement par un modèle de langage multimodal, utilisé à la fois pour transférer la trajectoire démontrée et piloter l'exécution en boucle fermée. Un module nommé Point-set BCSDM suit ces points par vision multi-vue et projette leurs vitesses sur un torseur rigide unique, sans modèle CAD ni estimateur de pose. Testé en simulation et sur robot réel, POIL transfère une même démonstration à travers des changements de catégorie d'objet, de prise et de géométrie de but, tout en récupérant après des perturbations externes. Une page projet est en ligne (sangminkim-99.github.io/poil).
L'intérêt pour l'industrie robotique tient à la promesse d'un apprentissage par imitation qui ne requiert plus la collecte de centaines ou de milliers de démonstrations, contrairement aux modèles vision-langage-action à grande échelle type Pi-0 ou GR00T N2 entraînés sur des jeux de données massifs de téléopération. POIL vise directement le talon d'Achille des méthodes one-shot : leur fragilité face aux changements de scène, de prise ou aux perturbations. En revendiquant une robustesse en boucle fermée et une généralisation à de nouvelles catégories d'objets à partir d'un seul exemple, les auteurs s'attaquent à un écart souvent souligné entre démonstrations en laboratoire et conditions réelles d'intégration.
POIL s'inscrit dans une lignée de travaux sur les systèmes dynamiques stables, traditionnellement définis dans l'espace des poses rigides SE(3), que les auteurs étendent ici à des ensembles de points suivis sans modèle 3D préalable ni estimateur de pose, une contrainte forte des pipelines de préhension classiques basés sur des modèles CAD. La méthode se positionne ainsi comme une alternative plus légère aux approches VLA gourmandes en données qui dominent actuellement la recherche en manipulation robotique. Le travail reste à ce stade un preprint arXiv non encore évalué par les pairs ; les auteurs mettent à disposition une page projet, sans annoncer pour l'instant de code source ni de calendrier de publication.
Dans nos dossiers




