RAPID : programmation à base d'agents pour robots à partir de démonstrations
Une équipe de recherche présente RAPID (Robot Agentic Programming from Demonstrations) dans un preprint publié sur arXiv le 25 septembre 2026 (arXiv:2609.30249) : un système qui génère, vérifie et affine automatiquement un programme robotique complet à partir d'une seule démonstration visuelle humaine, sans corpus d'entraînement massif. La boucle agentique itérative infère elle-même, depuis cette démonstration, trois ingrédients clés : une spécification de tâche testable, des primitives d'action exécutables par le robot, et un environnement interactif pour exécuter et vérifier le programme. Pour rendre le résultat réutilisable au-delà du contexte filmé, RAPID exprime les primitives comme des programmes d'optimisation de trajectoire reproduisant l'effet de mouvement au niveau de l'objet, assemblés par des contraintes relationnelles qui capturent la géométrie de la scène au moment de l'exécution. Les chercheurs ont testé le système en simulation sur huit tâches de manipulation non préhensile riches en contacts (pousser, pivoter, basculer des objets) et sur des tâches préhensiles classiques du benchmark LIBERO-Pro, puis l'ont déployé sur un bras robotique Franka réel pour l'ensemble des huit tâches non préhensiles ; le projet est documenté sur yuyaoliu.me/projects/rapid.
L'intérêt de RAPID tient à la difficulté qu'il attaque : transformer une démonstration unique en un programme réutilisable et généralisable, là où les politiques d'apprentissage par imitation ou les modèles vision-langage-action (VLA) exigent généralement des corpus de démonstrations massifs. En appliquant à la manipulation robotique la logique des agents de codage logiciel, capables d'itérer, tester et corriger leur propre production, RAPID parie que la synthèse de programmes symboliques explicites généralise mieux que des politiques paramétriques apprises, en particulier sur les tâches non préhensiles où la dynamique de contact et le frottement rendent la généralisation notoirement difficile. Les auteurs revendiquent une généralisation à la pose, la forme, le matériau et l'environnement des objets, une affirmation émanant pour l'instant d'une seule équipe sur un périmètre de tâches limité et non validée indépendamment ; le déploiement réel se cantonne d'ailleurs à un unique bras Franka et aux tâches non préhensiles, les tâches préhensiles de LIBERO-Pro n'ayant été testées qu'en simulation. Il s'agit donc d'un résultat de recherche prometteur mais encore au stade du preprint, pas d'un produit ou d'un pipeline prêt pour l'intégration industrielle.
Le travail s'inscrit dans un mouvement plus large visant à transposer aux robots le paradigme des agents de codage popularisé en génie logiciel, plutôt que d'empiler les données pour entraîner des politiques de bout en bout. Il se positionne ainsi en alternative aux approches VLA dominantes du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent des politiques directement à partir de grands ensembles de démonstrations plutôt que de synthétiser un programme symbolique explicite à partir d'un seul exemple ; aucun acteur français ou européen n'apparaît dans cette publication. À ce stade, RAPID reste un résultat académique diffusé via un preprint arXiv et un site de projet présentant des matériaux complémentaires, sans partenariat industriel, pilote de déploiement ni calendrier de commercialisation annoncés par les auteurs.




