SkillWeaver : exploration à base d'agents de compétences d'interaction neuronales pour la génération de données robotiques à grande échelle
SkillWeaver, un framework publié sur arXiv (2609.36171), propose de générer automatiquement des données robotiques en simulation grâce à un agent de raisonnement. Le système repose sur des « Neural Interaction Skills » (NIS), des politiques paramétrables, réutilisables et en boucle fermée, entraînées par apprentissage par renforcement pour la manipulation riche en contacts. Étant donné une tâche et un environnement simulé, un agent VLM (modèle vision-langage) décide de la prochaine action, invoque et paramètre une NIS, observe le résultat, puis produit des étapes de vérification, de réflexion et de mémoire. L'exploration prend la forme d'une recherche arborescente guidée par un vérificateur. Le système a généré 39,1 K démonstrations sur 14,1 K scènes, ensuite distillées en politiques visuomotrices. Il s'agit d'un travail de recherche, sans produit ni déploiement industriel associé.
L'enjeu porte sur le goulot d'étranglement de la donnée. La téléopération reste coûteuse et difficilement extensible à des environnements variés ou à des tâches longues. Les pipelines de simulation actuels dépendent souvent de contrôleurs en boucle ouverte, de séquences de compétences scriptées ou de programmes propres à chaque tâche, ce qui limite leur généralité. SkillWeaver déplace la logique : le savoir-faire physique est encapsulé dans des primitives apprises, et l'agent découvre lui-même les enchaînements gagnants. Les auteurs affirment une meilleure généralisation à de nouveaux objets, configurations spatiales, tâches et environnements, ainsi qu'un transfert sim-to-sim et sim-to-real en zéro ou few-shot. Ces résultats viennent du résumé de l'article. Le résumé ne donne aucun taux de réussite, aucun modèle de référence ni aucun protocole. Le volume de manipulation réelle testé est aussi inconnu, alors que c'est là que se joue l'écart entre démonstration et réalité. La revendication d'une alternative « scalable » reste donc à confirmer par les tableaux détaillés.
Le travail s'inscrit dans la recherche sur la génération de données synthétiques pour les modèles VLA (vision-langage-action), qui alimentent aujourd'hui les efforts autour de Pi-0, GR00T ou Helix. Elle vise à réduire la dépendance à la collecte humaine. Les approches concurrentes combinent LLM et code généré, ou augmentent un petit nombre de démonstrations humaines en simulation. L'originalité ici est de placer des politiques RL fermées, et non du code ou des trajectoires scriptées, comme briques de l'exploration. La suite dépendra de la publication du code et des données, de la reproduction par d'autres laboratoires et de la mesure du coût de calcul de la recherche arborescente. Aucun acteur français ou européen n'est cité dans le résumé.
Dans nos dossiers




