
Génération et intégration guidées par représentation de programmes exécutables pour la manipulation robotique
Des chercheurs présentent RIVET (Representation-guided Integration of VLM-generated Executable Task programs), un framework qui utilise un modèle vision-langage pour générer automatiquement l'ensemble d'un système de manipulation robotique, perception, rendu, inférence de relations et planification, autour d'une représentation partagée combinant des poses 6D par objet et un graphe de relations entre objets. Décrit dans un papier arXiv (2609.31337v1), le système a été testé sur trois tâches, l'empilement de cubes, le réarrangement de tangram et l'assemblage tridimensionnel, à la fois en simulation et sur un robot physique réel. Les programmes générés une seule fois pour un domaine de manipulation donné sont ensuite réutilisés tels quels sur des configurations de départ et d'objectif jamais vues, sans nouvelle génération de code. En conditions réelles, les auteurs rapportent un taux de réussite global de 83 % en réutilisant des systèmes générés hors ligne.
L'intérêt pour l'industrie robotique tient au problème que RIVET cible directement : quand un VLM génère séparément les modules de perception, de planification et de contrôle, ceux-ci opèrent souvent sur des représentations géométriques incompatibles, ce qui casse le pipeline complet. En imposant une représentation commune à tous les modules générés, l'approche évite cette fragmentation typique des pipelines "code généré par IA" en robotique. Pour les intégrateurs, l'argument clé est économique autant que technique : le code n'est produit qu'une fois par domaine puis réemployé sans réinvoquer le VLM à chaque nouvelle configuration, ce qui limite le coût d'inférence en déploiement. Un taux de succès réel de 83 % reste notable dans un domaine où l'écart entre simulation et monde réel demeure un obstacle documenté, même s'il s'agit ici de résultats de laboratoire sur un nombre restreint de tâches, à ne pas confondre avec une validation à l'échelle industrielle.
RIVET s'inscrit dans un courant de recherche qui explore la génération de code exécutable par VLM comme alternative aux politiques vision-langage-action entraînées de bout en bout, du type de celles popularisées par des modèles comme Pi-0 ou GR00T N2, qui apprennent une correspondance directe perception-action sans passer par du code interprétable. Ce travail reste à ce stade un résultat académique, validé en simulation et sur un seul bras robotique en conditions de laboratoire, sans partenaire industriel ni calendrier de déploiement annoncé, une nuance qui le distingue nettement d'une annonce produit.
Dans nos dossiers




