Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon
Le laboratoire de recherche Omron Sinic X a publié une version mise à jour sur arXiv d'un article présentant ViLaIn-TAMP, un système hybride de planification pour robots bimanuels. Le framework combine trois briques : un interpréteur vision-langage (ViLaIn, dérivé d'un travail antérieur) qui convertit des entrées multimodales en spécifications structurées au format PDDL, un moteur de planification tâche-et-mouvement (TAMP) qui transforme ces spécifications en séquences de trajectoires concrètes en vérifiant leur faisabilité géométrique et symbolique avant exécution, et un module de planification corrective (CP) qui récupère les retours d'échec moteur et les réinjecte comme contraintes pour affiner la spécification initiale. Les chercheurs ont conçu des tâches de manipulation bimanuelle complexes dans un contexte de cuisine pour évaluer le système. Résultat : ViLaIn-TAMP dépasse de 17,5 points le taux de réussite moyen d'une approche de référence où un modèle vision-langage sert directement de planificateur, et le module correctif ajoute 32,9 points supplémentaires. Le framework a aussi été testé sur un robot physique à deux bras.
L'enjeu dépasse la simple performance chiffrée. La quasi-totalité des travaux existants sur la planification pilotée par le langage se limite à des tâches de préhension-dépose à un seul bras, laissant la manipulation bimanuelle, où les sous-tâches sont étroitement interdépendantes et où les collisions inter-bras doivent être gérées explicitement, largement inexplorée. Les modèles vision-langage seuls agissent en boîte noire, sans garanties de sécurité vérifiables, tandis que les planificateurs symboliques classiques offrent ces garanties mais exigent une expertise poussée pour être configurés. En combinant les deux, ViLaIn-TAMP vise à répondre à un besoin concret pour les intégrateurs industriels : obtenir un comportement robotique interprétable et vérifiable avant déploiement, plutôt qu'une démonstration qui échoue silencieusement en conditions réelles.
Le travail s'inscrit dans la continuité d'un ViLaIn antérieur, adapté ici pour la planification tâche-et-mouvement complète plutôt que la seule interprétation de scène. Il se positionne explicitement contre les approches où un modèle vision-langage fait office de planificateur de bout en bout, une tendance qui gagne du terrain mais que ces résultats questionnent en matière de fiabilité sur tâches longues et bimanuelles. Le code et les démonstrations sont disponibles sur la page du projet hébergée par Omron Sinic X.
Dans nos dossiers




