ProAct-VLM : replanification de tâches vision-langage avant l'échec, avec retour de perception continu
Une équipe de chercheurs publie sur arXiv ProAct-VLM, un cadre de planification de tâches pour la manipulation robotique. Il intègre un modèle vision-langage (VLM) dans une boucle de perception en temps réel. Le code et la page projet sont hébergés sur GitHub (moured/ProAct-VLM). Le système surveille l'environnement en continu pendant l'exécution d'une tâche longue et replanifie dès qu'un changement pertinent apparaît, avant que l'action en cours n'échoue. Les auteurs l'ont comparé à plusieurs approches de référence et l'ont testé avec différents VLM comme backbone. Ils rapportent de meilleurs taux de succès et une meilleure efficacité sur des tâches de manipulation dynamiques à long horizon. Le résumé publié ne donne ni chiffres précis, ni nom de robot, ni liste des baselines. Le gain reste donc à vérifier dans le texte complet.
Le problème visé est courant en déploiement : une pièce déplacée, un objet tombé ou un opérateur qui passe suffisent à rendre un plan périmé ou dangereux. Les pipelines à règles, réglés à la main pour des scénarios précis, se généralisent mal en milieu ouvert. Les cadres à base de VLM existants replanifient surtout de façon réactive, après un échec d'exécution ou lors d'un contrôle en fin de tâche. Certains vérifient des conditions avant chaque action, mais ces contrôles ponctuels ne voient pas ce qui change pendant le mouvement. ProAct-VLM propose de passer d'une correction après l'échec à une anticipation pendant l'exécution. Pour un intégrateur, l'enjeu est de réduire les arrêts, les reprises et les risques de collision dans les environnements semi-structurés, comme la logistique ou l'assemblage avec présence humaine. Il faut toutefois rester prudent. Une boucle de perception continue couplée à un VLM pose des questions de latence, de coût de calcul et de fausses alertes qui déclenchent des replanifications inutiles. Le résumé n'en dit rien.
Ce travail s'inscrit dans le mouvement qui utilise les modèles vision-langage comme planificateurs de haut niveau, en complément des politiques VLA (vision-langage-action) qui pilotent directement les actionneurs. Les cadres de replanification réactifs et les vérifications de préconditions constituent les références directes. Ils sont cités comme les limites que ProAct-VLM cherche à dépasser. Il s'agit d'une prépublication (v1) non évaluée par des pairs. On ne sait pas encore si les résultats ont été obtenus en simulation ou sur robot réel, ni sur quelles plateformes. Les prochaines étapes à surveiller sont la publication du code, la reproduction indépendante et des tests sur matériel avec des perturbations réelles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




