AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM
AntiGrounding, un framework de sélection visuelle d'actions pour la manipulation robotique guidée par des modèles vision-langage, est détaille dans une version mise a jour d'un article arXiv (2506.12374v3). Chaque trajectoire courte retenue après filtrage de faisabilité sert a la fois de plan de mouvement exécutable et de prompt visuel rendu, évalué par un question-réponse visuel multi-vues qui note sécurité, alignement avec la tache, efficacité et plausibilité physique. Ces scores, agrégés par fusion pondérée des vues, guident les propositions de trajectoire suivantes; des contrôles séparés gèrent orientation et pince, et un jumeau numérique valide les segments choisis avant exécution par le robot réel. Sur huit taches de manipulation en conditions réelles, AntiGrounding associe a un seul évaluateur, désigne GPT-6 Astra, atteint 71,25% de réussite, contre 50,00% pour le modèle pi0.5 et 47,50% pour une base de référence de type PIVOT évaluée avec le même VLM.
L'intérêt pour le secteur tient a l'alternative proposee aux modèles VLA généralistes entraines de bout en bout, comme pi0.5, GR00T N2 ou Helix, qui associent directement instruction et action: ici le VLM sert d'évaluateur dans une boucle de recherche et de notation de trajectoires géométriques, approche plus auditable pour la sécurité avant un déploiement industriel. L'écart avec pi0.5 (50,00%) sur les mêmes huit taches rappelle que les politiques VLA généralistes restent en dessous des attentes en conditions réelles, nuançant l'idée d'un sim-to-real déjà résolu a grande échelle. Les auteurs précisent toutefois que la performance reste bornée par la fidélité du jumeau numérique et par les aléa de l'interaction physique: il s'agit d'un travail de recherche publie sur arXiv, non d'un produit commercialise ni déployé en usine.
Le travail s'inscrit dans la lignée des recherches combinant grands modèles vision-langage et planification robotique, aux cotes de politiques VLA comme pi0 et pi0.5 de Physical Intelligence ou GR00T N2 de NVIDIA, et se distingue de la méthode concurrente PIVOT en confiant au VLM un rôle de juge plutôt que de générateur direct d'action. Aucun acteur français ou européen, tel Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools, n'apparait dans ces travaux, qui restent pour l'instant un résultat de laboratoire sur huit taches, sans calendrier de pilote industriel annonce.
Dans nos dossiers




