Prise de décision conditionnée par les affordances : combler l'écart sémantico-spatial en navigation vision-langage inter-étages zéro-shot
Des chercheurs proposent PACE (Preference-refined Affordance-Conditioned Execution), un module d'exécution locale supervisé qui vient se greffer sur des planificateurs sémantiques « zero-shot » figés pour la navigation guidée par le langage (VLN) entre étages. Le module convertit les indices sémantiques liés aux transitions (escalier, porte, passage étroit) en une pose d'affordance traversable, à long horizon et centrée sur l'agent. Il conditionne ensuite la génération d'actions à court horizon sur cette cible spatiale. Un post-entraînement par raffinement de préférences tenant compte des échecs s'appuie sur des paires issues de rollouts, qui opposent les comportements normaux ou de récupération aux comportements amplifiant la déviation. PACE a été intégré à six navigateurs VLN zero-shot open source. Sur les sous-ensembles multi-étages de R2R-CE et RxR-CE, le taux de succès moyen passe de 16,35 % à 27,65 % et de 4,76 % à 12,06 %. Des essais en conditions réelles, dans des environnements inédits, sont également rapportés.
L'enjeu tient à un écart que les démonstrations masquent souvent : un planificateur fondé sur un grand modèle peut choisir la bonne destination sans que le robot sache franchir l'obstacle. Atteindre le pied d'un escalier ou l'entrée d'une porte ne garantit pas la traversée, car il faut trouver une pose exécutable et corriger les erreurs d'action qui s'accumulent. Le gain relatif est net (environ +70 % sur R2R-CE, presque le triple sur RxR-CE), et il est obtenu sur six planificateurs différents sans les modifier. Cela plaide pour une couche d'exécution spatiale séparée du raisonnement sémantique. Il faut toutefois relativiser : les taux absolus restent bas, à 27,65 % et 12,06 %, très loin d'une fiabilité exploitable en site industriel, et les tests réels ne sont pas chiffrés dans le résumé. Les résultats portent sur des benchmarks simulés, pas sur un produit ni un déploiement.
Ce travail s'inscrit dans le courant des navigateurs VLN généralistes, où des modèles vision-langage ou des grands modèles de langage planifient sans entraînement spécifique à la tâche. Leur point faible reste l'exécution physique dans les zones contraintes, en particulier le changement d'étage, sous-représenté dans les évaluations classiques. PACE s'attaque à ce cas précis avec une approche modulaire, là où d'autres acteurs de l'IA embarquée privilégient des politiques VLA de bout en bout. Il s'agit d'une publication de recherche (arXiv, version 2), sans annonce de pilote ni calendrier commercial. La suite logique serait une validation quantifiée sur robots réels, avec des mesures de robustesse en conditions variées, avant toute intégration dans des piles de navigation industrielles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




