Aller au contenu principal
ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage
RecherchearXiv cs.RO 

ViTL : navigation en langage naturel zéro-shot guidée par logique temporelle via modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ViTL (Vision-Language Temporal Logic), un système de navigation robotique capable d'exécuter des commandes en langage naturel impliquant plusieurs cibles et des contraintes temporelles, sans entraînement spécifique à l'environnement testé. Publié sur arXiv le 30 juin 2026, le framework s'attaque à un cas concret : une instruction comme "Nettoie la chaise ou le canapé, puis allume la télé" implique un ordre logique et un choix entre deux objets, ce qu'aucun système zero-shot existant ne gérait jusqu'ici. ViTL agit à deux niveaux. Au niveau tâche, un grand modèle de langage traduit la commande en formule de logique temporelle linéaire (LTL), convertie ensuite en automate fini déterministe (DFA) qui coordonne des cartes de valeur multi-canaux et déclenche une replanification dynamique dès qu'un nouvel objet pertinent est détecté. Au niveau navigation, les auteurs introduisent un "score directionnel" : plutôt qu'une valeur unique et indifférenciée sur tout le champ de vision, chaque direction de frontière est étiquetée sur l'image d'observation et notée séparément par le modèle vision-langage. Les tests ont été menés sur le simulateur Habitat-Matterport 3D (HM3D).

L'enjeu dépasse la démonstration académique. Les méthodes actuelles de navigation zero-shot vers un objet, qui s'appuient sur des VLM pour guider une exploration par frontières dans un environnement inconnu, restent cantonnées à une seule cible à la fois. En prouvant qu'un pipeline LLM-vers-logique-vers-automate peut orchestrer plusieurs sous-tâches ordonnées sans réentraînement, ViTL déplace la limite de ce qu'un robot peut comprendre d'une instruction humaine complexe, un enjeu direct pour les intégrateurs qui déploient des robots domestiques ou logistiques devant suivre des consignes composites. Le score directionnel améliore aussi, selon les auteurs, la précision et l'efficacité sur les tâches à cible unique par rapport à leur référence de base, signe que le gain ne se limite pas aux scénarios multi-cibles.

Ce travail s'inscrit dans la lignée des approches récentes combinant VLM et exploration frontalière pour la navigation sémantique zero-shot, une piste active depuis l'essor des modèles vision-langage capables de raisonner sur des scènes inconnues sans carte préexistante. La contribution spécifique de ViTL, la formalisation en logique temporelle plutôt qu'en heuristique ad hoc, ouvre la voie à des commandes encore plus complexes (conditions, boucles, contraintes de sécurité) dans de futurs travaux, même si le passage du simulateur HM3D à un robot réel reste l'étape non résolue par cette publication.

Dans nos dossiers

À lire aussi

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt
1arXiv cs.RO 

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt

Des chercheurs ont publié PIGEON (Point of Interest Guided Exploration for Object Navigation), un cadre de navigation robotique pour localiser des objets dans des espaces intérieurs inconnus. L'approche repose sur des modèles vision-langage (VLM), mais résout leur principal obstacle opérationnel : l'inférence dense image par image est trop coûteuse pour un usage embarqué temps réel. PIGEON introduit des Points d'Intérêt (PoI), unités de décision visuelles couplant waypoints géométriques et observations égocentriques brutes, que le VLM utilise pour sélectionner parmi des destinations candidates : frontières d'exploration, objets suspectés, escaliers franchissables, résumés de niveau sol. Un planificateur bas niveau exécute les trajectoires continues entre ces points. Le système intègre un pipeline RLVR (Reinforcement Learning with Verifiable Rewards) permettant d'affiner des VLM locaux sans annotations Chain-of-Thought manuelles. Sur le benchmark Habitat ObjectNav, référence standard en navigation simulée, PIGEON affiche les meilleures performances zero-shot publiées à ce jour et se transfère à la tâche Active Embodied Question Answering par simple modification du prompt. Des déploiements sur robots physiques sont documentés dans le papier (arXiv 2511.13207). L'enjeu central est l'efficacité computationnelle des VLM dans des boucles de contrôle robotique. Les approches concurrentes utilisent soit les VLM comme contrôleurs denses (coûteux), soit pour un simple ranking de frontières d'exploration (sémantiquement appauvri). PIGEON propose un compromis : décisions rares mais ancrées dans les observations brutes, rendant chaque choix vérifiable et compatible avec l'apprentissage par renforcement sans supervision humaine. La réduction de la dépendance aux données annotées est un avantage concret pour des équipes robotiques sans large budget d'annotation. La progression des performances avec la taille du modèle de fondation (scaling) indique une architecture alignée avec les tendances génératives actuelles. La navigation d'objets en environnement inconnu est un benchmark actif en robotique cognitive, avec des systèmes concurrents comme ESC, SG-Nav ou OpenFMNav exploitant également des LLM pour la planification sémantique. PIGEON se différencie par son mode zero-shot strict, sans réentraînement spécifique à l'environnement cible. Habitat, le simulateur d'intérieur de Meta AI Research, reste la plateforme d'évaluation de référence pour ce type de tâche. Ce résultat est académique : aucun partenariat commercial ni déploiement industriel n'est mentionné, et la robustesse en environnements réels dynamiques non contrôlés reste à valider à plus grande échelle. Les prochaines étapes naturelles incluent des tests en milieux variés et l'adaptation à des VLM embarqués contraints en ressources.

RechercheOpinion
1 source
Modèle du monde pour la navigation sociale de robots guidée par la logique
2arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source
STeP : logique temporelle de signaux pour des spécifications précises de génération d'actions avec des modèles vision-langage
3arXiv cs.RO 

STeP : logique temporelle de signaux pour des spécifications précises de génération d'actions avec des modèles vision-langage

Des chercheurs proposent STeP, un cadre hiérarchique qui relie les modèles vision-langage-action (VLA) à la logique temporelle de signaux (Signal Temporal Logic, STL), un formalisme mathématique servant à spécifier des contraintes spatiales, temporelles et logiques de façon précise et vérifiable. Concrètement, une politique de haut niveau s'appuie sur un modèle vision-langage pour décomposer une instruction en langage naturel en sous-tâches, générer pour chacune une spécification STL, puis choisir la politique de bas niveau adaptée à son exécution : soit un contrôle prédictif par modèle (MPC) guidé directement par les contraintes STL, soit une politique apprise dont l'exécution est surveillée en continu via ces mêmes contraintes, pour les comportements perceptuellement complexes ou impliquant des contacts physiques. Le système a été évalué sur un banc de manipulation de table en conditions réelles, avec replanification possible si une contrainte est violée en cours d'exécution. Il s'agit d'un article de recherche (arXiv, catégorie "new"), pas d'un produit commercialisé. L'enjeu dépasse la simple démonstration technique. Les modèles VLA génèrent des trajectoires impressionnantes en généralisation mais restent largement des boîtes noires, incapables de garantir qu'une instruction précise, du type "posez l'objet dans les 5 secondes sans dépasser telle zone", sera réellement respectée. Pour des intégrateurs industriels, cette absence de vérifiabilité formelle est un frein direct à l'adoption en environnement contraint, là où une simple démo vidéo ne suffit pas. En réintroduisant des méthodes formelles héritées du contrôle et de la vérification de systèmes cyber-physiques, ce travail illustre une tentative de combler l'écart entre le battage médiatique autour des VLA et des garanties d'exécution exploitables en production. Ce projet s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix, RT-2 et dérivés) qui ont démontré la faisabilité de politiques génératives multi-tâches, mais sans mécanisme natif d'interprétabilité ni de contrôle formel. STeP se positionne comme une couche intermédiaire plutôt qu'un modèle concurrent. À ce stade, seule une validation en laboratoire sur tâches de table a été menée, aucun pilote industriel ni déploiement à plus grande échelle n'a été annoncé.

RecherchePaper
1 source
CollaBot : manipulation collaborative simultanée guidée par modèle vision-langage
4arXiv cs.RO 

CollaBot : manipulation collaborative simultanée guidée par modèle vision-langage

Une équipe de chercheurs a publié sur arXiv (arXiv:2508.03526v2) CollaBot, un framework généraliste de manipulation collaborative simultanée par plusieurs robots. L'approche articule trois composants : un module de segmentation de scène basé sur SEEM (Segment Everything Everywhere all at once Model) pour isoler l'objet cible dans l'environnement, un framework de saisie collaborative qui décompose la tâche en génération locale de poses de préhension par chaque robot et coordination globale entre agents, et un module de planification en deux étapes pour produire des trajectoires sans collision. Testé sur des configurations variées, nombre de robots, types d'objets (dont des objets volumineux comme des tables), types de tâches, CollaBot atteint un taux de réussite de 72 %, surpassant les méthodes basées sur le behavior cloning. Des expériences en conditions réelles confirment la faisabilité de l'approche hors simulation. Ce résultat pointe un angle mort structurel de la robotique de manipulation : la quasi-totalité des frameworks existants ciblent des robots seuls opérant sur des objets de petite taille, alors que les environnements industriels et domestiques exigent fréquemment la manipulation coordonnée d'objets volumineux, tables, panneaux, charges lourdes. La décomposition explicite du problème (saisie locale + coordination globale) se révèle plus robuste que l'apprentissage bout-en-bout pur pour la généralisation multi-robot, ce qui constitue une piste d'architecture à retenir pour les intégrateurs industriels cherchant à déployer des cellules multi-bras flexibles. Le taux de 72 % mérite toutefois d'être nuancé : le papier ne détaille pas précisément la diversité des objets testés en conditions réelles ni les critères de succès retenus, ce qui limite la comparaison directe avec d'autres systèmes. La manipulation multi-robot collaborative reste un champ en structuration, sans cadre généraliste interopérable établi à ce jour. CollaBot s'inscrit dans une tendance plus large d'intégration de modèles vision-langage dans la planification robotique, dans l'esprit des architectures VLA portées par Physical Intelligence avec Pi-0, Figure AI avec Figure 03, ou Google DeepMind avec GR00T N2, mais appliqué spécifiquement à la coordination multi-agents sur objets larges, un scénario que les VLA classiques traitent mal. Les suites logiques seraient de tester le framework avec un nombre de robots plus élevé, dans des environnements encombrés, et de publier des benchmarks complets pour permettre une reproductibilité indépendante et une comparaison sérieuse avec les approches concurrentes.

RecherchePaper
1 source