Aller au contenu principal
RecherchearXiv cs.RO 

VIRGA : géométrie riemannienne par agent virtuel pour la coordination air-sol à détection active

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VIRGA (Virtual-Agent-Intermediated Riemannian Geometry for Active-Sensing Air-Ground Coordination), un cadre de coordination géométrique publié en préprint sur arXiv (2609.21883). Le système vise un scénario précis : un drone doit rester visible en permanence par un LiDAR monté sur nacelle orientable porté par un robot terrestre, tout en évitant des obstacles dynamiques. VIRGA convertit les observations des deux LiDAR en champs de Riemann bornés, reliés par un « agent virtuel » à retour élastique réciproque, puis traduit cette référence commune en commandes pour le drone, le robot au sol et la nacelle. Comparé à trois contrôleurs de référence, un Ray-RMP adapté (réponse rapide mais marge de sécurité insuffisante), un champ de Riemann dense (bon évitement géométrique mais coût de calcul trop élevé pour stabiliser le champ de vision) et un ColAG adapté (faible latence mais violations de sécurité et de visibilité), VIRGA réussit l'ensemble des scénarios d'entrepôt testés et, sans réentraînement, un test de résistance en environnement type grotte, confiné et irrégulier.

Ce résultat intéresse les concepteurs de flottes hétérogènes destinées à l'inspection ou à la logistique en milieu confiné, où maintenir la ligne de visée entre un capteur mobile et un aéronef relève d'une contrainte opérationnelle plutôt que d'un confort. La comparaison met en évidence qu'aucun des trois contrôleurs concurrents ne tient simultanément la vitesse de réponse, la marge de sécurité géométrique et la continuité du champ de vision : chacun échoue sur au moins un critère. Le transfert réussi, sans réentraînement, d'un scénario d'entrepôt vers un environnement souterrain irrégulier répond à une critique récurrente adressée aux méthodes de coordination multi-robots, à savoir leur fragilité en dehors des conditions d'entraînement.

VIRGA prolonge les travaux sur les champs de Riemann appliqués à la planification de mouvement (RMP), déjà utilisés en navigation robotique, en les étendant à un couplage actif entre plusieurs plateformes et un capteur orienté. Le choix des références de comparaison, Ray-RMP et ColAG, situe explicitement la méthode par rapport aux approches existantes de coordination air-sol. Le travail reste, à ce stade, une contribution de recherche en préprint, non relue par les pairs, évaluée en simulation, sans indication de déploiement matériel réel ni de partenariat industriel. Des études d'ablation isolent la contribution de trois composants, l'évaluation géométrique en ligne, la médiation par agent virtuel et le retour élastique réciproque, laissant ouverte la question de la généralisation à des flottes de plus de deux robots.

Dans nos dossiers

À lire aussi

Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées
1arXiv cs.RO 

Navigation air-sol collaborative vision-langage pour la navigation via cartes aériennes partagées

Des chercheurs ont publié sur arXiv (2609.03483) un système baptisé AGC-VLN, pour "Air-Ground Collaborative Vision-and-Language Navigation", qui fait collaborer un drone (UAV) offrant une vue aérienne globale et un véhicule terrestre autonome (UGV) doté d'une caméra en vue subjective. Le drone superpose sur sa vue plongeante la position rapportée de l'UGV et la cible identifiée par un modèle vision-langage (VLM), sous forme de repères "CAR" et "GOAL" avec distances, pour construire une carte partagée en vue aérienne. L'UGV s'en sert pour planifier un trajet le long des routes avec un VLM figé, non réentraîné, pendant que le drone exécute en parallèle 3D-SPF, une variante de la méthode de localisation SPF, pour repérer et rejoindre la cible depuis les airs. Sur 100 épisodes en boucle fermée dans la scène Town10HD du simulateur CARLA-Air, le taux de réussite conjoint atteint 77,0%, contre 50,0% pour le drone seul, soit un gain de collaboration de 27,0 points, et dépasse de 24,0 points la meilleure référence mono-agent publiée, Travel UAV (53,0%). Ce travail comble un angle mort documenté: une évaluation récente sur CARLA-Air portant sur cinq modèles VLA de pointe n'avait trouvé aucune coopération stable entre drone et robot terrestre, la communication sémantique naïve ou le couplage bidirectionnel dégradant même les performances. AGC-VLN propose une architecture sans réentraînement, qui sépare le raisonnement sémantique confié au VLM de l'exécution géométrique déterministe, ouvrant une interface de collaboration exploitable sans données supplémentaires. Pour les intégrateurs qui déploient des flottes hétérogènes drones et robots mobiles, la preuve que le gain vient de la complémentarité des points de vue plutôt que d'un modèle plus puissant plaide pour des architectures multi-agents modulaires plutôt que des VLA monolithiques appliqués robot par robot. Le papier s'inscrit dans la lignée des méthodes de navigation vision-langage sans entraînement, jusqu'ici cantonnées au mono-agent, et se compare à Travel UAV ainsi qu'à SPF, dont 3D-SPF est une extension. Les auteurs revendiquent la première base de référence "training-free" pour la navigation collaborative air-sol, une affirmation à prendre comme un positionnement plutôt qu'un fait vérifié indépendamment, le domaine restant, de leur propre aveu, largement inexploré. Les résultats reposent uniquement sur simulation, sans essai en conditions réelles ni chiffres de déploiement industriel; le code est publié sur GitHub (ZSN2024/AGC-VLN), laissant ouverte la question du transfert simulation-vers-réel pour des flottes physiques.

RechercheActu
1 source
AnchorVLN : raisonnement vision-langage ancré à la géométrie pour la navigation à vocabulaire ouvert
2arXiv cs.RO 

AnchorVLN : raisonnement vision-langage ancré à la géométrie pour la navigation à vocabulaire ouvert

AnchorVLN, décrit dans un article publié sur arXiv début septembre 2026 (2609.12285v1), répartit la navigation vision-langage en environnement intérieur inconnu entre un modèle vision-langage (VLM), qui propose la sémantique, et un module géométrique dédié, qui calcule les métriques. Implémenté sous le nom EMBODIED-NAV-MCP, un serveur au protocole Model Context Protocol, il pilote l'agent via un jeu d'outils dont aucun n'accepte de distance en mètres ni d'angle en radians. Testé sur le CMU Vision-Language Navigation Challenge 2026, soit 30 questions de suivi d'instructions réparties sur 15 scènes et un ensemble figé de 45 questions de référencement d'objets, le système obtient 64,4 % de réussite en suivi d'instructions, un score qui chute de 13,3 points (t = 2,77) sans modélisation du contrôleur. Sur le référencement d'objets, l'ancrage géométrique valide 10 questions sur 45 contre 0 sur 45 pour une estimation directe des coordonnées par le VLM, ramenant l'erreur médiane de centrage de 3,37 à 2,48 mètres. Ce partage des rôles répond à une limite connue des VLM multimodaux : solides en ancrage de vocabulaire ouvert et en raisonnement zero-shot, ils restent peu fiables pour extraire directement d'une image une distance, un cap ou une comparaison spatiale exploitable. Les approches précédentes codaient la géométrie à la main dans des pipelines dédiés ou faisaient générer des waypoints par le modèle, au prix d'une pile de contrôle à retoucher pour chaque robot, tâche ou vocabulaire. En imposant cette frontière sémantique/géométrie au niveau du schéma des outils plutôt que dans le code métier, AnchorVLN vise une portabilité entre plateformes sans modifier la couche d'autonomie, un enjeu direct pour les intégrateurs gérant des flottes hétérogènes. L'écart de 13,3 points mesuré entre le système complet et sa version sans contrôleur fournit une estimation chiffrée, rare dans ce domaine, du poids réel de l'estimation métrique dans la performance d'un pipeline de navigation piloté par VLM. Le travail s'inscrit dans le CMU Vision-Language Navigation Challenge 2026, une compétition académique de référence pour la navigation en vocabulaire ouvert sans carte préconstruite ni liste fermée d'objets. Il se positionne explicitement contre deux familles d'approches antérieures, la géométrie codée à la main et la génération directe de waypoints par le modèle, en proposant une troisième voie où la contrainte géométrique découle de la définition même des outils accessibles au VLM plutôt que d'une modification du contrôleur. Il s'agit à ce stade d'un résultat de recherche en préimpression, testé sur un périmètre restreint de 15 scènes et 75 questions au total entre les deux tâches, et non d'un produit ou d'un déploiement en conditions réelles ; aucun calendrier de généralisation à d'autres environnements ou à des robots physiques n'est communiqué au-delà du cadre du challenge.

RecherchePaper
1 source
GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
3arXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public. L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception. GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

RecherchePaper
1 source
Apprentissage de la coordination visuomotrice prédictive
4arXiv cs.RO 

Apprentissage de la coordination visuomotrice prédictive

Des chercheurs ont publié sur arXiv (référence 2503.23300, version 2, juin 2026) un système de prédiction de la coordination visuomotrice humaine à partir de flux égocentrés. Concrètement, le modèle prend en entrée des images capturées par une caméra portée par l'utilisateur ainsi que des données cinématiques (positions et orientations corporelles), et prédit en sortie la pose de la tête, la direction du regard et les mouvements du haut du corps. L'architecture proposée, baptisée Visuomotor Coordination Representation (VCR), apprend des dépendances temporelles structurées entre ces signaux multimodaux. Elle s'appuie sur un cadre de modélisation du mouvement par diffusion, une famille de modèles génératifs capables de produire des trajectoires cohérentes dans le temps. L'évaluation porte sur EgoExo4D, le jeu de données à grande échelle de Meta combinant vidéos égocentrées et exocentrées d'activités du quotidien, ce qui confère aux résultats une portée de généralisation sur des scénarios variés. L'enjeu pratique est significatif pour la robotique collaborative et les interfaces homme-machine. Anticiper où un opérateur va regarder et comment il va bouger son bras dans la seconde à venir est une brique fondamentale pour des robots industriels capables d'adapter leur trajectoire sans collision, ou pour des exosquelettes qui doivent pré-charger l'assistance musculaire avant le geste. L'approche démontre que la fusion vision-cinématique surpasse les approches unimodales, ce qui valide l'hypothèse que le regard et le mouvement corporel sont couplés de façon prévisible et exploitable par un modèle appris. Pour les technologies d'assistance (aide à la mobilité, interfaces de compensation du handicap), la prédiction de l'intention motrice ouvre des pistes concrètes de réduction de latence. Ce travail s'inscrit dans un courant de recherche en pleine accélération autour de la modélisation du comportement humain en vue première personne, nourri par la montée en puissance de dispositifs portables comme les lunettes AR et les capteurs inertiels embarqués. Les approches concurrentes incluent les modèles de prédiction de gaze sur vidéo statique (Aleatoric, GazeTR) et les frameworks de prédiction de mouvement full-body comme HumanMAC ou MDM, mais peu croisent explicitement regard et cinématique dans un cadre de prédiction temporelle unifiée. La publication ne mentionne pas de calendrier de déploiement industriel ni de partenariat applicatif ; il s'agit pour l'instant d'une contribution académique, avec page projet disponible, dont la suite naturelle serait une intégration dans des pipelines d'imitation learning pour robots humanoïdes ou cobots.

RecherchePaper
1 source