Aller au contenu principal
Skytopia : navigation de drone monoculaire par modèles du monde latents conditionnés par l'action
RecherchearXiv cs.RO 

Skytopia : navigation de drone monoculaire par modèles du monde latents conditionnés par l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie Skytopia, une politique de navigation pour drones équipés d'une seule caméra orientée vers l'avant, dans un preprint arXiv (identifiant 2609.26007) mis en ligne fin septembre 2026. Le système repose sur un modèle du monde latent conditionné par l'action, entraîné sur une plateforme de simulation par 3D Gaussian Splatting conçue pour l'occasion. Deux objectifs d'entraînement sont combinés : un objectif direct qui prédit la représentation de la prochaine observation à partir du mouvement prévu, et un objectif inverse qui retrouve ce mouvement à partir de la transition prédite. Particularité du système, le module de prédiction est écarté après l'entraînement, seule la représentation qu'il produit sert au déploiement, ce qui permet à une politique unique de gérer trois modes de navigation : point-goal, image-goal et sans objectif explicite (goal-free). En simulation, Skytopia atteint des taux de réussite de 57,8%, 66,0% et 49,0% selon ces trois configurations, devant toutes les références testées, et l'abandon du prédicteur réduit le coût de calcul à l'inférence de 59,4%. La même politique, sans aucun réglage fin supplémentaire, a ensuite été déployée sur un drone physique et a atteint ses objectifs en intérieur, en extérieur dégagé et en forêt.

La navigation monoculaire, sans lidar ni caméra stéréo, reste un problème difficile pour les drones car une image unique fournit peu d'indices sur la profondeur et l'échelle des objets, ce qui complique le transfert simulation-vers-réel sur des plateformes légères. L'argument central des auteurs est que ce dont une politique a besoin d'un modèle du monde n'est pas la prédiction elle-même mais la représentation qui permet de la produire, puisqu'en vol l'action exécutée explique presque tout le changement observé entre deux images. Se débarrasser du prédicteur au moment du déploiement fait chuter le coût d'inférence de près de 60%, un enjeu direct pour l'embarqué sur des drones aux budgets de calcul et d'énergie limités. Le transfert réussi, sans réentraînement, vers trois environnements très différents constitue un signal utile pour les équipes qui parient sur des politiques de navigation entraînées entièrement en simulation. Il faut toutefois relativiser : des taux de réussite entre 49% et 66% restent modestes, et les tests ont été menés à l'échelle d'un laboratoire de recherche, loin d'un déploiement en flotte ou d'une validation industrielle.

Ce travail s'inscrit dans une tendance plus large à utiliser des modèles du monde pour la prise de décision d'agents embarqués, déjà explorée côté manipulation et locomotion robotique, mais appliquée ici à la navigation aérienne avec une seule caméra, une configuration de perception plus contrainte que les plateformes multi-caméras ou équipées de lidar. Le choix d'entraîner la politique dans un environnement de 3D Gaussian Splatting plutôt que dans un simulateur photoréaliste classique reflète un mouvement plus général vers le rendu neuronal pour accélérer les pipelines d'entraînement. À la différence des architectures où le prédicteur reste actif à l'inférence et réinjecte sa sortie dans la génération d'action à chaque pas de contrôle, la norme pour la plupart des politiques fondées sur un modèle du monde, Skytopia traite ce module comme un outil auxiliaire réservé à l'entraînement. Publié comme simple preprint, l'article n'annonce ni partenaire industriel ni déploiement pilote ; la suite logique serait une validation sur un plus grand nombre d'environnements et une intégration dans des piles logicielles commerciales de drones autonomes.

Dans nos dossiers

À lire aussi

ContactGuard : surveillance de l'exécution pré-contact par modèles du monde latents conditionnés par l'action
1arXiv cs.RO 

ContactGuard : surveillance de l'exécution pré-contact par modèles du monde latents conditionnés par l'action

Publié sur arXiv (2608.13438v1), un article de recherche présente ContactGuard, un moniteur d'exécution qui détecte les échecs de manipulation robotique avant le contact physique avec l'objet. Pensé pour les politiques visuomotrices « chunked » couplées à des caméras montées au poignet, souvent aveugles à une approche déjà en train de pousser, rater, glisser ou déranger l'objet, le système prédit dans un espace visuel latent compact la conséquence du prochain bloc d'actions planifié par la politique, puis interrompt l'exécution en cas d'échec probable. Son modèle du monde, entraîné sur des trajectoires robotiques non étiquetées sans prédiction vidéo pixel par pixel, s'appuie sur une sonde d'échec légère apprise sur un petit jeu de clips pré-contact étiquetés. Testé sur robot réel, il prédit les échecs plus précisément que des versions simplifiées mises en comparaison, sans modifier la politique existante. Cette approche cible une limite concrète des politiques actuelles de type VLA, qui exécutent des séquences d'actions sur plusieurs pas de temps sans réévaluation intermédiaire, rendant les échecs difficiles à anticiper avant qu'ils ne surviennent physiquement. Sur des tâches contact-riche comme l'insertion, l'assemblage ou la préhension, un échec détecté après coup signifie pièces endommagées ou reprises coûteuses. Pour les intégrateurs, l'intérêt tient à la nature de couche de sécurité externe du système, greffée sur une politique existante sans réentraînement, potentiellement applicable à plusieurs politiques « chunked » déjà déployées. Plutôt que de renforcer la politique de base à la source, ContactGuard ajoute une supervision prédictive en aval, une piste utile pour un secteur où l'écart entre démonstrations en laboratoire et fiabilité en conditions réelles reste un sujet sensible. Il s'agit d'une contribution académique sans lien annoncé avec une entreprise ou un robot commercial précis : aucun fabricant, site de déploiement ni feuille de route commerciale ne figure dans la publication. Le travail s'inscrit dans la lignée des modèles du monde latents en robotique, plus économes en calcul que la prédiction vidéo pixel par pixel, et se positionne en couche de supervision complémentaire aux politiques VLA plutôt qu'en nouvelle architecture de contrôle. La validation repose sur des tâches réelles de manipulation, mais reste un résultat de laboratoire : aucun acteur français ou européen du secteur n'est cité, et les auteurs ne précisent ni calendrier de suite ni partenariat industriel.

RecherchePaper
1 source
XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?
2arXiv cs.RO 

XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?

XEWorld, un banc d'essai contrôle présente par une équipe de recherche, évalué si les modèles du monde conditionnes par l'action, des simulateurs appris pour la manipulation robotique, généralisent a des robots jamais vus pendant l'entrainement. Le protocole isole la variable embodiment en testant des robots non vus dans des scènes physiquement identiques a celles de l'entrainement. Le constat est net: les modèles actuels se comportent avant tout comme des systèmes d'appariement visuel en 2D, dont la généralisation dépend de la similarité visuelle avec les robots déjà vus, et non de la similarité cinématique réelle. Consequence directe, ils peinent a traduire une commande articulaire numérique en trajectoire visuelle cohérente et échouent a prédire une évolution dynamique de la scene a partir d'une simple image statique de départ. Pour rendre correctement un embodiment inédit en zero-shot, il faut leur fournir des actions déjà projetées dans l'espace des pixels et un alignement spatio-temporel explicite, ce qui contourne le problème plutôt que de le résoudre. Meme quand l'adaptation few-shot permet de récupérer l'apparence du nouveau robot, elle declenche un oubli catastrophique des embodiments déjà appris. Ce résultat pèse directement sur l'industrie robotique: les modèles du monde sont promus comme des simulateurs bon marche pour entrainer des politiques VLA telles que Pi-0, GR00T N2 ou Helix, en complément ou en remplacement de la collecte de données réelles et des moteurs physiques classiques. Si ces simulateurs appris ne généralisent pas au-delà des robots vus a l'entrainement, chaque nouvel humanoïde, bras industriel ou plateforme mobile nécessiterait son propre modèle reentraine, ce qui fragilise la promesse d'un simulateur généraliste réutilisable d'un intégrateur a l'autre. L'étude agit aussi comme un correctif face a l'enthousiasme autour des architectures cross-embodiment: la généralisation apparente de certaines démonstrations tiendrait davantage a une ressemblance d'aspect entre robots qu'a une compréhension de la physique sous-jacente, un signal d'alerte pour quiconque évalué des annonces de transfert zero-shot entre plateformes. Cette limite s'inscrit dans une course plus large ou des laboratoires comme Google DeepMind, NVIDIA ou Physical Intelligence développent des modèles du monde et des politiques généralistes censées piloter des robots très différents avec un seul réseau, une démarche destinée a réduire le cout de la collecte de données robot par robot. XEWorld, publie en preprint sur arXiv début aout 2026, ne remet pas en cause l'utilité des modèles du monde en soi mais isole précisément le point de blocage actuel: la confusion entre apparence visuelle et dynamique physique. Les auteurs appellent a des innovations architecturales qui découplent explicitement ces deux dimensions, une piste qui conditionnera la capacité des prochaines générations de simulateurs appris a soutenir un entrainement véritablement cross-embodiment plutôt qu'un simple recyclage visuel de robots déjà connus.

RecherchePaper
1 source
AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage
3arXiv cs.RO 

AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage

Des chercheurs présentent AeroAct, un modèle "monde-action" (world-action model, WAM) conçu pour piloter des quadricoptères à partir de commandes en langage naturel. Selon les auteurs, il s'agit du premier WAM démontré en vol réel sur drone. Le système adapte un Transformer de diffusion vidéo pré-entraîné pour prédire, à partir de l'historique visuel à la première personne, de la proprioception et d'instructions textuelles, des séquences de trajectoires et d'actions locales. Pendant l'entraînement, le modèle apprend en prédisant les images futures que produirait chaque action, une supervision dense des conséquences visuelles, mais au moment du déploiement il calcule directement les commandes de vol sans générer de vidéo. Pour produire les données d'entraînement, l'équipe a construit un pipeline basé sur DiffAero combinant les moteurs de simulation Isaac Lab et le rendu par 3D Gaussian splatting, complété par un dispositif portatif à bas coût qui couple caméra et estimation de mouvement pour recréer des trajectoires de vol. Une procédure d'auto-guidage améliore la cohérence temporelle entre segments de trajectoire qui se chevauchent. Les tests, en simulation en boucle fermée et sur un quadricoptère physique réel, montrent des gains en suivi de cible et en recherche d'objets. L'intérêt est de dépasser les limites des méthodes actuelles de navigation aérienne par langage, qui reposent sur des actions discrètes, des points de passage ou des commandes de vitesse instantanées offrant peu d'information sur l'effet des actions sur les observations futures. En ancrant explicitement l'apprentissage dans la prédiction visuelle des conséquences du mouvement, AeroAct cherche à combler l'écart classique entre simulation et réalité pour les modèles vision-langage-action appliqués au vol, un enjeu clé pour les intégrateurs en inspection industrielle, cartographie ou recherche-sauvetage par drone. Le travail s'inscrit dans la vague plus large des modèles du monde appliqués à la robotique, où l'action est conditionnée par une anticipation visuelle plutôt que par des commandes bas niveau directes. Il reste à ce stade une publication de recherche arXiv, pas un produit commercialisé ni déployé en conditions opérationnelles ; les auteurs présentent des résultats préliminaires en simulation et sur banc de vol réel, sans indication de partenaire industriel ou de calendrier de mise en production.

RechercheActu
1 source
ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
4arXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io. L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique. Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

RecherchePaper
1 source