
Skytopia : navigation de drone monoculaire par modèles du monde latents conditionnés par l'action
Une équipe de recherche publie Skytopia, une politique de navigation pour drones équipés d'une seule caméra orientée vers l'avant, dans un preprint arXiv (identifiant 2609.26007) mis en ligne fin septembre 2026. Le système repose sur un modèle du monde latent conditionné par l'action, entraîné sur une plateforme de simulation par 3D Gaussian Splatting conçue pour l'occasion. Deux objectifs d'entraînement sont combinés : un objectif direct qui prédit la représentation de la prochaine observation à partir du mouvement prévu, et un objectif inverse qui retrouve ce mouvement à partir de la transition prédite. Particularité du système, le module de prédiction est écarté après l'entraînement, seule la représentation qu'il produit sert au déploiement, ce qui permet à une politique unique de gérer trois modes de navigation : point-goal, image-goal et sans objectif explicite (goal-free). En simulation, Skytopia atteint des taux de réussite de 57,8%, 66,0% et 49,0% selon ces trois configurations, devant toutes les références testées, et l'abandon du prédicteur réduit le coût de calcul à l'inférence de 59,4%. La même politique, sans aucun réglage fin supplémentaire, a ensuite été déployée sur un drone physique et a atteint ses objectifs en intérieur, en extérieur dégagé et en forêt.
La navigation monoculaire, sans lidar ni caméra stéréo, reste un problème difficile pour les drones car une image unique fournit peu d'indices sur la profondeur et l'échelle des objets, ce qui complique le transfert simulation-vers-réel sur des plateformes légères. L'argument central des auteurs est que ce dont une politique a besoin d'un modèle du monde n'est pas la prédiction elle-même mais la représentation qui permet de la produire, puisqu'en vol l'action exécutée explique presque tout le changement observé entre deux images. Se débarrasser du prédicteur au moment du déploiement fait chuter le coût d'inférence de près de 60%, un enjeu direct pour l'embarqué sur des drones aux budgets de calcul et d'énergie limités. Le transfert réussi, sans réentraînement, vers trois environnements très différents constitue un signal utile pour les équipes qui parient sur des politiques de navigation entraînées entièrement en simulation. Il faut toutefois relativiser : des taux de réussite entre 49% et 66% restent modestes, et les tests ont été menés à l'échelle d'un laboratoire de recherche, loin d'un déploiement en flotte ou d'une validation industrielle.
Ce travail s'inscrit dans une tendance plus large à utiliser des modèles du monde pour la prise de décision d'agents embarqués, déjà explorée côté manipulation et locomotion robotique, mais appliquée ici à la navigation aérienne avec une seule caméra, une configuration de perception plus contrainte que les plateformes multi-caméras ou équipées de lidar. Le choix d'entraîner la politique dans un environnement de 3D Gaussian Splatting plutôt que dans un simulateur photoréaliste classique reflète un mouvement plus général vers le rendu neuronal pour accélérer les pipelines d'entraînement. À la différence des architectures où le prédicteur reste actif à l'inférence et réinjecte sa sortie dans la génération d'action à chaque pas de contrôle, la norme pour la plupart des politiques fondées sur un modèle du monde, Skytopia traite ce module comme un outil auxiliaire réservé à l'entraînement. Publié comme simple preprint, l'article n'annonce ni partenaire industriel ni déploiement pilote ; la suite logique serait une validation sur un plus grand nombre d'environnements et une intégration dans des piles logicielles commerciales de drones autonomes.
Dans nos dossiers




