DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation
Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor.
L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé.
Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




