
AeroEval : validation par étapes du programme et de l'exécution pour les missions de drones générées par IA
Des chercheurs présentent AeroEval, un intergiciel (middleware) assisté par agents, conçu pour valider par étapes les missions de drone générées par des grands modèles de langage (LLM). Le système combine une analyse déterministe des programmes avec des agents LLM ancrés dans le contexte. Un premier étage vérifie la syntaxe, l'usage de l'API de la plateforme et la conformité à l'intention de la mission. Un second étage évalue le comportement réel à partir des trajectoires d'exécution, des exigences de mission et de l'environnement. Chaque étage renvoie des informations d'échec structurées, qui alimentent une régénération itérative du code. L'évaluation porte sur 20 tâches de navigation et cinq types de missions analytiques, dans les simulateurs AirSim et Gazebo. Le taux de réussite en navigation passe de 55 % à 95 %. Pris isolément, le validateur de code et le validateur de trajectoire atteignent respectivement 44 % et 56 % de réussite moyenne par exécution, contre 88 % pour la chaîne complète. Sur les missions d'analyse principales, le taux agrégé passe de 34 % pour AeroGen en une seule passe à 88 % dans le budget de régénération.
L'intérêt de ces résultats tient à l'écart qu'ils chiffrent entre un code qui compile et une mission qui fait ce que l'utilisateur voulait. Un programme syntaxiquement valide peut enfreindre une contrainte d'altitude, mal couvrir une zone, percuter un obstacle ou rater une transition événementielle. Les garde-fous par prompt ou les simples verdicts de simulateur localisent mal ces défauts. Le gain vient surtout de la complémentarité des deux étages, car aucun ne suffit seul : chacun reste sous 60 %, et leur combinaison dépasse 85 %. Pour les intégrateurs de drones autonomes, c'est un argument en faveur de validateurs structurés placés avant tout déploiement physique, avec des retours exploitables par le générateur. Les réserves sont nettes. Les résultats viennent uniquement de simulation, sur un nombre limité de tâches, avec un budget de régénération dont le coût en appels LLM n'est pas détaillé. Les auteurs eux-mêmes restreignent leurs conclusions à « l'environnement évalué ». Rien ne prouve donc encore que ces performances résistent au vent, au bruit de capteurs ou aux latences d'un vol réel.
Ce travail prolonge la ligne des systèmes de génération de code pour drones à partir de langage naturel, dont AeroGen sert ici de référence de base. Ces systèmes reposent surtout sur des consignes de sécurité dans le prompt ou sur le simple résultat d'une simulation, sans localisation fine de la défaillance. AeroEval s'inscrit dans le courant plus large de la vérification de code généré pour les systèmes cyber-physiques, où la boucle de rétroaction entre génération et exécution simulée devient un composant à part entière. Il s'agit d'une préimpression arXiv (v1), sans pilote industriel ni calendrier de déploiement annoncé. Les prochaines étapes logiques sont des essais en vol réel, une évaluation sur des plateformes et des scénarios plus variés, et une mesure du surcoût de calcul de la régénération guidée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




