DrivingBench : les modèles vision-langage peuvent-ils conduire une Toyota Corolla ?
DrivingBench, un nouveau benchmark publié sur arXiv (2609.38948), place pour la première fois, à la connaissance de ses auteurs, des modèles vision-langage généralistes aux commandes d'une vraie voiture. Les modèles reçoivent les images d'une caméra montée sur une Toyota Corolla via trois outils, puis commandent directement l'angle de volant et la vitesse sur un parcours de cônes dans un parking, à basse vitesse. Le véhicule peut continuer à rouler pendant que le modèle réfléchit, et chaque nouvelle commande remplace celle en cours. Quatre modèles ont été testés dans leurs environnements natifs (Codex, Claude Code, Cursor), avec jusqu'à trois tentatives par conversation: GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol et Grok 4.6. Seul Astra termine le parcours, à sa deuxième tentative. Aucun autre modèle ne dépasse 50 % du tracé. Deux des quatre progressent nettement d'une tentative à l'autre lorsqu'ils conservent leur contexte.
L'intérêt tient à ce que le test mesure ce que les benchmarks numériques ignorent: la boucle complète observer, agir, surveiller, corriger et tenir un objectif long sous contrainte de latence. Ici, le temps d'inférence fait partie de la tâche, puisque la voiture avance pendant que le modèle délibère. Le résultat tempère l'idée que de bons scores sur des tâches logicielles se transfèrent mécaniquement au monde physique: un seul modèle sur quatre boucle un parcours à basse vitesse, sur un terrain dégagé et sans trafic. L'amélioration entre tentatives suggère aussi que la mémoire de contexte compense en partie le manque de précision spatiale, ce qui intéresse les concepteurs d'agents pour la robotique mobile. Les auteurs relèvent enfin que le format de sortie des outils et la formulation de la consigne ont suffi à décider si un modèle conduisait ou refusait, un point de fragilité à garder en tête pour toute intégration industrielle.
Ce travail s'inscrit dans le débat sur l'écart entre compétence numérique et compétence incarnée. Il se distingue des approches de conduite autonome classiques, entraînées de bout en bout ou spécialisées sur des données routières, car il évalue des modèles généralistes sans entraînement dédié. Il diffère aussi des VLA robotiques, conçus pour émettre des actions à haute fréquence. Ici, la boucle de contrôle passe par des agents de code, avec une latence qui reste élevée. Il faut rester prudent: l'échantillon est de quatre modèles, avec trois essais maximum, ce qui limite la portée statistique, et le test n'évalue pas la sécurité. Les auteurs publient le harnais, les prompts, la carte du parcours et les traces avec vidéo et télémétrie, ce qui permet à d'autres laboratoires de reproduire et d'étendre l'expérience, par exemple avec des vitesses plus élevées ou des environnements plus complexes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




