DevGRU : navigation visuelle guidée par la profondeur avec modèle récurrent conscient des collisions
Des chercheurs présentent DevGRU (arXiv:2608.18470v1, prépublication mise en ligne le 20 août 2026), un système de navigation visuelle pour robots conditionné par image de profondeur et point de destination (point-goal). Le cœur du système est un prédicteur d'action (action predictor, AP) qui génère des trajectoires futures tenant compte des collisions, permettant d'éviter les obstacles immédiats. Un second module, le prédicteur de collision, travaille en tandem avec l'AP pour compenser les erreurs accumulées dans l'estimation de la pose cible et anticiper les déviations de trajectoire avant qu'elles ne se produisent. Les auteurs ont évalué leur méthode sur neuf scènes différentes, en la comparant à trois approches de référence considérées comme état de l'art (ViNT, NoMaD et NavDP) ainsi qu'à quatre variantes supplémentaires de ViNT et NoMaD. DevGRU surpasse nettement ViNT et NoMaD en performance de navigation, tout en utilisant un nombre de paramètres entraînables nettement plus faible : le modèle est 7 fois plus compact que NavDP et son temps d'inférence est 17 fois plus rapide.
L'enjeu que cible ce travail est concret pour l'industrie : les modèles de navigation dits "fondation", censés généraliser d'une plateforme robotique à l'autre, échouent souvent dans des environnements intérieurs structurés, en particulier dans les passages étroits, où les collisions restent fréquentes malgré des démonstrations convaincantes en conditions contrôlées. En traitant explicitement la prédiction de collision comme un signal de correction plutôt qu'un simple filtre a posteriori, DevGRU illustre une piste pour combler cet écart entre démonstration et fiabilité réelle. Le gain en légèreté et en vitesse d'inférence est également significatif pour les intégrateurs, puisqu'il ouvre la voie à un déploiement embarqué sur du matériel de calcul limité, sans dépendre d'une infrastructure de calcul déportée.
Ce travail s'inscrit dans la lignée des modèles de navigation généralistes issus de la recherche académique, dont ViNT et NoMaD sont des jalons de référence, avec NavDP comme benchmark plus récent. Il s'agit à ce stade d'une publication de recherche (arXiv, type "new"), sans lien annoncé avec une entreprise, un produit commercial ou un déploiement réel signalé. Aucun pilote industriel ni calendrier de mise en production n'est mentionné dans l'article.
Dans nos dossiers




