DAVIS : un cadre actif de bout en bout basé uniquement sur la profondeur pour le football humanoïde
Un article publié le 24 septembre 2026 sur arXiv (2609.28175) présente DAVIS, un framework qui apprend à des robots humanoïdes des gestes de contact au football à partir d'une seule caméra de profondeur montée sur la tête, sans module de perception ni de planification supplémentaire à l'exécution. Ce flux vidéo est combiné à un historique proprioceptif et à une commande de tâche optionnelle de faible dimension pour produire directement des cibles PD sur les 25 degrés de liberté du robot. Pour compenser les pertes fréquentes de vue du ballon dues aux mouvements du robot lui-même, DAVIS apprend une géométrie auxiliaire sensible à la visibilité et combine un recuit progressif de la vérité terrain vers la prédiction, des curricula de tâches et des a priori de mouvement de type AMP pour passer de la simulation au réel. Deux compétences, le tir cadré et le dribble directionnel, sont validées en simulation puis testées sur un robot réel, le Noetix E1, avec des études d'ablation à l'appui.
L'intérêt du travail tient à la contrainte qu'il s'impose : prouver qu'une seule caméra de profondeur, sans suivi externe ni pile de perception dédiée, suffit à des gestes dynamiques de contact en corps entier, ce qui réduirait le matériel et le calcul embarqué nécessaires à un déploiement réel. Cela nourrit le débat sur l'écart entre démonstrations simulées et comportement réel des humanoïdes, mais la validation reste limitée à deux gestes isolés sur un seul robot, pas à un match complet, ce qui appelle à la prudence sur la portée réellement démontrée. Pour les équipes de recherche en robotique, DAVIS propose surtout une méthode, pas un produit : une alternative plus frugale aux architectures VLA généralistes entraînées sur de vastes corpus multimodaux.
Ce travail s'inscrit dans l'essor du football comme banc d'essai pour les humanoïdes, terrain occupé depuis des années par la RoboCup Humanoid League et plus récemment par des démonstrations d'entreprises chinoises comme Unitree ou Booster Robotics. Noetix Robotics, dont le E1 sert ici de plateforme d'expérimentation réelle, reste un acteur peu connu hors de ce créneau académique. Contrairement aux modèles VLA généralistes comme Pi-0, GR00T N2 ou Helix, entraînés sur image RGB et langage pour la manipulation, DAVIS se limite volontairement à la profondeur, sans langage ni RGB, au service de gestes sportifs précis. Les auteurs annoncent des ablations complémentaires mais aucun calendrier de déploiement pilote, signe d'un travail encore au stade de la recherche académique plutôt que de la préparation commerciale.
Dans nos dossiers




