Retrouver la vue : évaluation de la vision active physique pour surmonter les occlusions en manipulation robotique
Des chercheurs publient sur arXiv (2609.37292) BAVO-Bench, un benchmark de vision active bimanuelle (Bimanual Active Vision under Occlusion), accompagné d'une politique de contrôle baptisée A-FAR (Active Future-Aware Recovery). Le benchmark contrôle systématiquement la visibilité externe selon trois conditions : Clean (sans occultation), Stage Occlusion (occultation liée à une étape de la tâche) et Random-time Occlusion (occultation à un instant aléatoire). Il permet ainsi d'évaluer à la fois la performance de manipulation et la capacité du robot à retrouver une vue exploitable en déplaçant sa caméra. A-FAR pilote conjointement le point de vue et la manipulation. Elle exprime les observations d'une caméra mobile dans un repère 3D unique centré sur le robot. Elle distille ensuite, depuis un modèle 4D pré-entraîné, la structure relationnelle de la scène et son évolution future. La politique bénéficie donc d'un guidage géométrique anticipatif sans avoir besoin d'observations futures au déploiement. Les auteurs annoncent, sur plusieurs tâches de manipulation, une meilleure robustesse face aux occultations structurées et décalées dans le temps, avec des performances maintenues en conditions propres. Le résumé ne chiffre pas ces gains.
Le point de départ est un angle mort des évaluations actuelles. La plupart des benchmarks de manipulation supposent une caméra fixe ou des vues fiables. Ils testent donc peu la façon dont une politique se rétablit quand une observation utile disparaît en cours d'exécution, par exemple derrière un bras, un objet ou un opérateur. Or c'est fréquent en atelier ou en logistique, où les caméras montées sur le robot ou sur des poteaux sont régulièrement masquées. Un cadre reproductible qui sépare occultation liée à la tâche et occultation aléatoire donne aux équipes VLA et imitation learning un moyen comparable de mesurer cette robustesse. Le choix d'un dispositif bimanuel, proche des plateformes de téléopération à bas coût et des humanoïdes, en accroît la pertinence. Il faut toutefois rester prudent : il s'agit d'un travail académique, apparemment évalué en simulation ou en environnement contrôlé, sans déploiement industriel ni chiffres de taux de réussite dans le résumé. Il ne dit rien de l'écart entre démonstration et réalité.
Ce travail s'inscrit dans le courant de la perception active et des politiques conditionnées par la géométrie, qui cherche à dépasser les VLA entraînés sur des vues quasi statiques. L'usage d'un modèle 4D pré-entraîné comme « enseignant » relève d'une logique de distillation : la connaissance de la dynamique spatio-temporelle est intégrée à l'entraînement pour éviter un coût de calcul supplémentaire à l'inférence. Les suites logiques sont la publication du code et des données du benchmark, la comparaison avec des politiques généralistes comme Pi-0 ou GR00T, puis la validation sur robot réel avec caméra poignet ou tête mobile. Cette dernière étape déterminera si l'approche dépasse le cadre de l'évaluation académique.
Dans nos dossiers



