VGM-VS : repenser le modèle de géométrie visuelle pour l'asservissement visuel de haute précision
Des chercheurs présentent VGM-VS, une méthode d'asservissement visuel (visual servoing) construite sur un modèle de géométrie visuelle pré-entraîné de type feed-forward, décrite dans un preprint publié sur arXiv le 28 septembre 2026 (arXiv:2609.28312v1). Le système compare l'image courante à une image de référence capturée à la configuration cible, estime la pose relative de la caméra via ce modèle de géométrie, puis l'applique de façon itérative comme incrément de pose dans un schéma classique de servoing par pose en boucle fermée (PBVS). Pour résoudre l'ambiguïté d'échelle propre à ces modèles, qui ne fournissent qu'une translation à un facteur près alors que le contrôle robotique exige une valeur métrique, les auteurs ajoutent une étape d'adaptation métrique spécifique à la scène : le robot enregistre lui-même des paires image-pose le long d'une trajectoire prédéfinie partant de la pose cible, données qui servent à réentraîner la tête caméra du modèle et à apprendre conjointement la transformation main-œil, sans calibration dédiée. La méthode a été testée sur trois tâches d'assemblage réel à tolérances serrées : prise d'un câble USB-C, insertion de câble et insertion de barrette RAM. Fonctionnant en temps réel à 30 Hz, VGM-VS atteint une précision terminale submillimétrique sur les tâches de câble et des taux de réussite de 90 à 100 % lorsque la cible est déplacée en cours de servoing, tout en convergeant systématiquement pour des déplacements initiaux allant jusqu'à 30 cm et une occlusion de 50 % de l'objet cible.
Pour les intégrateurs industriels et les équipes de manipulation fine, ce résultat s'attaque directement à deux limites récurrentes du servoing visuel classique : la fragilité face aux occlusions et aux textures pauvres, et la dépendance à une calibration main-œil lourde et propre à chaque installation. En s'appuyant sur la représentation géométrique acquise lors d'un pré-entraînement à grande échelle, la méthode conserve une estimation de pose fiable même quand la cible n'occupe qu'une petite partie de l'image, un scénario fréquent en assemblage électronique où les composants (câbles, connecteurs, barrettes) sont petits et partiellement masqués. Le résultat suggère que les modèles de géométrie visuelle génériques, initialement conçus pour la reconstruction 3D ou la localisation, peuvent être adaptés à moindre coût pour du contrôle robotique métrique de haute précision, sans passer par un pipeline de calibration dédié ni par un réentraînement complet du modèle.
Le papier ne précise pas l'institution ni les auteurs à l'origine du travail, et reste à ce stade un preprint non encore évalué par les pairs, ce qui invite à la prudence sur la généralisation des taux de succès annoncés au-delà des trois tâches testées. Le travail s'inscrit dans la lignée des approches combinant servoing basé pose (PBVS) et représentations apprises, en se positionnant face aux méthodes de servoing classiques utilisées comme référence de comparaison dans l'étude. Aucune feuille de route de déploiement industriel ni de partenariat n'est mentionnée à ce stade ; la validation reste limitée à des démonstrations en laboratoire sur des bancs d'assemblage électronique.
Dans nos dossiers




