Aller au contenu principal
RecherchearXiv cs.RO 

VGM-VS : repenser le modèle de géométrie visuelle pour l'asservissement visuel de haute précision

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VGM-VS, une méthode d'asservissement visuel (visual servoing) construite sur un modèle de géométrie visuelle pré-entraîné de type feed-forward, décrite dans un preprint publié sur arXiv le 28 septembre 2026 (arXiv:2609.28312v1). Le système compare l'image courante à une image de référence capturée à la configuration cible, estime la pose relative de la caméra via ce modèle de géométrie, puis l'applique de façon itérative comme incrément de pose dans un schéma classique de servoing par pose en boucle fermée (PBVS). Pour résoudre l'ambiguïté d'échelle propre à ces modèles, qui ne fournissent qu'une translation à un facteur près alors que le contrôle robotique exige une valeur métrique, les auteurs ajoutent une étape d'adaptation métrique spécifique à la scène : le robot enregistre lui-même des paires image-pose le long d'une trajectoire prédéfinie partant de la pose cible, données qui servent à réentraîner la tête caméra du modèle et à apprendre conjointement la transformation main-œil, sans calibration dédiée. La méthode a été testée sur trois tâches d'assemblage réel à tolérances serrées : prise d'un câble USB-C, insertion de câble et insertion de barrette RAM. Fonctionnant en temps réel à 30 Hz, VGM-VS atteint une précision terminale submillimétrique sur les tâches de câble et des taux de réussite de 90 à 100 % lorsque la cible est déplacée en cours de servoing, tout en convergeant systématiquement pour des déplacements initiaux allant jusqu'à 30 cm et une occlusion de 50 % de l'objet cible.

Pour les intégrateurs industriels et les équipes de manipulation fine, ce résultat s'attaque directement à deux limites récurrentes du servoing visuel classique : la fragilité face aux occlusions et aux textures pauvres, et la dépendance à une calibration main-œil lourde et propre à chaque installation. En s'appuyant sur la représentation géométrique acquise lors d'un pré-entraînement à grande échelle, la méthode conserve une estimation de pose fiable même quand la cible n'occupe qu'une petite partie de l'image, un scénario fréquent en assemblage électronique où les composants (câbles, connecteurs, barrettes) sont petits et partiellement masqués. Le résultat suggère que les modèles de géométrie visuelle génériques, initialement conçus pour la reconstruction 3D ou la localisation, peuvent être adaptés à moindre coût pour du contrôle robotique métrique de haute précision, sans passer par un pipeline de calibration dédié ni par un réentraînement complet du modèle.

Le papier ne précise pas l'institution ni les auteurs à l'origine du travail, et reste à ce stade un preprint non encore évalué par les pairs, ce qui invite à la prudence sur la généralisation des taux de succès annoncés au-delà des trois tâches testées. Le travail s'inscrit dans la lignée des approches combinant servoing basé pose (PBVS) et représentations apprises, en se positionnant face aux méthodes de servoing classiques utilisées comme référence de comparaison dans l'étude. Aucune feuille de route de déploiement industriel ni de partenariat n'est mentionnée à ce stade ; la validation reste limitée à des démonstrations en laboratoire sur des bancs d'assemblage électronique.

Dans nos dossiers

À lire aussi

Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)
1arXiv cs.RO 

Modèles du monde alignés sur la progression pour l'asservissement visuel en boucle fermée (WM-VS)

Des chercheurs ont publié sur arXiv en septembre 2026 un article décrivant WM-VS (World Model for Visual Servoing), un cadre d'asservissement visuel en boucle fermée fonde sur un modèle du monde aligne sur la progression de la tache. Le système utilise des correspondances DINOv2 calculées hors ligne sur une région cible pour définir une coordonnée de servo signée en quatre dimensions (translation, échelle, rotation dans le plan). L'entrainement se fait en deux étapes: la première aligne les transitions latentes conditionnées par l'action sur cette coordonnée, la seconde gelé le modèle du monde et entraine une politique réactive de vitesse articulaire via imitation d'action, supervision des conséquences et courtes projections imaginées favorisant la réduction d'erreur. Le déploiement se fait uniquement en RGB, de manière réactive, sans optimisation de trajectoire en ligne. Sur un bras réel a 7 degrés de liberté en configuration camera fixe (eye-to-hand), l'erreur RMSE sur les coins de la cible descend a 10% ou moins de sa valeur initiale dans 30 essais sur 30, et ce critère est maintenu jusqu'a la dernière image valide dans 25 essais sur 30, soit 83,33%. Retirer l'alignement sur l'erreur future fait chuter ce taux a 26,67%. Le signal de progression appris corrélé avec une mesure externe d'erreur par marqueur AprilTag non utilisée pour l'entrainement (coefficient de Spearman de 0,8778). Sans reentrainement, sur deux cibles 3D inédites, les auteurs rapportent des réductions d'erreur de translation de 86,48% et 90,27%, et de rotation de 70,01% et 65,70%. Code et données sont annonces pour une publication ultérieure en open source, mais ne sont pas encore disponibles. Le problème cible n'est pas cosmétique pour l'asservissement visuel industriel: la plupart des modèles du monde prédisent des états plausibles sans indiquer si une action réduit réellement l'erreur de tache, un écart que les auteurs nomment le "prédiction-control mismatch". Combler ce manque intéressé directement les intégrateurs qui cherchent des bras capables de corriger leur trajectoire en boucle fermée a partir d'une simple camera RGB, sans capteur de profondeur ni calcul de trajectoire couteux en ligne. Le résultat le plus parlant reste la généralisation a des cibles jamais vues, avec des réductions d'erreur supérieures a 65% sans reentrainement, qui suggère que le signal appris capture une notion géométrique transférable plutôt qu'un simple mimétisme des trajectoires d'entrainement. La validation reste toutefois limitée a un seul bras en laboratoire et a un petit jeu de cibles: rien n'indique la robustesse face aux occlusions, variations d'éclairage ou objets déformables d'un entrepôt ou d'une ligne d'assemblage réelle. Cette approche s'inscrit dans la vague des modèles du monde appliques au contrôle robotique, un axe distinct mais complémentaire des architectures vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la manipulation généraliste pilotée par instructions en langage naturel. WM-VS se concentre plus étroitement sur l'asservissement visuel classique, en le rendant réactif grâce a un apprentissage explicitement aligne sur la réduction d'erreur plutôt que sur la seule plausibilité visuelle. Les auteurs présentent ce travail comme une preuve de concept méthodologique avant diffusion plus large du code et des données. Aucun partenaire industriel, site pilote ou calendrier de déploiement n'est mentionne, ce qui situe cette contribution au stade de la recherche académique et non du produit prêt a l'emploi.

RecherchePaper
1 source
HABILIS Brain 0 : supervision par changement de géométrie pour modèles vision-langage-action et récupération de flux résiduel
2arXiv cs.RO 

HABILIS Brain 0 : supervision par changement de géométrie pour modèles vision-langage-action et récupération de flux résiduel

Une équipe de recherche a publié le 23 septembre 2026 sur arXiv (référence 2609.25558) une architecture nommée HABILIS Brain 0, construite autour d'un modèle appelé GC-VLA (Geometry-Change Vision-Language-Action). Plutôt que de s'appuyer sur la géométrie de la scène à l'instant présent, comme le font la plupart des politiques vision-langage-action, ce modèle apprend à prédire des tokens de changement géométrique multi-vues sur un horizon de 0,5 seconde, calculés hors ligne à partir de paires d'images avant/après. L'entraînement se fait en quatre étapes: un modèle vision-langage dédié au changement géométrique (GC-VLM), un module d'action continu (ActionExpert) aligné sur les commandes robotiques sans rétropropager de gradients vers le VLM, une phase où cette rétropropagation est activée pour mettre à jour les deux ensembles conjointement, puis, une fois GC-VLA gelé, l'ajout d'un correctif résiduel nommé Geometry-Conditioned Residual Flow (GCRF), piloté par un routeur d'intervention binaire et une politique de vélocité bornée apprise en boucle fermée. Sur le benchmark de simulation LIBERO, GC-VLA seul atteint 95,20% de réussite, et la version complète avec GCRF grimpe à 99,55%. Ces chiffres proviennent uniquement d'un environnement simulé académique, pas d'un déploiement industriel, une nuance qui compte dans un secteur où l'écart entre performances démontrées et robustesse en conditions réelles reste une source récurrente de scepticisme. L'intérêt de GC-VLA tient surtout à sa promesse d'un préentraînement indépendant de l'embodiment, exploitable sur des vidéos robotiques et égocentriques génériques avant l'alignement spécifique à un bras ou un humanoïde donné, une piste qui parle directement aux intégrateurs cherchant à mutualiser des modèles de perception entre plateformes matérielles différentes plutôt que de réentraîner un modèle par robot. Le score de 99,55% sur LIBERO, bien qu'élevé, reste un résultat de benchmark standard en simulation et ne présume pas d'une performance équivalente hors laboratoire. Ce travail s'inscrit dans la lignée des politiques vision-langage-action récentes telles que Pi-0, GR00T N2 ou Helix, qui combinent perception, langage et contrôle moteur dans un même réseau, mais s'en distingue par une supervision explicite du changement géométrique plutôt que par une géométrie statique de la scène. La construction en couches successives, VLM figé puis dégelé puis correction résiduelle apprise en boucle fermée, dessine une feuille de route où chaque étape peut être publiée et évaluée séparément avant un éventuel transfert vers du matériel physique, une étape que cette publication n'aborde pas encore.

RechercheOpinion
1 source
Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)
3arXiv cs.RO 

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)

Des chercheurs proposent T³VF (Test-Time Training Visual Foresight VLA), une méthode d'adaptation à l'inférence publiée sur arXiv en mai 2025 (réf. 2605.08215). Les architectures Visual Foresight VLA, qui figurent parmi les plus performantes pour le contrôle de robots manipulateurs, fonctionnent en deux temps : elles prédisent d'abord une image future représentant l'état visuel attendu après l'action, puis génèrent la commande motrice à partir de cette prédiction. Cette dépendance en cascade crée une vulnérabilité double aux situations hors-distribution (OOD) : une prédiction visuelle dégradée corrompt directement la décision motrice en aval. T³VF exploite l'écart entre l'image future prédite et l'observation réellement reçue comme signal de supervision naturel, permettant au modèle de s'ajuster en continu pendant l'exécution, sans modification architecturale ni modules auxiliaires. Un mécanisme de filtrage adaptatif sélectionne les mises à jour pertinentes pour éviter la dérive par accumulation d'erreurs indiscriminée. Pour les équipes de déploiement, l'enjeu est direct : les VLA sont benchmarkés en laboratoire mais confrontés en production à des variations de scène (éclairage, textures, disposition des objets) rarement couvertes par les données d'entraînement. T³VF propose une adaptation sans annotation humaine ni nouvelle session d'entraînement, le robot se corrigeant à partir de ses propres observations, avec un surcoût d'inférence qualifié de modeste par les auteurs, une affirmation à vérifier selon les environnements cibles. Si les résultats se confirment à plus grande échelle, la méthode pourrait réduire les cycles de re-fine-tuning lors du passage en production, un poste de coût opérationnel significatif pour les intégrateurs industriels. Les VLA s'imposent depuis 2023 comme architecture dominante en manipulation robotique, portés par des modèles comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 de Physical Intelligence. Les variantes Visual Foresight, qui ajoutent une prédiction d'état futur avant l'action, ont montré des gains sur les tâches de précision, mais leur fragilité face aux shifts de distribution restait peu adressée dans la littérature. Ce travail s'inscrit dans un courant croissant de Test-Time Training (TTT) appliqué à la robotique, distinct du fine-tuning classique en ce qu'il n'exige aucune supervision externe. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné : ce pré-print académique ne décrit pas de produit ou de déploiement commercialisé associé.

RechercheOpinion
1 source
ART-VS : tuilage à résolution adaptative pour l'asservissement visuel par Vision Transformer
4arXiv cs.RO 

ART-VS : tuilage à résolution adaptative pour l'asservissement visuel par Vision Transformer

Une équipe de chercheurs propose ART-VS (Adaptive Resolution Tiling Visual Servoing), une méthode en deux phases pour le servo-visuel robotique exploitant des descripteurs de Vision Transformer (ViT) auto-supervisés, sans aucun entraînement spécifique à la tâche. Le principe : une première phase à résolution native assure un alignement grossier robuste, puis une seconde phase découpe l'image en tuiles haute résolution et restreint la mise en correspondance aux voisinages locaux pour affiner la précision finale. Sur le banc de test standard sous perturbations, ART-VS atteint 95,4% de convergence, contre 76,6% pour l'approche ViT standard et 81,0% pour le traitement pleine résolution, soit respectivement +18,8 et +14,4 points. La méthode s'exécute plus de 10 fois plus vite que l'approche pleine résolution tout en consommant 27% moins de VRAM, réduisant l'erreur de positionnement de 53% par rapport au ViT standard. En validation réelle sur des instances jamais vues à l'entraînement, ART-VS atteint 95/100 sur des bouteilles transparentes et 98/100 sur des chaussures, sur trois architectures ViT distinctes. Ces résultats comptent dans le débat sur la généralisabilité des approches visuelles en robotique. La saisie d'objets transparents à 95% de réussite sans données d'entraînement spécifiques constitue une démonstration concrète de la valeur des descripteurs ViT fondés sur l'auto-supervision (DINO, DINOv2), que les méthodes classiques basées sur la profondeur ou la texture peinent structurellement à gérer. Pour les intégrateurs et les équipes robotiques industrielles, l'absence de fine-tuning élimine une friction majeure au déploiement multi-catégories, et le gain d'efficacité computationnelle ouvre la voie à des boucles de servo-visuel embarquées ou à faible latence. La réduction de 53% de l'erreur de positionnement est particulièrement pertinente pour les tâches d'assemblage ou d'insertion à tolérance serrée. ART-VS s'inscrit dans un courant qui exploite les modèles fondationnels visuels pré-entraînés comme socle pour le contrôle robotique sans annotation. Le servo-visuel classique reposait sur des descripteurs artisanaux (SIFT, SURF) ou des pipelines supervisés, tous deux limités en généralisation inter-objets. L'utilisation de ViT auto-supervisés pour générer des correspondances denses avait déjà montré des résultats prometteurs, mais le compromis entre résolution grossière (robuste, imprécise) et haute résolution (précise, coûteuse) restait non résolu. Le travail est publié en preprint sur arXiv (2606.19089), le code étant disponible publiquement. Les suites naturelles incluront la validation en environnements industriels contraints et l'intégration avec des architectures Vision-Language-Action (VLA) pour des tâches de manipulation longue séquence.

RecherchePaper
1 source