Aller au contenu principal
VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation
RecherchearXiv cs.RO 

VGGT-DP : contrôle robotique généralisable via des modèles de vision fondation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de VGGT-DP ont publié une version révisée de leur article sur arXiv (arXiv:2509.18778v2) présentant un nouveau cadre d'apprentissage par imitation visuelle pour le contrôle de robots manipulateurs. Le système utilise comme encodeur visuel le Visual Geometry Grounded Transformer (VGGT), un modèle de perception 3D pré-entraîné, combiné à un retour proprioceptif pour aligner la perception visuelle avec l'état interne du robot. Pour limiter la latence d'inférence, les auteurs introduisent un mécanisme de réutilisation de jetons image par image (frame-wise token reuse, FTR), qui met en cache les jetons de l'agrégateur VGGT issus des images qui se chevauchent et ne recalcule les caractéristiques que pour la dernière image reçue. Un élagage aléatoire de jetons est aussi appliqué pour réduire le surapprentissage. Sur les tâches de manipulation du banc d'essai simulé MetaWorld, VGGT-DP dépasse les références Diffusion Policy (DP) et DP3, en particulier sur les scénarios exigeant de la précision et sur les tâches à long horizon temporel.

L'apport principal tient au fait que la majorité des travaux en apprentissage par imitation se concentrent sur l'architecture de la politique de contrôle, souvent des modèles de diffusion, en négligeant la qualité de l'encodeur visuel et sa capacité de compréhension spatiale. En ancrant la perception dans des a priori géométriques 3D et en la couplant à la proprioception, VGGT-DP cherche à réduire l'écart entre ce que le robot perçoit et ce qu'il ressent physiquement, un facteur d'échec fréquent des politiques visuomotrices en boucle fermée. La réduction de la latence via la réutilisation de jetons est pertinente pour un déploiement temps réel sur du matériel embarqué à ressources de calcul limitées. Toutefois, les résultats reposent uniquement sur MetaWorld, un environnement simulé, sans validation sur robot réel ni chiffres de transfert sim-to-real.

Ce travail s'inscrit dans la course plus large aux modèles fondation pour la robotique, aux côtés d'approches vision-langage-action comme Pi-0, GR00T N2 ou Helix, mais s'en distingue en misant sur la fusion vision 3D-proprioception plutôt que sur le conditionnement par le langage. Le statut "replace" sur arXiv indique une révision d'une soumission antérieure. Aucune information n'est donnée sur une publication du code, un partenaire industriel ou un déploiement sur robot physique: le travail reste à un stade académique, la prochaine étape logique étant une validation en conditions réelles et une éventuelle intégration avec des modèles VLA conditionnés par le langage.

À lire aussi

FP2 : doter les modèles fondation robotiques d'un contrôle de force
1arXiv cs.RO 

FP2 : doter les modèles fondation robotiques d'un contrôle de force

Des chercheurs publient sur arXiv (2609.37433) FP2, une interface logicielle légère qui ajoute un contrôle de force explicite aux modèles de fondation robotiques (RFM) déjà adaptés à une tâche. L'architecture sépare l'action de la régulation. Le RFM adapté joue le rôle de politique de fondation et génère les actions au niveau de la tâche. Une seconde politique, à haute fréquence, s'occupe uniquement de réguler l'interaction. Pour savoir quoi réguler, FP2 compresse les représentations contextuelles de la politique de fondation, les combine avec les historiques de torseur (wrench, force et couple) et de proprioception, puis prédit des paramètres de contrôle de force structurés. L'évaluation porte sur quatre backbones de RFM et quatre tâches de manipulation réelles riches en contacts. Selon les auteurs, FP2 améliore de façon constante la performance de tâche et la qualité de régulation de force par rapport aux politiques de fondation seules, et se compare favorablement à des méthodes de référence sensibles à la force ou fondées sur le contrôle de force. Le résumé ne donne ni taux de réussite, ni fréquences de boucle, ni noms de backbones ou de tâches. L'intérêt tient à un point faible connu des VLA et autres modèles généralistes : ils produisent des trajectoires plausibles, mais l'interaction physique fiable (insertion, essuyage, assemblage, contact avec des objets déformables) exige une régulation de force que ces modèles, cadencés bien en dessous du kHz, n'assurent pas nativement. FP2 propose une voie pragmatique : ne pas réentraîner le modèle de fondation, mais lui greffer une couche de bas niveau. Les ablations indiquent que le contexte de la politique de fondation et le retour physique sont complémentaires, et que conserver la génération d'actions du RFM améliore l'efficacité comme la généralisation à des objets nouveaux. Pour un intégrateur, cela plaide pour une architecture en couches plutôt que pour des modèles de bout en bout dotés de capteurs de force. Réserve : il s'agit d'un préprint non évalué par les pairs, et le nombre limité de tâches ne dit rien de la robustesse en production, du coût du capteur de torseur ni de la latence ajoutée. Ces travaux s'inscrivent dans un mouvement plus large. Les modèles de fondation robotiques comme Pi-0, GR00T ou Helix ont surtout été validés sur des tâches où la vision et la position dominent. Les approches « force-aware » existantes injectent la force comme simple entrée du modèle, tandis que le contrôle d'impédance ou d'admittance classique reste réglé à la main. FP2 se place entre les deux en apprenant les paramètres du contrôleur à partir du contexte. La suite dépendra de la publication du code et des résultats détaillés sur le site du projet (force-policy.github.io/fp2), ainsi que d'une validation sur d'autres plateformes et tâches industrielles. Aucun pilote ni calendrier de déploiement n'est annoncé, et aucun acteur français ou européen n'est cité dans le résumé.

RecherchePaper
1 source
Insertion robotique généralisable grâce aux modèles du monde
2arXiv cs.RO 

Insertion robotique généralisable grâce aux modèles du monde

Une équipe de recherche décrit, dans un article publié sur arXiv en septembre 2026 sous le titre "Generalizable Robotic Insertion with World Models" (identifiant 2609.28258v1), un système d'insertion robotique généraliste construit autour d'un modèle du monde (world model) entraîné sur un seul réseau couvrant jusqu'à 90 tâches d'insertion différentes, portant sur des pièces aux géométries variées. Le modèle combine les données proprioceptives du bras robotique avec les images brutes issues d'une caméra montée sur le poignet. Sur des objets totalement inédits, dont la géométrie n'a jamais été vue pendant l'entraînement, le système atteint un taux de réussite de 56% en zero-shot, contre seulement 7% pour une base de référence model-free entraînée dans les mêmes conditions. Les chercheurs montrent aussi que la performance progresse à mesure que le nombre d'objets inclus dans le jeu d'entraînement augmente, signe d'une bonne scalabilité. Un fine-tuning du modèle généraliste sur des objets exclus de l'entraînement initial améliore par ailleurs nettement l'efficacité en données par rapport à un entraînement from scratch, et dépasse parfois ses performances asymptotiques. Ce résultat s'attaque à un goulot d'étranglement connu de l'assemblage robotique en forte mixité de références: les approches actuelles, même très performantes, reposent sur des politiques spécialisées entraînées pièce par pièce, ce qui rend le déploiement sur une nouvelle référence lent et coûteux en ingénierie. Un système capable de généraliser à des pièces jamais vues changerait potentiellement l'équation pour les intégrateurs et les lignes à forte variabilité, en réduisant le travail de reprogrammation à chaque changement de produit. Les auteurs présentent leur travail comme le premier système capable d'assembler des objets inédits de façon entièrement pilotée par les données, sans modélisation géométrique explicite préalable, ce qui alimente le débat sur la capacité réelle des architectures génériques à tenir la charge en manipulation fine, un terrain où l'écart entre démonstration et fiabilité industrielle reste habituellement large. Ce travail s'inscrit dans la tendance de fond de la robotique de manipulation, où la recherche cherche à remplacer les politiques spécialisées task-specific par des modèles généralistes transférables d'un objet ou d'une tâche à l'autre, dans la lignée des efforts en cours autour des architectures vision-langage-action. Il reste à ce stade un résultat de recherche publié en preprint, sans partenaire industriel cité, ni site de déploiement, ni calendrier de commercialisation: les auteurs parlent d'une étape significative vers des systèmes d'assemblage généralisables et scalables, formulation à lire comme un jalon scientifique plutôt qu'une annonce produit. Les suites attendues pour ce type d'approche sont l'extension à davantage de tâches et de géométries, ainsi qu'une validation en conditions de production réelles, où robustesse et temps de cycle devront être mesurés au-delà des benchmarks de laboratoire.

RecherchePaper
1 source
Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage
3arXiv cs.RO 

Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage

Des chercheurs proposent les Large Reward Models (LRM), un cadre qui transforme des modèles vision-langage (VLM) de base en générateurs de récompense image par image, destinés à affiner des politiques de manipulation robotique. Le VLM de pointe retenu est spécialisé sur un jeu de données multi-sources : trajectoires de robots réels, interactions humain-objet et environnements de manipulation simulés. Contrairement aux approches qui évaluent les trajectoires a posteriori, les LRM exposent trois interfaces de récompense à partir des seules observations visuelles : estimation de progression, détection d'achèvement de la tâche et comparaison contrastive temporelle. Partant d'une politique apprise par imitation (IL), les auteurs utilisent ces signaux pour guider un affinage par PPO sur des tâches de manipulation à long horizon non vues pendant l'entraînement. La récompense de progression s'impose comme le meilleur signal en ligne sans information privilégiée : elle améliore la politique IL de référence et réduit l'écart avec les récompenses « privilégiées » issues de l'état interne de l'environnement. Côté matériel réel, elle sert à pondérer un clonage comportemental (behavioral cloning) selon la progression, sur quatre tâches de manipulation et deux plateformes robotiques, avec un gain sur le fine-tuning supervisé (SFT) classique dans les quatre cas. Le résumé ne donne ni modèle de VLM, ni taux de réussite chiffrés, ni noms de robots. L'enjeu est celui d'un goulot d'étranglement bien connu : l'apprentissage par renforcement (RL) peut améliorer les politiques de manipulation, mais écrire une fonction de récompense à la fois sémantiquement pertinente et réutilisable d'une tâche à l'autre reste coûteux, et se fait aujourd'hui surtout à la main, tâche par tâche. Si ces résultats se confirment, un VLM spécialisé pourrait servir de récompense générique, ce qui réduirait l'ingénierie de récompense pour les intégrateurs et ouvrirait la voie à une auto-amélioration des robots en déploiement, sans instrumentation de la scène. Des réserves s'imposent : l'écart avec les récompenses privilégiées est réduit, pas comblé ; la validation réelle ne porte que sur quatre tâches, et sur du clonage comportemental pondéré plutôt que sur du RL en ligne sur robot physique. Le travail relève de la recherche (preprint arXiv, version 3), sans produit ni déploiement industriel. Ces travaux s'inscrivent dans la montée des modèles de fondation pour la robotique, des VLA (vision-langage-action) comme Pi-0 ou GR00T aux VLM utilisés comme juges ou générateurs de récompense. Les approches précédentes de récompense par modèle de langage ou de vision restaient souvent limitées à une évaluation après coup, ce que les LRM cherchent à dépasser avec un signal exploitable en ligne. La suite logique serait de tester ces récompenses en RL directement sur robot réel, sur un plus grand nombre de tâches, et de mesurer leur robustesse face aux erreurs d'estimation de progression, qui peuvent être exploitées par la politique. Le résumé ne cite aucun acteur européen ni partenaire industriel.

RecherchePaper
1 source
Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable
4arXiv cs.RO 

Préhension vision-langage adaptative via des a priori de modèles fondation combinables et une synthèse de préhension généralisable

Un article publié le 4 septembre 2026 sur arXiv (arXiv:2609.04096) présente AdaRoboVLG, un framework de préhension vision-langage (Vision-Language-Grasp, VLG) capable de généraliser la synthèse de prises entre différentes mains robotiques sans réentraînement. Contrairement aux méthodes VLG existantes, qui couplent étroitement modèles de fondation et politique de préhension entraînée de bout en bout, AdaRoboVLG sépare les deux couches : une politique de base génère et évalue des prises physiquement réalisables via mappage cinématique et estimation de stabilité par fermeture de force, tandis que des modules de fondation spécialisés injectent des a priori spatiaux, cognitifs et temporels selon la tâche. En simulation comme sur robot réel, les auteurs rapportent une généralisation efficace entre mains et une robustesse maintenue sur trois défis de préhension représentatifs en environnements encombrés et dynamiques, sans préciser de plateforme commerciale ni de chiffres de charge utile, de degrés de liberté (DOF) ou de temps de cycle. Des vidéos supplémentaires sont disponibles sur adarobovlg.github.io. L'intérêt pour les intégrateurs tient au découplage proposé : faire évoluer les modules de compréhension sémantique sans réentraîner toute la politique de préhension à chaque nouvelle tâche, la couche physique restant stable et déjà validée. C'est une réponse à deux limites récurrentes des approches Vision-Language-Action actuelles, le coût du réentraînement complet et l'écart persistant entre démonstrations simulées et robustesse en conditions réelles encombrées. Si ces résultats se confirment sur du matériel tiers, cette séparation entre raisonnement sémantique et physique de la préhension pourrait devenir une alternative aux modèles monolithiques entraînés de bout en bout. Ce travail s'inscrit dans la lignée des recherches VLG combinant perception, langage et contrôle moteur pour la préhension, un courant jugé par les auteurs trop dépendant de politiques entraînées de bout en bout et coûteuses à porter d'une main robotique à une autre. AdaRoboVLG se positionne explicitement contre cette tendance avec une architecture modulaire censée rester compatible avec les futures générations de modèles de fondation, sans redesign de la couche de préhension. Classé comme nouvelle soumission arXiv non encore évaluée par les pairs, l'article n'annonce ni partenariat industriel ni calendrier de déploiement, sa portée pratique restant à valider sur des plateformes commerciales.

RechercheActu
1 source