Aller au contenu principal
RecherchearXiv cs.RO 

FASA : adaptation de l'échantillonnage sensible au retour pour des modèles VLA à diffusion efficaces

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié le 18 septembre 2026 sur arXiv (référence 2609.19475v1) présente FASA (Feedback-Aware Sampling Adaptation), une méthode d'accélération pour les modèles Vision-Language-Action (VLA) fondés sur la diffusion. Ces modèles, utilisés pour piloter des robots à partir d'images et de langage naturel, souffrent d'un défaut connu : leur processus de génération d'action repose sur un échantillonnage itératif coûteux en calcul et en accès mémoire, ce qui empêche leur exécution en temps réel sur du matériel embarqué limité. FASA fonctionne sans entraînement supplémentaire et agit directement au moment de l'inférence : un premier module, l'adaptateur de plage piloté par l'interaction, ajuste dynamiquement le nombre global d'étapes de débruitage en fonction du retour visuel et de la force mesurée par la pince du robot ; un second module, l'adaptateur d'étape sensible à la proprioception, choisit précisément l'étape optimale à l'intérieur de cette plage. Les auteurs annoncent des gains de vitesse d'inférence allant jusqu'à 1,45 fois par rapport aux méthodes existantes, avec des taux de réussite jugés comparables sur plusieurs bancs d'essai (benchmarks) non détaillés dans le résumé.

Cette approche cible un point de friction central pour l'industrialisation des VLA : les méthodes d'accélération existantes imposent soit un réentraînement coûteux (distillation, flow matching), soit un élagage ou un système de cache programmé de façon statique, qui dégrade la perception en ignorant la variabilité réelle de la charge de travail robotique. En traitant le retour multimodal comme signal de contrôle du pipeline de débruitage, FASA propose une troisième voie, sans coût d'entraînement, potentiellement pertinente pour les intégrateurs cherchant à déployer des modèles génératifs lourds sur des plateformes de calcul contraintes, comme les contrôleurs embarqués de robots manipulateurs.

Il s'agit toutefois d'un prépublication arXiv, non encore validée par relecture par les pairs, sans identification des auteurs ni de laboratoire dans le résumé disponible, et sans précision sur le matériel de test ni sur les modèles VLA de référence utilisés pour la comparaison. Le gain de 1,45x reste à situer par rapport aux architectures concurrentes d'accélération de l'inférence robotique, un axe de recherche actif à mesure que les modèles VLA gagnent en taille et en ambition d'usage industriel.

Dans nos dossiers

À lire aussi

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)
1arXiv cs.RO 

Modèle de diffusion adaptatif pour la manipulation robotique efficace (VADF)

Une équipe de chercheurs a publié sur arXiv (référence 2604.15938) une proposition architecturale baptisée VADF (Vision-Adaptive Diffusion Policy Framework), visant à corriger deux défauts structurels des politiques de diffusion appliquées à la manipulation robotique. Le premier défaut est le déséquilibre de classe dû à l'échantillonnage uniforme lors de l'entraînement : le modèle traite indistinctement les exemples faciles et difficiles, ce qui ralentit la convergence. Le second est le taux d'échec à l'inférence par dépassement de délai, un problème opérationnel concret dès qu'on sort du laboratoire. VADF intègre deux composants : l'ALN (Adaptive Loss Network), un MLP léger qui prédit en temps réel la difficulté de chaque pas d'entraînement et applique un suréchantillonnage des régions à forte perte via du hard negative mining ; et l'HVTS (Hierarchical Vision Task Segmenter), qui décompose une instruction de haut niveau en sous-tâches visuellement guidées, en assignant des schedules de bruit courts aux actions simples et des schedules longs aux actions complexes, réduisant ainsi la charge computationnelle à l'inférence. L'architecture est conçue model-agnostic, c'est-à-dire intégrable à n'importe quelle implémentation existante de politique de diffusion. L'intérêt pour un intégrateur ou un responsable R&D est avant tout pratique : les politiques de diffusion souffrent de coûts d'entraînement élevés et d'une fiabilité insuffisante en déploiement réel, ce qui freine leur adoption industrielle. Si les gains annoncés par VADF se confirment sur des benchmarks indépendants, la réduction des étapes de convergence représenterait un levier significatif sur les coûts GPU, et la diminution des timeouts à l'inférence améliorerait directement la cadence opérationnelle. Il faut toutefois noter que ce travail est un preprint non évalué par des pairs, sans chiffres de performance comparatifs publiés dans l'article lui-même. Les politiques de diffusion ont émergé comme méthode de choix pour l'imitation comportementale en robotique depuis les travaux de Chi et al. en 2023 (Diffusion Policy, Columbia), avant d'être intégrées dans des architectures plus larges comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La principale tension du domaine reste le sim-to-real gap et la robustesse à l'inférence en conditions réelles, terrain sur lequel VADF prétend apporter une contribution. Les prochaines étapes logiques seraient une validation sur des benchmarks standard (RLBench, LIBERO) et une comparaison directe avec ACT ou Diffusion Policy de référence.

RecherchePaper
1 source
FibVLA : un modèle vision-langage-action temporel efficace avec échantillonnage de Fibonacci
2arXiv cs.RO 

FibVLA : un modèle vision-langage-action temporel efficace avec échantillonnage de Fibonacci

FibVLA, un nouveau modèle vision-langage-action (VLA) présenté dans un article publié sur arXiv (2607.29596v1), s'attaque à un problème central des architectures actuelles: la difficulté à exploiter l'historique temporel sans sacrifier la vitesse d'inférence en temps réel. Les VLA classiques se contentent généralement de la perception du moment présent; ceux qui tentent d'intégrer un contexte long souffrent d'une chute de performance liée à l'encodage de séquences étendues. FibVLA propose deux mécanismes pour résoudre ce compromis: un échantillonnage rétrospectif logarithmique (logarithmic hindsight sampling) appliqué aux états proprioceptifs et aux images, qui capture les dépendances temporelles longue durée avec un minimum de redondance, et un module d'action reposant sur le flow matching couplé à une stratégie d'inférence récurrente dite "Fibonacci", générant des plans d'action sur un horizon étendu à partir d'un retour en boucle fermée en temps réel. Les auteurs rapportent une amélioration nette de la fluidité des mouvements et des taux de réussite, sans avoir besoin de réentraîner les encodeurs visuels de grande taille. Cette approche répond à une tension concrète pour l'industrie robotique: les intégrateurs veulent des robots capables de raisonner sur une séquence d'actions passées, pas seulement sur l'image instantanée, mais chaque milliseconde d'inférence compte pour un contrôle en boucle fermée. Si les résultats se confirment à plus grande échelle, FibVLA illustrerait qu'il est possible d'obtenir un raisonnement temporel étoffé sans payer le prix habituel en latence, un point sensible dans le débat sur l'écart entre démonstrations impressionnantes et déploiement industriel réel. FibVLA s'inscrit dans une lignée de modèles VLA qui cherche à généraliser l'IA incarnée, aux côtés d'approches comme RT-2, OpenVLA, Pi-0 ou GR00T N2, où la gestion efficace du contexte temporel reste un défi ouvert. L'article ne précise pas de partenariat industriel ni de calendrier de déploiement; il s'agit à ce stade d'un travail de recherche évalué en conditions réelles limitées, dont la prochaine étape logique serait une validation sur des plateformes robotiques plus variées et des tâches de manipulation plus complexes.

RechercheActu
1 source
Effets inattendus de la randomisation de domaine sensible au risque pour la commande prédictive par échantillonnage à contacts multiples
3arXiv cs.RO 

Effets inattendus de la randomisation de domaine sensible au risque pour la commande prédictive par échantillonnage à contacts multiples

Des chercheurs ont publié en mai 2026 une étude préliminaire (arXiv:2605.03290) sur les effets de la randomisation de domaine sensible au risque appliquée au contrôle prédictif par échantillonnage (SPC) dans des tâches à contacts physiques denses. La randomisation de domaine (DR) consiste à entraîner un planificateur sur des variantes aléatoires des paramètres physiques, masse, friction, rigidité, pour le rendre robuste aux erreurs de modélisation. Très utilisée en apprentissage par renforcement, elle restait quasiment inexploriée dans le SPC, où la qualité des trajectoires simulées est particulièrement sensible à l'incertitude. Les auteurs comparent trois stratégies d'agrégation de rollouts sous instances de modèles randomisés : moyenne, optimiste (meilleur cas) et pessimiste (pire cas), sur la tâche Push-T, un benchmark de manipulation où un robot pousse un objet en T vers une pose cible. Les résultats révèlent un effet inattendu : la DR ne se contente pas d'améliorer la robustesse aux erreurs de modèle, elle modifie structurellement le paysage de coût perçu par l'optimiseur d'échantillonnage. Selon le profil de risque retenu, le bassin d'attraction autour des actions produisant des contacts physiques est reconfiguré différemment, ce qui influe directement sur la propension de l'optimiseur à explorer ou à éviter les configurations de contact. Pour des applications industrielles, assemblage, manipulation fine ou tri, où les contacts sont inévitables, ce couplage entre incertitude de modèle et stratégie de risque est critique : un mauvais calibrage peut rendre le SPC soit trop conservateur, soit instable face aux contacts non planifiés. La DR a été systématisée dans les simulateurs physiques comme Isaac Sim de NVIDIA et popularisée par les travaux d'OpenAI sur la manipulation dextre (projet Dactyl, 2019). Le SPC, notamment via l'algorithme MPPI (Model Predictive Path Integral), connaît un regain d'intérêt pour la robotique temps réel, en locomotion et manipulation. Cette étude constitue un premier jalon formel à l'intersection des deux approches, jusqu'ici traitées séparément. Elle s'inscrit dans un contexte plus large où les modèles VLA (Vision-Language-Action) et les approches sim-to-real de Google DeepMind ou Physical Intelligence (Pi-0) cherchent à réduire l'écart entre simulation et réalité. Les auteurs ne publient que des résultats initiaux sur une tâche simple et ne proposent pas encore de généralisation ni de calendrier applicatif, ce qui limite la portée immédiate mais ouvre un axe de recherche prometteur pour le contrôle robuste aux contacts.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
4arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source