Aller au contenu principal
RecherchearXiv cs.RO 

Mémoire intégrée et compétences réutilisables : un cadre centré sur la mémoire pour les modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Optimus-R, un cadre de type VLA (Vision-Language-Action) centré sur la mémoire, qui traite l'adaptation d'un robot à une nouvelle tâche comme un réglage explicite d'une mémoire requête-compétence, plutôt que comme un réentraînement des paramètres du modèle. Le dispositif repose sur trois briques. Une interface de mémoire « en ligne » insère des tokens de mémoire apprenables dans le flux de préfixe du VLA, ce qui permet au backbone d'extraire des représentations de requête et de compétence liées au contrôle, dans son circuit natif de conditionnement de l'action. Une banque de mémoire requête-compétence externalise ensuite ces compétences : des prototypes de requêtes décident quoi récupérer, des valeurs de compétence précisent comment agir. Enfin, un mécanisme léger « Bridge-and-Adapt » aligne les requêtes et compétences du domaine cible sur l'espace mémoire existant, via un adaptateur et des mises à jour résiduelles. Les auteurs rapportent des expériences en adaptation intra-domaine, inter-domaines et en apprentissage continu. Leur conclusion est un apprentissage de compétences économe en données, avec un oubli catastrophique atténué. Le résumé ne fournit ni taux de réussite, ni nom de robot, ni taille de modèle, ni benchmark. Il s'agit d'un travail de recherche publié sur arXiv, sans produit ni déploiement associé.

L'enjeu est très concret pour qui veut déployer des VLA en production. Aujourd'hui, adapter un modèle généraliste à un nouveau poste, une nouvelle pièce ou un nouvel effecteur passe le plus souvent par du fine-tuning. Celui-ci coûte du calcul et des démonstrations, et il peut dégrader les tâches déjà maîtrisées. Pour un intégrateur qui maintient plusieurs cellules, ce risque de régression oblige à revalider l'existant à chaque mise à jour. Déplacer l'apprentissage vers une mémoire externe, extensible avec peu de paramètres modifiés, irait vers une logique plus modulaire, où l'on ajoute une compétence sans toucher au reste. L'approche reste cependant à démontrer. Faute de chiffres dans le résumé, on ignore l'ampleur du gain, la nature des domaines testés (simulation ou matériel réel) et la façon dont la banque se comporte quand le nombre de compétences croît. L'écart entre résultats de laboratoire et exploitation industrielle reste donc entier.

Ce travail s'inscrit dans un courant de recherche sur l'apprentissage continu pour les politiques robotiques et l'adaptation efficiente en paramètres, déjà exploré par des méthodes de type adaptateurs ou LoRA appliquées aux VLA. Il rejoint aussi l'intérêt croissant pour les mémoires externes et la récupération de compétences dans les modèles de fondation. Les acteurs industriels comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix) travaillent sur des modèles généralistes, mais leurs méthodes d'adaptation propres ne sont pas détaillées publiquement dans ce cadre. La suite logique est la publication du code et des détails expérimentaux, puis une comparaison avec ces approches sur des benchmarks communs et sur robot réel. Tant que ces éléments manquent, Optimus-R relève d'une piste de recherche prometteuse et non d'une solution éprouvée.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
1arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source
StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action
2arXiv cs.RO 

StateMem : mémoire résiduelle à état unique et inférence adaptative pour les modèles vision-langage-action

Publié le 22 septembre 2026 sur arXiv sous la référence 2609.22684, StateMem est un nouveau framework de mémoire pour les politiques vision-langage-action (VLA) utilisées en manipulation robotique. Plutôt que de s'appuyer sur des banques de mémoire externes comme celles de MemoryVLA, il maintient un unique token de mémoire persistant mis à jour par résidus de faible rang et route de façon adaptative les préfixes mis en cache, avec un contrôleur sans entraînement ajustant le seuil en ligne et une correction rapide compensant la dérive des données en cache. Sur le benchmark LIBERO, StateMem atteint 97,6% de réussite moyenne tout en réduisant de 20,25% la fréquence de rafraîchissement complet du préfixe du modèle vision-langage. Sur RoboMemArena, catégorie Occlusion, il devance les autres méthodes VLA isolées avec 21,8% de taux de succès par tâche et 44,3% de taux de succès cumulé, et gagne 21 points de réussite moyenne sur six tâches de manipulation réelle. L'enjeu est concret pour l'industrie: la manipulation robotique dépendante de la mémoire, où une action tardive doit exploiter une information vue plus tôt, comme un objet temporairement caché, reste un point faible des VLA qui ne regardent que l'observation courante. En évitant le stockage et la récupération explicites d'une mémoire externe, StateMem allège le pipeline d'inférence et réduit le calcul redondant, un critère décisif pour la latence et le coût de calcul embarqué en déploiement temps réel. Les gains en environnement d'occlusion sont particulièrement significatifs car ils ciblent l'écart entre démonstrations de laboratoire et conditions réelles d'usine ou d'entrepôt, où l'occlusion visuelle est fréquente. Le travail s'inscrit dans la lignée des politiques VLA qui cherchent à dépasser la réaction à l'instant présent pour intégrer un raisonnement temporel, en se positionnant comme alternative plus légère aux architectures à mémoire externe explicite telles que MemoryVLA. Les auteurs valident leur approche sur trois terrains complémentaires, la suite standardisée LIBERO, le benchmark récent RoboMemArena axé sur mémoire et occlusion, et des tâches réelles sur robot physique, limitant le risque de sur-optimisation à un seul environnement simulé. Déposé en pré-publication sans mention de licence commerciale ni de partenariat industriel, StateMem reste à ce stade une contribution de recherche dont l'adoption en production dépendra de sa reproduction indépendante.

RechercheActu
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
3arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
Évolution continue des compétences dans un modèle vision-langage-action (VLA)
4arXiv cs.RO 

Évolution continue des compétences dans un modèle vision-langage-action (VLA)

Des chercheurs ont publié Stellar VLA (arXiv:2511.18085v3), un cadre d'apprentissage continu par imitation (continual imitation learning, CIL) pour les modèles Vision-Langage-Action (VLA). La méthode propose deux variantes progressives : T-Stellar, fondée sur une modélisation plate centrée sur les tâches, et TS-Stellar, organisée en structure hiérarchique tâche-compétence. Les expériences menées sur le benchmark LIBERO, référence standard pour les tâches de manipulation robotique, montrent que les deux variantes surpassent les baselines VLA et CIL actuelles, avec seulement 1 % de rejeu de données. Une validation en conditions réelles sur une plateforme bi-bras, avec des configurations de scènes et d'embodiments distincts, confirme que le transfert de connaissances entre tâches reste effectif au-delà du simulateur. Le principal apport de Stellar VLA est d'adresser un frein structurel au déploiement des grands modèles VLA : les méthodes CIL existantes nécessitent des paramètres additionnels ou des modules externes, ce qui les rend difficilement scalables lorsque le modèle de base est déjà massif. En optimisant conjointement des représentations de tâches et un espace de connaissances partagé, Stellar VLA introduit un mécanisme de routage expert guidé par la sémantique, sélectionnant les K embeddings les plus proches pour orienter le modèle vers la compétence pertinente, sans alourdir l'architecture. Pour les équipes qui déploient des robots polyvalents en production, cela ouvre la voie à l'apprentissage incrémental de nouvelles tâches avec un coût de fine-tuning réduit. TS-Stellar se distingue notamment sur les manipulations hiérarchiques complexes, et les visualisations publiées illustrent une rétention robuste des compétences acquises ainsi qu'une capacité de découverte automatique de nouvelles tâches. Les VLA constituent un axe de recherche en accélération depuis 2023, portés par Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA (UC Berkeley) ou encore RT-2 (Google DeepMind), qui cherchent à généraliser la manipulation robotique via un préentraînement multimodal massif. La question du catastrophic forgetting, c'est-à-dire la perte des compétences antérieures lors de l'apprentissage d'une nouvelle tâche, reste un verrou non résolu à l'échelle industrielle. Stellar VLA se positionne comme une surcouche légère applicable à des VLA existants, sans retraining complet. Le projet est documenté sur stellarvla.github.io ; aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication, qui reste à ce stade un travail de recherche académique.

RechercheOpinion
1 source