Aller au contenu principal
RecherchearXiv cs.RO 

Une mémoire récurrente linéaire suffit pour distiller une politique de modèle du monde pour le robot d'air hockey

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude publiée sur arXiv (v1, identifiant 2609.39151) examine si le contrôle dépendant d'une mémoire exige des dynamiques récurrentes non linéaires. Le cadre est une tâche simulée de défense au air hockey, où le suivi du palet est temporairement perdu. Les auteurs utilisent comme enseignant un agent DreamerV3 (modèle du monde). Celui-ci surpasse une politique sans mémoire lorsque le suivi est coupé. Réinitialiser son état récurrent dégrade fortement ses performances, ce qui montre que la tâche requiert bien de la mémoire. Cet enseignant est distillé en politiques récurrentes compactes, avec un état de 64 dimensions. Elles combinent une récurrence linéaire diagonale et une « innovation » non linéaire de rang k optionnelle, tout en conservant des encodeurs d'observation et des têtes d'action non linéaires. Sur cinq graines appariées, le modèle purement linéaire (k=0) égale à la fois la base GRU et l'enseignant sur toute la plage de pertes de suivi testée. Augmenter le rang de l'innovation non linéaire n'apporte aucun gain mesurable. Les résultats viennent d'un jeu de test neuf, ouvert seulement après le gel des modèles et des analyses.

L'intérêt tient à l'économie de calcul. Le modèle linéaire exige moins de paramètres récurrents et moins de calcul qu'un GRU pour des performances comparables. Pour la robotique embarquée, où la latence et le budget énergétique contraignent les politiques temps réel, cela suggère qu'une partie de l'apprentissage de représentation non linéaire, placée autour d'un mémoire linéaire simple, peut suffire pour des tâches à occlusion ou perte de capteur. C'est cohérent avec l'intérêt récent pour les modèles à espace d'états linéaires. Le protocole, avec un jeu de test verrouillé et des graines appariées, est plus rigoureux que la moyenne du domaine. La portée reste étroite : une seule tâche simulée, un seul enseignant, un état de dimension 64, un horizon de coupure limité, cinq graines, et aucune validation sur robot réel, donc rien sur l'écart sim-to-real. Les auteurs précisent eux-mêmes que la conclusion ne vaut que pour des politiques dont l'encodeur et la tête d'action restent non linéaires. Ce n'est donc pas une preuve que la mémoire linéaire suffit en général.

Le travail s'inscrit dans deux courants. Le premier est celui des modèles du monde de type Dreamer, qui servent ici d'enseignants performants mais coûteux. Le second est celui de la distillation vers des politiques légères et des architectures récurrentes linéaires, présentées comme alternatives aux GRU et aux LSTM. Le air hockey robotique est un banc d'essai classique pour le contrôle dynamique rapide sous contraintes de perception. Les suites naturelles sont des tests sur des tâches plus longues ou plus riches en mémoire, d'autres enseignants, des états plus grands, et surtout un transfert sur matériel réel. Il s'agit d'un préprint non évalué par des pairs, sans produit ni déploiement associé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DRAM : mémoire associative récurrente à règle delta pour les politiques de manipulation robotique
1arXiv cs.RO 

DRAM : mémoire associative récurrente à règle delta pour les politiques de manipulation robotique

Des chercheurs proposent DRAM (Delta-rule Recurrent Associative Memory), un module de mémoire enfichable destiné aux politiques de manipulation robotique pré-entraînées. Décrit dans un preprint arXiv (2609.32453, version 2), il s'attache à un large éventail de politiques existantes et leur confère une mémoire longue durée sans modifier leur architecture ni réentraîner le backbone. Seuls le module de mémoire et l'action expert, la tête qui produit les actions, subissent un post-entraînement propre à la tâche. Le module maintient une mémoire associative de taille fixe, fondée sur une attention linéaire à règle delta avec porte (gated delta-rule). Sa mise à jour est modifiée pour intégrer en parallèle tous les tokens de chaque image. Un mécanisme de lecture indépendant de l'architecture injecte ensuite le contexte historique dans la prédiction d'action, quelle que soit la politique hôte. Les auteurs annoncent que DRAM améliore de façon constante des politiques gelées par rapport aux références à contexte court et à d'autres conceptions de mémoire compacte. Le résumé ne donne aucun chiffre, ni taux de réussite, ni nombre de tâches, ni liste des politiques testées. L'enjeu est pratique. La manipulation dépend de l'historique : savoir quelles étapes d'une tâche sont faites, où un objet a été rangé ou si une tentative a échoué. Or la plupart des politiques pré-entraînées, notamment les VLA (vision-language-action), ne voient que l'observation courante ou une courte fenêtre temporelle. Les deux remèdes actuels ont un coût. Empiler plusieurs images dans le backbone fait grimper le coût d'inférence, un problème pour le contrôle temps réel sur du matériel embarqué. S'appuyer sur des caractéristiques sémantiques prédéfinies limite la généralité et peut imposer de réentraîner le backbone. Une mémoire de taille fixe garde un coût d'inférence constant quelle que soit la durée de la tâche. Le fait que le backbone reste gelé compte aussi pour les intégrateurs : on pourrait ajouter de la mémoire à un modèle de fondation déjà validé sans relancer un entraînement lourd. Il s'agit toutefois d'une preuve de concept académique. Rien n'indique à ce stade une validation sur robot réel, des tâches longues en conditions industrielles ou des mesures de latence. Cette approche s'inscrit dans le courant qui importe en robotique les modèles récurrents efficaces issus du langage : attention linéaire, règle delta, mémoires d'état de taille fixe, alternatives aux Transformers à contexte croissant. Elle répond à une limite reconnue des VLA généralistes actuels, souvent sans état ou à mémoire très courte. Les auteurs la comparent à d'autres mémoires compactes, mais le résumé ne nomme pas les concurrents. La suite logique serait des évaluations sur plusieurs familles de politiques, avec des tâches réelles à longue échéance et un chiffrage du surcoût de calcul, seuls éléments qui permettront de juger si la mémoire post-hoc tient ses promesses hors du laboratoire.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Une mémoire simple à base d'agents pour les politiques robotiques généralistes
2arXiv cs.RO 

Une mémoire simple à base d'agents pour les politiques robotiques généralistes

Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches. L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME. Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.

RecherchePaper
1 source
GigaWorld-1 : une feuille de route pour créer des modèles du monde évaluant les politiques robotiques
3arXiv cs.RO 

GigaWorld-1 : une feuille de route pour créer des modèles du monde évaluant les politiques robotiques

Une équipe de recherche publie GigaWorld-1, un modèle du monde spécialement conçu pour évaluer les politiques robotiques, accompagné de WMBench, un banc d'essai construit à partir de données réelles de téléopération et de rollouts de politiques appariés sur des tâches de manipulation variées. L'étude analyse 7 modèles du monde vidéo, 4 schémas de représentation d'action et plus de 324 000 rollouts de politiques simulés mis en correspondance avec des exécutions robotiques réelles, en s'appuyant aussi sur les soumissions de la communauté au CVPR 2026 GigaBrain Challenge, des trajectoires synthétiques et plus de 12 000 heures de vidéos d'entraînement. Trois résultats principaux ressortent : la qualité d'un évaluateur dépend surtout de la cohérence des rollouts sur de longs horizons temporels et de leur fidélité à l'action réelle, plutôt que du simple réalisme visuel à court terme ; les gains de pré-entraînement viennent autant d'un équilibre entre connaissances générales et contrôlabilité spécifique au robot que de la seule taille des données ; et des choix d'architecture comme l'encodage d'action, la conception de la mémoire et le post-entraînement orienté évaluation déterminent fortement l'alignement avec le comportement réel du robot. Code, modèles, jeux de données et outils sont publiés en intégralité. Ce travail s'attaque à un vrai goulot d'étranglement du secteur : contrairement aux LLM, évaluables via des benchmarks numériques rapides, les politiques robotiques nécessitent des essais physiques lents, coûteux et limités par le matériel et la supervision humaine. Utiliser des modèles du monde comme évaluateurs de substitution promet d'accélérer drastiquement l'itération sur les modèles fondation embarqués (VLA), en simulant les conséquences d'une action avant tout déploiement réel. Mais jusqu'ici, personne n'avait établi méthodiquement ce qui rend un modèle du monde fiable pour ce rôle précis d'évaluateur, plutôt que pour la génération vidéo générique. En démontrant que le réalisme visuel court terme est un mauvais proxy et que la cohérence long-horizon compte davantage, l'étude remet en cause une hypothèse implicite du secteur, celle voulant qu'un bon générateur vidéo fasse automatiquement un bon simulateur d'évaluation, avec des implications directes pour tous les laboratoires qui entraînent des politiques de manipulation (type GR00T N2, Pi-0 ou Helix) et cherchent à réduire leur dépendance aux essais sur banc réel. Le travail s'inscrit dans la montée en puissance des modèles du monde comme brique d'infrastructure pour la robotique fondation, un axe de recherche porté ces derniers mois par des acteurs comme World Labs, Genie de DeepMind ou les initiatives associées au GigaBrain Challenge du CVPR 2026, dont les soumissions communautaires alimentent d'ailleurs directement WMBench. La démarche se distingue par son échelle : plus de 12 000 heures de vidéos d'entraînement et 324 000 rollouts appariés à des exécutions réelles, un volume rarement atteint pour ce type d'analyse comparative. En publiant intégralement code, modèles et jeux de données, les auteurs positionnent GigaWorld-1 et WMBench comme une référence ouverte que d'autres laboratoires pourront reprendre pour benchmarker leurs propres politiques, une étape qui pourrait accélérer la comparaison objective entre familles de modèles VLA concurrentes, aujourd'hui difficile faute de protocole d'évaluation standardisé.

RecherchePaper
1 source
Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes
4arXiv cs.RO 

Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes

Une équipe de recherche publie sur arXiv (référence 2609.24682) une méthode qui ajoute un terme d'alignement de représentations à l'entraînement classique des modèles Vision-Language-Action (VLA), ces réseaux qui associent perception et langage à des actions robotiques. Un world model figé est passé une seule fois sur les images d'entraînement, ses caractéristiques internes sont mises en cache, puis le modèle VLA « étudiant » apprend à s'aligner sur ce cache pendant l'entraînement. Le world model n'est jamais chargé lors du déploiement et le module de projection est jeté après l'entraînement, si bien que la politique finale reste identique au modèle VLA non distillé, tant en taille qu'en calcul. Résultat mesuré : un étudiant de 0,8 milliard de paramètres tourne en 32 millisecondes et consomme 1,86 Go de mémoire sur une carte grand public RTX 5090, atteint 97,9 % de réussite sur le benchmark de manipulation LIBERO, et progresse de 48,2 % à 50,5 % sur RoboCasa-GR1, un banc d'essai de manipulation humanoïde en simulation. Le gain se vérifie aussi sur du matériel réel, sur une plateforme à bras unique et sur une plateforme bimanuelle. L'intérêt pour l'industrie robotique tient à la séparation qu'établit ce travail entre deux familles de modèles jusque-là difficiles à concilier : les VLA, rapides mais dépourvus d'objectif qui tienne compte de la réaction du monde à une action, et les world models, physiquement mieux fondés mais trop lents pour piloter un robot en temps réel puisqu'ils doivent projeter le futur seconde par seconde. En montrant que la connaissance physique d'un world model peut être injectée dans une politique légère sans alourdir le calcul au moment de l'exécution, l'étude suggère qu'on peut améliorer la robustesse des VLA sans ajouter de données, de paramètres ni de calcul supplémentaire au déploiement, un point qui intéresse directement les intégrateurs contraints par la latence et la puissance embarquée. Ce résultat s'inscrit dans un débat actuel de la recherche en robotique entre approches VLA et approches par world models, sans qu'aucun partenaire industriel ni déploiement commercial ne soit mentionné à ce stade. La méthode a été testée en faisant varier la taille de l'étudiant, l'architecture de base, la couche d'alignement et le world model utilisé comme enseignant, un signal que l'effet observé relève d'un principe général plutôt que d'un couplage fragile entre deux réseaux précis. Les auteurs publient les détails sur une page projet dédiée, mais le travail reste à ce jour un résultat de recherche évalué en simulation et en laboratoire, sans calendrier annoncé vers une industrialisation.

RecherchePaper
1 source