Aller au contenu principal
T$^2$Mem : apprendre une mémoire au moment du test pour la robotique
RecherchearXiv cs.RO 

T$^2$Mem : apprendre une mémoire au moment du test pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv T²Mem, un cadre qui donne une mémoire à une politique vision-langage-action (VLA) pré-entraînée qui n'en avait pas. La méthode repose sur l'entraînement au moment du test (test-time training). Le système ne retraite pas tout l'historique à chaque décision. Il encode les observations passées dans des « poids rapides » compacts, mis à jour en ligne par apprentissage auto-supervisé. Une interface ancrée dans les observations extrait l'information vision-langage qui alimente la mémoire, puis renvoie le contexte récupéré à l'action expert de la politique. L'entraînement alterne entre mémoire et politique, chacune restant figée pendant l'optimisation de l'autre. Sur les 16 tâches du benchmark RoboMME, le taux de succès moyen passe de 17,93 % à 56,83 % par rapport à la politique de base. T²Mem dépasse aussi les méthodes à mémoire récurrente rapportées dans ce benchmark. Les auteurs annoncent une inférence au moins trois fois plus rapide que les méthodes explicites, mesurée par profilage contrôlé.

Ce travail s'attaque à une faiblesse structurelle des VLA. Ils décident surtout à partir de l'observation courante, alors que de nombreuses tâches de manipulation dépendent d'informations qui ne sont plus visibles, comme un objet masqué ou une étape déjà exécutée. Point notable : la mémoire est apprise à partir des seules démonstrations d'actions, sans modèle de raisonnement externe ni annotations dédiées. Cela réduit le coût de données et la complexité d'intégration. Le gain de latence compte pour les boucles de contrôle temps réel. Plusieurs réserves s'imposent. Il s'agit d'un préprint évalué sur benchmark, et le résumé ne mentionne ni validation sur robot physique ni déploiement. L'accélération est mesurée par les auteurs eux-mêmes. Enfin, 56,83 % de réussite moyenne reste loin d'une fiabilité industrielle.

Le contexte est celui de politiques généralistes qui ont progressé en dextérité mais restent largement sans état. Les approches de mémoire existantes reposent sur des historiques explicites, des modules de raisonnement externes ou des mémoires récurrentes, d'où la comparaison menée ici avec ces dernières. Le résumé ne nomme pas la politique de base utilisée, ce qui limite pour l'instant la lecture de la portée du gain. Un site projet est annoncé. Les prochaines étapes à surveiller sont la reproduction sur d'autres politiques de base, les essais sur robots réels et une éventuelle reprise du principe dans les modèles de fondation robotiques commerciaux.

À lire aussi

1arXiv cs.RO 

Une mémoire simple à base d'agents pour les politiques robotiques généralistes

Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches. L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME. Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.

RecherchePaper
1 source
Apprendre à une main robotique à marcher
2Hackaday Robots Hacks 

Apprendre à une main robotique à marcher

Des chercheurs de l'ETH Zurich (Suisse) ont présenté une main robotique capable de marcher sur ses propres doigts, un projet dévoilé fin septembre 2026 et dont la sortie coïncide, de façon fortuite selon les auteurs, avec Halloween. L'équipe est partie d'une main robotique disponible dans le commerce, qu'elle a équipée d'une batterie et d'un Raspberry Pi Zero 2 W, puis pilotée via un réseau de neurones entraîné par apprentissage par renforcement dans un simulateur avant transfert sur le matériel réel. La main compte vingt articulations, quatre par doigt, et le réseau calcule en continu le prochain état articulaire à partir des mouvements précédents, de l'état courant de la main et de l'objectif fixé. Cette approche s'est révélée plus rapide qu'un modèle de locomotion quadrupède simplement adapté. Le système a appris à avancer en ligne droite, tourner, se relever après une chute (21 réussites sur 25 essais, en moins de vingt secondes) et taper sur un clavier, bien que l'absence de caméra empêche la main d'accomplir cette dernière tâche de façon autonome. Elle a franchi quatorze surfaces différentes, du tapis en caoutchouc au gravier et à l'herbe, et a réussi à pousser de petits objets vers des cibles désignées. Ce résultat illustre concrètement que l'apprentissage par renforcement, combiné à une simulation puis un transfert vers le réel, fonctionne aussi pour de la locomotion sur des géométries inhabituelles comme des doigts, et pas seulement pour des pattes de robots quadrupèdes ou humanoïdes. Pour les intégrateurs et chercheurs en robotique, cela ouvre une piste vers des effecteurs modulaires et autonomes: une main ou un préhenseur pourrait se détacher d'un bras robotique pour aller chercher un objet hors de portée, puis revenir se fixer. Les auteurs restent toutefois transparents sur les limites: une dérive systématique vers la droite due à la géométrie de la main nécessite une correction constante, et le clavier ne peut être actionné sans supervision externe puisqu'aucune caméra embarquée ne guide les frappes. Ce travail s'inscrit dans la tradition de l'ETH Zurich en robotique de locomotion, l'institut étant déjà connu pour ses robots quadrupèdes ANYmal, dont les techniques de marche ont ici inspiré les comparaisons de performance. Il rejoint aussi une longue série de projets amateurs et académiques de mains robotiques bricolées documentés ces dernières années. Il s'agit pour l'instant d'une démonstration de recherche, sans partenaire industriel ni feuille de route de commercialisation annoncée, mais les auteurs évoquent explicitement l'intégration future de cette autonomie de déplacement à des bras robotiques plus larges.

UEL'ETH Zurich, institution européenne reconnue en robotique de locomotion (ANYmal), renforce la réputation de la recherche européenne sur le sim-to-real, mais ce projet reste une démonstration académique sans partenaire industriel ni impact direct sur l'industrie ou la réglementation française ou européenne.

RecherchePaper
1 source
Apprendre à oublier : mémoire épisodique hiérarchique pour le déploiement à long terme des robots
3arXiv cs.RO 

Apprendre à oublier : mémoire épisodique hiérarchique pour le déploiement à long terme des robots

Des chercheurs ont publié H²-EMV, un cadre logiciel permettant aux robots humanoïdes de gérer sélectivement leur mémoire épisodique sur le long terme. Le problème adressé est concret : lorsqu'un utilisateur demande « Où as-tu mis mes clés ? » ou « Pourquoi la tâche a-t-elle échoué ? », le robot doit interroger un historique d'expériences captées en continu depuis des capteurs multimodaux. Sans filtrage, ce volume dépasse rapidement les capacités de stockage et rend les requêtes en temps réel impraticables. H²-EMV construit une mémoire hiérarchique de manière incrémentale, applique un oubli sélectif via un modèle de langage qui évalue la pertinence de chaque événement selon des règles en langage naturel, puis affine ces règles à partir des retours utilisateur. Testé sur des simulations de tâches domestiques et sur 20,5 heures d'enregistrements réels collectés avec le robot humanoïde ARMAR-7, le système réduit la taille mémoire de 45 % et le temps de calcul des requêtes de 35 %, tout en maintenant la précision des réponses. En deuxième session, cette précision progresse de 70 % grâce à l'adaptation aux priorités individuelles de l'utilisateur. Pour les déploiements longs de robots de service, ce résultat lève un frein non résolu. La mémoire épisodique est un point de friction majeur : un robot qui efface tout entre deux sessions est inutilisable sur la durée, mais stocker sans discrimination devient ingérable sur plusieurs semaines ou plusieurs mois. H²-EMV démontre qu'un oubli structuré et appris ne dégrade pas les performances de question-réponse, et que celles-ci s'améliorent avec l'usage, propriété rare dans les systèmes robotiques actuels. Pour les intégrateurs et les décideurs B2B, cela ouvre la voie à des assistants humanoïdes capables de dialogue contextuel persistant sans infrastructure de stockage surdimensionnée, condition nécessaire à un déploiement viable en environnement réel. ARMAR-7 est un humanoïde développé à l'Institut für Anthropomatik und Robotik du Karlsruhe Institute of Technology (KIT), en Allemagne, dont les recherches en interaction homme-robot figurent parmi les plus avancées en Europe. La gestion de mémoire long terme en robotique est un champ actif : des approches comme MemoryBank ou les bases vectorielles couplées à des grands modèles de langage ciblent des problèmes comparables, mais rarement sur des horizons temporels aussi longs ni sur des données réelles aussi volumineuses. L'article (arXiv:2604.11306v2) reste un preprint non encore évalué en conférence à comité de lecture ; les résultats annoncés attendent une confirmation indépendante. Les prochaines étapes naturelles sont une validation sur d'autres plateformes humanoïdes et des horizons de déploiement encore plus étendus pour confirmer la stabilité de l'apprentissage des règles d'oubli.

UEH²-EMV est développé et validé sur ARMAR-7, humanoïde du KIT (Allemagne), positionnant un laboratoire européen à la pointe de la gestion mémoire long terme pour robots de service.

RecherchePaper
1 source
MessyMem : une mémoire acquise par la pratique pour la manipulation mobile
4arXiv cs.RO 

MessyMem : une mémoire acquise par la pratique pour la manipulation mobile

Un système baptisé MessyMem, décrit dans un article publié sur arXiv (identifiant 2609.15976v1, version initiale de septembre 2026), s'attaque à un problème concret de la manipulation mobile : les robots qui interviennent dans plusieurs pièces et à plusieurs reprises n'accumulent aujourd'hui aucune connaissance persistante d'une visite à l'autre, par exemple qu'un placard est verrouillé ou qu'un objet se trouve dans un tiroir précis. MessyMem construit et maintient un graphe de scène 3D spatialement ancré, listant objets et emplacements, qu'il enrichit avec des propriétés et des résultats appris par interaction, et qu'il relie à des observations visuelles pour permettre un rappel précis. Les auteurs l'ont testé en simulation, sur une séquence continue de 25 tâches s'étalant sur plus de 3 heures, où le système atteint 80,0 % de progression des tâches, soit 14,8 points de pourcentage de mieux que la meilleure variante ablationnée du système et 28,9 points de mieux que la meilleure méthode externe comparée. Le système parvient à retrouver des preuves pertinentes parmi des milliers d'images clés stockées, remontant à plus d'une heure dans le passé. Un test complémentaire a également été mené sur un manipulateur mobile réel, sans que l'abstract ne détaille de métriques chiffrées équivalentes pour cette partie. Ce travail répond directement à une limite connue des architectures actuelles : les représentations de scène compactes utilisées par les planificateurs pilotés par modèles vision-langage omettent les connaissances tirées de l'interaction, les historiques vidéo bruts sont difficiles à interroger, et les modèles raisonnent au moment de l'inférence sans jamais mettre à jour durablement ce que le robot sait. Pour les intégrateurs et décideurs qui envisagent des flottes de robots opérant en continu sur de longues périodes, dans des environnements domestiques, commerciaux ou industriels, ce type de mémoire structurée laisse espérer une réduction du temps perdu à ré-explorer ou refaire des erreurs déjà rencontrées. Il faut toutefois noter que les chiffres les plus spectaculaires proviennent d'un banc d'essai simulé construit par les auteurs eux-mêmes, ce qui limite pour l'instant leur portée face à une validation à grande échelle sur robot physique. L'approche s'inscrit dans un effort de recherche plus large visant à doter les manipulateurs mobiles d'une mémoire à long terme complémentaire des modèles de planification génératifs, plutôt qu'un simple contexte réinitialisé à chaque tâche. S'agissant d'une publication de recherche fraîche et non d'un produit commercialisé, les suites logiques attendues sont l'extension à un plus grand nombre de tâches et d'environnements, ainsi qu'une validation renforcée sur robots physiques déployés en conditions réelles.

RecherchePaper
1 source