Aller au contenu principal
Try Once, Puis Optimal : Mémoire de Procédure Dé-redondée pour l'Amortissement de l'Exploration Inter-Épisodes
RecherchearXiv cs.RO 

Try Once, Puis Optimal : Mémoire de Procédure Dé-redondée pour l'Amortissement de l'Exploration Inter-Épisodes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Instance-Oriented Memory (IOM), un système de mémoire objet-centrique qui évite aux robots manipulateurs de re-sonder à chaque rencontre les objets à état caché, comme un four à micro-ondes verrouillé ou une porte au mécanisme invisible. Dès la première rencontre, réussie ou non, IOM enregistre une courte procédure indexée sur les caractéristiques visuelles de l'objet, puis l'injecte comme biais souple dans une politique de manipulation ; à la rencontre suivante, le robot reconnaît l'objet et rappelle directement la procédure au lieu de re-explorer. La distillation s'appuie sur un modèle vision-langage (VLM) prêt à l'emploi, sans entraînement spécifique à la tâche. Sur quatre tâches d'objets articulés (four et porte en simulation, bouteille et armoire sur robot réel), une mémoire de procédure oracle réduit les opérations de manipulation de 16 à 30 % sans perte de réussite, et la version instrumentée par VLM récupère 69 à 88 % de ce gain dès la sortie de boîte.

L'apport cible un angle mort des mémoires inter-épisodes existantes, qui organisent la réutilisation autour d'états génériques plutôt qu'autour de l'objet et du coût réel de sa re-exploration. Pour des intégrateurs déployant des robots en environnement semi-structuré (entrepôt, cuisine, hôpital) où les mêmes appareils reviennent souvent dans le champ d'action, ce gain d'efficacité réduit directement le temps de cycle. Le point le plus significatif pour la fiabilité en conditions réelles : la procédure retrouvée n'est qu'un biais sur une politique pilotée par retour sensoriel, pas une instruction impérative, donc une mémoire erronée est corrigée plutôt que suivie aveuglément. Le taux de réussite ne régresse jamais, même quand la procédure rappelée est fausse, ce qui arrive dans environ 12 % des instances de porte, et il s'améliore même sur le robot réel.

IOM s'inscrit dans la recherche sur la manipulation d'objets articulés à état caché, où le robot doit sonder physiquement un loquet ou une charnière avant d'agir de façon fiable. Contrairement aux politiques VLA généralistes récentes comme GR00T N2, Helix ou Pi-0, centrées sur la généralisation de compétences entre tâches, IOM se positionne comme une couche de mémoire additionnelle au-dessus d'une politique existante plutôt que comme un concurrent direct. L'article, soumis sur arXiv le 28 juillet 2026 en tant que nouvelle contribution, précise que le code sera publié après acceptation : aucune implémentation n'est donc encore disponible publiquement, et la validation reste pour l'instant limitée à quatre tâches de laboratoire.

Dans nos dossiers

À lire aussi

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
1arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
PISTO : inférence proximale pour l'optimisation stochastique de trajectoires
2arXiv cs.RO 

PISTO : inférence proximale pour l'optimisation stochastique de trajectoires

Des chercheurs ont publié sur arXiv (arXiv:2605.07215) un algorithme de planification de trajectoires robotiques appelé PISTO (Proximal Inference for Stochastic Trajectory Optimization). Leur contribution centrale est de démontrer que STOMP, méthode stochastique classique, minimise implicitement une divergence KL par rapport à une distribution de trajectoires de Boltzmann, révélant une structure d'inférence variationnelle (VI) sous-jacente. PISTO exploite cette observation en ajoutant une régularisation KL entre propositions gaussiennes successives, ce qui stabilise les mises à jour et produit une interprétation de type trust-region. L'algorithme reste entièrement sans dérivées et s'appuie sur un échantillonnage Monte Carlo à pondération d'importance. Sur les benchmarks de planification de bras robotiques, PISTO atteint 89 % de taux de succès contre 63 % pour CHOMP et 68 % pour STOMP, tout en générant des trajectoires plus courtes et plus lisses, à deux fois la vitesse des méthodes stochastiques concurrentes. Des validations complémentaires sur des tâches de locomotion et manipulation contact-rich en simulation MuJoCo montrent des performances supérieures aux baselines CEM et MPPI en termes de récompense cumulée. Pour les intégrateurs et ingénieurs en planification de mouvement, l'absence totale de dérivées est une caractéristique décisive : elle permet de traiter des fonctions de coût non-différentiables ou discontinues, fréquentes dans les environnements industriels réels (détection de collisions, zones interdites, contraintes non paramétriques). Le gain de vitesse d'un facteur deux par rapport aux méthodes stochastiques existantes réduit directement les temps de cycle dans les applications de planification en ligne, point critique pour la robotique collaborative et les systèmes pick-and-place haute cadence. La validation sur MuJoCo avec contacts ouvre des perspectives vers la locomotion humanoïde et la manipulation dextre, bien que ces résultats restent pour l'instant entièrement simulés, sans validation sur matériel physique. PISTO s'inscrit dans la lignée de STOMP (développé chez Willow Garage et présenté à l'ICRA 2011) et de ses concurrents gradient-based tels que CHOMP, ainsi que des méthodes stochastiques modernes MPPI (popularisé par NVIDIA en 2017) et CEM. Soumis comme preprint arXiv sans révision par les pairs à ce stade, l'article n'annonce ni déploiement industriel ni partenariat commercial. Son impact pratique dépendra de la mise à disposition du code source et de validations expérimentales sur robot réel, étapes absentes de la publication actuelle.

RecherchePaper
1 source
Roue à griffes adaptative au terrain pour l'exploration planétaire optimale : conception et étude expérimentale
3arXiv cs.RO 

Roue à griffes adaptative au terrain pour l'exploration planétaire optimale : conception et étude expérimentale

Une équipe de recherche (identité anonymisée dans le preprint arXiv:2605.24311 soumis en mai 2026) présente une roue multimodale capable d'ajuster en continu la hauteur de ses grousers, les crampons périphériques qui mordent le sol, pour s'adapter aux variations de terrain lors d'explorations planétaires. Le prototype, dont le nom reste masqué pour la révision par les pairs, a été évalué sur quatre surfaces représentatives : carrelage vinyle, roche grossière, gravier de pois et sable dans deux états de compaction. Sur 750 essais expérimentaux, le déploiement adaptatif réduit le glissement de 30 à 58 % selon le terrain, et améliore le temps de parcours ainsi que la consommation énergétique de jusqu'à 77,4 % en régime granulaire, comparé à une configuration à grouser fixe. La conclusion centrale bouscule un paradigme établi : aucune hauteur de grouser unique ne minimise le glissement sur l'ensemble des surfaces testées, ce qui souligne les limites structurelles des roues statiques, encore la norme sur Curiosity, Perseverance et la quasi-totalité des rovers en développement. Pour les agences spatiales (NASA, ESA, JAXA) et les intégrateurs de systèmes de mobilité, un mécanisme adaptatif de ce type offre un gain direct sur l'autonomie énergétique et la distance journalière franchissable. L'équipe propose également une loi de dimensionnement simplifiée reliant la granularité du terrain à la hauteur optimale de grouser, un outil potentiellement utilisable pour la planification de trajectoire embarquée. Les grousers font partie de la conception des roues de rovers depuis les missions Apollo (Lunar Roving Vehicle, 1971), mais leur hauteur a toujours été figée au stade de la conception. Les travaux récents sur les roues multimodales avaient exploré la rigidité variable ou le diamètre ajustable sans jamais traiter la hauteur de grouser comme variable de contrôle continue : ce preprint comble ce manque avec une validation expérimentale à grande échelle. Des designs à compliance variable issus de Carnegie Mellon et du JPL constituent les références concurrentes les plus proches, sans confrontation directe dans l'article. La suite logique passe par une validation sur simulant lunaire ou martien certifié, puis l'intégration d'un contrôleur adaptatif en boucle fermée avec détection de terrain embarquée.

UEL'ESA, mentionnée comme bénéficiaire potentielle, pourrait intégrer ce principe de grouser adaptatif dans ses futurs rovers lunaires ou martiens, mais aucune entité française ou européenne n'est identifiée parmi les auteurs.

RecherchePaper
1 source
Apprendre à oublier : mémoire épisodique hiérarchique pour le déploiement à long terme des robots
4arXiv cs.RO 

Apprendre à oublier : mémoire épisodique hiérarchique pour le déploiement à long terme des robots

Des chercheurs ont publié H²-EMV, un cadre logiciel permettant aux robots humanoïdes de gérer sélectivement leur mémoire épisodique sur le long terme. Le problème adressé est concret : lorsqu'un utilisateur demande « Où as-tu mis mes clés ? » ou « Pourquoi la tâche a-t-elle échoué ? », le robot doit interroger un historique d'expériences captées en continu depuis des capteurs multimodaux. Sans filtrage, ce volume dépasse rapidement les capacités de stockage et rend les requêtes en temps réel impraticables. H²-EMV construit une mémoire hiérarchique de manière incrémentale, applique un oubli sélectif via un modèle de langage qui évalue la pertinence de chaque événement selon des règles en langage naturel, puis affine ces règles à partir des retours utilisateur. Testé sur des simulations de tâches domestiques et sur 20,5 heures d'enregistrements réels collectés avec le robot humanoïde ARMAR-7, le système réduit la taille mémoire de 45 % et le temps de calcul des requêtes de 35 %, tout en maintenant la précision des réponses. En deuxième session, cette précision progresse de 70 % grâce à l'adaptation aux priorités individuelles de l'utilisateur. Pour les déploiements longs de robots de service, ce résultat lève un frein non résolu. La mémoire épisodique est un point de friction majeur : un robot qui efface tout entre deux sessions est inutilisable sur la durée, mais stocker sans discrimination devient ingérable sur plusieurs semaines ou plusieurs mois. H²-EMV démontre qu'un oubli structuré et appris ne dégrade pas les performances de question-réponse, et que celles-ci s'améliorent avec l'usage, propriété rare dans les systèmes robotiques actuels. Pour les intégrateurs et les décideurs B2B, cela ouvre la voie à des assistants humanoïdes capables de dialogue contextuel persistant sans infrastructure de stockage surdimensionnée, condition nécessaire à un déploiement viable en environnement réel. ARMAR-7 est un humanoïde développé à l'Institut für Anthropomatik und Robotik du Karlsruhe Institute of Technology (KIT), en Allemagne, dont les recherches en interaction homme-robot figurent parmi les plus avancées en Europe. La gestion de mémoire long terme en robotique est un champ actif : des approches comme MemoryBank ou les bases vectorielles couplées à des grands modèles de langage ciblent des problèmes comparables, mais rarement sur des horizons temporels aussi longs ni sur des données réelles aussi volumineuses. L'article (arXiv:2604.11306v2) reste un preprint non encore évalué en conférence à comité de lecture ; les résultats annoncés attendent une confirmation indépendante. Les prochaines étapes naturelles sont une validation sur d'autres plateformes humanoïdes et des horizons de déploiement encore plus étendus pour confirmer la stabilité de l'apprentissage des règles d'oubli.

UEH²-EMV est développé et validé sur ARMAR-7, humanoïde du KIT (Allemagne), positionnant un laboratoire européen à la pointe de la gestion mémoire long terme pour robots de service.

RecherchePaper
1 source