Aller au contenu principal
RecherchearXiv cs.RO 

Évaluation et amélioration de la mémoire au niveau des compétences pour la manipulation robotique en observabilité partielle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.38886) HIDE, un benchmark dédié à la mémoire en manipulation robotique sous observabilité partielle, ainsi que SEEK, un cadre logiciel pour y répondre. HIDE regroupe 15 tâches réparties en trois familles : comptage de répétitions, rappel d'états passés et suivi de l'avancement d'une exécution. Les configurations initiales sont randomisées. Chaque tâche comporte des points de décision où deux observations quasi identiques exigent des actions différentes, selon ce qui s'est produit auparavant. SEEK combine trois mécanismes de mémoire complémentaires, qui conservent des indices historiques et suivent l'état d'exécution. L'évaluation couvre la simulation et des expériences sur robot réel. Le résumé ne donne ni nom de robot, ni modèle de base, ni taux de succès chiffrés, ni liste des politiques testées. Il indique que les politiques existantes montrent des limites substantielles sur HIDE et que l'ajout de mémoire améliore le taux de succès dans les deux contextes.

Le résultat le plus utile est aussi le moins spectaculaire. Aucun des trois mécanismes ne vaut pour toutes les tâches : chacun aide sur certaines et dégrade les performances sur d'autres. Seule leur combinaison obtient le meilleur taux de succès moyen, parmi les configurations évaluées. Pour un intégrateur, cela signifie qu'une mémoire générique ajoutée à une politique VLA (vision-langage-action) ne suffit pas. Il faut choisir l'architecture selon la nature de l'information à retenir : un compteur, un événement passé ou une étape en cours. Le benchmark met aussi un nom sur une faiblesse peu mesurée. Beaucoup de politiques actuelles réagissent à l'observation courante, alors que des tâches réelles (compter des pièces posées, savoir si une étape a déjà été faite, reprendre après une interruption) dépendent d'un état caché. Les démonstrations sélectionnées en vidéo masquent ce défaut, qu'un benchmark standardisé peut enfin quantifier. Les chiffres détaillés manquent toutefois dans le résumé : l'ampleur réelle des gains reste à vérifier dans l'article complet.

Ce travail s'inscrit dans la montée en puissance des politiques généralistes de type Pi-0, GR00T ou Helix. Elles généralisent sur des tâches et des environnements variés, mais traitent le plus souvent un historique court, voire une seule image. Les benchmarks de manipulation existants testent surtout la diversité des tâches et la généralisation, rarement la dépendance à l'historique, ce que HIDE cherche à combler. Il s'agit d'une publication de recherche (v1, préprint) : ni produit, ni déploiement industriel, ni pilote annoncé. Les suites plausibles sont l'adoption de HIDE par d'autres laboratoires comme référence commune et l'intégration de mémoire au niveau des compétences dans les grands modèles de fondation robotiques. Cela dépendra de la disponibilité publique du benchmark et du code, que le résumé ne précise pas.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

MANIGUARD : référentiel et jeu de données pour l'évaluation et l'amélioration de la sécurité de la manipulation robotique
1arXiv cs.RO 

MANIGUARD : référentiel et jeu de données pour l'évaluation et l'amélioration de la sécurité de la manipulation robotique

Une équipe de recherche présente en août 2026 ManiGuard, un cadre pour évaluer et améliorer la sécurité des politiques de manipulation robotique fondées sur des modèles de fondation. Le benchmark associé, ManiGuard-Bench, couvre six familles de tâches domestiques à fort contact physique, organisées en 200 tâches de base testées en configuration standard et sous quatre perturbations hors distribution, soit 1000 scénarios verrouillés où la sécurité est contrôlée par des moniteurs à automates fondés sur la logique LTLf et des prédicats physiques, en simulation et sur un bras Franka réel. Le pipeline associé fournit 8000 démonstrations annotées pour la sécurité. Sur plus de 23000 épisodes testés avec des politiques VLA en zero-shot et affinées, 6 à 21% des épisodes pourtant réussis violent la spécification de sécurité, et l'affinage porte le taux de complétion sûre de quasi nul à 7,5-29,8%, avec 21 à 42% des épisodes engagés toujours en infraction. Ce travail est une publication de recherche, pas une annonce produit, mais son constat central interpelle : le succès d'une tâche et sa sécurité restent deux mesures distinctes, alors que l'évaluation des politiques VLA (vision-language-action) actuelles, du type Pi-0, GR00T N2 ou Helix, repose surtout sur des taux de réussite bruts. Pour les intégrateurs qui envisagent de déployer ces politiques en environnement domestique ou industriel à fort contact, le message est direct : même après affinage sur des données dédiées, deux des six familles de tâches restent quasi toujours dangereuses, et augmenter le volume de démonstrations ne comble pas cet écart. ManiGuard s'inscrit dans une montée en puissance rapide des politiques de manipulation fondées sur des modèles de fondation, dont les progrès en taux de réussite ont devancé les outils d'évaluation de leur sécurité, jusqu'ici basés sur des classifieurs appris ou des juges LLM que les auteurs jugent insuffisamment rigoureux. Le benchmark s'en distingue en ancrant ses contrôles dans la logique temporelle formelle et des prédicats physiques, vérifiés en simulation comme sur un bras Franka réel. Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, ne figure parmi les politiques testées. Les 8000 démonstrations et le benchmark sont publiés, ouvrant la voie à des campagnes d'affinage sécuritaire par d'autres laboratoires, sans calendrier de déploiement industriel annoncé à ce stade.

UEAucun acteur français ou européen n'est impliqué ni testé, mais le benchmark ouvert est directement utilisable par les intégrateurs européens pour évaluer la sécurité de leurs politiques VLA avant déploiement, un enjeu pertinent au regard des exigences de sécurité de l'AI Act.

RecherchePaper
1 source
SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle
2arXiv cs.RO 

SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle

Un article déposé sur arXiv début août 2026 présente SkillMemo, un framework de mémoire de compétences pour la manipulation robotique compositionnelle. Il vise une limite connue des politiques de diffusion (Diffusion Policy) et des modèles vision-langage-action (VLA): leur difficulté à généraliser hors distribution faute de jeux de données de trajectoires suffisamment vastes. Un module de segmentation guidé par experts, bâti sur une architecture Mixture-of-Experts, découpe les démonstrations longues en compétences atomiques via des coefficients de gating appris, puis les stocke dans une mémoire épisodique sous forme de paires clé-valeur compactes. À l'inférence, le modèle récupère les compétences pertinentes et les fusionne avec sa distribution de gating courante pour affiner ses prédictions d'action. Sur des benchmarks de simulation et des tâches réelles de manipulation, SkillMemo améliore les backbones DP et VLA et dépasse le modèle de référence π0.5. La rareté des trajectoires embarquées à grande échelle limite structurellement la capacité des VLA et des DP à recombiner des compétences apprises séparément pour des tâches nouvelles, un écart souvent pointé entre démonstrations de laboratoire et robustesse réelle. En misant sur une mémoire de compétences réutilisables plutôt que sur un réentraînement systématique, SkillMemo réduit cette dépendance aux données sans changer d'architecture de base, un enjeu direct pour les intégrateurs qui ont besoin de politiques capables de composer des compétences déjà apprises face à des tâches variables. Battre π0.5, référence largement citée dans la littérature récente, renforce la crédibilité de l'approche mémoire pour la généralisation compositionnelle, un problème que le simple passage à l'échelle des modèles n'a pas suffi à résoudre. SkillMemo s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et les modèles VLA, devenus les deux paradigmes dominants pour piloter bras et robots humanoïdes à partir de démonstrations, et répond à un constat partagé: ces modèles peinent à sortir du cadre de leurs données d'entraînement dès qu'une tâche combine des sous-compétences dans un ordre inédit. À ce stade, SkillMemo reste un travail de recherche en preprint, validé sur des benchmarks de simulation et des tâches réelles en laboratoire, sans indication de code public, de partenariat industriel ni de calendrier de déploiement. Son positionnement face à π0.5 en fait néanmoins une référence probable pour les prochains travaux sur la mémoire de compétences en robotique.

RecherchePaper
1 source
Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire
3arXiv cs.RO 

Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire

Une équipe de recherche a publié le 11 août 2026 sur arXiv (référence 2608.09410) un article intitulé "Skills in Weights, Memory in Code", présentant HyMeS, un framework hybride destiné à la manipulation robotique dépendant de la mémoire à long terme. Le système associe une politique vision-langage-action (VLA) markovienne, qui apprend les compétences motrices de bas niveau par imitation learning basée sur le gradient, à un agent de codage chargé de la gestion de la mémoire de haut niveau. Cet agent apprend par heuristique, en mettant à jour de façon itérative un système de règles exécutables à partir des retours d'essais (rollouts). Une vérification multimodale de l'achèvement des étapes, combinant signaux proprioceptifs et jugements d'un modèle vision-langage sur plusieurs images, permet de rafraîchir la mémoire en boucle fermée. Sur le benchmark RoboMemArena, HyMeS fait grimper le taux de succès cumulé moyen de 52,5% à 66,2% et le taux de succès par tâche de 41,3% à 60,1% par rapport au modèle de référence pi0.5, tout en dépassant le système concurrent PrediMem de 4,5 points en succès cumulé et 14,5 points en succès par tâche. L'enjeu dépasse la simple performance chiffrée: la plupart des politiques VLA actuelles génèrent chaque action à partir de l'observation courante ou d'un historique court et fixe, ce qui les rend inadaptées aux tâches non markoviennes où le robot doit se souvenir d'informations glanées bien plus tôt dans la séquence. En séparant les compétences motrices, apprises par imitation et figées dans les poids du réseau, de la logique de mémoire, gérée en code exécutable et adaptable sans nouvelles démonstrations, HyMeS promet une généralisation compositionnelle plus économe en données: seules les compétences motrices réutilisables nécessitent des démonstrations, pas chaque configuration de tâche dépendante de l'historique. Pour les intégrateurs et laboratoires travaillant sur des tâches industrielles multi-étapes (tri, assemblage séquentiel), c'est un argument direct contre le coût prohibitif de collecte de données propre aux approches VLA de bout en bout. Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que pi0.5 (Physical Intelligence), utilisé ici comme référence, et se positionne face à d'autres approches de mémoire augmentée comme PrediMem. Il s'agit à ce stade d'un préprint arXiv validé uniquement sur le benchmark RoboMemArena, sans validation annoncée sur robot physique ni pilote industriel.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
4arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source