Aller au contenu principal
SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle
RecherchearXiv cs.RO 

SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv début août 2026 présente SkillMemo, un framework de mémoire de compétences pour la manipulation robotique compositionnelle. Il vise une limite connue des politiques de diffusion (Diffusion Policy) et des modèles vision-langage-action (VLA): leur difficulté à généraliser hors distribution faute de jeux de données de trajectoires suffisamment vastes. Un module de segmentation guidé par experts, bâti sur une architecture Mixture-of-Experts, découpe les démonstrations longues en compétences atomiques via des coefficients de gating appris, puis les stocke dans une mémoire épisodique sous forme de paires clé-valeur compactes. À l'inférence, le modèle récupère les compétences pertinentes et les fusionne avec sa distribution de gating courante pour affiner ses prédictions d'action. Sur des benchmarks de simulation et des tâches réelles de manipulation, SkillMemo améliore les backbones DP et VLA et dépasse le modèle de référence π0.5.

La rareté des trajectoires embarquées à grande échelle limite structurellement la capacité des VLA et des DP à recombiner des compétences apprises séparément pour des tâches nouvelles, un écart souvent pointé entre démonstrations de laboratoire et robustesse réelle. En misant sur une mémoire de compétences réutilisables plutôt que sur un réentraînement systématique, SkillMemo réduit cette dépendance aux données sans changer d'architecture de base, un enjeu direct pour les intégrateurs qui ont besoin de politiques capables de composer des compétences déjà apprises face à des tâches variables. Battre π0.5, référence largement citée dans la littérature récente, renforce la crédibilité de l'approche mémoire pour la généralisation compositionnelle, un problème que le simple passage à l'échelle des modèles n'a pas suffi à résoudre.

SkillMemo s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et les modèles VLA, devenus les deux paradigmes dominants pour piloter bras et robots humanoïdes à partir de démonstrations, et répond à un constat partagé: ces modèles peinent à sortir du cadre de leurs données d'entraînement dès qu'une tâche combine des sous-compétences dans un ordre inédit. À ce stade, SkillMemo reste un travail de recherche en preprint, validé sur des benchmarks de simulation et des tâches réelles en laboratoire, sans indication de code public, de partenariat industriel ni de calendrier de déploiement. Son positionnement face à π0.5 en fait néanmoins une référence probable pour les prochains travaux sur la mémoire de compétences en robotique.

À lire aussi

GraphPoint : graphes d'entités sémantiques et trajectoires de points pour la manipulation robotique compositionnelle
1arXiv cs.RO 

GraphPoint : graphes d'entités sémantiques et trajectoires de points pour la manipulation robotique compositionnelle

Un article déposé sur arXiv (référence 2609.18358) début septembre 2026 présente GraphPoint, une méthode de manipulation robotique associée à un nouveau benchmark baptisé CoMani. Le travail part d'un constat répandu en robotique : les politiques de manipulation entraînées par apprentissage peinent à généraliser au-delà de leurs démonstrations, même quand une nouvelle instruction combine des objets et des comportements déjà vus séparément. Les auteurs expliquent que lorsque langage et scène visuelle sont trop fortement corrélés pendant l'entraînement, la politique finit par mémoriser un mapping visuo-moteur fixe au lieu de réellement suivre l'instruction donnée. CoMani propose des scènes initiales appariées et des variations contrôlées portant sur un seul facteur sémantique à la fois, afin de forcer les modèles évalués à s'appuyer sur le langage plutôt que sur des raccourcis visuels. Deux niveaux de généralisation compositionnelle sont testés : à l'intérieur d'une sous-tâche, en recombinant entités, types d'action et modificateurs déjà connus, et entre sous-tâches, en réutilisant des comportements appris dans des tâches longues et inédites. GraphPoint, la méthode proposée, relie des graphes d'entités sémantiques à un contrôle géométrique en prédisant la trajectoire future du point de préhension du gripper, convertie ensuite en commandes moteur via la géométrie du robot ; le gripper et les objets sont organisés par rôles sémantiques et leurs interactions conditionnées par le type et le modificateur d'action demandés, tandis qu'une estimation de progression guide les transitions entre étapes. L'enjeu dépasse la seule démonstration technique : il touche directement le problème de l'écart entre performance affichée sur des tâches déjà vues et robustesse réelle en usage, un point sensible pour tout intégrateur évaluant une politique vision-langage-action avant déploiement industriel. En isolant précisément si un modèle suit l'instruction ou reconnaît simplement une scène mémorisée, CoMani offre aux équipes de recherche un outil de diagnostic plus rigoureux que les démonstrations vidéo sélectionnées qui dominent souvent la communication du secteur autour des capacités de généralisation. Le papier s'inscrit dans la vague récente de benchmarks cherchant à mesurer la généralisation compositionnelle des politiques de manipulation plutôt que leur seule réussite sur des tâches figées. Les auteurs indiquent que le code sera publié en accès libre sous le nom GraphPoint, sans préciser de calendrier ni d'institution porteuse. Aucun partenariat industriel, déploiement réel ou chiffre de performance chiffré au-delà des résultats d'ablation sur CoMani n'est mentionné à ce stade, ce qui situe cette publication au stade de la recherche amont plutôt que du produit commercialisable.

RecherchePaper
1 source
ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation
2arXiv cs.RO 

ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation

Une équipe de chercheurs a publié ATOM-Bench, un benchmark de terrain conçu pour évaluer les politiques de manipulation robotique sur deux dimensions distinctes : l'acquisition de compétences atomiques et la généralisation compositionnelle. Le dispositif décompose la manipulation sur table en "atomes moteurs" (précision de préhension, trajectoire du poignet, force de contact) et en "atomes d'instruction" (comptage, filtrage logique, ancrage sémantique). Il comprend 30 tâches atomiques et 24 tâches compositionnelles inédites, testées sur des configurations bras unique et bras double. Les auteurs ont collecté 3 000 démonstrations humaines pour le fine-tuning et effectué 2 700 rollouts physiques sur cinq politiques de manipulation représentatives. Les métriques introduites, l'Atomic Score (AS) et le Compositional Failure Share (CFS), permettent d'isoler la source d'un échec : exécution moteur défaillante, mauvais ancrage instruction, ou incapacité à recombiner des compétences acquises. Les résultats remettent en cause un postulat courant dans le secteur : que des politiques performantes sur des tâches atomiques généralisent naturellement à des tâches compositionnelles. Ce n'est pas le cas. Malgré des scores atomiques corrects sur l'ancrage d'instructions simples, les modèles testés échouent systématiquement sur le comptage, le filtrage logique et les atomes moteurs fins. Plus significatif encore, une bonne performance atomique ne prédit pas fiablement la réussite sur les tâches compositionnelles hors distribution. Pour un intégrateur ou un décideur industriel, cela signifie que les benchmarks classiques sur tâches démontrées surestiment largement la robustesse opérationnelle des politiques dites "généralistes". ATOM-Bench s'inscrit dans un contexte où les politiques VLA (Vision-Language-Action) comme pi0 (Physical Intelligence), Octo, ou OpenVLA sont présentées comme des fondations universelles pour le contrôle robotique. Ce cadre d'évaluation comble l'absence de protocole standardisé pour tester la composabilité des compétences, un angle mort identifié depuis les travaux sur l'abstraction hiérarchique en RL. Les données de démonstration et les rollouts d'évaluation sont publiés en open access pour permettre une comparaison reproductible entre équipes. La prochaine étape logique serait d'intégrer ATOM-Bench comme protocole de validation dans les pipelines de fine-tuning des acteurs du secteur, notamment pour qualifier des déploiements réels en environnement industriel non contrôlé.

UELes laboratoires et intégrateurs européens travaillant sur des politiques de manipulation robotique peuvent adopter ATOM-Bench comme protocole de validation open-access pour qualifier la robustesse réelle de leurs systèmes avant déploiement industriel.

RecherchePaper
1 source
Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire
3arXiv cs.RO 

Compétences en poids, mémoire en code : apprentissage hybride pour la manipulation robotique dépendante de la mémoire

Une équipe de recherche a publié le 11 août 2026 sur arXiv (référence 2608.09410) un article intitulé "Skills in Weights, Memory in Code", présentant HyMeS, un framework hybride destiné à la manipulation robotique dépendant de la mémoire à long terme. Le système associe une politique vision-langage-action (VLA) markovienne, qui apprend les compétences motrices de bas niveau par imitation learning basée sur le gradient, à un agent de codage chargé de la gestion de la mémoire de haut niveau. Cet agent apprend par heuristique, en mettant à jour de façon itérative un système de règles exécutables à partir des retours d'essais (rollouts). Une vérification multimodale de l'achèvement des étapes, combinant signaux proprioceptifs et jugements d'un modèle vision-langage sur plusieurs images, permet de rafraîchir la mémoire en boucle fermée. Sur le benchmark RoboMemArena, HyMeS fait grimper le taux de succès cumulé moyen de 52,5% à 66,2% et le taux de succès par tâche de 41,3% à 60,1% par rapport au modèle de référence pi0.5, tout en dépassant le système concurrent PrediMem de 4,5 points en succès cumulé et 14,5 points en succès par tâche. L'enjeu dépasse la simple performance chiffrée: la plupart des politiques VLA actuelles génèrent chaque action à partir de l'observation courante ou d'un historique court et fixe, ce qui les rend inadaptées aux tâches non markoviennes où le robot doit se souvenir d'informations glanées bien plus tôt dans la séquence. En séparant les compétences motrices, apprises par imitation et figées dans les poids du réseau, de la logique de mémoire, gérée en code exécutable et adaptable sans nouvelles démonstrations, HyMeS promet une généralisation compositionnelle plus économe en données: seules les compétences motrices réutilisables nécessitent des démonstrations, pas chaque configuration de tâche dépendante de l'historique. Pour les intégrateurs et laboratoires travaillant sur des tâches industrielles multi-étapes (tri, assemblage séquentiel), c'est un argument direct contre le coût prohibitif de collecte de données propre aux approches VLA de bout en bout. Le travail s'inscrit dans la lignée des modèles VLA généralistes tels que pi0.5 (Physical Intelligence), utilisé ici comme référence, et se positionne face à d'autres approches de mémoire augmentée comme PrediMem. Il s'agit à ce stade d'un préprint arXiv validé uniquement sur le benchmark RoboMemArena, sans validation annoncée sur robot physique ni pilote industriel.

RecherchePaper
1 source
GTA-2 : un cadre multi-VLM pour synthétiser des compétences de manipulation robotique via des axes de tâches ancrés
4arXiv cs.RO 

GTA-2 : un cadre multi-VLM pour synthétiser des compétences de manipulation robotique via des axes de tâches ancrés

Des chercheurs ont publié le 10 septembre 2026 sur arXiv un article décrivant GTA-2 (Grounded Task Axes v2), une architecture multi-VLM destinée à générer des compétences de manipulation robotique sans démonstration ni entraînement spécifique à la tâche. Le système repose sur quatre agents VLM (modèles vision-langage) spécialisés qui décomposent successivement une tâche, construisent une représentation abstraite en axes et points clés, assignent les paramètres de contrôleur puis ancrent ces éléments dans des observations RGB-D réelles. Les auteurs ont testé GTA-2 sur 14 tâches de manipulation avec un robot réel, en le comparant à la politique VLA pi0.5 et à deux systèmes Code-as-Policies, l'un utilisant des contrôleurs à axes de tâche, l'autre des primitives robotiques classiques. En zero-shot, GTA-2 atteint un taux de réussite moyen de 73,9%, soit 31,4 points de plus que la meilleure référence testée. Avec un retour humain ciblé sur une étape défaillante, sans retoucher les étapes correctes, ce taux grimpe à 90,7%. Le projet est documenté sur gta2-project.github.io. L'intérêt pour l'industrie tient moins à la performance brute qu'à la structure explicite du pipeline. Plutôt que de prédire des actions de bout en bout comme une politique VLA entraînée, ou de composer des primitives fixes prédéfinies par tâche, GTA-2 fige des sous-tâches sémantiques intermédiaires, points clés, axes, paramètres liés à la scène, que l'humain peut corriger étape par étape. Pour les intégrateurs, cela répond à un problème concret: les compétences génériques restent trop grossières pour capturer les décisions géométriques et de contrôle propres à chaque scène, tandis que prédéfinir un comportement par tâche ne passe pas à l'échelle. En évitant tout fine-tuning ou collecte de démonstrations propres à la tâche, l'approche promet un déploiement plus rapide sur de nouvelles tâches, au prix d'une dépendance à la qualité des VLM sous-jacents et, comme le montre l'écart entre 73,9% et 90,7%, d'une supervision humaine encore nécessaire pour fiabiliser l'exécution. GTA-2 est la seconde itération du concept Grounded Task Axes, positionné explicitement contre deux familles d'approches dominantes du secteur: les politiques VLA de bout en bout, illustrées ici par pi0.5, et les frameworks Code-as-Policies qui font générer du code de contrôle robotique par un modèle de langage. Il s'agit à ce stade d'un travail de recherche académique publié sur arXiv, testé en laboratoire sur des tâches réelles mais sans annonce de déploiement industriel, de partenariat ou de calendrier de commercialisation. Le code et des démonstrations vidéo sont annoncés sur la page projet dédiée, sans précision sur une éventuelle mise à disposition open source du framework complet.

RecherchePaper
1 source