Aller au contenu principal
RecherchearXiv cs.RO 

Diagnostic et récupération du décalage de l'espace d'observation aux jonctions de compétences à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2610.10810) une étude sur un mode de défaillance qu'ils nomment Observation-Space Shift (OSS), qui frappe la manipulation robotique longue durée assemblée par chaînage de compétences entraînées séparément. Chaque compétence est fiable isolément, mais la performance chute nettement une fois enchaînées. La compétence suivante doit démarrer de l'état laissé par la précédente, et non de sa distribution d'entraînement. Grâce à des resets privilégiés du simulateur, l'équipe établit que le décalage dominant vient de la scène déplacée (un tiroir resté ouvert, des objets secondaires laissés en route), et non de la configuration articulaire du robot ni de l'objet manipulé. Pour tester ce diagnostic, ils construisent un système entièrement appris de type détecter, restaurer, reprendre. Un moniteur de progression de tâche repère le blocage, une politique apprise remet en place les éléments déplacés, puis un fine-tuning robuste aux jonctions permet à la compétence de repartir. Sur le benchmark BOSS-44, le taux de succès de la chaîne complète passe de 7,6 % à 26,5 %, soit 3,5 fois la politique de base et 51 % d'un oracle de restauration privilégié.

Le résultat le plus instructif tient aux échecs des alternatives. Le rééchantillonnage best-of-K, une Diffusion Policy et des baselines à base de modèles du monde ne parviennent pas à se rétablir depuis les états de jonction évalués. Réessayer depuis un état hors support ne suffit donc pas : remettre la scène dans une configuration que la politique connaît avant de reprendre est plus efficace. Pour les intégrateurs qui composent des séquences de compétences (ouverture de tiroir, rangement, assemblage), le message est pratique : la fiabilité unitaire ne se multiplie pas proprement, et il faut instrumenter les transitions. Les auteurs restent prudents : ils présentent leur système comme une preuve du diagnostic, pas comme une méthode générale. Même restauré, le système n'atteint que 26,5 % de succès de chaîne, ce qui reste loin d'un seuil industriel, et les résultats viennent surtout de simulation.

Côté réel, l'équipe a testé sur un bras Franka avec une politique π0.5 affinée. Le moniteur y est limité par l'observabilité des caméras extérieures, mais la boucle fermée récupère malgré tout certains échecs autrement terminaux. Les auteurs en tirent un argument pour ajouter des capteurs de poignet et de pince. Ces travaux s'inscrivent dans le débat sur la dégradation des VLA et des politiques de type π0 sur les longs horizons, où l'écart entre démonstration et fiabilité répétée reste le principal frein au déploiement. Les approches concurrentes misent sur des modèles généralistes plus robustes, des données de récupération d'erreurs ou des modèles du monde, que cette étude montre insuffisants dans ce cadre précis. Les prochaines étapes probables sont l'intégration de capteurs embarqués et la validation sur davantage de tâches physiques.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

SkillWeave : tisser des démonstrations hétérogènes en compétences de manipulation à long horizon

Des chercheurs publient sur arXiv SkillWeave, un cadre de démonstrations hétérogènes pour la manipulation dextre à long horizon. Il associe deux modes de collecte selon le type d'interaction. La téléopération couvre les phases larges d'approche et de transport. L'enseignement kinesthésique, où l'opérateur guide physiquement le bras, couvre les gestes de précision riches en contacts. Ce second mode crée un décalage visuel, puisque l'humain apparaît dans les images d'entraînement. L'équipe y répond par une politique de diffusion conditionnée par un masque d'objet. L'entraînement utilise une segmentation d'objets réalisée hors ligne. Au déploiement, un prédicteur de masque léger la remplace, ce qui évite la segmentation en ligne et l'inpainting d'images. Un second mécanisme, le « successor-aware terminal steering », traite la dérive de distribution entre sous-politiques entraînées séparément. Il choisit, parmi des actions échantillonnées par la politique prédécesseur, celle qui mène vers des états couverts par la distribution d'états initiaux de la politique successeur. Sur trois tâches réelles à long horizon, le taux de réussite de bout en bout moyen atteint 27 %. Les sous-tâches dextres, avec politiques kinesthésiques à masque, atteignent 65 % en moyenne. L'efficacité de composition des transitions entre politiques atteint 87 % en moyenne. Le code et les vidéos sont publiés. L'intérêt tient à ce que ces chiffres montrent sur le goulot d'étranglement de la manipulation longue. Un taux de bout en bout de 27 % reste très loin d'un niveau exploitable en production. Il confirme aussi que l'enchaînement de compétences multiplie les erreurs : avec 65 % par sous-tâche dextre, la réussite s'érode vite sur trois tâches. La contribution est donc surtout diagnostique. Elle indique que la jonction entre politiques pèse autant que la qualité de chaque politique, avec 87 % de composition efficace. Elle suggère aussi qu'une modalité de collecte unique, souvent la téléopération seule, est mal adaptée aux contacts fins. Pour un intégrateur, la leçon est pratique : le coût de collecte de données se répartit mieux si l'on réserve le guidage physique aux seuls gestes critiques. Les limites sont à garder en tête. Ni les tâches, ni la plateforme robotique, ni le nombre d'essais ne figurent dans le résumé, et aucune comparaison avec des modèles généralistes n'y est donnée. Les résultats restent ceux d'un laboratoire, sans déploiement industriel. Le contexte est celui d'un champ qui cherche à sortir des démonstrations courtes. Les politiques de diffusion et les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T progressent sur des tâches isolées. Ils restent fragiles dès que la séquence s'allonge. La téléopération à grande échelle est l'approche dominante pour collecter des données. Le teaching kinesthésique, plus lent mais plus précis, est resté marginal à cause du biais visuel que cet article cherche à corriger. Le travail s'inscrit dans les approches de décomposition en compétences, qui visent à composer des primitives plutôt qu'à entraîner une politique monolithique. La suite logique serait de tester la méthode sur davantage de tâches et d'embodiments. Il faudrait aussi la confronter à des VLA généralistes sur les mêmes séquences. Le caractère reproductible du code publié le permettra.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

ManiUnit : un jeu de données et un banc d'essai de compétences de manipulation pour les tâches à long horizon

ManiUnit est un jeu de données et un benchmark de compétences de manipulation, construit à partir de 50 activités du simulateur BEHAVIOR-1K et publié sur arXiv en octobre 2026. Le jeu de données compte 137 899 segments répartis sur 21 types de compétences et 417 sous-tâches, tandis que le benchmark comprend 1 260 instances de test. Chaque segment est associé à une instruction explicite de sous-tâche. Le benchmark mesure aussi la sensibilité à des perturbations de la position initiale de la base mobile ou de la configuration articulaire du robot. Il restaure des états intermédiaires du simulateur et définit des conditions de succès locales, ce qui permet d'évaluer chaque compétence sans exécuter les étapes qui la précèdent. Sur deux activités à long horizon, une politique de compétence entraînée sur les segments ManiUnit atteint 78,7 % de succès local en manipulation, contre 49,3 % pour une politique de tâche entraînée sur des démonstrations complètes. Une fois coordonnées par un planificateur, politiques de tâche et de compétence font passer le succès sur la tâche complète de 4,0 % à 18,0 %. L'enjeu est de rendre diagnostiquables les échecs de la manipulation mobile à long horizon, où un robot doit traverser plusieurs pièces et enchaîner des compétences à partir d'une seule consigne en langage naturel. Les auteurs identifient trois difficultés. D'abord, des observations proches sous une même consigne rendent la sélection de la compétence ambiguë. Ensuite, même lorsqu'une compétence réussit, l'état du robot qu'elle transmet à la suivante peut s'écarter des états de départ démontrés et dégrader l'exécution. Enfin, les métriques au niveau de la tâche masquent les causes d'échec, puisqu'une défaillance précoce empêche de tester les étapes suivantes. Les évaluations de politiques vision-langage-action (VLA) représentatives montrent que des scores agrégés similaires peuvent cacher des écarts importants d'une compétence à l'autre. Sur le benchmark complet, les perturbations articulaires réduisent le taux de succès d'environ 56 % par rapport aux états de départ démontrés. Ce résultat appelle à la prudence face aux démonstrations de VLA mesurées sur des conditions initiales propres. Il faut toutefois relativiser la portée de ces chiffres : tout est mesuré en simulation, sur un nombre limité d'activités pour la comparaison compétence contre tâche, et un succès de 18,0 % sur la tâche complète reste très éloigné d'un seuil industriel. Les auteurs ne nomment pas ici les modèles VLA évalués. ManiUnit s'inscrit dans la lignée de BEHAVIOR-1K, benchmark de tâches domestiques de longue durée, et d'une tendance à décomposer les tâches en compétences réutilisables pilotées par un planificateur, plutôt qu'à entraîner une politique monolithique. Le gain obtenu avec le planificateur suggère que cette approche modulaire est plus prometteuse, mais elle dépend de la robustesse de chaque compétence face aux états hérités. Le jeu de données et le benchmark sont des ressources de recherche, sans calendrier de déploiement ni transfert vers le matériel réel annoncé dans le résumé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences
3arXiv cs.RO 

Analyse des capacités incarnées dans les modèles de langage multimodaux par évaluation et diagnostic par compétences

Une équipe de chercheurs a publié BEAR (Benchmark for Embodied Abilities and Reasoning), un cadre d'évaluation qui décompose les tâches robotiques en 14 compétences atomiques pour diagnostiquer les failles des grands modèles de langage multimodaux (MLLMs) embarqués. Le benchmark regroupe 4 469 échantillons entrelacés image-vidéo-texte couvrant 6 catégories, de la perception bas niveau jusqu'à la planification de haut niveau. Soumis à 20 MLLMs dont GPT-5, il révèle deux résultats principaux : les capacités perceptuelles constituent le principal goulot d'étranglement derrière les échecs de raisonnement, et les modèles présentent une modélisation spatiotemporelle instable qui restait invisible dans les benchmarks précédents. En réponse, les auteurs proposent BEAR-Agent, un agent multimodal augmenté d'outils de raisonnement visuel et spatial, qui obtient une amélioration relative de 17,5 % sur GPT-5 par rapport au modèle de base, avec des gains confirmés en simulation et en robotique réelle. L'intérêt de ce travail tient à la granularité du diagnostic. Les benchmarks existants mesurent si un agent réussit une tâche sans expliquer pourquoi. BEAR révèle que les modèles n'échouent pas d'abord sur le raisonnement abstrait, mais sur la perception : identifier des objets dans une scène, interpréter une séquence vidéo, localiser un élément dans l'espace. Ce résultat contredit l'hypothèse répandue selon laquelle les LLMs auraient comblé le déficit de compréhension scénique grâce à leur préentraînement massif. La découverte sur l'instabilité spatiotemporelle est particulièrement significative pour les intégrateurs déployant des VLA (Vision-Language-Action models) en environnement industriel : elle suggère que les performances observées en démonstration vidéo curatée ne reflètent pas la fiabilité opérationnelle réelle. Ce preprint arXiv (version 2, 2025) s'inscrit dans un effort plus large pour structurer l'évaluation des agents embarqués, là où des benchmarks comme EgoSchema ou OpenEQA traitent la compréhension incarnée sans diagnostiquer les sous-compétences. BEAR se distingue par ses expériences en environnements robotiques réels, contrairement aux approches purement simulées comme EmbodiedScan. Aucun acteur français ou européen n'est directement impliqué dans cette publication académique, qui émane vraisemblablement d'équipes universitaires asiatiques ou nord-américaines au vu de la page projet associée. La prochaine étape logique serait l'adoption de BEAR comme protocole standard dans les pipelines d'évaluation VLA avant tout déploiement physique.

RecherchePaper
1 source
Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain
4arXiv cs.RO 

Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain

Des chercheurs proposent LYRA, un cadre de génération de code robotique qui apprend des compétences de manière continue à partir des retours humains. Il vise les tâches de manipulation dites « ultra-longues », où l'enchaînement d'actions dépasse ce qu'un grand modèle de langage (LLM) sait produire de façon fiable en une seule passe. Le système distille chaque correction humaine en compétences modulaires et réutilisables, puis étend leurs fonctionnalités au fil des interactions sans écraser les comportements déjà acquis. Une mémoire externe stocke ces compétences et des exemples d'exécution. Une récupération augmentée (RAG) sélectionne les connaissances pertinentes pour chaque tâche. Quand cette récupération ne suffit pas, l'utilisateur donne un indice pour orienter la réutilisation. Les auteurs annoncent un taux de succès de 0,93, jusqu'à 27 % au-dessus des méthodes de référence, et un gain de 42 % en efficacité de correction, c'est-à-dire en nombre d'interventions humaines nécessaires. Les tests couvrent les benchmarks Ravens, Franka Kitchen, LIBERO-long et MetaWorld, ainsi que des tâches en conditions réelles. LYRA réussit notamment la tâche « construire une maison », qui exige de planifier plus de 20 primitives. Ce travail s'attaque à un point faible connu de la robotique pilotée par LLM. Les modèles traduisent bien une consigne en code, mais l'ambiguïté des instructions, le bruit des générations et la fenêtre de contexte limitée rendent les longues séquences peu fiables. Les boucles fermées qui reposent seulement sur le retour d'un LLM ne règlent pas le problème, car ces modèles raisonnent mal sur l'état physique d'un robot, même quand l'erreur saute aux yeux d'un humain. L'intérêt pour un intégrateur est concret : plutôt que de réentraîner un modèle ou de réécrire des prompts à chaque correction, l'opérateur enrichit une bibliothèque de compétences qui se transmet d'une tâche à l'autre. Cela limite l'oubli catastrophique, fréquent quand les retours s'accumulent dans des représentations qui généralisent mal. L'approche est une alternative à bas coût aux modèles vision-langage-action (VLA) entraînés de bout en bout, mais elle déplace la charge vers l'humain dans la boucle. Les résultats sont à lire avec prudence : il s'agit d'un preprint sans validation par les pairs. Les benchmarks sont en grande partie simulés. L'article ne donne pas de temps de cycle, de robot industriel ni de volume de déploiement. Le gain de 27 % est relatif aux méthodes de référence choisies par les auteurs. Le papier arrive en version 3 sur arXiv (2509.18597), ce qui indique plusieurs cycles de révision depuis la première soumission de septembre 2025. Il s'inscrit dans la lignée des approches de génération de code pour la robotique, comme Code as Policies, qui font du LLM un planificateur écrivant des appels à des primitives. Il s'oppose à la voie des VLA généralistes (Pi-0, GR00T, Helix), qui encodent la compétence dans les poids du modèle. Aucun partenaire industriel, calendrier de pilote ni publication de code n'est mentionné dans le résumé. La suite logique serait un test sur bras industriels avec des opérateurs non experts, et une mesure de la façon dont la bibliothèque de compétences se comporte à grande échelle, quand la récupération doit trier des centaines de compétences.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source