Aller au contenu principal
RecherchearXiv cs.RO 

ManiUnit : un jeu de données et un banc d'essai de compétences de manipulation pour les tâches à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ManiUnit est un jeu de données et un benchmark de compétences de manipulation, construit à partir de 50 activités du simulateur BEHAVIOR-1K et publié sur arXiv en octobre 2026. Le jeu de données compte 137 899 segments répartis sur 21 types de compétences et 417 sous-tâches, tandis que le benchmark comprend 1 260 instances de test. Chaque segment est associé à une instruction explicite de sous-tâche. Le benchmark mesure aussi la sensibilité à des perturbations de la position initiale de la base mobile ou de la configuration articulaire du robot. Il restaure des états intermédiaires du simulateur et définit des conditions de succès locales, ce qui permet d'évaluer chaque compétence sans exécuter les étapes qui la précèdent. Sur deux activités à long horizon, une politique de compétence entraînée sur les segments ManiUnit atteint 78,7 % de succès local en manipulation, contre 49,3 % pour une politique de tâche entraînée sur des démonstrations complètes. Une fois coordonnées par un planificateur, politiques de tâche et de compétence font passer le succès sur la tâche complète de 4,0 % à 18,0 %.

L'enjeu est de rendre diagnostiquables les échecs de la manipulation mobile à long horizon, où un robot doit traverser plusieurs pièces et enchaîner des compétences à partir d'une seule consigne en langage naturel. Les auteurs identifient trois difficultés. D'abord, des observations proches sous une même consigne rendent la sélection de la compétence ambiguë. Ensuite, même lorsqu'une compétence réussit, l'état du robot qu'elle transmet à la suivante peut s'écarter des états de départ démontrés et dégrader l'exécution. Enfin, les métriques au niveau de la tâche masquent les causes d'échec, puisqu'une défaillance précoce empêche de tester les étapes suivantes. Les évaluations de politiques vision-langage-action (VLA) représentatives montrent que des scores agrégés similaires peuvent cacher des écarts importants d'une compétence à l'autre. Sur le benchmark complet, les perturbations articulaires réduisent le taux de succès d'environ 56 % par rapport aux états de départ démontrés. Ce résultat appelle à la prudence face aux démonstrations de VLA mesurées sur des conditions initiales propres.

Il faut toutefois relativiser la portée de ces chiffres : tout est mesuré en simulation, sur un nombre limité d'activités pour la comparaison compétence contre tâche, et un succès de 18,0 % sur la tâche complète reste très éloigné d'un seuil industriel. Les auteurs ne nomment pas ici les modèles VLA évalués. ManiUnit s'inscrit dans la lignée de BEHAVIOR-1K, benchmark de tâches domestiques de longue durée, et d'une tendance à décomposer les tâches en compétences réutilisables pilotées par un planificateur, plutôt qu'à entraîner une politique monolithique. Le gain obtenu avec le planificateur suggère que cette approche modulaire est plus prometteuse, mais elle dépend de la robustesse de chaque compétence face aux états hérités. Le jeu de données et le benchmark sont des ressources de recherche, sans calendrier de déploiement ni transfert vers le matériel réel annoncé dans le résumé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
1arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

SkillWeave : tisser des démonstrations hétérogènes en compétences de manipulation à long horizon

Des chercheurs publient sur arXiv SkillWeave, un cadre de démonstrations hétérogènes pour la manipulation dextre à long horizon. Il associe deux modes de collecte selon le type d'interaction. La téléopération couvre les phases larges d'approche et de transport. L'enseignement kinesthésique, où l'opérateur guide physiquement le bras, couvre les gestes de précision riches en contacts. Ce second mode crée un décalage visuel, puisque l'humain apparaît dans les images d'entraînement. L'équipe y répond par une politique de diffusion conditionnée par un masque d'objet. L'entraînement utilise une segmentation d'objets réalisée hors ligne. Au déploiement, un prédicteur de masque léger la remplace, ce qui évite la segmentation en ligne et l'inpainting d'images. Un second mécanisme, le « successor-aware terminal steering », traite la dérive de distribution entre sous-politiques entraînées séparément. Il choisit, parmi des actions échantillonnées par la politique prédécesseur, celle qui mène vers des états couverts par la distribution d'états initiaux de la politique successeur. Sur trois tâches réelles à long horizon, le taux de réussite de bout en bout moyen atteint 27 %. Les sous-tâches dextres, avec politiques kinesthésiques à masque, atteignent 65 % en moyenne. L'efficacité de composition des transitions entre politiques atteint 87 % en moyenne. Le code et les vidéos sont publiés. L'intérêt tient à ce que ces chiffres montrent sur le goulot d'étranglement de la manipulation longue. Un taux de bout en bout de 27 % reste très loin d'un niveau exploitable en production. Il confirme aussi que l'enchaînement de compétences multiplie les erreurs : avec 65 % par sous-tâche dextre, la réussite s'érode vite sur trois tâches. La contribution est donc surtout diagnostique. Elle indique que la jonction entre politiques pèse autant que la qualité de chaque politique, avec 87 % de composition efficace. Elle suggère aussi qu'une modalité de collecte unique, souvent la téléopération seule, est mal adaptée aux contacts fins. Pour un intégrateur, la leçon est pratique : le coût de collecte de données se répartit mieux si l'on réserve le guidage physique aux seuls gestes critiques. Les limites sont à garder en tête. Ni les tâches, ni la plateforme robotique, ni le nombre d'essais ne figurent dans le résumé, et aucune comparaison avec des modèles généralistes n'y est donnée. Les résultats restent ceux d'un laboratoire, sans déploiement industriel. Le contexte est celui d'un champ qui cherche à sortir des démonstrations courtes. Les politiques de diffusion et les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T progressent sur des tâches isolées. Ils restent fragiles dès que la séquence s'allonge. La téléopération à grande échelle est l'approche dominante pour collecter des données. Le teaching kinesthésique, plus lent mais plus précis, est resté marginal à cause du biais visuel que cet article cherche à corriger. Le travail s'inscrit dans les approches de décomposition en compétences, qui visent à composer des primitives plutôt qu'à entraîner une politique monolithique. La suite logique serait de tester la méthode sur davantage de tâches et d'embodiments. Il faudrait aussi la confronter à des VLA généralistes sur les mêmes séquences. Le caractère reproductible du code publié le permettra.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique
3arXiv cs.RO 

IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique

Une équipe de chercheurs publie sur arXiv (identifiant 2606.05660, juin 2026) une revue systématique de la sécurité dans les systèmes d'IA incarnée (embodied AI) appliqués à la manipulation robotique à long horizon. Ce survey structure la littérature selon trois niveaux d'intervention : la sécurité au stade de la planification (planning-time), au niveau de la politique de contrôle (policy-time) et pendant l'exécution (execution-time). Les auteurs identifient quatre vecteurs de risque pouvant s'accumuler dans un même système en boucle fermée : le misgrounding sémantique (l'agent interprète mal l'instruction de haut niveau), la propagation d'erreur entre sous-tâches, la dérive d'exécution (execution drift) et les risques physiques liés aux contacts. Ils distinguent par ailleurs trois catégories de garanties dans la littérature existante : formelles, statistiques et heuristiques empiriques, et concluent que les preuves formelles font défaut à chaque couche. L'enjeu est direct pour les intégrateurs et les décideurs industriels. Un bras robotique déployé en entrepôt ou en ligne de production enchaîne des dizaines d'actions sur des horizons temporels étendus, et chaque sous-tâche peut propager silencieusement une erreur vers les suivantes. Or le survey révèle que la sécurité au niveau de la politique de contrôle, au coeur même des modèles VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, est la couche la moins documentée empiriquement. Les mécanismes d'intervention déclenchés par l'incertitude (uncertainty-triggered intervention) restent immatures, et les benchmarks spécifiques à la sécurité en manipulation longue durée sont quasi-inexistants, ce qui rend toute validation rigoureuse avant déploiement aujourd'hui difficile. Ce travail paraît dans un contexte d'accélération industrielle : Figure AI, Boston Dynamics, Unitree et Physical Intelligence multiplient les démonstrations de manipulation dextère, souvent en conditions semi-contrôlées, alimentant un écart potentiel entre annonces marketing et réalité opérationnelle. Il convient de souligner que ce papier est une analyse critique de l'existant, pas un nouveau système ou algorithme. Ses recommandations prioritaires portent sur trois axes : des assurances cross-couche cohérentes de la planification jusqu'à l'exécution physique, des benchmarks dédiés à la sécurité en manipulation longue durée, et des protocoles de déploiement progressifs pour les agents robotiques en environnements réels. En creux, le constat est que les capacités du secteur progressent plus vite que les outils pour en évaluer la sécurité.

UEL'absence de benchmarks formels de sécurité pour la manipulation longue durée concerne directement les industriels européens déployant des bras robotisés, et pourrait alimenter les exigences de validation dans le cadre de l'AI Act pour les systèmes robotiques à haut risque.

RecherchePaper
1 source
LongBench : évaluation des politiques de manipulation robotique sur des tâches réelles à horizon long
4arXiv cs.RO 

LongBench : évaluation des politiques de manipulation robotique sur des tâches réelles à horizon long

Une équipe de chercheurs a publié en avril 2026 LongBench, un benchmark conçu pour évaluer les politiques de manipulation robotique sur des tâches longues et enchaînées dans le monde réel. Contrairement à la majorité des benchmarks existants, LongBench repose sur plus de 1 000 épisodes exécutés en conditions réelles, et non en simulation. Il se structure autour de deux régimes complémentaires : les tâches Context-Independent, où l'état du monde est entièrement observable, et les tâches Context-Dependent, où le robot doit gérer une ambiguïté sur l'état ou l'intention. Les tâches sont organisées en sous-ensembles ciblant des capacités spécifiques (robustesse d'exécution, cohérence temporelle, raisonnement contextuel), permettant un diagnostic fin des sources d'échec. Six politiques de l'état de l'art ont été évaluées sur ce protocole, sans qu'un seul facteur dominant n'explique les dégradations de performance sur les horizons longs. Ces résultats remettent en question une hypothèse courante dans le domaine : celle selon laquelle améliorer la mémoire ou le contexte historique suffirait à résoudre les échecs en manipulation longue durée. LongBench montre que dans les environnements pleinement observables, c'est la robustesse d'exécution, c'est-à-dire la capacité du robot à répéter fidèlement une séquence motrice sur des dizaines de pas, qui domine les performances, et non la gestion du contexte. À l'inverse, dans les scénarios ambigus, les méthodes à mémoire n'apportent pas d'amélioration systématique : la difficulté contextuelle varie fortement selon les tâches, ce qui suggère qu'il n'existe pas de solution générique. Pour les intégrateurs et les équipes R&D qui évaluent des politiques VLA (Vision-Language-Action) ou des architectures de contrôle diffusion, ce benchmark offre un protocole de diagnostic plus fin que les métriques de succès agrégé habituelles. Le benchmark s'inscrit dans un effort plus large de la communauté robotique pour dépasser les évaluations en simulation, dont le sim-to-real gap reste un problème structurel non résolu. Plusieurs benchmarks récents, comme DROID ou Open X-Embodiment, ont posé des bases de données multi-robots, mais peu proposent une décomposition mécaniste des sources d'échec sur des horizons longs. LongBench se positionne comme un outil de diagnostic complémentaire, agnostique à l'architecture, applicable aussi bien aux politiques de type ACT, Diffusion Policy qu'aux approches VLA. Les auteurs n'annoncent pas de déploiement industriel associé : il s'agit d'un outil de recherche, pas d'un produit. Les prochaines étapes attendues incluent l'extension à d'autres morphologies robotiques et l'intégration de tâches bi-manuelles, qui représentent le prochain mur de complexité pour la manipulation longue durée.

RecherchePaper
1 source