Aller au contenu principal
RecherchearXiv cs.RO 

SiMDex : exploiter des vidéos égocentriques similaires pour la manipulation dextre inter-incarnation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SiMDex, un framework de curation de données par similarité pour l'entraînement des modèles vision-langage-action (VLA) appliqués à la manipulation dextre robotique, publié début août 2026 sur arXiv. Le système traite un problème concret: parmi des millions de vidéos égocentriques humaines disponibles, lesquelles sont réellement utiles pour apprendre à un bras ou une main robotique à manipuler des objets? SiMDex formule cette sélection comme un problème de recommandation, avec un pipeline en trois étapes (rappel, classement, reclassement) qui extrait, pour chaque démonstration robotique, les sous-ensembles pertinents dans un réservoir d'environ 32 millions d'échantillons vidéo égocentriques. L'espace d'action utilisé est agnostique à la morphologie, donc aucune modification de l'architecture VLA ni du processus d'entraînement n'est requise pour l'intégrer. Face à une base de référence entraînée avec un volume équivalent de données humaines choisies aléatoirement, SiMDex n'utilise que 1,49 million d'échantillons triés, soit moins de 5% du réservoir total, tout en faisant grimper le taux de réussite global de 47,7% à 61,1%.

Cet écart de plus de 13 points obtenu avec dix fois moins de données a une portée directe pour le secteur: il suggère que le frein au post-entraînement des VLA n'est pas le volume de vidéos humaines disponibles, mais leur pertinence pour la tâche visée. Depuis deux ans, la course à la manipulation dextre mise surtout sur la mise à l'échelle brute de jeux de données égocentriques pour combler l'écart entre démonstration et déploiement réel. SiMDex questionne cette logique indiscriminée: pour les laboratoires et intégrateurs qui entraînent des politiques de manipulation, un curatoriat ciblé peut réduire fortement les coûts de calcul et de stockage tout en améliorant la performance, sans toucher au modèle lui-même.

Le travail s'inscrit dans la recherche sur l'apprentissage cross-embodiment, où des vidéos de mains humaines servent à préentraîner des politiques ensuite transférées à des mains ou bras robotiques de morphologie différente, une piste explorée par plusieurs équipes travaillant sur des VLA généralistes. Les résultats restent pour l'instant limités à des benchmarks internes: rien n'indique encore une validation en déploiement réel, ni si le code ou le jeu de données mineur seront rendus publics.

À lire aussi

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
1arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source
MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification
2arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
Pyramide de données pour la manipulation incarnée
3arXiv cs.RO 

Pyramide de données pour la manipulation incarnée

Une équipe de recherche publie sur arXiv (2607.24744) une revue structurant l'écosystème des données pour l'apprentissage robotique en une "pyramide" à cinq niveaux : données réelles issues de robots physiques, données de type UMI (capture de démonstrations humaines avec interface portable), vidéos égocentriques et exocentriques, données de simulation, et données vision-langage générales issues du web. Les auteurs organisent cette pyramide autour d'un compromis central entre scalabilité et alignement robotique, et évaluent chaque source selon quatre critères : qualité, diversité, réutilisabilité et fidélité physique. Ils passent ensuite en revue les modèles fondation récents pour la robotique, qu'il s'agisse de modèles de "cerveau" incarné, de modèles vision-langage-action (VLA) ou de modèles monde-action, en analysant comment chacun sélectionne, aligne et mélange ces différentes sources lors du pré-entraînement, et comment ce choix conditionne leurs capacités de perception, de raisonnement, de planification et de prédiction. Cette cartographie répond à un problème identifié depuis plusieurs années dans le secteur : contrairement aux modèles de langage ou de vision, qui s'entraînent sur la quasi-totalité du contenu textuel et visuel disponible sur internet, les agents incarnés ne peuvent pas se contenter de données passives puisqu'ils doivent apprendre le couplage entre observation, état physique et action. C'est ce goulot d'étranglement qui explique pourquoi des modèles comme Pi-0, GR00T N2 ou Helix combinent systématiquement plusieurs sources de données plutôt qu'une seule, et pourquoi des plateformes comme Figure 03 ou Optimus Gen 3 misent autant sur la collecte de données réelles en usine que sur la simulation. Les auteurs terminent par six chantiers non résolus : constituer des jeux de données tactiles à grande échelle, capturer des séquences d'échec et de récupération, développer des pipelines de collecte scalables, aligner les actions entre différentes morphologies de robots, exploiter les données égocentriques pour la manipulation dextre, et concevoir des recettes de données principielles plutôt qu'empiriques, autant de points de friction qui continuent de freiner le passage de la démonstration au déploiement industriel fiable.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines
4arXiv cs.RO 

Apprentissage de la manipulation dextérique à partir de vidéos monoculaires de mains humaines

Une équipe de chercheurs a publié sur arXiv (identifiant arXiv:2606.16436v1) un framework baptisé V2P-Manip, conçu pour extraire des politiques de manipulation dextre directement à partir de vidéos monoculaires de démonstrations humaines. L'architecture propose un pipeline intégré en trois étapes : acquisition d'assets 3D, estimation de trajectoires, puis apprentissage de politique de manipulation. Pour réconcilier perception visuelle et contraintes physiques, les auteurs introduisent un processus de raffinement en deux étapes imposant à la fois un alignement spatial et une cohérence physique. Le système a été évalué sur les benchmarks TACO et OakInk, deux jeux de données de référence en manipulation dextre, et affiche un taux de réussite moyen supérieur à 75 % sur des tâches de manipulation synthétiques, avec une généralisation démontrée sur plusieurs morphologies de mains robotiques différentes. L'enjeu central que V2P-Manip cherche à résoudre est celui du coût de collecte des données d'entraînement : la télé-opération reste lente, coûteuse et difficile à standardiser à grande échelle. Utiliser des vidéos monoculaires standard, sans capteurs de profondeur ni mocap, représente un levier de scalabilité potentiellement majeur pour les fabricants d'effecteurs dextres et les laboratoires à budget limité. Le pipeline démontre aussi une transférabilité des "manipulation priors" entre embodiments différents, ce qui est un résultat non trivial. Il faut néanmoins noter que le taux de 75 % est mesuré sur des tâches synthétiques et que les vidéos utilisées en entrée sont des démonstrations humaines sélectionnées -- le real-world gap reste à quantifier sur du matériel réel déployé en conditions industrielles non contrôlées. La manipulation dextre constitue l'une des frontières les plus dures de la robotique, un domaine où des acteurs comme Dexterous Robotics, Shadow Robot (UK) ou Psyonic tentent d'atteindre la maturité produit. Côté recherche, les approches concurrentes s'appuient généralement sur la télé-opération (Pi-0 de Physical Intelligence, ACT, DROID dataset) ou sur des capteurs de profondeur calibrés. L'originalité de V2P-Manip est de contourner ces contraintes matérielles en exploitant uniquement la vision monoculaire. La validation reste pour l'instant confinée à des benchmarks académiques, et aucun déploiement ou partenariat industriel n'est annoncé dans cette version préliminaire.

RecherchePaper
1 source