Aller au contenu principal
InstructMove : un référentiel où le texte est indispensable pour le suivi d'instructions en manipulation
RecherchearXiv cs.RO 

InstructMove : un référentiel où le texte est indispensable pour le suivi d'instructions en manipulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Horizon Robotics publie InstructMove, un nouveau benchmark destine a évaluer si les modèles vision-langage-action (VLA) suivent réellement des instructions textuelles lors de taches de manipulation robotique. Presente dans un papier arXiv (2608.22990), le benchmark se concentre sur des scènes de pick-and-place comportant des distracteurs sémantiques, et décompose la compréhension d'instruction en quatre volets: identification de catégorie, discrimination d'attributs, raisonnement spatial et pick-and-place compositionnel. InstructMove fournit un protocole entrainement-évaluation complet, avec des données d'entrainement dédiées et des taches d'évaluation tenues a l'écart, accompagne d'outils de diagnostic pour mesurer la dépendance réelle au langage. Le code est disponible sur GitHub, sous le dépôt HorizonRobotics/RoboOrchardSim.

L'enjeu dépasse le simple ajout d'un jeu de tests: la plupart des benchmarks de manipulation existants souffrent d'un biais structurel ou l'objet ou la destination vises sont visuellement évidents ou physiquement uniques, ce qui permet a une politique de réussir la tache sans jamais avoir traite l'instruction textuelle. En exigeant que plusieurs actions soient plausibles visuellement et physiquement mais qu'une seule corresponde a la consigne, InstructMove force les modèles a démontrer un véritable ancrage langagier plutôt qu'un raccourci visuel. Pour les intégrateurs et décideurs qui évaluent des systèmes VLA comme Pi-0, GR00T N2 ou Helix, ce travail rappelle que des performances élevées sur des benchmarks classiques ne garantissent pas une compréhension linguistique fiable, un écart critique des lors que ces robots doivent exécuter des instructions variées en environnement réel. Les auteurs montrent aussi que des données de simulation générées via InstructMove améliorent les performances d'instruction-following sur des taches réelles, un signal encourageant pour le transfert sim-to-real.

Ce travail s'inscrit dans la montée en puissance de Horizon Robotics, acteur chinois connu pour ses puces d'aide a la conduite autonome et désormais actif dans l'IA incarnée, face a des laboratoires occidentaux comme Physical Intelligence ou Nvidia sur le terrain des modèles VLA généralistes. En publiant a la fois le benchmark et le code source, l'équipe positionne InstructMove comme un outil de diagnostic ouvert pour la communauté robotique, plutôt qu'un produit commercial.

Impact France/UE

Les intégrateurs européens évaluant des systèmes VLA (Pi-0, GR00T, Helix) disposent d'un nouvel outil de diagnostic open-source, sans impact direct sur un acteur français ou européen.

À lire aussi

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain
1arXiv cs.RO 

TactiDex : un référentiel tactile réel pour la manipulation dextre proche de l'humain

La recherche en manipulation robotique dextre franchit une nouvelle étape avec TactiDex, un benchmark et un jeu de données publiés sur arXiv (référence 2607.09190v1) et dédiés à la manipulation guidée par le toucher. Le projet part d'un constat technique précis: la plupart des méthodes actuelles de transfert humain-robot pour les mains dextres reposent uniquement sur des trajectoires cinématiques, ce qui produit une imitation du mouvement sans véritable ancrage physique dans le contact. TactiDex propose à la place un jeu de données réel qui aligne des signaux tactiles couvrant l'ensemble de la main avec des états cinématiques et des états d'objets à plusieurs niveaux de granularité, accompagné de métriques d'évaluation standardisées. Sur cette base, les auteurs introduisent TactiSkill, un framework de transfert reposant sur une récompense tactile à trois composantes, conçue pour unifier dans un seul objectif le guidage du geste, la ressemblance avec le comportement humain et le respect des contraintes de contact. Les expériences couvrent à la fois des tâches à une main et des tâches bimanuelles, avec une page projet dédiée (tactidex.github.io) pour consulter les données et résultats. Pour l'industrie robotique, ce travail s'attaque directement à un angle mort connu des pipelines d'apprentissage par démonstration: la plupart des systèmes actuels, y compris les architectures VLA les plus médiatisées, valident surtout la trajectoire du geste et non la qualité physique du contact, ce qui laisse un écart entre démonstration réussie en vidéo et manipulation réellement stable en conditions réelles. En intégrant le retour tactile comme signal de supervision structuré plutôt que comme donnée accessoire, TactiDex offre aux équipes de recherche et aux intégrateurs travaillant sur des mains robotiques un cadre d'évaluation plus rigoureux pour juger si un geste appris est simplement copié ou physiquement plausible, ce qui pèse directement sur la fiabilité des déploiements en préhension fine. Le travail s'inscrit dans la lignée des efforts récents visant à dépasser la simple imitation cinématique dans le transfert humain-robot, un problème identifié de longue date dans la littérature sur la téléopération et l'apprentissage par démonstration. Aucune date de publication de code ni de partenariat industriel n'est mentionnée à ce stade; le projet reste au niveau d'un benchmark de recherche, dont l'adoption dépendra de sa reprise par d'autres laboratoires travaillant sur des mains dextres et l'apprentissage tactile.

RecherchePaper
1 source
LabDex : un référentiel hiérarchique pour la manipulation dextérique en laboratoire
2arXiv cs.RO 

LabDex : un référentiel hiérarchique pour la manipulation dextérique en laboratoire

LabDex, un jeu de données et benchmark a grande échelle pour la manipulation dextre en laboratoire de chimie, a été publie sur arXiv le 20 aout 2026 sous la référence 2608.18618v1. L'outil organise les taches de laboratoire selon une taxonomie hiérarchique en trois niveaux: les compétences atomiques, qui couvrent les gestes de manipulation fondamentaux; les taches compositionnelles, qui les combinent; et les protocoles expérimentaux a long horizon, qui enchainent plusieurs étapes dépendantes de l'état du système. Fait notable, LabDex réunit pour la première fois sous un cadre commun des plateformes réelles et simulées, avec des définitions de taches, des démonstrations et des protocoles d'évaluation standardises. Ses concepteurs ont teste plusieurs méthodes d'apprentissage robotique sur ces trois niveaux, en conditions réelles comme en simulation, pour valider la conception des taches et la qualité des démonstrations collectées. Ce travail comble un angle mort des benchmarks existants, qui ne combinaient jusqu'ici ni l'usage de mains dextres, ni des interactions réalistes avec du matériel de laboratoire, ni des procédures multi-étapes, ce qui limitait l'entrainement et l'évaluation systématiques des politiques robotiques dans ce domaine. Pour les laboratoires autonomes de chimie et de découverte de médicaments, cela offre un cadre de référence commun pour comparer des approches sur un protocole partage plutôt que sur des démonstrations isolées et difficiles a reproduire. En reliant compétences élémentaires et performance sur des taches complexes, LabDex permet aussi d'analyser ce qui, dans une politique de manipulation, se généralisé réellement d'une tache a l'autre, une question souvent laissée dans le flou par les démonstrations triées sur le volet des annonces commerciales de bras manipulateurs ou d'humanoïdes. Cette publication s'inscrit dans la dynamique des laboratoires autonomes, ou "self-driving labs", un axe de recherche visant a confier a des robots des protocoles expérimentaux répétitifs ou dangereux, aujourd'hui réalisés manuellement par des chimistes. Jusqu'ici, les benchmarks de manipulation dextre provenaient soit de la robotique domestique ou industrielle générale, soit de simulations pures, sans lien direct avec les contraintes concrètes d'un laboratoire de chimie. LabDex se positionne comme une brique de fondation pour la communauté de recherche en apprentissage robotique, avec l'ambition de servir de référence standardisée pour comparer de futures politiques, y compris des modèles généralistes de type vision-langage-action, sur des taches de complexité croissante.

RecherchePaper
1 source
DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
3arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source
OopsieVerse : un référentiel de sécurité avec simulation sensible aux dommages pour la manipulation robotique
4arXiv cs.RO 

OopsieVerse : un référentiel de sécurité avec simulation sensible aux dommages pour la manipulation robotique

Des chercheurs de l'Université du Texas à Austin (UT Austin Robin Lab) ont publié OopsieVerse, un banc d'essai et framework de simulation destiné à mesurer les dommages causés par les robots manipulateurs domestiques. Le système, baptisé DamageSim, convertit les forces de contact, les variations de température et les interactions avec des liquides en dommages mécaniques, thermiques ou fluides quantifiables, de manière agnostique à la tâche effectuée. Les auteurs ont implémenté ce module dans deux simulateurs aux moteurs physiques distincts, OmniGibson (basé sur Nvidia Omniverse) et RoboCasa (basé sur MuJoCo), démontrant sa portabilité. OopsieVerse inclut également une suite de tâches domestiques conçues pour distinguer la réussite d'une tâche de son exécution sans dommage collatéral, un point que les benchmarks existants ignorent largement. Le code et la documentation sont disponibles sur robin-lab.cs.utexas.edu/oopsieverse. Ce travail comble une lacune méthodologique importante pour l'industrie robotique: jusqu'ici, l'évaluation des politiques de manipulation, y compris les modèles Vision-Language-Action (VLA) récents, se concentrait presque exclusivement sur le taux de réussite des tâches, sans mesurer si le robot endommage l'objet manipulé, son environnement ou lui-même au passage. Pour des intégrateurs et décideurs qui envisagent de déployer des robots domestiques ou de service, cette distinction est cruciale: un robot qui range la vaisselle neuf fois sur dix mais casse un verre à chaque essai n'est pas viable commercialement. En proposant un signal de dommage explicite et physiquement fondé, OopsieVerse permet d'entraîner des politiques via apprentissage par imitation ou par renforcement conditionnées au dommage, et d'évaluer objectivement des VLA de référence sur ce critère, révélant potentiellement un écart entre démonstrations soignées et sécurité réelle. Le projet s'inscrit dans une tendance de fond de la recherche en robotique manipulative: après des années centrées sur la réussite pure des tâches (empilement, saisie, tri), l'attention se déplace vers la sécurité physique comme condition préalable au déploiement en environnement non contrôlé, chez des particuliers notamment. Les auteurs positionnent explicitement leur outil comme une fondation open-source pour la recherche systématique sur la manipulation sûre, et montrent des cas d'usage allant de la collecte de démonstrations plus sûres au transfert sim-to-real avec amélioration mesurable de la sécurité réelle. Les prochaines étapes attendues concernent l'adoption de ce benchmark par la communauté pour comparer les politiques VLA existantes (Pi-0, GR00T, Helix notamment) sur cet axe encore peu exploré.

RecherchePaper
1 source