Aller au contenu principal
MotionForge : pipeline de génération de données et benchmark à grande échelle pour la manipulation longue portée d'objets dynamiques avec décalages de domaine
RecherchearXiv cs.RO 

MotionForge : pipeline de génération de données et benchmark à grande échelle pour la manipulation longue portée d'objets dynamiques avec décalages de domaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La communauté de recherche en robotique dispose depuis fin septembre 2026 d'un nouveau benchmark baptisé MotionForge, décrit dans un article arXiv (2609.25689) comme le premier à évaluer conjointement les changements de domaine et les interactions de longue durée dans la manipulation d'objets dynamiques. Le système combine un pipeline de génération de données et une suite de simulation couvrant 40 tâches d'interaction dynamique réparties en 11 patterns de mouvement distincts, dont 17 tâches dites longue durée (long-horizon). Deux protocoles structurent l'évaluation : le premier mesure la robustesse des politiques face à des changements de domaine isolés (par exemple uniquement l'arrière-plan) ou combinés (objets, arrière-plans, éclairage et vitesse modifiés simultanément) ; le second est un protocole d'exécution découplé et sensible à la latence, où l'environnement continue d'évoluer indépendamment du temps de calcul nécessaire à la politique pour décider de son action, contrairement aux simulateurs classiques qui figent la scène pendant l'inférence.

Ce travail est important parce qu'il expose un décalage jusqu'ici mal quantifié entre les promesses des politiques robotiques généralistes de type vision-langage-action et leurs performances réelles hors environnements statiques ou quasi statiques. Les auteurs rapportent des limitations substantielles de ces politiques dès lors que plusieurs facteurs de domaine varient en même temps, ce qui contredit l'idée reçue selon laquelle le sim-to-real ou la généralisation à grande échelle seraient déjà largement résolus pour la manipulation dynamique. Pour les intégrateurs et décideurs industriels envisageant des déploiements en entrepôt, logistique ou chaîne de production où les objets bougent en continu, ce résultat invite à traiter les métriques de démonstration avec prudence tant que les tests ne reproduisent pas des conditions de domain shift joint et de latence réaliste.

MotionForge répond à une lacune identifiée dans les benchmarks dynamiques existants, jugés trop centrés sur des interactions courtes et réactives avec des mouvements simples, sans protocole systématique de test sous changement de domaine ni exécution temps réel agnostique au modèle. En le positionnant comme testbed de référence, les auteurs visent à orienter les prochains travaux de recherche en IA incarnée vers des évaluations plus proches des conditions réelles, sans toutefois annoncer à ce stade de déploiement matériel ni de partenariat industriel.

À lire aussi

AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances
1arXiv cs.RO 

AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances

AffordSim est un générateur de données simulées et benchmark pour la manipulation robotique consciente des affordances, publié en preprint sur arXiv en mai 2026 (référence 2604.11674). Le système répond à un problème structurel : les estimateurs de préhension génériques optimisent la stabilité sans logique de tâche et sélectionnent souvent la mauvaise zone fonctionnelle de l'objet, tandis que les annotations manuelles de contact doivent être réécrites pour chaque nouvel objet et chaque nouvelle tâche. AffordSim intègre la prédiction d'affordances 3D à vocabulaire ouvert dans un pipeline de simulation : à partir d'une instruction en langage naturel, il synthétise la scène, localise les régions fonctionnelles pertinentes sur les surfaces d'objets (la poignée d'une casserole, le bouton d'un tiroir), échantillonne des prises conditionnées à ces régions, puis sélectionne les trajectoires exécutables par planification de mouvement. La randomisation de pose, texture, éclairage et bruit d'image est intégrée pour favoriser le transfert sim-to-real. Le benchmark couvre 50 tâches, cinq embodiments robotiques distincts et plus de 500 objets rigides et articulés. Les politiques VLA (Vision-Language-Action) entraînées sur ces données transfèrent zéro-shot vers un Franka FR3 réel avec 24 % de succès moyen, sans aucun fine-tuning sur données physiques. La zone fonctionnelle d'un objet, l'affordance, est précisément le point de défaillance ignoré par les benchmarks de manipulation génériques : saisir le mauvais endroit rend l'action aval impossible quel que soit le planificateur. AffordSim atteint 93 % du taux de succès des annotations manuelles sur les tâches critiques d'affordance, et 89 % sur les tâches composites difficiles, ce qui valide l'annotation automatisée comme substitut crédible à l'annotation humaine à grande échelle. Pour les équipes développant des modèles de fondation robotique ou des politiques VLA, cela réduit drastiquement le coût de génération de données diversifiées. Le score de 24 % en zero-shot reste modeste, mais il constitue une preuve de principe importante : un pipeline entièrement simulé peut produire des politiques opérationnelles sur matériel réel, condition nécessaire à un déploiement industriel scalable. AffordSim s'inscrit dans la vague des générateurs de données synthétiques pour la manipulation, aux côtés de RoboGen, GenSim et des pipelines Nvidia Isaac. Le Franka FR3, bras académique de référence vendu autour de 15 000 euros, est l'unique plateforme réelle testée, ce qui limite la portée des conclusions hors de ce contexte de laboratoire. Les modèles de fondation robotique comme pi0 (Physical Intelligence) ou OpenVLA constituent le terrain applicatif naturel de cet outil. En Europe, des équipes comme le LAAS-CNRS à Toulouse et des startups comme Enchanted Tools (Paris, robots manipulateurs expressifs) pourraient exploiter ce type de générateur pour réduire leur dépendance aux plateformes de données propriétaires américaines. Ce travail restant un preprint non encore évalué par les pairs, les métriques avancées devront être confirmées lors d'une soumission en conférence (CoRL, RSS ou ICRA).

UELes équipes européennes comme le LAAS-CNRS (Toulouse) et Enchanted Tools (Paris) pourraient exploiter AffordSim pour réduire leur dépendance aux plateformes de données propriétaires américaines dans le développement de politiques VLA.

RechercheOpinion
1 source
FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables
2arXiv cs.RO 

FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables

FolDeX, benchmark présenté dans un article arXiv publié le 10 septembre 2026, évalue la manipulation robotique longue durée d'objets déformables à partir de données collectées exclusivement sur robots réels, avec le pliage de vêtements comme tâche principale. Le jeu de données compte plus de 2000 heures d'expérience physique, plus de 20 tâches et plus de 10 types de robots différents. Il s'organise autour de quatre axes : réutilisation des interventions humaines et des récupérations effectuées en déploiement, transfert de données entre tâches (du rigide au déformable, entre catégories de vêtements), réutilisation entre scènes avec éclairage, arrière-plan et agencement variables, et transfert entre plateformes robotiques. Une plateforme d'évaluation publique, hébergée sur ai.midea.com/#/fold-challenge par le groupe chinois Midea, permet de soumettre des politiques externes selon un protocole standardisé, avec objets tenus à l'écart de l'entraînement et initialisations contrôlées. Le projet cible l'écart bien connu entre simulation et monde réel dans l'IA incarnée : les modèles vision-langage-action et monde-action qui réussissent en simulation se dégradent souvent sur robot physique, en particulier sur des séquences longues et bimanuelles exigeant un suivi continu de l'état de l'objet. Les benchmarks existants couvrent surtout des tâches courtes sur objets rigides, laissant un vide pour juger la fiabilité réelle des politiques généralistes à grande échelle. En imposant un protocole externe avec objets et initialisations non divulgués à l'avance, FolDeX limite le risque de démonstrations sélectionnées, fréquentes dans les annonces du secteur humanoïde, et donne aux intégrateurs un moyen concret de vérifier si la manipulation fine tient hors des vidéos contrôlées. FolDeX s'inscrit dans la course actuelle à l'IA incarnée généraliste, aux côtés d'approches comme Figure 03 et Helix chez Figure AI, Optimus Gen 3 chez Tesla, la famille Pi-0 chez Physical Intelligence ou GR00T N2 chez Nvidia. Contrairement à ces annonces produits, il s'agit d'un outil de recherche ouvert, non d'un robot ou d'un modèle commercial livré. Son hébergement par Midea, groupe chinois de l'électroménager également actionnaire majoritaire de l'allemand Kuka dans la robotique industrielle, traduit l'intérêt croissant des fabricants asiatiques pour la manipulation d'objets souples, un enjeu clé pour le textile ou la logistique. La plateforme est déjà accessible pour des soumissions externes, sans calendrier de résultats ni classement encore communiqué.

UELe fabricant allemand Kuka, actionnaire majoritaire détenu par Midea, est indirectement associe a cette initiative qui pourrait intéresser les intégrateurs européens de robotique industrielle pour le textile et la logistique.

RecherchePaper
1 source
HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets
3arXiv cs.RO 

HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets

Des chercheurs ont publié HiPHI, un jeu de données de mouvement humain corps entier et d'interaction avec des objets, dépassant les 600 heures d'enregistrement, décrit dans un article déposé sur arXiv en août 2026 sous la référence 2608.16222. Construit à partir d'un pipeline de capture de mouvement optique, HiPHI atteint une précision de suivi des marqueurs spatiaux inférieure au millimètre pour le mouvement corps entier, ainsi que des trajectoires d'objets au niveau du maillage (mesh-level). Le dataset s'appuie théoriquement sur FrameNet, un cadre linguistique qui organise les primitives du mouvement humain. Les auteurs publient aussi une suite de benchmarks évaluant quatre axes : la diversité de l'espace des mouvements, l'ancrage des interactions (interaction grounding), la cohérence des objets manipulés, et les applications d'IA physique. Selon les analyses présentées, HiPHI élargit sensiblement la couverture des mouvements par rapport aux jeux de données existants, tout en conservant une fidélité élevée dans la qualité des interactions capturées. Ce travail cible un goulot d'étranglement jugé critique pour l'apprentissage de politiques robotiques humanoïdes à grande échelle : les vidéos issues d'internet, bien qu'abondantes, manquent d'états physiques précis et d'ancrage réel des interactions, tandis que les jeux de données de capture en laboratoire offrent une haute fidélité mais une couverture comportementale trop étroite. Pour les intégrateurs et laboratoires qui entraînent des modèles vision-langage-action à l'image de Pi-0 ou GR00T N2, ce type de fondation de données conditionne directement la capacité à généraliser des politiques apprises vers des tâches réelles incarnées, autrement dit le passage du simulateur au monde physique. Le papier revendique une amélioration mesurable de la diversité de mouvement, mais il s'agit à ce stade d'un benchmark académique évalué par ses propres auteurs, sans déploiement industriel ni adoption confirmée par un fabricant de robots humanoïdes. HiPHI s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les grands corpus vidéo génériques et les datasets de mouvement capturés en studio, un problème documenté depuis plusieurs années dans la littérature sur l'apprentissage par imitation pour humanoïdes. Les auteurs positionnent leur contribution face aux jeux de données de mouvement existants, jugés soit trop limités en diversité soit insuffisamment ancrés physiquement, sans nommer de concurrent unique. Le texte souligne une application transversale au-delà de la robotique : les mêmes extensions de couverture pourraient aussi nourrir des modèles de prior de mouvement en infographie, utilisés notamment pour l'animation de personnages. Publié comme preprint arXiv, HiPHI demeure pour l'instant une ressource de recherche ouverte plutôt qu'un produit commercial ; sa valeur pour l'industrie dépendra de la publication effective du dataset et du code, de comparaisons indépendantes, et d'une éventuelle intégration dans des pipelines d'entraînement de robots humanoïdes commerciaux.

RecherchePaper
1 source
NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets
4arXiv cs.RO 

NaviScale : générer des ensembles de données de cartes sémantiques à grande échelle pour la navigation d'objets

Des chercheurs publient sur arXiv NaviScale, un système génératif de données d'entraînement pour la navigation robotique orientée objet (ObjectNav), où un robot doit localiser un objet identifié seulement par sa catégorie. Plutôt que de reconstruire un environnement 3D complet pour chaque exemple, le framework compose des plans d'appartements réels avec des cartes sémantiques et d'obstacles extraites pièce par pièce des jeux MP3D et HM3DSem, en variant la structure des plans et les combinaisons de pièces. Un module de lancer de rayons, VisRC, convertit ces cartes en observations partielles réalistes selon le champ de vision, la portée des capteurs et les occlusions. Le jeu de données final compte 192 000 cartes générées à partir de 24 000 plans issus de 12 794 propriétés. Après 300 000 itérations, le prédicteur atteint 64,3% de réussite et 34,8% de SPL (succès pondéré par la longueur du trajet) sur HM3D, et 43,1% et 16,8% sur MP3D, avec un test sur robot physique. Ce travail répond à un frein connu de la navigation incarnée: la collecte de données 3D annotées reste lente et coûteuse, ce qui limite la généralisation des modèles à des lieux inédits. En entraînant un prédicteur sur des cartes composées plutôt que reconstruites en 3D, NaviScale ouvre une voie pour multiplier le volume de données d'entraînement à moindre coût, intéressant pour les équipes de robotique mobile et les intégrateurs de robots de service ou d'AMR (robots mobiles autonomes). Les scores restent toutefois issus de benchmarks de simulation, et le test sur robot physique, peu détaillé dans le résumé, appelle à la prudence avant de conclure à un transfert simulation-réel abouti. NaviScale s'inscrit dans la lignée des approches d'ObjectNav fondées sur des cartes sémantiques, alternative aux politiques de bout en bout entraînées par renforcement en environnement 3D complet, plus gourmandes en données et en calcul. En s'appuyant sur les jeux établis MP3D (Matterport3D) et HM3DSem, les auteurs cherchent à combler l'écart entre les besoins massifs des modèles de navigation actuels et la rareté des scènes 3D annotées publiques. Il s'agit d'une contribution de recherche, sans partenariat industriel ni calendrier commercial mentionné, complétée par des tests sur la robustesse aux erreurs de segmentation et une validation préliminaire sur robot physique.

RecherchePaper
1 source