Aller au contenu principal
RecherchearXiv cs.RO 

REBOOT : de l'échec à la récupération, un jeu de données et un benchmark pour l'assemblage de précision

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a mis en ligne fin septembre 2026 sur arXiv (2609.22591) REBOOT, pour Recovery Episode Benchmark for Off-nominal Trajectories, un jeu de données et un benchmark de manipulation robotique construit autour de l'échec comme signal d'apprentissage à part entière. L'ensemble comprend 2 160 démonstrations réparties sur 18 tâches d'assemblage de précision, chacune découpée en cinq phases communes : alignement en prise, engagement en prise, transport, alignement en dépôt et engagement en dépôt, ce qui permet une évaluation phase par phase plutôt qu'un simple résultat final binaire. Des échecs sont introduits à chaque phase puis appariés à des trajectoires de récupération réalisées par des experts, qui ramènent le système vers un état permettant de poursuivre la tâche. Chaque tâche est annotée en symétrie rotationnelle, précision d'engagement et direction d'assemblage via des paires installation-retrait, avec des flux RGB-D synchronisés sur quatre points de vue et des descriptions en langage naturel par phase. La moitié des démonstrations est experte, l'autre reproduit des échecs observés lors de déploiements réels de politiques entraînées par imitation. Trois architectures ont été testées : un transformeur à chunks d'actions, un modèle de diffusion et π0-FAST.

Les jeux d'entraînement robotique actuels contiennent presque exclusivement des démonstrations réussies, et les benchmarks existants réduisent la performance à un score binaire de succès ou d'échec, ce qui masque où et pourquoi une politique échoue réellement. En mesurant des taux de complétion par phase, REBOOT révèle des points de défaillance propres à chaque architecture, invisibles en évaluation binaire classique. Pour les intégrateurs et laboratoires qui déploient des politiques vision-language-action sur des tâches d'assemblage industriel, cela offre un diagnostic localisé, permettant d'identifier si l'échec survient à l'alignement, à l'engagement ou pendant le transport de la pièce, et fournit une base pour entraîner explicitement la capacité de récupération après erreur, une condition nécessaire à l'assemblage de précision en environnement réel non contrôlé.

Le benchmark s'inscrit dans l'essor des politiques vision-language-action génériques telles que π0, GR00T N2 ou Helix, dont la promesse se heurte encore à l'écart entre démonstrations en laboratoire et fiabilité sur des tolérances millimétriques. Contrairement aux jeux de référence existants comme Open X-Embodiment ou DROID, centrés sur le volume de démonstrations réussies, REBOOT se présente comme le premier construit explicitement autour de l'échec et de sa récupération. Le jeu de données et le code associés sont publiés en accès libre (nanayawoa.github.io/REBOOT). Il s'agit d'une contribution de recherche en prépublication, sans déploiement industriel annoncé à ce stade ; son adoption par les laboratoires et fournisseurs de piles VLA reste à observer dans les prochains mois.

À lire aussi

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables
1arXiv cs.RO 

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables

SoftVTBench, jeu de données visuo-tactile pour la manipulation d'objets déformables, a été publié le 20 août 2026 sur arXiv (2608.18701). Il réunit 4 000 démonstrations expertes sur plus de 50 objets, dont des objets déformables volumétriques et leurs jumeaux rigides visuellement identiques. À 20 Hz, chaque épisode synchronise RGB multi-vues, capteurs tactiles RGB, suivi de marqueurs sur les deux doigts du gripper, proprioception, instructions en langage naturel, actions de préhension, et des états de référence par éléments finis (FEM) réservés à l'évaluation. Le benchmark associé introduit le Deformation-aware Success Rate (DSR), qui ne valide un essai que si la tâche réussit sans dépasser une tolérance de déformation calibrée par objet. Sur Diffusion Policy, π0.5 et FastWAM, les 12 configurations testées comptent toutes des succès classiques qui violent en réalité cette tolérance, dans 0,7% à 24% des cas. Sous changement de distribution, les versions avec toucher font mieux en réussite (six comparaisons sur six) et en DSR (cinq sur six), un avantage plus incertain en distribution. Le message clé pour l'industrie: un taux de réussite binaire masque des comportements physiquement problématiques, glissement ou compression excessive, un enjeu direct pour les intégrateurs manipulant des produits fragiles (agroalimentaire, textile, emballage, médical). Plus notable, ajouter des capteurs tactiles n'améliore pas automatiquement la manipulation: le gain n'est net que sous changement de distribution, signe que la fusion visuo-tactile reste un problème d'ingénierie non résolu plutôt qu'un simple avantage matériel. Cela nuance le discours courant sur les architectures vision-langage-action, où le toucher est souvent présenté comme un bonus de robustesse automatique. L'absence de jeux de données associant observations exploitables par une politique et vérité terrain physique indépendante était jusque-là le principal obstacle à une évaluation fine de l'interaction, la plupart des benchmarks existants se limitant à un succès binaire de tâche. SoftVTBench se positionne comme ressource commune pour étudier non seulement si une politique réussit, mais comment elle interagit physiquement avec un objet mou et quand le toucher améliore réellement cette interaction. Il s'agit d'une publication de recherche, sans annonce de déploiement industriel ni partenariat constructeur, et sans acteur français ou européen identifié dans cette étude.

RecherchePaper
1 source
HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets
2arXiv cs.RO 

HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets

Des chercheurs ont publié HiPHI, un jeu de données de mouvement humain corps entier et d'interaction avec des objets, dépassant les 600 heures d'enregistrement, décrit dans un article déposé sur arXiv en août 2026 sous la référence 2608.16222. Construit à partir d'un pipeline de capture de mouvement optique, HiPHI atteint une précision de suivi des marqueurs spatiaux inférieure au millimètre pour le mouvement corps entier, ainsi que des trajectoires d'objets au niveau du maillage (mesh-level). Le dataset s'appuie théoriquement sur FrameNet, un cadre linguistique qui organise les primitives du mouvement humain. Les auteurs publient aussi une suite de benchmarks évaluant quatre axes : la diversité de l'espace des mouvements, l'ancrage des interactions (interaction grounding), la cohérence des objets manipulés, et les applications d'IA physique. Selon les analyses présentées, HiPHI élargit sensiblement la couverture des mouvements par rapport aux jeux de données existants, tout en conservant une fidélité élevée dans la qualité des interactions capturées. Ce travail cible un goulot d'étranglement jugé critique pour l'apprentissage de politiques robotiques humanoïdes à grande échelle : les vidéos issues d'internet, bien qu'abondantes, manquent d'états physiques précis et d'ancrage réel des interactions, tandis que les jeux de données de capture en laboratoire offrent une haute fidélité mais une couverture comportementale trop étroite. Pour les intégrateurs et laboratoires qui entraînent des modèles vision-langage-action à l'image de Pi-0 ou GR00T N2, ce type de fondation de données conditionne directement la capacité à généraliser des politiques apprises vers des tâches réelles incarnées, autrement dit le passage du simulateur au monde physique. Le papier revendique une amélioration mesurable de la diversité de mouvement, mais il s'agit à ce stade d'un benchmark académique évalué par ses propres auteurs, sans déploiement industriel ni adoption confirmée par un fabricant de robots humanoïdes. HiPHI s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les grands corpus vidéo génériques et les datasets de mouvement capturés en studio, un problème documenté depuis plusieurs années dans la littérature sur l'apprentissage par imitation pour humanoïdes. Les auteurs positionnent leur contribution face aux jeux de données de mouvement existants, jugés soit trop limités en diversité soit insuffisamment ancrés physiquement, sans nommer de concurrent unique. Le texte souligne une application transversale au-delà de la robotique : les mêmes extensions de couverture pourraient aussi nourrir des modèles de prior de mouvement en infographie, utilisés notamment pour l'animation de personnages. Publié comme preprint arXiv, HiPHI demeure pour l'instant une ressource de recherche ouverte plutôt qu'un produit commercial ; sa valeur pour l'industrie dépendra de la publication effective du dataset et du code, de comparaisons indépendantes, et d'une éventuelle intégration dans des pipelines d'entraînement de robots humanoïdes commerciaux.

RecherchePaper
1 source
TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs
3arXiv cs.RO 

TacVerse : un jeu de données et benchmark multi-capteurs pour la perception tactile visuelle entre capteurs

Une équipe de chercheurs a publié TacVerse, un jeu de données multi-capteurs et benchmark destiné à évaluer la perception tactile par vision (vision-based tactile sensors, VBTS) à travers des capteurs de designs hétérogènes. Le dataset compile 106 800 images tactiles issues de sept capteurs VBTS distincts, couvrant trois tâches cibles : classification de formes, classification de réseaux de rainures (grating), et régression de force. Les expériences sont conduites selon trois protocoles expérimentaux : entraînement intra-capteur, transfert zéro-shot inter-capteurs, et adaptation few-shot. L'article, déposé sur arXiv (2606.25877), ne mentionne pas de financement industriel ni de partenaire de déploiement terrain ; il s'agit d'une contribution académique à visée benchmark, sans produit commercialisé associé. Le résultat le plus structurant pour les intégrateurs robotiques est le gouffre de généralisation inter-capteurs : si les performances intra-capteur sont solides sur les trois tâches, le transfert direct zéro-shot vers un capteur inconnu dégrade significativement les résultats, surtout pour la régression de force et la classification de réseaux de rainures. La classification de forme se révèle comparativement plus robuste face au changement de capteur. L'adaptation few-shot améliore la régression de force sur des capteurs cibles non vus, sans toutefois atteindre les performances intra-capteur. Ce résultat implique qu'un modèle entraîné sur un VBTS donné ne peut pas être déployé tel quel sur un autre design sans dégradation mesurable, ce qui complexifie les stratégies de standardisation des pipelines de perception tactile dans l'industrie. Les capteurs VBTS (type GelSight, DIGIT, Tactip et variantes) ont connu un essor marqué depuis 2018, portés par des labos comme MIT CSAIL et des acteurs industriels comme Meta AI (DIGIT). TacVerse s'inscrit dans un effort de standardisation de l'évaluation, comparable à ce que ImageNet a représenté pour la vision classique. L'étude révèle également que le préentraînement par MAE (Masked Autoencoder) offre les gains les plus constants sur l'ensemble des tâches et des capteurs, suggérant une piste d'architecture prioritaire pour les travaux futurs. Aucun concurrent direct de benchmark tactile multi-capteurs à cette échelle n'est cité dans l'abstract ; TacVerse vise à combler ce vide méthodologique pour la communauté sim-to-real et apprentissage auto-supervisé en perception haptique.

RecherchePaper
1 source
AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances
4arXiv cs.RO 

AffordSim : un générateur de données évolutif et un benchmark pour la manipulation robotique guidée par les affordances

AffordSim est un générateur de données simulées et benchmark pour la manipulation robotique consciente des affordances, publié en preprint sur arXiv en mai 2026 (référence 2604.11674). Le système répond à un problème structurel : les estimateurs de préhension génériques optimisent la stabilité sans logique de tâche et sélectionnent souvent la mauvaise zone fonctionnelle de l'objet, tandis que les annotations manuelles de contact doivent être réécrites pour chaque nouvel objet et chaque nouvelle tâche. AffordSim intègre la prédiction d'affordances 3D à vocabulaire ouvert dans un pipeline de simulation : à partir d'une instruction en langage naturel, il synthétise la scène, localise les régions fonctionnelles pertinentes sur les surfaces d'objets (la poignée d'une casserole, le bouton d'un tiroir), échantillonne des prises conditionnées à ces régions, puis sélectionne les trajectoires exécutables par planification de mouvement. La randomisation de pose, texture, éclairage et bruit d'image est intégrée pour favoriser le transfert sim-to-real. Le benchmark couvre 50 tâches, cinq embodiments robotiques distincts et plus de 500 objets rigides et articulés. Les politiques VLA (Vision-Language-Action) entraînées sur ces données transfèrent zéro-shot vers un Franka FR3 réel avec 24 % de succès moyen, sans aucun fine-tuning sur données physiques. La zone fonctionnelle d'un objet, l'affordance, est précisément le point de défaillance ignoré par les benchmarks de manipulation génériques : saisir le mauvais endroit rend l'action aval impossible quel que soit le planificateur. AffordSim atteint 93 % du taux de succès des annotations manuelles sur les tâches critiques d'affordance, et 89 % sur les tâches composites difficiles, ce qui valide l'annotation automatisée comme substitut crédible à l'annotation humaine à grande échelle. Pour les équipes développant des modèles de fondation robotique ou des politiques VLA, cela réduit drastiquement le coût de génération de données diversifiées. Le score de 24 % en zero-shot reste modeste, mais il constitue une preuve de principe importante : un pipeline entièrement simulé peut produire des politiques opérationnelles sur matériel réel, condition nécessaire à un déploiement industriel scalable. AffordSim s'inscrit dans la vague des générateurs de données synthétiques pour la manipulation, aux côtés de RoboGen, GenSim et des pipelines Nvidia Isaac. Le Franka FR3, bras académique de référence vendu autour de 15 000 euros, est l'unique plateforme réelle testée, ce qui limite la portée des conclusions hors de ce contexte de laboratoire. Les modèles de fondation robotique comme pi0 (Physical Intelligence) ou OpenVLA constituent le terrain applicatif naturel de cet outil. En Europe, des équipes comme le LAAS-CNRS à Toulouse et des startups comme Enchanted Tools (Paris, robots manipulateurs expressifs) pourraient exploiter ce type de générateur pour réduire leur dépendance aux plateformes de données propriétaires américaines. Ce travail restant un preprint non encore évalué par les pairs, les métriques avancées devront être confirmées lors d'une soumission en conférence (CoRL, RSS ou ICRA).

UELes équipes européennes comme le LAAS-CNRS (Toulouse) et Enchanted Tools (Paris) pourraient exploiter AffordSim pour réduire leur dépendance aux plateformes de données propriétaires américaines dans le développement de politiques VLA.

RechercheOpinion
1 source