Aller au contenu principal
R2S-EGO : raffinement à double proxy pour la reconstruction réel-vers-simulation à capture éparse
RecherchearXiv cs.RO 

R2S-EGO : raffinement à double proxy pour la reconstruction réel-vers-simulation à capture éparse

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Payload de 6 vues pour R2S-EGO, 19,062 dB de PSNR contre 14,226 dB pour la meilleure référence R2S existante, et un taux de réussite de 82,5% (±6,8%) sur une tâche réelle de position assise avec un robot humanoïde Unitree G1, contre seulement 10,0% (±10,5%) pour la méthode concurrente GaussGym : c'est ce que rapporte un article publié le 6 août 2026 sur arXiv (2608.06827v1), présentant une nouvelle méthode nommée R2S-EGO pour la reconstruction de scènes en robotique. Le système combine deux "proxys" : l'un dérivé d'un simulateur qui modélise le domaine de requêtes exécutables propres au comportement du robot, l'autre ancré sur une capture réelle qui fournit les contraintes géométriques de la scène. Les tests ont été menés sur 48 vues égocentriques figées du G1, réparties sur trois environnements de la base de données Replica, avec un budget fixe de sélection de vues à générer.

Ce travail répond à un problème concret pour les équipes qui entraînent des politiques de contrôle en simulation avant déploiement réel (le fameux "sim-to-real") : la capture dense multi-vues d'un environnement réel est coûteuse et lente, alors qu'une capture humaine parcimonieuse laisse des angles de vue mal couverts pour les trajectoires spécifiques du robot. En générant des vues synthétiques ciblées sur les déficits de couverture réels plutôt qu'en capturant plus de données terrain, R2S-EGO réduit potentiellement le temps et le coût de mise en place de scènes d'entraînement pour les robots humanoïdes, un enjeu direct pour tout intégrateur ou laboratoire qui veut multiplier les scènes d'entraînement sans multiplier les tournages. Le gain de performance rapporté sur la tâche de position assise, s'il se confirme sur des tâches plus variées, suggérerait que l'écart simulation-réalité reste largement conditionné par la qualité de la représentation visuelle de la scène plutôt que par la seule dynamique du robot.

Le contexte est celui de la course actuelle autour du "real-to-sim" pour l'entraînement de politiques VLA appliquées aux robots humanoïdes, domaine où des acteurs comme GaussGym (cité ici comme référence comparative) développent des approches de rendu par Gaussian Splatting. L'étude ne précise pas d'affiliation institutionnelle ni de calendrier de déploiement industriel ; il s'agit à ce stade d'une contribution de recherche évaluée sur un robot Unitree G1 en environnement contrôlé, sans indication de pilote commercial ou d'intégration annoncée chez un fournisseur de robots humanoïdes.

Dans nos dossiers

À lire aussi

ReVeal : un cadre de réel-vers-simulation conscient de la reconstruction pour l'évaluation des politiques VLA
1arXiv cs.RO 

ReVeal : un cadre de réel-vers-simulation conscient de la reconstruction pour l'évaluation des politiques VLA

Un nouveau préprint publié sur arXiv le 22 septembre 2026 (référence 2609.23910v1) présente ReVeal, un framework d'évaluation « real-to-sim » destiné à tester les politiques vision-langage-action (VLA) en robotique. Le système combine trois étapes : reconstruction de l'espace de travail, évaluation de la qualité de cette reconstruction, puis évaluation en boucle fermée de la politique dans l'environnement simulé reconstruit. Deux métriques sont introduites : Novel-View Mesh Fidelity (NVMF), qui mesure la fidélité des observations sous des angles inédits, et Annotated Planar Geometry Fidelity (APGF), qui évalue la précision géométrique des surfaces planes. Les auteurs développent aussi PGSR-D, un pipeline de reconstruction ajoutant une supervision par profondeur monoculaire pour améliorer la géométrie là où les indices visuels multi-vues manquent. Sur 8 scènes de test, NVMF et APGF distinguent de façon cohérente la fidélité de trois pipelines : 2DGS, PGSR et PGSR-D. Des évaluations appariées portant sur trois politiques VLA, GR00T, SmolVLA et pi0.5, menées sur 8 tâches de manipulation humanoïde, montrent un ordre cohérent entre fidélité de reconstruction et degré d'accord entre performance réelle et performance simulée. Ce travail cible un obstacle connu du secteur robotique : les erreurs de reconstruction 3D peuvent faire diverger les résultats obtenus en simulation de ceux obtenus en conditions réelles, ce qui fragilise l'usage de la simulation comme méthode rapide et peu coûteuse pour évaluer des politiques d'IA embarquée avant déploiement. En établissant une corrélation mesurable entre fidélité de reconstruction et fiabilité de l'évaluation simulée, ReVeal donne aux intégrateurs et laboratoires un moyen de juger si un environnement simulé est assez fiable pour remplacer des tests physiques, un enjeu central alors que les politiques génératives de type VLA se multiplient et que leur validation à grande échelle sur robot réel reste coûteuse et lente. Le papier ne prétend pas résoudre l'écart sim-to-réel, mais documente empiriquement à quel point la qualité de reconstruction conditionne la validité des benchmarks simulés, une nuance utile face à des résultats en simulation souvent présentés sans contrôle de cette fidélité. Le sujet s'inscrit dans la multiplication récente de politiques VLA généralistes pour la manipulation robotique, telles que GR00T (Nvidia), SmolVLA (Hugging Face) et pi0.5 (Physical Intelligence), ici utilisées comme cas de test plutôt que comme objets d'étude. Les méthodes de reconstruction comparées, 2D Gaussian Splatting (2DGS) et Planar Gaussian Splatting Reconstruction (PGSR), relèvent des techniques de rendu neuronal récentes employées pour construire des jumeaux numériques d'environnements robotiques. À ce stade, ReVeal reste un cadre de recherche méthodologique, sans déploiement industriel ni intégration annoncée par un fournisseur de robots ou de simulateur. Il ouvre néanmoins la voie à des protocoles d'évaluation standardisés que les éditeurs de politiques VLA ou les plateformes de simulation pourraient adopter pour certifier la fiabilité de leurs bancs d'essai simulés avant tout déploiement physique.

RecherchePaper
1 source
Transfert simulation-réel tactile sans simulation tactile via reconstruction latente à goulot d'étranglement
2arXiv cs.RO 

Transfert simulation-réel tactile sans simulation tactile via reconstruction latente à goulot d'étranglement

Une équipe de recherche propose SBLR (Sim2Real via Bottlenecked Latent Reconstruction), une méthode qui permet d'entraîner des politiques de manipulation robotique tactile sans avoir à simuler physiquement chaque capteur tactile. Décrite dans un article déposé sur arXiv (référence 2608.15897v1), l'approche entraîne d'abord la politique sur un capteur "oracle" natif au simulateur, construit simplement à partir d'un nuage de points et des forces mesurées au bout des doigts, sans modéliser aucun capteur réel en particulier. Une seconde étape, dite de reconstruction latente à goulot d'étranglement, adapte ensuite cette politique à la perte d'information propre à un capteur tactile réel. L'alignement entre les représentations latentes du capteur oracle et du capteur réel est appris à partir de données non appariées, collectées par jeu aléatoire en simulation et dans le monde réel, via des réseaux de transformation fondés sur le "rectified flow" et entraînés sur des pseudo-paires de plus proches voisins. Sur trois tâches simulées à fort contact, SBLR égale ou approche les performances de l'oracle. En conditions réelles, sur des tâches d'insertion de tige (peg insertion) et d'engrenage (gear meshing) avec des capteurs GelSight Mini et DIGIT, la méthode atteint un taux de réussite zéro-shot de 85 à 97,5 %, dépassant de 7,5 à 15 points une référence basée sur une simulation physique du capteur tactile. L'intérêt pour l'industrie tient au problème que la méthode contourne: modéliser fidèlement chaque capteur tactile, dont les designs sont très variés et évoluent vite, exige une expertise pointue et des approximations qui dégradent souvent la fidélité du signal simulé. En évitant toute simulation spécifique au capteur, SBLR promet de réduire le coût d'ingénierie pour les intégrateurs qui manipulent plusieurs types de capteurs tactiles sur une même ligne de préhension fine, sans recalibration lourde à chaque changement de matériel. Le résultat va à l'encontre de l'hypothèse dominante selon laquelle un transfert sim2real tactile fiable nécessite une simulation physique dédiée du capteur. Ce travail s'inscrit dans la lignée des recherches sur la manipulation robotique riche en contact (assemblage, insertion, engrenage), où l'écart de fidélité entre capteurs tactiles simulés et réels reste un frein classique au déploiement. Les approches antérieures s'appuyaient sur des simulations physiques par éléments finis ou modèles d'élastomère, coûteuses et sujettes à divergence. L'article ne mentionne ni partenaire industriel ni publication de code, et les résultats matériels se limitent à deux tâches avec deux capteurs; il s'agit donc d'un travail de recherche académique à ce stade, sans déploiement industriel annoncé.

RecherchePaper
1 source
Reconstruction couture-vers-graphe pour l'alignement de configuration de vêtements
3arXiv cs.RO 

Reconstruction couture-vers-graphe pour l'alignement de configuration de vêtements

Un réseau de neurones dédié à la détection des coutures de vêtements vient d'être proposé dans un preprint arXiv (référence 2606.15171, juin 2026), avec pour application directe le chargement automatisé de vêtements sur une platine de sérigraphie. Le système, baptisé Seam-to-Graph, s'appuie sur des réseaux de neurones à graphes (GNN) couplés à des mécanismes d'attention pour transformer des observations partielles de coutures en un graphe squelette encodant la topologie du vêtement. Ce graphe alimente en temps réel un estimateur d'état, même lorsque les coutures ne sont que partiellement visibles, condition fréquente en manipulation robotique. À partir de cette estimation, un contrôleur d'asservissement visuel hiérarchique, sensible aux déformations du tissu, aligne le vêtement sur la configuration cible. Des expériences sur un robot bimanuel réel démontrent une précision comparable au niveau humain, avec une variance d'erreur réduite, et une robustesse confirmée sur plusieurs types de vêtements. Ce travail s'attaque à l'une des problématiques les plus résistantes de la robotique industrielle : les objets déformables non rigides. Les coutures constituent des primitives structurelles physiquement stables, présentes sur quasiment tout vêtement, et leur topologie reflète l'architecture globale de la pièce, là où une estimation de pose classique échoue. La démonstration sur une tâche industrielle concrète, la sérigraphie, est un signal positif. Toutefois, l'abstract ne publie aucun chiffre absolu sur les taux de réussite ni sur les temps de cycle, ce qui rend la comparaison avec les benchmarks industriels existants difficile. La manipulation de vêtements par robot est un domaine actif depuis plus d'une décennie, avec des travaux notables à UC Berkeley, ETH Zurich et Imperial College, mais peu de déploiements industriels réels faute d'estimateurs d'état fiables sur objets déformables. Parmi les acteurs positionnés sur la manipulation textile automatisée, la startup allemande Sewts (linge industriel) et le britannique Dextrous Robotics explorent des approches vision, mais aucun n'a publié d'approche graphe de coutures à ce stade. Les suites naturelles seraient une validation sur un parc de vêtements plus large, des tests à cadence industrielle, et une évaluation sur occultations sévères.

UELa startup allemande Sewts, active sur la manipulation de linge industriel, est la concurrente européenne la plus directement concernée par cette avancée en estimation d'état sur objets textiles déformables.

RecherchePaper
1 source
Reconstruction simulation-réel pour environnements très encombrés via raisonnement physique inter-objets
4arXiv cs.RO 

Reconstruction simulation-réel pour environnements très encombrés via raisonnement physique inter-objets

Une équipe de recherche présente un pipeline Real-to-Sim capable de reconstruire des scènes 3D physiquement cohérentes à partir d'une seule image RGB-D, c'est-à-dire une capture combinant couleur et profondeur. L'approche, décrite dans un preprint arXiv (2602.12633, version 2), cible spécifiquement les environnements très encombrés où la manipulation robotique exige une compréhension précise des contacts entre objets. Le coeur du système repose sur un pipeline d'optimisation différentiable qui modélise les dépendances spatiales via un graphe de contact : chaque relation physique entre objets adjacents est représentée explicitement, puis les poses et propriétés physiques de chaque objet sont affinées conjointement par simulation de corps rigides différentiable. Les évaluations couvrent des scènes simulées et des environnements réels. Ce travail s'attaque à un problème concret qui bloque les déploiements de manipulation robotique en contexte industriel désorganisé : les pipelines de perception standard produisent régulièrement des états invalides, objets en lévitation ou interpénétrations géométriques, qui rendent la simulation en aval peu fiable et donc inutilisable pour planifier des saisies ou des déplacements. En forçant la cohérence physique dès la reconstruction, le pipeline permet d'obtenir des scènes simulées qui reproduisent fidèlement la dynamique de contact du monde réel. Pour les intégrateurs et les équipes de recherche en manipulation, c'est une brique clé pour réduire le fossé sim-to-real sans recourir à des setups multicaméras coûteux ou à des annotations manuelles. La reconstruction Real-to-Sim est un chantier actif dans la communauté robotique depuis l'essor des pipelines sim-to-real pour l'apprentissage par renforcement et l'imitation. Des approches concurrentes s'appuient sur des reconstructions NeRF ou des méthodes basées Gaussian Splatting pour obtenir la fidélité géométrique, mais elles n'intègrent pas nécessairement de contraintes physiques explicites. Ce pipeline différentiable se distingue en traitant le raisonnement inter-objets comme une contrainte d'optimisation, pas comme une post-correction. Les prochaines étapes naturelles incluent l'intégration dans des pipelines de planification de manipulation contact-rich et le test sur des scènes industrielles réelles, où le désordre et les occlusions partielles sont la norme plutôt que l'exception.

RecherchePaper
1 source