Aller au contenu principal
GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)
RecherchearXiv cs.RO 

GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GraspIT, un nouveau dataset de prises robotiques présenté dans un article arXiv publié cette semaine, s'attaque au problème du transfert simulation-réel pour la préhension d'objets inédits. L'équipe a généré des scènes de table dans NVIDIA Isaac Sim, puis annoté chaque prise candidate via un test physique de glissement en quatre étapes, exécuté sur des instances virtuelles de bras Franka Panda, allant au-delà du simple critère de force-closure classique. Sur environ 2,3 millions de prises candidates, 83% obtiennent un score de qualité jugé bon (seuil de 0,50 ou plus), tandis que les 17% restants, qui passent le test de force-closure mais échouent au test de glissement, constituent des "hard negatives" utiles à l'entraînement. Une boucle réel-vers-simulation rétroprojette ensuite ces annotations sur 100 scènes réelles. Au total, le dataset livre environ 316 000 jeux d'images RGB-D annotées, couvrant 1035 scènes simulées et 100 scènes réelles, avec masques d'instance, poses en 6 degrés de liberté, propriétés physiques des objets et scores de qualité pour chaque prise. Les outils sont open source et conteneurisés via Docker.

Cette publication comble un manque identifié par les auteurs eux-mêmes: aucun dataset existant ne combinait jusqu'ici observations photoréalistes, validation physique rigoureuse des prises et pont explicite entre simulation et monde réel. Pour les équipes de recherche en manipulation robotique, ce type de ressource conditionne directement la qualité des politiques apprises par imitation ou par renforcement, notamment pour les modèles vision-langage-action qui nécessitent de gros volumes de démonstrations fiables. Les négatifs difficiles générés par le test de glissement offrent en particulier un signal d'entraînement plus discriminant que les datasets fondés sur la seule force-closure, souvent trop permissifs.

Le projet s'inscrit dans une littérature croissante cherchant à réduire l'écart sim-to-real, un obstacle persistant pour déployer en conditions réelles des politiques entraînées en simulation. La planification de trajectoires intégrée dans Isaac Sim permet en outre de streamer des démonstrations haute résolution pour l'apprentissage de politiques de manipulation sur table et le clonage comportemental, ouvrant la voie à des travaux de suivi sur des tâches de préhension plus complexes.

À lire aussi

Génération de données préservant la fonction pour la manipulation réelle-vers-simulation-vers-réelle en zero-shot
1arXiv cs.RO 

Génération de données préservant la fonction pour la manipulation réelle-vers-simulation-vers-réelle en zero-shot

Une équipe de recherche publie sur arXiv, sous l'identifiant 2609.18293 et sans revue par les pairs à ce stade, un framework de génération de données synthétiques pour l'apprentissage de politiques de manipulation robotique, capable de produire des démonstrations d'entraînement sans trajectoire téléopérée de départ. La méthode reconstruit des maillages 3D d'objets réels puis les déforme via une déformation guidée par contraintes qui préserve les interfaces géométriques critiques de la tâche, comme les surfaces de contact nécessaires à une insertion précise, tout en transférant les poses de tâche et les proxys de collision de manière physiquement cohérente. Une randomisation visuelle du domaine est ensuite appliquée pendant les simulations, et les politiques ainsi entraînées sont déployées en zero-shot sur robot réel, sans phase de fine-tuning sur données réelles. Les auteurs rapportent des expériences en simulation et sur banc réel pour des tâches de manipulation riches en contacts et à horizon long. L'enjeu vise le goulot d'étranglement actuel de l'apprentissage robotique : collecter, pour chaque nouvelle géométrie d'objet, assez de démonstrations réelles pour des tâches à tolérance géométrique serrée. Les méthodes standards d'augmentation de forme distordent souvent ces interfaces critiques, provoquant des défauts d'ajustement ou des interpénétrations qui rendent les trajectoires générées physiquement invalides et donc inexploitables. En préservant la fonction de l'interface de contact tout en diversifiant l'apparence des objets, l'approche promet de produire à moindre coût des démonstrations valides sans flotte de téléopérateurs humains, un enjeu direct pour l'entraînement des modèles vision-langage-action dont la rareté des données reste le principal facteur limitant. Le papier revendique une généralisation robuste à des géométries et conditions visuelles inédites, mais l'abstract ne fournit aucun taux de réussite chiffré ni comparaison à des méthodes concurrentes publiées, ce qui invite à considérer ces résultats comme préliminaires. Ce travail s'inscrit dans la ligne de recherche dite real-to-sim-to-real, qui cherche depuis plusieurs années à remplacer une partie de la téléopération humaine par de la simulation physique pour faire passer à l'échelle l'apprentissage robotique, notamment sur les tâches d'assemblage et d'insertion. L'abstract ne précise ni le laboratoire ni l'entreprise à l'origine des travaux, ni la disponibilité d'un code ou d'un jeu de données. Les étapes attendues restent classiques pour ce stade de recherche : publication avec revue par les pairs, comparaison chiffrée face aux méthodes existantes de génération de données synthétiques, puis éventuelle adoption par des intégrateurs confrontés à des tâches de manipulation industrielle à forte exigence géométrique.

RecherchePaper
1 source
RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique
2arXiv cs.RO 

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique

Le dataset RoboDesign1M rassemble un million d'échantillons multimodaux consacrés à la conception de robots, extraits automatiquement de la littérature scientifique couvrant plusieurs domaines de la robotique. Les auteurs ont mis au point un pipeline de collecte semi-automatisé permettant d'agréger efficacement des données diverses (texte et images) issues de publications existantes, plutôt que de les créer manuellement. Pour valider l'utilité du corpus, l'équipe a mené des expériences sur trois tâches distinctes : la génération d'images de conception robotique, la réponse à des questions visuelles portant sur des schémas de conception, et la recherche d'images de conception à partir de requêtes. Les résultats montrent que ce jeu de données constitue un nouveau benchmark exigeant pour ces tâches de compréhension du design. Le dataset sera rendu public, avec une page de projet dédiée (airvlab.github.io/robotdesign1m). Il s'agit d'une version mise à jour d'un article déposé sur arXiv (2503.06796), initialement publié en mars puis révisé. Ce travail cible un goulot d'étranglement méthodologique plutôt qu'un produit commercial : la conception mécanique d'un robot reste un processus long, coûteux et dépendant d'une expertise rare, et les modèles de fondation qui pourraient l'automatiser manquaient jusqu'ici de données d'entraînement à grande échelle sur ce sujet précis. En fournissant un million d'exemples annotés, RoboDesign1M ouvre la voie à des assistants IA capables de proposer des pistes de conception, de retrouver des schémas existants à partir d'une description textuelle, ou de générer des visualisations de composants robotiques. Pour les laboratoires de recherche et les équipes R&D en robotique, c'est surtout un instrument de mesure standardisé qui manquait pour comparer objectivement les approches de génération et de compréhension de designs. Le projet s'inscrit dans la tendance plus large d'application des modèles de fondation multimodaux à des domaines d'ingénierie spécialisés, après leur succès en vision et en langage naturel. La rareté des jeux de données de conception robotique freinait jusqu'à présent ce transfert, contrairement à des domaines comme la manipulation ou la navigation qui disposent déjà de corpus massifs. La mise à disposition publique annoncée par les auteurs devrait permettre à d'autres équipes de recherche de reproduire et d'étendre ces travaux, sans toutefois que des applications commerciales concrètes ou des partenariats industriels n'aient été mentionnés à ce stade.

RecherchePaper
1 source
TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable
3arXiv cs.RO 

TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable

TableVerse est un nouveau pipeline Real2Sim entièrement automatisé qui transforme des images non structurées, glanées sur internet, en environnements de table simulables avec une échelle métrique précise et une stabilité mécanique vérifiée. Contrairement aux méthodes existantes qui génèrent des scènes à partir de texte ou par génération procédurale simplifiée, TableVerse reconstruit de manière déterministe des dispositions d'objets réellement observées, en préservant leur topologie authentique. Le pipeline intègre également un module de génération de trajectoires conditionné par tâche, capable de produire des démonstrations de préhension et dépose (pick-and-place) sans collision. À partir de cette chaîne complète, les chercheurs ont constitué TableVerse-100K, un corpus de 100 000 environnements de table uniques et physiquement cohérents, chacun associé à des trajectoires de manipulation interactives. L'enjeu principal est celui, bien identifié dans la robotique manipulative, du goulot d'étranglement des données : entraîner des politiques de manipulation généralisables nécessite des volumes massifs de scènes réalistes et denses en encombrement, proches de véritables environnements domestiques ou industriels. Les approches de synthèse par hallucination texte-vers-disposition ou par génération procédurale produisent souvent des agencements physiquement implausibles, avec un encombrement bien plus pauvre que celui d'un vrai bureau ou d'une vraie table de cuisine. En ancrant la génération de scènes dans des images réelles plutôt que dans l'imagination d'un modèle génératif, TableVerse cherche à combler cet écart entre données synthétiques et complexité du monde réel, un enjeu central pour les modèles de type VLA (vision-langage-action) qui peinent aujourd'hui à généraliser au-delà de leurs environnements d'entraînement. Cette publication s'inscrit dans une dynamique de recherche plus large sur la génération automatisée de données d'entraînement pour la manipulation robotique, où plusieurs équipes explorent des approches concurrentes de synthèse procédurale ou de génération de scènes par diffusion 3D. L'accent mis ici sur la reconstruction déterministe à partir de médias internet non scénarisés, plutôt que sur la génération purement imaginative, marque une inflexion méthodologique. Les auteurs présentent TableVerse-100K comme une fondation de données destinée à alimenter les travaux futurs sur les politiques de manipulation généralisables, sans toutefois préciser à ce stade de calendrier de mise à disposition publique ou de validation par des déploiements robotiques réels.

RecherchePaper
1 source
R2RGEN : génération de données 3D réel-vers-réel pour une manipulation spatialement généralisée
4arXiv cs.RO 

R2RGEN : génération de données 3D réel-vers-réel pour une manipulation spatialement généralisée

Une équipe de chercheurs propose R2RGen, un cadre de génération de données pour l'apprentissage par imitation en manipulation robotique, publié sur arXiv (identifiant 2510.08547, version 2). Le principe : à partir d'un nombre minimal de démonstrations humaines réelles, le système génère automatiquement un grand volume de données d'entraînement spatialement diversifiées, sans jamais recourir à un simulateur. R2RGen traite les observations sous forme de nuages de points (pointcloud) et augmente les paires observation-action directement dans l'espace 3D réel. Le pipeline repose sur trois étapes : un module de parsing de scène et de trajectoire unifie les démonstrations issues de différentes configurations de caméras dans un espace 3D partagé ; une stratégie de backtracking par groupe augmente ensuite la position des objets et du robot lui-même ; enfin, un post-traitement adaptatif à la caméra aligne les données générées sur la distribution réelle des capteurs 3D. Le cadre est compatible avec les robots mobiles, ce qui le distingue des approches existantes, limitées aux bras fixes et à des angles de prise de vue prédéfinis. Ce résultat s'attaque à l'un des goulots d'étranglement les plus persistants de la robotique apprenante : le fossé sim-to-real. La plupart des pipelines de génération de données actuels passent par des moteurs physiques ou des rendus synthétiques, introduisant des artefacts visuels et des dynamiques inexactes qui dégradent les performances une fois transférés sur robot réel. R2RGen court-circuite entièrement cette chaîne en restant dans le domaine réel du début à la fin. En pratique, cela se traduit par une meilleure efficacité de la donnée sur l'ensemble des expériences rapportées, y compris sur des scénarios de manipulation mobile. Pour les équipes développant des politiques visuomotrices par imitation, cela signifie moins de démonstrations humaines nécessaires pour atteindre une généralisation spatiale robuste, c'est-à-dire la capacité du robot à opérer correctement quelle que soit la configuration relative des objets, de l'environnement ou de l'agent. La généralisation spatiale est le prérequis reconnu à toute manipulation robotique à usage général. Les travaux antérieurs, dans le sillage de RT-X et des pipelines sim-to-real basés sur Isaac Gym ou MuJoCo, avaient montré des gains mais restaient contraints à des bras fixes et à des angles de caméra prédéfinis. R2RGen se positionne comme une alternative plug-and-play sans infrastructure de simulation, abaissant la barrière d'entrée pour les laboratoires ou les équipes industrielles n'ayant pas accès à des environnements simulés robustes. La publication reste à ce stade une contribution académique sans déploiement industriel annoncé ; les auteurs indiquent comme prochaine étape naturelle la validation du passage à l'échelle sur des flottes de robots mobiles en environnement ouvert.

RecherchePaper
1 source