Aller au contenu principal
RecherchearXiv cs.RO 

FoldNet++ : un jeu de données synthétique à grande échelle pour le pliage et dépliage de t-shirts par un robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire EPIC de l'université de Pekin publient FoldNet++, un jeu de données synthétique pour l'apprentissage du pliage et du dépliage de T-shirts par des robots, décrit dans un preprint arXiv (2609.12433v1). Il couvre 6 embodiments robotiques, 1 000 T-shirts virtuels et 1 000 environnements, pour un total de 120 000 épisodes annotes. En reprenant le pipeline FoldNet, les auteurs simulent physiquement des T-shirts aux apparences variées avec des points clés sémantiques annotes, puis génèrent, via un cadre base sur des règles unifie, des démonstrations de manipulation propres a chaque robot. Des politiques visuomotrices entraînées uniquement sur ces données synthétiques atteignent plus de 90% de réussite de bout en bout une fois déployées sur des environnements réels et des T-shirts jamais vus, dans des configurations initiales arbitraires. Le projet est publie a l'adresse pku-epic.github.io/FoldNetXX.

Le linge constitue un cas d'école de la manipulation d'objets déformables, ou la géométrie change a chaque prise, ce qui rend l'apprentissage d'une politique généralisable bien plus difficile que pour des objets rigides. L'enjeu de FoldNet++ est de montrer qu'un entrainement purement synthétique, sans aucune donnée réelle, peut transférer efficacement vers le monde réel, une réponse potentielle au fosse simulation-réalité qui freine le secteur. Si ce taux de 90% se confirme sur des évaluations indépendantes, il offrirait aux intégrateurs de blanchisserie industrielle et de robotique domestique un moyen d'éviter la collecte couteuse de démonstrations réelles sur tissu. Le chiffre reste toutefois issu des auteurs eux-mêmes et mérite une vérification externe avant d'être généralisé.

FoldNet++ prolonge le pipeline du précédent FoldNet, développe par la même équipe, en l'étendant a davantage de robots, de vêtements et de scènes. Cette démarche rejoint une tendance plus large en robotique manipulative, ou plusieurs laboratoires cherchent a démontrer qu'un volume massif de données simulées peut réduire la dépendance a la téléopération sur robot réel, historiquement couteuse et lente a collecter. Donnees et code étant mis en ligne via le site du projet, la suite logique passe par des benchmarks indépendants sur d'autres types de vêtements que le T-shirt et sur des robots non couverts par les six embodiments testes, avant toute intégration dans des lignes de production ou des robots domestiques commerciaux.

Dans nos dossiers

À lire aussi

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique
1arXiv cs.RO 

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique

Le dataset RoboDesign1M rassemble un million d'échantillons multimodaux consacrés à la conception de robots, extraits automatiquement de la littérature scientifique couvrant plusieurs domaines de la robotique. Les auteurs ont mis au point un pipeline de collecte semi-automatisé permettant d'agréger efficacement des données diverses (texte et images) issues de publications existantes, plutôt que de les créer manuellement. Pour valider l'utilité du corpus, l'équipe a mené des expériences sur trois tâches distinctes : la génération d'images de conception robotique, la réponse à des questions visuelles portant sur des schémas de conception, et la recherche d'images de conception à partir de requêtes. Les résultats montrent que ce jeu de données constitue un nouveau benchmark exigeant pour ces tâches de compréhension du design. Le dataset sera rendu public, avec une page de projet dédiée (airvlab.github.io/robotdesign1m). Il s'agit d'une version mise à jour d'un article déposé sur arXiv (2503.06796), initialement publié en mars puis révisé. Ce travail cible un goulot d'étranglement méthodologique plutôt qu'un produit commercial : la conception mécanique d'un robot reste un processus long, coûteux et dépendant d'une expertise rare, et les modèles de fondation qui pourraient l'automatiser manquaient jusqu'ici de données d'entraînement à grande échelle sur ce sujet précis. En fournissant un million d'exemples annotés, RoboDesign1M ouvre la voie à des assistants IA capables de proposer des pistes de conception, de retrouver des schémas existants à partir d'une description textuelle, ou de générer des visualisations de composants robotiques. Pour les laboratoires de recherche et les équipes R&D en robotique, c'est surtout un instrument de mesure standardisé qui manquait pour comparer objectivement les approches de génération et de compréhension de designs. Le projet s'inscrit dans la tendance plus large d'application des modèles de fondation multimodaux à des domaines d'ingénierie spécialisés, après leur succès en vision et en langage naturel. La rareté des jeux de données de conception robotique freinait jusqu'à présent ce transfert, contrairement à des domaines comme la manipulation ou la navigation qui disposent déjà de corpus massifs. La mise à disposition publique annoncée par les auteurs devrait permettre à d'autres équipes de recherche de reproduire et d'étendre ces travaux, sans toutefois que des applications commerciales concrètes ou des partenariats industriels n'aient été mentionnés à ce stade.

RecherchePaper
1 source
I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs
2arXiv cs.RO 

I2Nav-Robot : un jeu de données robotique intérieur-extérieur à grande échelle pour la navigation par fusion multi-capteurs

Chercheurs de l'université de Wuhan (laboratoire i2Nav) ont publié i2Nav-Robot, un jeu de données à grande échelle destiné à la navigation par fusion multi-capteurs pour véhicules terrestres autonomes (UGV), en environnements intérieurs et extérieurs. La plateforme, un véhicule à roues omnidirectionnel, embarque des LiDAR solid-state à vision frontale et à 360 degrés de dernière génération, un radar millimétrique 4D, des caméras stéréo, une centrale inertielle (IMU), un récepteur GNSS et des odomètres à roues, tous synchronisés temporellement via une combinaison de synchronisation matérielle en ligne et de calibration hors ligne. Le jeu de données comprend dix séquences couvrant des scénarios variés (rues extérieures, parkings intérieurs) pour une distance cumulée d'environ 17 060 mètres, avec une vérité terrain de précision centimétrique obtenue par post-traitement de navigation intégrée sur IMU haut de gamme. Quinze méthodes open source de fusion multi-capteurs ont servi à valider la qualité des données. Le tout est accessible sur GitHub (i2Nav-WHU/i2Nav-Robot). Pour la recherche en navigation robotique, ce type de benchmark comble un manque réel: les jeux de données existants pour UGV souffrent souvent de configurations de capteurs limitées, d'une synchronisation imprécise, d'une vérité terrain incomplète ou peu fiable, et d'un manque de diversité de scénarios, ce qui freine le développement et la comparaison rigoureuse des algorithmes SLAM et de fusion de capteurs. Un dataset combinant LiDAR récents, radar 4D et vérité terrain centimétrique dans des environnements mixtes intérieur-extérieur offre aux équipes de recherche et aux intégrateurs un terrain d'évaluation plus représentatif des conditions réelles de déploiement, notamment pour les robots mobiles industriels et logistiques. Ce travail s'inscrit dans la lignée de benchmarks antérieurs comme KITTI ou M2DGR, mais cherche à dépasser leurs limites en matière de synchronisation et de diversité de capteurs, notamment via l'intégration récente du radar millimétrique 4D, technologie de plus en plus utilisée en complément du LiDAR pour la robustesse par mauvaise visibilité. La publication en open source, avec documentation complète sur GitHub, vise à en faire une référence pour les futures évaluations comparatives de méthodes de navigation autonome, un domaine où la disponibilité de données de qualité reste un goulot d'étranglement majeur pour l'industrie.

RecherchePaper
1 source
Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques
3arXiv cs.RO 

Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques

Une équipe de recherche publie Ego2Robot, un pipeline conçu pour transformer des vidéos de manipulation humaine filmées à la première personne (égocentriques) en données d'entraînement robotique. La méthode combine trois étapes : le retargeting des actions humaines vers des trajectoires robotiques, la synthèse visuelle d'un bras robotique inséré dans la scène, et une curation de qualité à plusieurs niveaux pour filtrer les séquences exploitables. Le résultat annoncé est un jeu de données de 18 561 heures de données robotiques synthétisées, couvrant 15 morphologies de robots différentes, ce qui en ferait le plus grand corpus ego-vers-robot jamais constitué. Pour évaluer la capacité de généralisation des modèles entraînés sur ces données, les auteurs étendent le benchmark RoboTwin2.0 avec des axes de perturbation dissociés : apparence visuelle, disposition de la scène, morphologie du robot et sémantique de la tâche. L'article, déposé sur arXiv (2608.02580), reste à ce stade un preprint non encore relu par les pairs. L'enjeu dépasse la simple taille du jeu de données. Les travaux précédents avaient montré que le retargeting vidéo pouvait produire des politiques efficaces mais limitées à une seule tâche, à petite échelle. Ego2Robot teste pour la première fois si cette approche apporte un bénéfice en pré-entraînement à grande échelle pour des modèles vision-langage-action (VLA), la brique centrale des robots généralistes actuels type Pi-0, GR00T N2 ou Helix. Les auteurs rapportent que le pré-entraînement conjoint sur données synthétisées et données robotiques réelles améliore de façon consistante la généralisation hors distribution, avec une validation sur déploiement réel. Si ces résultats se confirment, cela renforcerait l'idée que la vidéo humaine égocentrique, abondante et bien moins coûteuse à collecter que la téléopération, peut combler une partie du déficit de données qui freine l'entraînement des modèles robotiques généralistes. Le goulot d'étranglement des données reste le frein numéro un des modèles de manipulation généralistes : la téléopération reste coûteuse à grande échelle, et la simulation pure souffre encore d'un écart sim-to-real. Ego2Robot s'inscrit dans une lignée de travaux cherchant des sources de données alternatives, aux côtés d'approches par simulation ou par vidéos web génériques. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs mettent à disposition une page projet dédiée, sans calendrier annoncé pour une éventuelle mise à disposition publique du jeu de données complet.

RecherchePaper
1 source
RoboDream : des modèles du monde compositionnels pour la synthèse de données robotiques à grande échelle
4arXiv cs.RO 

RoboDream : des modèles du monde compositionnels pour la synthèse de données robotiques à grande échelle

Des chercheurs ont publié RoboDream (arXiv:2606.02577), un world model centré sur l'embodiment conçu pour générer des démonstrations photorealistic destinées à l'entraînement de politiques de manipulation robotique. Le système s'appuie sur des modèles de diffusion vidéo conditionnés simultanément sur le mouvement rendu du robot et sur des priors explicites de scène et d'objet, découplant ainsi l'exécution de trajectoire de la synthèse d'environnement. Cette architecture permet deux capacités distinctes : le "retrieval and rebirth", qui réutilise des trajectoires existantes dans des contextes entièrement nouveaux sans collecter de nouvelles données de mouvement, et la "prop-free teleoperation", où l'opérateur manipule dans le vide et le modèle génère a posteriori les objets cibles et la scène. Les expériences en conditions réelles montrent que les données ainsi synthétisées améliorent systématiquement les performances des politiques en aval et réduisent significativement les besoins en données réelles sur des tâches de manipulation variées. La télé-opération reste aujourd'hui le principal goulot d'étranglement du robot learning à grande échelle : coûteuse, lente, et contrainte par le temps de reset entre chaque démonstration (repositionner les objets, réorganiser la scène). RoboDream attaque ce problème en proposant une augmentation sémantique profonde plutôt qu'une simple modification de texture ou de couleur : le système génère des objets et des environnements entièrement nouveaux à partir d'une même trajectoire capturée. La "prop-free teleoperation" est opérationnellement significative car elle supprime le temps de reset, l'une des sources de coût caché les plus sous-estimées dans les pipelines de collecte actuels. Le fait que les politiques entraînées sur données synthétiques surpassent les baselines en conditions réelles valide partiellement la thèse que le sim-to-real gap peut être comblé par un générateur suffisamment ancré dans la géométrie et la cinématique du robot réel, contrairement aux approches purement visuelles. Cette publication s'inscrit dans une course à la mise à l'échelle des données robotiques qui s'est accélérée depuis 2023 avec l'essor des VLA (Vision-Language-Action models) : OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA. Ces architectures nécessitent des dizaines de milliers de démonstrations diversifiées pour être robustes. Face à ce besoin, deux voies coexistent : la collecte distribuée à grande échelle (projet Open X-Embodiment) et la génération synthétique. RoboDream s'inscrit dans la seconde, aux côtés de travaux comme UniSim ou RoboGen, mais se différencie par son ancrage explicite à la cinématique du robot, évitant les "embodiment hallucinations" qui affectent les générateurs purement visuels. Aucun partenariat industriel ni déploiement commercial n'est annoncé à ce stade. Les questions ouvertes portent sur la généralisation à des morphologies de robots différentes et sur les tâches de manipulation longue durée, où la cohérence temporelle des séquences générées reste un défi non résolu.

RechercheOpinion
1 source