Aller au contenu principal
3DROID : un jeu de données de gaussiennes 3D rendables avec fiabilité mesurée pour chaque scène
RecherchearXiv cs.RO 

3DROID : un jeu de données de gaussiennes 3D rendables avec fiabilité mesurée pour chaque scène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient 3DROID, un jeu de données de scènes de manipulation robotique reconstruites en 3D Gaussian Splatting (3DGS), une représentation de scène rendable à partir de n'importe quel point de vue. Les scènes sont ancrées dans l'espace de travail métrique du robot et chacune est accompagnée d'un indicateur de fiabilité mesuré. Le travail, déposé sur arXiv sous la référence 2610.01744, s'accompagne d'un pipeline de reconstruction « calibration-aware ». Celui-ci s'appuie sur du 3DGS feed-forward, c'est-à-dire un modèle qui prédit les gaussiennes en un seul passage, sans optimisation par scène. Les auteurs ont étudié l'effet de la fiabilité des extrinsèques caméra (la position et l'orientation des caméras par rapport au robot) et du conditionnement par la pose. Leurs résultats indiquent que ce conditionnement améliore la fidélité des nouvelles vues synthétisées. Son bénéfice géométrique dépend en revanche de la qualité des extrinsèques injectées. Le jeu de données est disponible sur Hugging Face. L'abstract ne donne ni le nombre de scènes, ni les métriques chiffrées, ni les modèles robotiques évalués. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel.

L'enjeu est l'écart entre ce que voient les modèles de manipulation et ce qu'ils doivent faire. Les politiques de type VLA (vision-langage-action) raisonnent surtout à partir d'images 2D, alors que le robot agit dans un monde 3D où l'échelle métrique compte pour saisir ou placer un objet. Le 3DGS est optimisé pour le rendu photométrique, pas pour la justesse métrique. Une scène très réaliste peut donc avoir la mauvaise échelle si les calibrations de caméra sont approximatives, ce qui est courant dans les grands jeux de données collectés sur des sites variés. Pour les équipes qui entraînent des politiques avec une supervision 3D (profondeur, nuages de points, trajectoires 3D), l'apport principal est de rendre cette fiabilité mesurable scène par scène. Elles peuvent ainsi filtrer ou pondérer les données au lieu de supposer qu'elles sont toutes bonnes. Le résultat est nuancé: injecter la pose ne suffit pas si elle est mauvaise.

Le nom 3DROID renvoie à DROID, le grand jeu de démonstrations de manipulation collectées sur des robots dans de nombreux environnements. Il est probable, sans que l'abstract le précise, que 3DROID en soit une extension 3D. Ces dernières années, la recherche a enrichi les données robotiques avec de la profondeur, des nuages de points et des trajectoires 3D, et le 3DGS est venu s'y ajouter comme supervision rendable. Aucun acteur industriel n'est cité, et rien n'indique de suite annoncée. La validité du jeu de données se jugera à son usage: il faudra voir si des politiques entraînées dessus progressent réellement en manipulation, ce que l'abstract ne démontre pas encore.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable
1arXiv cs.RO 

TableVerse : un jeu de données de tables à grande échelle avec des dispositions ancrées dans le réel pour la manipulation généralisable

TableVerse est un nouveau pipeline Real2Sim entièrement automatisé qui transforme des images non structurées, glanées sur internet, en environnements de table simulables avec une échelle métrique précise et une stabilité mécanique vérifiée. Contrairement aux méthodes existantes qui génèrent des scènes à partir de texte ou par génération procédurale simplifiée, TableVerse reconstruit de manière déterministe des dispositions d'objets réellement observées, en préservant leur topologie authentique. Le pipeline intègre également un module de génération de trajectoires conditionné par tâche, capable de produire des démonstrations de préhension et dépose (pick-and-place) sans collision. À partir de cette chaîne complète, les chercheurs ont constitué TableVerse-100K, un corpus de 100 000 environnements de table uniques et physiquement cohérents, chacun associé à des trajectoires de manipulation interactives. L'enjeu principal est celui, bien identifié dans la robotique manipulative, du goulot d'étranglement des données : entraîner des politiques de manipulation généralisables nécessite des volumes massifs de scènes réalistes et denses en encombrement, proches de véritables environnements domestiques ou industriels. Les approches de synthèse par hallucination texte-vers-disposition ou par génération procédurale produisent souvent des agencements physiquement implausibles, avec un encombrement bien plus pauvre que celui d'un vrai bureau ou d'une vraie table de cuisine. En ancrant la génération de scènes dans des images réelles plutôt que dans l'imagination d'un modèle génératif, TableVerse cherche à combler cet écart entre données synthétiques et complexité du monde réel, un enjeu central pour les modèles de type VLA (vision-langage-action) qui peinent aujourd'hui à généraliser au-delà de leurs environnements d'entraînement. Cette publication s'inscrit dans une dynamique de recherche plus large sur la génération automatisée de données d'entraînement pour la manipulation robotique, où plusieurs équipes explorent des approches concurrentes de synthèse procédurale ou de génération de scènes par diffusion 3D. L'accent mis ici sur la reconstruction déterministe à partir de médias internet non scénarisés, plutôt que sur la génération purement imaginative, marque une inflexion méthodologique. Les auteurs présentent TableVerse-100K comme une fondation de données destinée à alimenter les travaux futurs sur les politiques de manipulation généralisables, sans toutefois préciser à ce stade de calendrier de mise à disposition publique ou de validation par des déploiements robotiques réels.

RecherchePaper
1 source
Un jumeau numérique haute-fidélité pour la manipulation robotique basé sur le splattage gaussien 3D
2arXiv cs.RO 

Un jumeau numérique haute-fidélité pour la manipulation robotique basé sur le splattage gaussien 3D

Une équipe de chercheurs a publié sur arXiv (identifiant 2601.03200, version 2) un cadre logiciel permettant de construire des jumeaux numériques haute fidélité pour la manipulation robotique en quelques minutes à partir d'un ensemble réduit d'images RGB. Le système repose sur la technique de reconstruction 3D Gaussian Splatting (3DGS), qui modélise une scène comme un nuage de gaussiennes colorées et orientées, offrant un rendu photoréaliste nettement plus rapide que les approches NeRF classiques. À cela s'ajoute une fusion sémantique tenant compte de la visibilité des objets, pour un étiquetage précis des éléments de la scène en 3D, ainsi qu'une méthode de conversion géométrique par filtrage produisant des maillages prêts pour la détection de collisions. L'ensemble s'intègre directement dans la chaîne Unity-ROS2-MoveIt et a été validé expérimentalement sur un bras Franka Emika Panda effectuant des tâches de pick-and-place dans des environnements non structurés. L'intérêt industriel de cette approche réside dans sa capacité à compresser drastiquement le temps de mise en place d'un pipeline sim-to-real : là où la création d'un jumeau numérique exploitable pour la planification de mouvements demande habituellement des heures de scan, de nettoyage de maillage et de paramétrage de collision, le framework proposé vise à produire un environnement simulé cohérent géométriquement et sémantiquement en quelques minutes. Pour un intégrateur ou un responsable de ligne industrielle, cela signifie un déploiement potentiellement plus rapide de cellules robotisées dans des contextes où la scène évolue fréquemment. Le papier démontre aussi que la qualité géométrique des jumeaux 3DGS, souvent critiquée pour ses artefacts aux bords d'objets, peut être suffisante pour piloter une manipulation robuste, ce qui contredit partiellement l'idée que ces reconstructions restent cantonnées à la visualisation. Le contexte est celui d'une compétition intense autour de la représentation de scènes pour la robotique. Le 3DGS, introduit par Kerbl et al. en 2023, s'est imposé comme alternative aux NeRF grâce à sa vitesse de rendu en temps réel, et plusieurs groupes l'ont depuis adapté à la robotique (SplaTAM, Gaussian Grouping, GaussianWorld). Ce travail se distingue par son focus applicatif sur le pipeline complet perception-planification-exécution, en ciblant explicitement MoveIt et ROS2, les standards de facto en robotique industrielle open-source. Il s'agit néanmoins d'un preprint sans revue par les pairs, et les résultats de pick-and-place sont présentés sur un seul type de bras dans un environnement de laboratoire contrôlé, ce qui laisse ouverte la question de la robustesse à plus grande échelle.

UELe framework est validé sur un bras Franka Emika Panda (fabricant allemand) et s'intègre nativement avec ROS2/MoveIt, standards ouverts très utilisés par les intégrateurs industriels européens, ce qui le rend directement pertinent pour réduire les délais de déploiement de cellules robotisées en Europe.

RecherchePaper
1 source
PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
3arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
GA3T : jeu de données de traversabilité pour équipes de robots sol-aériens hétérogènes en milieux non structurés
4arXiv cs.RO 

GA3T : jeu de données de traversabilité pour équipes de robots sol-aériens hétérogènes en milieux non structurés

Une équipe de chercheurs a publié GA3T (Ground-Aerial Team for Terrain Traversal), un jeu de données de perception collaborative multi-robots ciblant les environnements non structurés, déposé sur arXiv en mai 2026. La collecte a mobilisé deux plateformes complémentaires : un robot terrestre Clearpath Husky (UGV) équipé de LiDAR 3D, caméra stéréo, IMU et GPS, et un drone Autel EVO II fournissant images RGB, observations thermiques/infrarouges et GPS depuis un point de vue aérien surplombant. Quatre environnements distincts ont été couverts -- sentiers forestiers, chemins rocheux, terrains boueux, congères et prairies -- pour un total de plus de 13 000 frames synchronisées sur environ 29 minutes d'opération. Le jeu de données intègre une segmentation zero-shot basée sur SAM 3 (Segment Anything Model v3, Meta) et plus de 8 000 images labellisées manuellement. Sa particularité tient à la période de collecte, en début de printemps : la canopée encore peu dense permet au drone d'observer partiellement le robot terrestre à travers les arbres, enrichissant la perception collaborative d'une dimension explicite de gestion des occlusions. GA3T comble un vide documenté dans la recherche sur la perception multi-robots en conditions réelles hors route. La quasi-totalité des datasets multi-robots existants se concentre sur le SLAM en environnements structurés ou sur la conduite coopérative simulée, sans fournir de capteurs multi-modaux chevauchants entre plateformes sol et air. La combinaison LiDAR terrestre et infrarouge aérien ouvre des pistes directes pour l'estimation de traversabilité -- problème central pour les déploiements autonomes en agriculture de précision, foresterie ou gestion de crise -- où les modèles doivent distinguer sol franchissable, boue instable et végétation dense sans balisage préalable. C'est précisément ce gap sim-to-real sur terrain non balisé que ce type de dataset vise à réduire, en fournissant des données brutes issues de conditions météo et de sol réelles. Clearpath Robotics, filiale de Rockwell Automation depuis 2023 et fournisseur de référence pour les UGV de recherche universitaire, est associé ici à l'Autel EVO II, drone commercial grand public repositionné en plateforme de collecte scientifique. Aucun acteur européen n'est impliqué dans cette publication. Sur le plan concurrentiel, GA3T se positionne face à des datasets établis comme RUGD, RELLIS ou le corpus DARPA SubT, mais avec l'angle inédit de la fusion cross-view air-sol sur terrain naturel non aménagé. Les auteurs ciblent explicitement comme applications prioritaires la fusion de points de vue hétérogènes, l'estimation de traversabilité et la compréhension de scènes collaboratives -- tâches directement pertinentes pour l'entraînement de modèles VLA (Vision-Language-Action) appliqués à la navigation hors route, un axe de recherche en forte accélération depuis 2024 dans plusieurs laboratoires américains et asiatiques.

RecherchePaper
1 source