Aller au contenu principal
PRISM : jeu de données de compétences industrielles réelles, précis, riche en contacts et multimodal
RecherchearXiv cs.RO 

PRISM : jeu de données de compétences industrielles réelles, précis, riche en contacts et multimodal

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie PRISM (Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing), un jeu de données décrit dans un preprint arXiv (2608.17962v1) destiné à l'apprentissage robotique pour l'assemblage industriel. PRISM couvre plus de 25 tâches de manipulation, comme le branchement/débranchement de composants électroniques ou le tri sur convoyeur, avec des contraintes mécaniques variées. Il contient plus de 5 000 trajectoires, soit 45 heures de démonstrations en téléopération, enregistrées avec des capteurs synchronisés : vision RGB-D multi-vues, force/couple, tactile et état du robot. Le jeu de données est publié en open source sur le site des auteurs (tengbo-yu.github.io/PRISM), sans partenaire industriel ni prix mentionnés.

Ce type de ressource cible un manque précis : la plupart des datasets de manipulation robotique existants, collectés en environnement domestique ou en laboratoire, se limitent à des tâches courtes et peu contraignantes comme le pick-and-place, sans capturer le contrôle de précision ni la régulation de force et de contact qu'exige l'assemblage industriel. Pour les intégrateurs et décideurs qui évaluent des bras robotiques ou des humanoïdes pour la ligne de production, PRISM fournit un benchmark réaliste pour entraîner et évaluer des politiques de manipulation multimodale sous contraintes de précision industrielle, un terrain où les modèles vision-langage-action généralistes échouent souvent hors laboratoire. Le signal à retenir est que la disponibilité de données de contact reste un goulot d'étranglement au moins aussi critique que la puissance des modèles pour fiabiliser la manipulation fine en usine.

La publication s'inscrit dans une tendance de fond du secteur : après plusieurs années de datasets généralistes axés sur la préhension d'objets du quotidien, la communauté de l'apprentissage robotique cherche à combler l'écart entre démonstrations de laboratoire et exigences réelles du manufacturing, où la tolérance aux erreurs de contact est quasi nulle. Aucune entreprise ni laboratoire commercial n'est cité dans l'abstract, ce qui situe PRISM du côté de la recherche académique ouverte plutôt que d'un produit prêt à déployer. Les auteurs présentent le dataset comme une fondation pour des travaux futurs sur la manipulation généralisable et riche en contacts, sans pilote industriel ni calendrier annoncés ; la suite logique serait son adoption par des équipes entraînant des modèles VLA pour l'assemblage.

À lire aussi

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles
1arXiv cs.RO 

EgoWalk : un jeu de données multimodal pour la navigation robotique en conditions réelles

Une équipe de chercheurs a publié EgoWalk, un dataset multimodal de 50 heures de navigation humaine destiné à entraîner des algorithmes de navigation robotique en conditions réelles. Les données ont été collectées dans une grande variété d'environnements intérieurs et extérieurs, sur plusieurs saisons et sites géographiques différents. Le dataset comprend les données brutes ainsi qu'un format prêt pour l'apprentissage par imitation (Imitation Learning), accompagné de pipelines automatisés générant deux types de sous-datasets dérivés : des annotations d'objectifs en langage naturel et des masques de segmentation de traversabilité. L'ensemble des pipelines de traitement et la description de la plateforme matérielle utilisée pour la collecte sont publiés en open source. L'intérêt principal d'EgoWalk réside dans la rareté des datasets de navigation en conditions non contrôlées, à grande échelle et couvrant plusieurs saisons. La majorité des systèmes de navigation robotique actuels souffrent d'un écart sim-to-real persistant, faute de données réelles suffisamment diversifiées. En proposant simultanément des annotations langage naturel et des masques de traversabilité générés automatiquement, EgoWalk vise à réduire le coût de labellisation manuelle qui freine le développement de modèles vision-langage-action (VLA) pour la navigation outdoor. La publication open source des pipelines permet aux équipes de réplication de reconstruire des datasets similaires sur leur propre plateforme, ce qui est un signal positif pour la reproductibilité dans le domaine. La navigation autonome en environnements non structurés reste l'un des défis centraux de la robotique mobile, que ce soit pour les robots de livraison, les plateformes de surveillance ou les assistants mobiles. EgoWalk s'inscrit dans un mouvement plus large de constitution de datasets ego-centriques, aux côtés d'initiatives comme SCAND (UT Austin) ou des travaux de Boston Dynamics et de Google DeepMind sur la navigation en extérieur. Le fait que les données soient collectées du point de vue humain, plutôt que depuis un robot, soulève la question du transfert de domaine, que les auteurs reconnaissent implicitement en proposant des benchmarks et études de diversité. Les prochaines étapes naturelles seraient la validation sur des plateformes robotiques réelles et l'intégration dans des architectures de type foundation model pour la navigation.

RechercheActu
1 source
GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
2arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de données en accès libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux équipes de recherche françaises et européennes travaillant sur le SLAM et l'estimation d'état pour robots a pattes.

RecherchePaper
1 source
CRISP : plateforme de simulation robotique riche en contacts, avec géométries étendues et solveurs de contact
3arXiv cs.RO 

CRISP : plateforme de simulation robotique riche en contacts, avec géométries étendues et solveurs de contact

Des chercheurs du laboratoire INRoL publient CRISP (Contact-RIch Simulation Platform), un nouveau moteur physique dédié a la simulation haute fidélité des interactions multi-contacts, pense en particulier pour la manipulation robotique a tolérances serrées. Le papier, mis en ligne sur arXiv sous la référence 2609.21761v1 en septembre 2026, décrit un moteur combinant une détection de collision fondée sur l'optimisation, compatible avec des représentations géométriques variées, et des solveurs de contact bases sur le lagrangien augmente, présentes comme plus robustes que les approches classiques. Les auteurs affirment résoudre les contraintes multi-contacts sans recourir aux relaxations numériques qui dégradent habituellement la précision des simulateurs existants. Le code est disponible publiquement sur GitHub a l'adresse github.com/INRoL/crisp. La fidélité physique de CRISP est validée par comparaison avec des plateformes de simulation de référence, puis illustrée sur des scenarios de manipulation robotique complexes, sans que le résume ne publie de chiffres précis de performance comme le temps de calcul ou le nombre de contacts simultanés gérés. La simulation reste le principal goulot d'étranglement pour l'entrainement de politiques de manipulation fine, insertion, assemblage, prise en tolérance serrée, une étape jugée critique pour transférer des compétences du simulateur vers le robot réel. Les moteurs généralistes utilises aujourd'hui pour entrainer des politiques de type VLA ou par renforcement, tels que MuJoCo, PhysX dans Isaac Sim ou Bullet, arbitrent généralement entre richesse géométrique et stabilité numérique du solveur de contact, ce qui limite leur fidélité sur les taches d'assemblage fin. En ciblant simultanément ces deux axes, CRISP s'attaque a un angle mort souvent cite par les intégrateurs et laboratoires travaillant sur la manipulation dexterisee humanoïde ou industrielle, celui de l'écart entre une démonstration en simulation et un comportement fiable en conditions réelles. Un moteur plus fidèle sur les contacts intensifs pourrait améliorer la qualité des données synthétiques servant a entrainer des modèles de manipulation, un enjeu direct pour réduire le volume de démonstrations réelles nécessaires. CRISP s'inscrit dans une vague de nouveaux moteurs physiques conçus spécifiquement pour la robotique et l'entrainement de politiques d'IA, aux cotes d'outils établis comme MuJoCo et sa variante accélérée MJX, NVIDIA Isaac Sim base sur PhysX, Drake du MIT, ou des projets plus récents comme Genesis et SAPIEN. Contrairement aux annonces de robots humanoïdes commerciaux, CRISP est publie comme un travail de recherche académique, classe "new" sur arXiv et non encore revu par les pairs, plutôt que comme un produit commercial: aucune entreprise, aucun client industriel ni feuille de route de déploiement n'est mentionne. Sa mise en open source vise avant tout l'adoption par la communauté robotique comme brique de recherche reproductible, dans un contexte ou la fidélité des simulateurs devient centrale face a la multiplication des politiques de manipulation entraînées en simulation. Les prochaines étapes attendues concernent l'intégration a des pipelines d'entrainement plus larges et des comparaisons sur des benchmarks de manipulation standardises, sans calendrier précise dans l'article.

RecherchePaper
1 source
Pré-entraînement multimodal ancré sur la proprioception pour l'assemblage riche en contacts en zéro-shot sim-vers-réel
4arXiv cs.RO 

Pré-entraînement multimodal ancré sur la proprioception pour l'assemblage riche en contacts en zéro-shot sim-vers-réel

Un article publié sur arXiv (arXiv:2609.07534, version révisée) présente PACE (Proprioception-Anchored Cross-Modal Encoder), une méthode d'apprentissage pour l'assemblage robotique à contact riche, ces tâches de vissage ou d'insertion qui exigent une précision submillimétrique et une lecture fiable des forces pendant un contact prolongé. L'apprentissage par renforcement en simulation permet de passer à l'échelle, mais les écarts entre simulation et réel sur la vision, la dynamique de contact et les mesures de force-couple limitent d'ordinaire le transfert des politiques vers le matériel réel. Les auteurs partent du constat que la proprioception, positions et vitesses articulaires, reste cohérente d'un domaine à l'autre car exprimée dans un référentiel calibré partagé. PACE entraîne les représentations visuelles et de force-couple à prédire les transitions d'état proprioceptif, ce qui pousse l'encodeur à ignorer les facteurs propres au domaine (éclairage, texture, biais des capteurs) tout en conservant les indices de mouvement utiles à la tâche. Les politiques entraînées sur ces caractéristiques figées sont déployées sur robot réel sans réglage fin in situ ni suivi de pose d'objet. Sur quatre tâches d'assemblage à contact riche, le taux de réussite moyen atteint 93,3% en conditions réelles, avec un écart de seulement 2,7 points de pourcentage par rapport à la simulation. Cette faible dégradation tranche avec les pertes habituellement observées lors du transfert sim-to-real sur des tâches de contact, où l'écart peut atteindre plusieurs dizaines de points dès que le retour de force entre en jeu. Pour les intégrateurs de cellules d'assemblage, se passer du suivi de pose d'objet est un argument concret, cette brique restant l'une des plus coûteuses et fragiles des systèmes de vision industrielle actuels. Si le résultat se confirme au-delà des quatre tâches testées et à l'échelle d'une ligne de production, il indiquerait que le sim-to-real cesse d'être le principal frein à l'usage de l'apprentissage par renforcement pour des manipulations fines en usine, face aux automates programmés manuellement. Le travail s'inscrit dans la recherche sur la réduction de l'écart sim-to-real, qui recourt habituellement à la randomisation de domaine, à l'identification de système ou à la fusion apprise de plusieurs modalités, des approches citées comme lignes de base moins robustes que PACE face aux perturbations testées. Publié comme version corrigée (replace) sur arXiv, sans affiliation institutionnelle précisée dans le résumé, il s'agit à ce stade d'une contribution de recherche validée en laboratoire sur quatre tâches, non d'un produit commercialisé ni d'un pilote industriel annoncé. Les suites attendues restent l'extension à davantage de tâches et de plateformes, puis une validation en conditions de production réelles.

RecherchePaper
1 source