Aller au contenu principal
Transfert simulation-réel efficace de modèles monde-action à partir de données synthétiques
RecherchearXiv cs.RO 

Transfert simulation-réel efficace de modèles monde-action à partir de données synthétiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le fossé sim-to-real reste un défi central pour déployer des politiques de manipulation apprises, car il permet en théorie de remplacer des démonstrations réelles coûteuses par des données synthétiques bon marché à grande échelle. Publiée le 30 juin 2026 (arXiv:2606.31101), une étude teste si un "world-action model", un modèle combinant prédiction visuelle et contrôle moteur, peut être entraîné uniquement en simulation puis déployé sans aucune démonstration réelle. L'équipe part de Cosmos Policy, un modèle de diffusion vidéo adapté au contrôle visuomoteur, et construit des environnements simulés avec une randomisation poussée des domaines. Les démonstrations d'entraînement, environ 800 par tâche, sont générées automatiquement via le pipeline de planification de mouvement AnyTask, sans donnée réelle. Trois tâches sont testées: soulever un objet, ouvrir un tiroir, et effectuer un pick-and-place. Déployé en zero-shot sur un bras robotique Franka, le modèle atteint un taux de réussite moyen de 35%.

Ce résultat, même modeste, répond à une question ouverte du secteur: les world-action models peuvent-ils transférer du simulateur au monde réel sans coûteuses démonstrations humaines? Jusqu'ici, aucun travail n'avait démontré ce transfert pour la manipulation robotique. Un taux de 35% reste loin des standards attendus pour un déploiement industriel, souvent supérieurs à 80%, et confirme que le fossé sim-to-real demeure un obstacle réel, non résolu par la seule échelle des données synthétiques. Pour les intégrateurs et décideurs B2B, le signal est clair: remplacer la téléopération humaine par de la donnée simulée reste au stade de preuve de concept, pas de solution prête à l'emploi.

Le travail s'inscrit dans la lignée des modèles de fondation robotiques récents comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui cherchent tous à réduire la dépendance aux démonstrations réelles. Cosmos Policy dérive des travaux de NVIDIA sur les modèles de monde Cosmos. La méthode AnyTask pour générer automatiquement des trajectoires en simulation illustre une tendance plus large: automatiser la création de données d'entraînement plutôt que multiplier les téléopérations en laboratoire, approche également explorée par Physical Intelligence ou Skild AI. Les auteurs présentent ce résultat comme une première preuve de faisabilité, sans calendrier de commercialisation ni partenariat industriel annoncé.

À lire aussi

Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique
1arXiv cs.RO 

Re³Sim : générer des données de simulation photoréalistes en 3D par transfert réel-vers-simulation pour la manipulation robotique

Cette annonce arrive du côté recherche académique plutôt que de l'industrie commerciale : une équipe présente RE³SIM, un système de simulation photoréaliste en 3D destiné à combler l'écart entre entraînement simulé et déploiement réel en robotique manipulatrice. Publié sur arXiv (version 4, remplaçant une précédente), le papier décrit un pipeline qui reconstruit fidèlement des scènes réelles grâce à des techniques avancées de reconstruction 3D et de rendu neuronal, permettant un rendu en temps réel de caméras virtuelles multi-angles au sein d'un simulateur physique. En s'appuyant sur des informations privilégiées pour générer efficacement des démonstrations expertes en simulation, puis en entraînant des politiques robotiques par apprentissage par imitation, les chercheurs rapportent un taux de réussite moyen supérieur à 58% en transfert "zero-shot" vers le réel, c'est-à-dire sans aucune donnée réelle utilisée pour l'entraînement, uniquement des données simulées. Ils ont aussi constitué un jeu de données de simulation à grande échelle pour tester la généralisation des politiques apprises sur des objets variés. Le résultat compte parce qu'il s'attaque directement à l'un des goulots d'étranglement les plus coûteux du secteur : la collecte de données réelles pour entraîner des robots manipulateurs, qui exige des opérateurs qualifiés et du matériel onéreux. Si le fossé sim-to-real (géométrique et visuel) peut être réduit de manière fiable grâce à des reconstructions photoréalistes plutôt qu'à des environnements simulés génériques, cela change la donne pour les intégrateurs et les équipes de R&D qui cherchent à multiplier les scénarios d'entraînement sans multiplier les essais physiques. Un taux de 58% en zero-shot reste toutefois modeste comparé aux standards de fiabilité industrielle, et mérite d'être lu comme une preuve de concept académique plutôt qu'une solution prête à l'emploi pour la production. RE³SIM s'inscrit dans la lignée des travaux récents sur les politiques vision-langage-action (VLA) et les pipelines d'apprentissage par imitation, un axe de recherche également poursuivi par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T). La démarche real-to-sim-to-real, où l'on capture d'abord le monde réel avant de simuler dessus, distingue cette approche des simulateurs purement synthétiques et pourrait influencer les futurs outils de génération de données pour l'entraînement de robots. Le code et des démonstrations sont disponibles sur le site du projet (re3sim.github.io), signe que l'équipe cherche une adoption élargie par la communauté robotique plutôt qu'une simple publication isolée.

RecherchePaper
1 source
ExpertGen : apprentissage de politiques expertes par transfert simulation-réel à partir de comportements imparfaits
2arXiv cs.RO 

ExpertGen : apprentissage de politiques expertes par transfert simulation-réel à partir de comportements imparfaits

ExpertGen est un framework de recherche publié sur arXiv (2603.15956) qui automatise l'apprentissage de politiques de manipulation robotique en simulation pour en faciliter le transfert vers du matériel réel. Le système initialise une politique de diffusion à partir de démonstrations imparfaites, générées par un grand modèle de langage ou fournies manuellement, puis applique du renforcement pour l'affiner sans jamais modifier les poids du modèle préentraîné. L'optimisation porte uniquement sur le bruit initial de la diffusion, ce qui maintient l'exploration dans des trajectoires cohérentes avec le comportement humain, même avec des récompenses binaires éparses. Sur les benchmarks publiés, ExpertGen atteint 90,5 % de succès sur des tâches d'assemblage industriel et 85 % sur des tâches de manipulation à long horizon, surpassant toutes les méthodes de référence testées. Le transfert sim-to-réel est validé par distillation DAgger : les politiques d'état apprises en simulation sont converties en politiques visuomotrices et déployées sur du matériel robotique physique. Ce résultat s'attaque directement au principal goulot d'étranglement du robot learning industriel : la collecte de données de qualité. La téléopération à grande échelle est coûteuse, lente et ne se généralise pas. ExpertGen propose une alternative crédible en utilisant des démonstrations imparfaites, y compris synthétiques, comme amorce, puis en laissant le renforcement corriger l'écart de qualité en simulation. Le fait de geler la politique de diffusion est une décision architecturale clé : elle évite le mode collapse typique du fine-tuning RL sur des politiques expressives, tout en permettant la convergence sans reward engineering manuel. Pour les intégrateurs industriels, c'est un signal concret que le sim-to-real gap sur des tâches d'assemblage n'est pas insurmontable, à condition de disposer d'un simulateur suffisamment fidèle. Ce travail s'inscrit dans la vague des politiques de diffusion pour la robotique, initiée par Diffusion Policy (Chi et al., 2023, Columbia University) et prolongée par des systèmes comme pi-zero de Physical Intelligence ou les politiques dextères développées chez Google DeepMind et NVIDIA avec GR00T N2. ExpertGen reste pour l'instant un résultat académique : les métriques de succès sont issues de benchmarks de simulation contrôlés, et le déploiement réel mentionné dans le papier est préliminaire. Aucune timeline commerciale ni partenaire industriel ne sont annoncés. Les prochaines étapes logiques incluent des tests de robustesse à des variations de capteurs et d'environnement plus sévères, ainsi qu'une intégration éventuelle avec des politiques de fondation multimodales pour généraliser au-delà des tâches d'assemblage structurées.

RechercheOpinion
1 source
Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel
3arXiv cs.RO 

Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel

Des chercheurs ont soumis sur arXiv (arXiv:2606.28805, juin 2026) un ensemble de modèles physiques haute-fidélité destinés à améliorer le sim-to-real transfer en robotique, appliqués au tennis de table de niveau professionnel. À des vitesses et effets compétitifs, une balle de ping-pong suit des trajectoires complexes et contre-intuitives que le robot doit anticiper en une fraction de seconde. Les modèles proposés couvrent trois domaines : la dynamique aérodynamique du vol de balle, avec les coefficients de traînée et de force de Magnus modélisés en fonction du nombre de Reynolds et du rapport de rotation ; le contact balle-table, intégrant les effets de déformation (buckling) de la balle sur le coefficient de restitution ainsi que des termes résiduels ; et le contact balle-raquette, via un réseau de neurones résiduel combiné à des coefficients de restitution normale et tangentielle et un amortissement torsionnel. Ces modèles ont servi à entraîner des politiques par apprentissage par renforcement (RL), aboutissant à ce que les auteurs décrivent comme le premier agent robotique capable d'affronter des joueurs professionnels en conditions réelles. L'intérêt technique dépasse le cadre sportif. La nature adversariale du tennis de table impose une contrainte rarement aussi explicite ailleurs : toute zone où la simulation diverge de la réalité devient exploitable par l'adversaire, forçant une précision de modélisation sans concession. Les travaux antérieurs en robotique ping-pong se cantonnaient à des plages étroites de vitesses et d'effets, insuffisantes pour reproduire les comportements balistiques du jeu professionnel. Que ce pipeline simulation-vers-réalité soit suffisamment fidèle pour approcher ce niveau valide l'approche pour des tâches de manipulation rapide en milieu industriel, où les essais réels restent coûteux ou dangereux, et renforce l'hypothèse que le sim-to-real gap est soluble par la précision physique plutôt que par l'accumulation de données réelles. Ce travail s'inscrit dans la continuité directe des recherches publiées par Google DeepMind en 2024, qui avaient démontré qu'un robot pouvait battre des joueurs amateurs confirmés en conditions réelles. Ce nouveau papier documente les fondations physiques qui rendent possible le saut qualitatif vers le niveau professionnel. Plusieurs équipes concurrentes utilisent le ping-pong comme benchmark de robotique agile, mais peu ont publié des modèles de contact aussi détaillés pour les phases raquette-balle et balle-table. La revendication de compétitivité face à des professionnels reste à confirmer par des évaluations indépendantes, le papier étant une prépublication non encore évaluée par les pairs. Les suites logiques incluent la généralisation de ces modèles de contact résiduels à d'autres objets déformables et leur transposition à des tâches industrielles de manipulation précise à haute cadence.

RecherchePaper
1 source
Modèles du monde JEPA à régularisation de profondeur : des représentations plus transférables à partir de données robotiques réelles en extérieur
4arXiv cs.RO 

Modèles du monde JEPA à régularisation de profondeur : des représentations plus transférables à partir de données robotiques réelles en extérieur

Publié sur arXiv (arXiv:2607.16314v1), un nouveau papier de recherche propose une architecture de modèle du monde basée sur JEPA (Joint Embedding Predictive Architecture) qui intègre la profondeur comme prior géométrique pendant l'entraînement. L'équipe a entraîné un modèle de 18 millions de paramètres sur des vidéos capturées par un robot agricole réel évoluant en extérieur, un environnement visuellement complexe et imprévisible par rapport aux données de laboratoire habituelles. La méthode combine une supervision par carte de profondeur avec un régularisateur latent isotrope appelé SIGReg, qui vise la représentation la plus riche en information possible tout en respectant la géométrie de la scène, et ajoute une surparamétrisation limitée à l'entraînement pour ne pas alourdir l'inférence. Face à la baseline LeWM, les résultats montrent une réduction de 33% de l'erreur sur une sonde d'odométrie visuelle à représentation gelée, une meilleure séparation du score de surprise à la fois sur les données d'origine et sur le benchmark hors domaine TartanGround, ainsi qu'une fidélité accrue des projections latentes multi-étapes sous décalage de domaine, avec des gains qui s'amplifient à mesure que l'horizon de prédiction s'allonge. Ce travail répond à un problème central pour la robotique de terrain: la plupart des modèles du monde performent bien en simulation ou en environnement contrôlé, mais peinent à généraliser sur des données réelles bruitées, avec éclairage variable et textures complexes. Montrer qu'un simple prior physique, la profondeur, améliore la transférabilité sans ajouter de coût de calcul à l'inférence est significatif pour les intégrateurs qui doivent déployer des modèles embarqués sur des robots agricoles, des AMR ou d'autres plateformes mobiles à ressources limitées. Le résultat le plus notable dépasse la géométrie pure: le modèle améliore aussi la détection de surprise sur des phénomènes physiques non directement liés à la 3D, comme l'éclairage et les ombres, ce qui suggère un effet d'amélioration générale de la qualité des représentations plutôt qu'un simple gain spécifique à la tâche de profondeur. À noter toutefois que les gains sont mesurés sur un seul type de robot et un modèle de taille modeste, la généralisation à d'autres plateformes reste à démontrer. Les architectures JEPA, popularisées par les travaux de Yann LeCun chez Meta, sont présentées comme une alternative aux modèles génératifs pixel par pixel pour apprendre la dynamique du monde sans reconstruire chaque détail visuel. Ce papier s'inscrit dans cette lignée en cherchant à rendre ces modèles utilisables sur des données réelles de terrain, un défi que la littérature identifie souvent comme le principal obstacle entre les démonstrations en simulation et le déploiement effectif. Les auteurs positionnent leur approche contre LeWM comme référence directe et s'appuient sur TartanGround pour valider la généralisation hors domaine. Les prochaines étapes attendues incluraient l'extension à d'autres types de robots et capteurs, et l'intégration de ce modèle du monde dans des politiques de contrôle robotique complètes plutôt que dans des sondes d'évaluation isolées.

RecherchePaper
1 source