Aller au contenu principal
RecherchearXiv cs.RO 

SMART : manipulation d'objets articulés en transfert simulation-réel sans entraînement préalable, grâce à un pré-entraînement synthétique à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SMART, un système qui s'appuie sur des démonstrations synthétisées à grande échelle pour apprendre aux robots à manipuler des objets articulés (portes, tiroirs, charnières). Son noyau est SMART-Sim, une plateforme de simulation conçue pour représenter la sémantique des parties d'objet et leurs contraintes d'articulation. Elle permet de générer des tâches de façon agentique, c'est-à-dire par des agents logiciels qui proposent eux-mêmes les scénarios, et de collecter des démonstrations efficacement. Un système de synthèse distribué alimente le jeu de données SMART-Data, qui compte plus d'un million de démonstrations couvrant 44 types de tâches atomiques, 5 configurations de robots et 2 507 objets articulés. Un modèle vision-langage-action (VLA) pré-entraîné sur ces données obtient des résultats compétitifs sur les benchmarks de simulation. Il réalise aussi un transfert zéro-shot de la simulation vers le réel et montre une performance qui progresse avec le volume de données sur des tâches réelles. Les travaux sont publiés sur arXiv (v1) et sont pour l'instant une préimpression, sans produit commercialisé ni déploiement industriel associé. Le résumé ne donne ni taux de réussite, ni nombre d'essais réels, ni liste des robots physiques testés.

Si ces résultats se confirment, ils touchent un des verrous de la robotique générale : la collecte de démonstrations réelles pour les interactions riches en contacts est lente, coûteuse et difficile à standardiser. Ouvrir une porte ou tirer un tiroir impose de suivre une contrainte cinématique précise, et la téléopération y produit des données bruitées. Un transfert zéro-shot, sans aucune donnée réelle de réglage, irait à l'encontre de l'idée répandue selon laquelle la simulation seule ne suffit pas pour la manipulation fine. Il suggérerait aussi que les lois d'échelle des VLA peuvent s'appuyer sur des données synthétiques structurées. Pour les intégrateurs et les décideurs B2B, l'enjeu est concret : armoires, fours, vannes, portes d'entrepôt ou équipements de laboratoire sont des objets articulés omniprésents. Le coût d'adaptation d'un robot à un nouveau site pourrait baisser si le pré-entraînement synthétique se généralise. Les chiffres publiés ne permettent toutefois pas encore de mesurer l'écart entre démonstration et conditions réelles. Il faudra examiner la diversité des objets réels, des éclairages et des robots dans les expériences.

Cette approche s'inscrit dans une tendance où les VLA généralistes (famille Pi-0, GR00T, Helix et autres) sont entraînés sur des mélanges de téléopération, de vidéo humaine et de simulation. Les jeux de données synthétiques existants ont couvert un nombre limité de catégories d'objets articulés, tandis que les pipelines de synthèse généralistes ignoraient les contraintes de parties. SMART vise précisément cette lacune. Les prochaines étapes à surveiller sont la publication du code, de la plateforme et des données, des évaluations indépendantes sur d'autres robots, et une comparaison avec des modèles entraînés sur données réelles. Aucun acteur européen n'est cité dans le résumé.

À lire aussi

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
1arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
Transfert simulation-réel efficace de modèles monde-action à partir de données synthétiques
2arXiv cs.RO 

Transfert simulation-réel efficace de modèles monde-action à partir de données synthétiques

Le fossé sim-to-real reste un défi central pour déployer des politiques de manipulation apprises, car il permet en théorie de remplacer des démonstrations réelles coûteuses par des données synthétiques bon marché à grande échelle. Publiée le 30 juin 2026 (arXiv:2606.31101), une étude teste si un "world-action model", un modèle combinant prédiction visuelle et contrôle moteur, peut être entraîné uniquement en simulation puis déployé sans aucune démonstration réelle. L'équipe part de Cosmos Policy, un modèle de diffusion vidéo adapté au contrôle visuomoteur, et construit des environnements simulés avec une randomisation poussée des domaines. Les démonstrations d'entraînement, environ 800 par tâche, sont générées automatiquement via le pipeline de planification de mouvement AnyTask, sans donnée réelle. Trois tâches sont testées: soulever un objet, ouvrir un tiroir, et effectuer un pick-and-place. Déployé en zero-shot sur un bras robotique Franka, le modèle atteint un taux de réussite moyen de 35%. Ce résultat, même modeste, répond à une question ouverte du secteur: les world-action models peuvent-ils transférer du simulateur au monde réel sans coûteuses démonstrations humaines? Jusqu'ici, aucun travail n'avait démontré ce transfert pour la manipulation robotique. Un taux de 35% reste loin des standards attendus pour un déploiement industriel, souvent supérieurs à 80%, et confirme que le fossé sim-to-real demeure un obstacle réel, non résolu par la seule échelle des données synthétiques. Pour les intégrateurs et décideurs B2B, le signal est clair: remplacer la téléopération humaine par de la donnée simulée reste au stade de preuve de concept, pas de solution prête à l'emploi. Le travail s'inscrit dans la lignée des modèles de fondation robotiques récents comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui cherchent tous à réduire la dépendance aux démonstrations réelles. Cosmos Policy dérive des travaux de NVIDIA sur les modèles de monde Cosmos. La méthode AnyTask pour générer automatiquement des trajectoires en simulation illustre une tendance plus large: automatiser la création de données d'entraînement plutôt que multiplier les téléopérations en laboratoire, approche également explorée par Physical Intelligence ou Skild AI. Les auteurs présentent ce résultat comme une première preuve de faisabilité, sans calendrier de commercialisation ni partenariat industriel annoncé.

RecherchePaper
1 source
Skill2Real : apprentissage de compétences à base d'agents pour la manipulation robotique en transfert simulation-réel sans entraînement supplémentaire
3arXiv cs.RO 

Skill2Real : apprentissage de compétences à base d'agents pour la manipulation robotique en transfert simulation-réel sans entraînement supplémentaire

Des chercheurs publient sur arXiv (2610.02788) Skill2Real, un cadre de politiques « agentiques » qui apprend des compétences robotiques exécutables à travers une interface de programmation (API) partagée, puis les transfère à un robot réel en zero-shot, sans réglage fin de la politique de tâche ni mise à jour de la mémoire de compétences. L'architecture est hiérarchique : un « Cerebellum » acquiert d'abord des compétences locales de manipulation, puis un « Brain » apprend la composition au niveau de la tâche, le Cerebellum restant gelé. Un cycle Proposer-Verifier-Governor (PVG) s'appuie sur des données privilégiées de simulation pour diagnostiquer les échecs et valider les modifications, tout en gardant les compétences ancrées dans les observations publiques et la sémantique de l'API. Les chiffres annoncés : avec GPT-5.6 Sol apprenant sur LIBERO-90 et GPT-6 Astra évaluant chaque checkpoint gelé, le taux de réussite sur LIBERO-Pro Long passe de 2,0 % à 56,3 %, sans entraînement sur ce jeu. Un entraînement indépendant sur Robosuite atteint 85,1 % (Sol) et 89,4 % (Opus 5) de réussite moyenne sur sept tâches. Sur quatre tâches réelles, les compétences gelées apprises par Sol sur LIBERO-90 atteignent 78,75 % d'achèvement moyen avec Astra. L'intérêt tient à l'approche : plutôt que d'entraîner un VLA de bout en bout et de combler l'écart sim-to-real par de la randomisation de domaine ou du fine-tuning sur données réelles, le travail fait apprendre à un LLM des programmes qui appellent une API commune. Cette couche d'abstraction absorbe en partie les différences de perception, de dynamique et d'embodiment. Les ablations donnent un signal utile : retirer le Verifier ou le Governor pendant l'entraînement réduit le succès final sur Pro Long de 17,3 et 13,3 points, ce qui suggère que la boucle de validation compte autant que le modèle. Pour les intégrateurs, cela évoque une voie où les compétences deviennent des actifs logiciels réutilisables d'un robot à l'autre. Les réserves sont nettes : quatre tâches réelles seulement, une moyenne de 78,75 % qui masque sans doute des écarts entre tâches, un résultat dépendant de modèles de fondation propriétaires, et une dépendance à une API bien conçue qui déplace une partie de la difficulté plutôt qu'elle ne la supprime. Il s'agit de résultats de laboratoire, pas d'un produit ni d'un déploiement. Ce travail s'inscrit dans la lignée des approches « code as policies » et des agents LLM pour la robotique, qui rivalisent avec les VLA comme Pi-0 ou GR00T, entraînés sur de grands volumes de démonstrations. LIBERO et Robosuite sont des bancs d'essai standards de manipulation en simulation, et LIBERO-Pro est une variante plus exigeante visant à tester la robustesse, ce qui rend le bond de 2,0 % à 56,3 % d'autant plus notable, même s'il reste loin d'une fiabilité industrielle. L'article ne mentionne ni calendrier ni pilote industriel. Les prochaines étapes à surveiller sont des tests sur davantage de tâches et d'embodiments, une évaluation avec des modèles ouverts, et une comparaison directe avec des VLA affinés sur données réelles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique
4arXiv cs.RO 

Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique

Les auteurs de cette étude publient H-Tac, un jeu de données tactile-action à grande échelle constitué de 160 heures de vidéos humaines à la première personne, couvrant plus de 300 tâches et totalisant 135 000 épisodes. À partir de cette base, ils proposent Transferable Tactile Pre-Training (TTP), un système de pré-entraînement fondé sur le sens tactile humain, destiné à transférer des compétences de manipulation fine vers des robots. La méthode s'appuie sur des espaces tactiles et d'action unifiés, maintenus identiques pendant les phases de pré-entraînement et de post-entraînement, afin de préserver les connaissances acquises lors du passage de l'humain au robot. Un module expert dédié prédit l'évolution future du signal tactile, ce qui permet de modéliser explicitement la dynamique de contact et les interactions physiques fines. Les auteurs rapportent des performances supérieures aux approches existantes, en simulation comme sur robots réels, avec une bonne capacité de généralisation. Ce travail cible un verrou connu du secteur robotique: le toucher reste la modalité la moins exploitée dans les modèles Vision-Language-Action, alors qu'il est indispensable pour les tâches riches en contact où la vision seule ne suffit pas à estimer une force appliquée. Les jeux de données tactiles existants restent petits et couvrent peu de types de contacts, ce qui limite le plafond de performance des modèles VLA tactiles, dont le post-entraînement reste largement indifférent à la dynamique physique. En s'appuyant sur des vidéos humaines plutôt que sur de la téléopération robotique coûteuse à collecter, H-Tac vise à lever ce goulot d'étranglement de données, une stratégie déjà explorée pour le pré-entraînement d'actions mais rarement appliquée au tactile à cette échelle. Si les résultats se confirment sur d'autres plateformes, cela pourrait rapprocher les robots manipulateurs dextres de tâches fines comme l'insertion de précision ou la manipulation d'objets déformables, au-delà des démonstrations scénarisées. L'article s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix) qui combinent perception visuelle et langage mais négligent généralement le retour tactile faute de données adaptées. Publié sur arXiv (2607.01067v1) début juillet 2026, ce travail reste au stade de la recherche académique: aucun partenariat industriel ni déploiement commercial n'est mentionné, et les auteurs présentent TTP comme une preuve de concept ouvrant la voie à un pré-entraînement tactile transférable et passant à l'échelle, plutôt que comme un produit prêt à l'emploi.

RecherchePaper
1 source