Aller au contenu principal
RecherchearXiv cs.RO 

Seed2Scale : un moteur de données auto-évolutif à expansion de mondes parallèles pour l'apprentissage robotique à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Seed2Scale, un moteur de génération de données auto-évolutif pour l'apprentissage robotique, décrit dans un préprint arXiv (2603.08260, version 2). Le système part d'à peine quatre démonstrations initiales. Il fonctionne selon un principe de synergie hétérogène : « petit modèle qui collecte, grand modèle qui évalue, modèle cible qui apprend ». Le collecteur est SuperTiny, un modèle Vision-Language-Action (VLA, qui traduit images et instructions en actions) très léger, chargé d'explorer l'espace des comportements. Un modèle vision-langage (VLM) pré-entraîné joue le rôle de vérificateur : il note et filtre automatiquement les trajectoires produites. Une seconde étape, dite « parallel worlds », reprend les trajectoires auto-évoluées et les projette dans d'autres environnements de la même tâche, afin de diversifier les données. Les auteurs indiquent que le taux de succès du modèle cible progresse de façon régulière au fil des itérations et dépasse nettement la référence entraînée sur les seules démonstrations initiales. En évaluation réelle sans adaptation (zero-shot), Seed2Scale atteint 75,38 % de réussite, là où les méthodes de comparaison tombent à 0 %.

L'intérêt tient à l'objet traité : le goulot d'étranglement des politiques VLA reste la collecte de démonstrations, coûteuse en téléopération et en heures opérateur. Si une boucle de données peut partir de quatre exemples et s'améliorer sans intervention humaine, le coût marginal des données chute, ce qui intéresse les intégrateurs qui doivent adapter une politique à chaque site client. Le résultat vise aussi un défaut connu des boucles d'auto-amélioration : l'effondrement des performances quand le système s'entraîne sur ses propres sorties bruitées. Ici, le filtrage par VLM est présenté comme le garde-fou. Il faut toutefois lire le chiffre de 75,38 % avec prudence. Le résumé ne précise ni la tâche, ni le robot, ni le nombre d'essais réels, ni la nature des méthodes de référence qui échouent totalement. Un 0 % chez les concurrents suggère une configuration de test très défavorable à ces baselines, et un écart aussi net demande une validation sur davantage de tâches et d'embodiments avant de parler de passage à l'échelle démontré.

Le travail s'inscrit dans la course aux données synthétiques et auto-générées pour la robotique, où se côtoient les approches par simulation massive, par génération vidéo ou par modèles du monde, et les grands modèles de fondation de type Pi-0 ou GR00T, qui misent plutôt sur des corpus de téléopération toujours plus vastes. Seed2Scale joue l'inverse : très peu de données humaines, beaucoup d'itérations autonomes. Il s'agit d'une publication académique, avec une page projet associée, et non d'un produit ni d'un déploiement industriel. Les suites probables sont une validation sur des tâches plus longues et plus variées, des comparaisons directes avec les pipelines de données des grands acteurs, et un test de robustesse du vérificateur VLM, dont la fiabilité conditionne toute la boucle.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle
1arXiv cs.RO 

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle

Des chercheurs ont présenté AXIS, un moteur de données communautaire et évolutif pour l'apprentissage de la manipulation robotique, décrit dans un article déposé sur arXiv le 24 juillet 2026. Le système permet de collecter des démonstrations à grande échelle via téléopération directement dans le navigateur, sans matériel spécialisé ni opérateurs centralisés, et génère puis valide automatiquement de nouvelles tâches de manipulation. Un pipeline automatisé filtre la qualité des trajectoires, les lisse et applique des augmentations visuelles et physiques pour produire des données prêtes à l'entraînement. Le jeu de données AXIS compte actuellement 207 tâches diverses et plus de 50 000 trajectoires, organisées en "task snapshots" évalués selon un protocole strict à données retenues (held-out). Ce travail cible un goulot d'étranglement bien identifié du secteur : la difficulté à faire grandir les jeux de démonstrations utilisés pour entraîner les politiques vision-langage-action (VLA), jusqu'ici souvent limités par du matériel dédié ou des catalogues de tâches figés. Les auteurs montrent que le pré-entraînement continu sur AXIS améliore le taux de réussite global du modèle π0.5 de 5,8 points, et dépasse de 37,3 points un modèle pré-entraîné sur RoboCasa365, avec des gains qui s'accentuent à mesure que le volume de données augmente. Les progrès les plus nets apparaissent sous perturbations de disposition, de bruit capteur et de point de vue caméra, un signal utile pour les intégrateurs cherchant des politiques robustes hors laboratoire plutôt que de simples démonstrations réussies en conditions idéales. Le projet s'inscrit dans une tendance émergente consistant à traiter la collecte de données robotiques comme un problème d'échelle communautaire, à l'image de ce que le crowdsourcing a permis pour les grands modèles de langage. Il se positionne explicitement face à RoboCasa365, utilisé comme référence de comparaison, et s'appuie sur des politiques VLA existantes telles que π0.5 pour évaluer l'apport réel des données AXIS. Il s'agit à ce stade d'un article de recherche déposé en preprint, dont les résultats n'ont pas encore été validés par relecture par les pairs ni reproduits par des équipes tierces.

RecherchePaper
1 source
WorldContact : un modèle du monde centré sur le contact pour l'apprentissage robotique à grande échelle
2arXiv cs.RO 

WorldContact : un modèle du monde centré sur le contact pour l'apprentissage robotique à grande échelle

Un article publié sur arXiv sous la référence 2609.19600v1 présente WorldContact, un modèle du monde ("world model") centré sur le contact, conçu pour la manipulation d'objets déformables comme les sacs de courses en plastique. Le système est construit à partir d'un nombre limité de trajectoires de haute qualité et prédit la dynamique des objets avec des pas de temps plus larges que le simulateur numérique classique dont il s'inspire, ce dernier nécessitant de très petits pas d'intégration pour capter les mouvements rapides et éviter l'interpénétration des surfaces. Les auteurs ont testé WorldContact sur 16 tâches de manipulation de sacs de courses. Sur un seul GPU Nvidia H100, les mesures de state-rollout montrent une accélération d'un facteur 10 par rapport au simulateur source, un chiffre qui exclut toutefois le rendu graphique et les entrées-sorties disque, ce qui limite sa comparabilité directe avec un temps d'exécution complet. Les données générées ont servi à affiner une politique vision-langage-action (VLA) existante, ensuite déployée sur un robot réel. Sur la tâche de levage de sac, le taux de réussite au premier essai passe de 65%, lorsque la politique est entraînée uniquement sur les données du simulateur d'origine, à 95% une fois le jeu de données enrichi par WorldContact. Ce résultat s'attaque à un goulot d'étranglement bien identifié dans la robotique de manipulation: l'expérience physique réelle nécessaire pour adapter un robot à un nouvel objet ou une nouvelle tâche reste coûteuse à collecter, et les objets déformables comme les tissus ou les emballages souples aggravent le problème car leur simulation fine est lente. Un modèle du monde dix fois plus rapide que la simulation physique classique, capable de produire des données d'entraînement synthétiques exploitables pour affiner une politique VLA, offre une piste concrète pour réduire ce coût. Le saut de 65% à 95% de succès sur un robot réel constitue une preuve empirique, quoique limitée à un seul type de tâche, que l'augmentation de données via world model peut combler une partie de l'écart entre simulation et réalité pour la manipulation déformable, un domaine où les politiques génériques peinent généralement à généraliser. L'étude s'inscrit dans la tendance croissante des modèles du monde appris comme alternative ou complément aux simulateurs physiques classiques en robotique, ces derniers étant pénalisés par leurs contraintes d'intégration numérique sur les phénomènes de contact rapide. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier de déploiement au-delà de la validation expérimentale sur robot réel; les résultats, obtenus sur 16 tâches centrées sur un seul type d'objet, relèvent d'une preuve de concept plutôt que d'un système prêt à l'industrialisation, la généralisation à d'autres catégories d'objets déformables restant à démontrer.

RecherchePaper
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
3arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique
4arXiv cs.RO 

RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique

Un article publié sur arXiv (référence 2609.03199v1, catégorie « cross-listing » signalant un intérêt à la fois pour la robotique et la vision par ordinateur) présente RoboTok, un moteur de données conçu pour exploiter des vidéos humaines à l'échelle d'internet afin d'entraîner des politiques robotiques de manipulation dextre. Le système part d'une vidéo requête montrant une manipulation humaine, puis recherche dans de vastes collections de vidéos web des démonstrations pertinentes pour la même tâche. Techniquement, RoboTok apprend un espace de mouvement latent à partir de trajectoires 3D de la main, exprimées dans des repères centrés sur l'acteur estimés automatiquement, ce qui permet de comparer des gestes de manipulation malgré des différences de point de vue caméra, d'apparence de scène ou d'occlusions partielles de l'acteur. Cette représentation reste suffisamment compacte pour permettre une recherche efficace et une indexation continue sur des corpus vidéo de très grande taille. Les auteurs comparent RoboTok à des méthodes existantes de récupération de données robotiques, sur des benchmarks de recherche et sur la performance de politiques robotiques en aval, sans toutefois préciser dans le résumé les chiffres exacts de gain, ni les tâches ou plateformes robotiques testées. L'enjeu principal visé par ce travail est le goulot d'étranglement bien identifié de l'apprentissage robotique : collecter des données directement sur robot reste coûteux et ne permet pas de couvrir la longue traîne des tâches réelles rencontrées en manipulation. En proposant une méthode de récupération sensible à la pose de la main plutôt qu'à l'apparence brute, RoboTok cherche à transformer la vidéo web, ressource déjà abondante et en croissance continue, en une source de supervision exploitable et évolutive pour l'entraînement de politiques. Pour les intégrateurs et équipes de recherche en robotique dextre, cela s'inscrit dans une tendance plus large consistant à s'appuyer sur des données humaines non robotiques pour réduire la dépendance à la téléopération coûteuse, sans toutefois démontrer ici un déploiement matériel réel ni un produit commercialisé : il s'agit d'une contribution méthodologique et expérimentale, évaluée sur benchmarks académiques. Le papier se positionne dans la lignée des approches récentes de pré-entraînement robotique à partir de vidéos humaines à grande échelle, une direction de recherche active pour contourner la rareté des données robot réelles. Le résumé ne mentionne ni entreprise, ni laboratoire nommé, ni calendrier de suite ; il s'agit à ce stade d'une publication de recherche, pas d'une annonce produit ou d'un pilote industriel.

RecherchePaper
1 source