Aller au contenu principal
RynnWorld-Teleop : un modèle du monde conditionné par l'action pour la téléopération numérique
RecherchearXiv cs.RO 

RynnWorld-Teleop : un modèle du monde conditionné par l'action pour la téléopération numérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs viennent de publier RynnWorld-Teleop (arXiv:2607.06558v1), un système de "téléopération numérique" qui remplace le robot physique par un modèle du monde génératif. Le principe : un flux de poses de main capturé chez l'opérateur pilote un modèle génératif centré-robot qui synthétise, à partir d'une seule image de référence, une vidéo égocentrique haute fidélité simulant ce que verrait le robot en exécutant le geste. Ce flux de poses sert d'étiquette d'action indépendante de l'embodiment, transférable à n'importe quel robot cible via un retargeting standard, ce qui produit des trajectoires état-action complètes sans jamais toucher de matériel réel. Techniquement, le pipeline combine un conditionnement squelettique sensible à la profondeur, un entraînement progressif humain-vers-robot sur un Diffusion Transformer vidéo, et une distillation autorégressive en streaming qui compresse le processus génératif en une seule passe d'inférence, atteignant plus de 40 images par seconde en génération interactive temps réel sur un seul GPU H100.

L'enjeu dépasse la prouesse technique : la collecte de données robotiques massives et diversifiées est aujourd'hui bridée par la téléopération physique, où chaque démonstration immobilise du temps opérateur sur un matériel et un espace de travail précis. En découplant la collecte des contraintes physiques, RynnWorld-Teleop promet de faire chuter drastiquement le coût par trajectoire. Les auteurs rapportent que des politiques entraînées exclusivement sur des données générées par leur système atteignent un transfert Sim2Real en zero-shot sur des tâches bimanuelles dextres et variées, et que l'ajout de ces données synthétiques à des jeux réels améliore systématiquement les taux de réussite, un signal fort pour ceux qui cherchent à faire passer les architectures VLA à l'échelle sans exploser les budgets de collecte terrain.

Ce travail s'inscrit dans une tendance plus large de modèles du monde génératifs utilisés comme moteurs de données pour l'apprentissage par imitation, en écho à des approches comme les VLA à grande échelle (Pi-0, GR00T). Il s'agit pour l'instant d'une publication de recherche, sans déploiement industriel ni partenariat annoncé, et la prochaine étape naturelle serait une validation sur des plateformes robotiques commerciales tierces.

Dans nos dossiers

À lire aussi

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique
1arXiv cs.RO 

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique

DreamX-Phi 1.0, un modèle de monde vidéo conditionné par l'action pour la manipulation robotique, est présenté dans un article déposé sur arXiv (2608.13489v1). À partir d'une image observée, d'une instruction en langage naturel et d'une séquence d'actions prescrite, poses de l'effecteur terminal et états du gripper, le système prédit les observations vidéo futures correspondantes. Pour éviter qu'une vidéo réaliste en apparence déplace le mauvais bras ou fasse disparaître l'objet manipulé, les auteurs injectent des transformations géométriques SE(3) propres à chaque bras dans les couches d'attention via un encodage de type PRoPE, complété par une branche de profondeur pour la géométrie de la scène et des masques SAM3 associés à un modèle enseignant V-JEPA figé pour maintenir la cohérence des objets durant la saisie. Le générateur multi-étapes est ensuite distillé en un modèle étudiant à peu d'étapes pour accélérer le déploiement. Le modèle revendique la première place sur la Track 1 et la deuxième sur la Track 2 du WorldArena 2.0 Challenge, avec publication annoncée du modèle et du code. Cette approche s'attaque à un problème central des modèles de monde appliqués à la robotique: une vidéo générée peut paraître photoréaliste tout en étant physiquement incohérente avec les commandes envoyées au robot, ce qui invalide son usage pour l'entraînement de politiques ou la planification. En ancrant la génération vidéo sur la géométrie rigide réelle de chaque bras et en préservant l'identité des objets manipulés, DreamX-Phi cherche à combler l'écart entre démonstration visuelle convaincante et fidélité exploitable pour le contrôle. La distillation en modèle étudiant à peu d'étapes répond à une contrainte pratique bien connue des intégrateurs: les modèles de monde vidéo multi-étapes sont souvent trop lents pour une boucle de contrôle temps réel, ce qui limite sinon leur usage à la simulation ou à l'évaluation hors ligne. Le classement sur WorldArena 2.0 reste toutefois un résultat de benchmark académique et non une validation en conditions réelles sur un robot physique. DreamX-Phi s'inscrit dans une vague plus large de modèles de monde vidéo pour la robotique, qui cherchent à compléter ou remplacer les architectures vision-langage-action comme Pi-0 ou GR00T N2 par une simulation générative directe des conséquences d'une action. Le recours à SAM3 pour la segmentation et à V-JEPA comme enseignant figé situe le projet dans la lignée des modèles de représentation vidéo auto-supervisés récents plutôt que dans une pile propriétaire fermée. À ce stade, aucune information ne mentionne de déploiement sur un robot physique ni de partenariat industriel: il s'agit d'un article de recherche accompagné d'un résultat de compétition, le modèle et le code étant seulement annoncés comme à venir. La suite logique, si cette promesse de publication est tenue, sera l'adoption du modèle comme brique de simulation ou d'évaluation par d'autres équipes travaillant sur la manipulation robotique.

RecherchePaper
1 source
DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique
2arXiv cs.RO 

DexTouch-WM : des modèles du monde tactiles conditionnés par l'action, appris du toucher humain pour la manipulation dextérique

DexTouch-WM, publié en preprint sur arXiv (2609.20649v1), est un modèle du monde conditionné par l'action qui prédit conjointement les images RGB futures et la dynamique tactile bilatérale pour la manipulation dextre robotique. Il s'appuie sur des réseaux de capteurs piézorésistifs flexibles montés selon un schéma identique sur des mains humaines et robotiques, rendant leurs signaux tactiles directement comparables. Le mouvement humain est retranscrit dans l'espace d'action du robot, permettant à des démonstrations tactiles humaines de superviser le même modèle de dynamique que celui utilisé sur robot réel. L'architecture associe un vidéo expert pré-entraîné à un tactile expert léger via des tokens tenant compte de l'anatomie de la main. Les auteurs fixent cinq heures de données robot réel et font varier les données tactiles humaines de zéro à cent heures. Les tâches humaines et robotiques utilisées à l'entraînement étant disjointes, l'amélioration observée sur les prédictions visuelles, géométriques et de contact en domaine robot suggère un transfert réel des dynamiques de contact entre les deux embodiments. Cela vise le principal goulot d'étranglement de la manipulation dextre en contact riche: la collecte de données tactiles reste lente, coûteuse et liée à un capteur et un robot spécifiques. En montrant qu'une supervision tactile humaine, bien plus facile à collecter en volume, complète un budget de données robot limité, les auteurs proposent un axe de données alternatif à la téléopération ou à la simulation pure, utile pour entraîner des politiques de manipulation à plus grande échelle. Ce travail prolonge les modèles du monde vidéo déjà employés en robotique comme substituts de simulation, en y ajoutant une dynamique tactile bilatérale explicite, un axe encore peu exploité face à la vision et au langage dans la manipulation dextre. Il se positionne face aux approches misant uniquement sur la téléopération robot ou la simulation physique pour générer des données de contact. Publié comme preprint arXiv sans annonce de déploiement, de partenariat industriel ou de calendrier commercial, il reste une contribution de recherche: les auteurs présentent l'évaluation en environnement de substitution et la génération de trajectoires synthétiques pour l'apprentissage de politiques comme des pistes ouvertes plutôt que comme un système prêt à l'emploi.

RecherchePaper
1 source
Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone
3arXiv cs.RO 

Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone

Un modèle de recherche baptisé Streaming-WAM (World-Action Model), décrit dans un article publié sur arXiv le 25 septembre 2026 (arXiv:2609.28927v1), s'attaque au coût de calcul des modèles qui prédisent l'image future pour piloter un bras robotique. Ces modèles, dits world-action models, génèrent habituellement une prédiction visuelle avant de produire l'action suivante, ce qui immobilise le robot pendant l'inférence. Streaming-WAM fonctionne en mode asynchrone : à chaque mise à jour, il conditionne sa prédiction visuelle non seulement sur la dernière observation caméra, mais aussi sur les actions déjà engagées, c'est-à-dire le segment fixe du prochain lot de mouvements en cours d'exécution par le robot. Les caractéristiques visuelles ainsi anticipées servent ensuite à générer, dans la même passe, les actions restantes du lot. Sur le benchmark de simulation LIBERO, le système atteint un taux de succès moyen de 98,35 % tout en divisant par 2,93 le temps moyen par épisode par rapport à une variante appelée Fast-WAM. Sur une tâche en conditions réelles consistant à tamponner une feuille de papier, le temps d'épisode passe de 90 secondes avec un modèle synchrone classique (Joint-WAM) à 38 secondes avec Streaming-WAM. L'enjeu dépasse la simple accélération : les world-action models sont perçus comme un moyen de rendre la manipulation robotique plus robuste en anticipant les conséquences visuelles d'une action avant de l'exécuter, mais leur latence de génération les rendait jusqu'ici difficiles à déployer en temps réel. En montrant qu'il est possible de conserver un taux de succès élevé tout en réduisant fortement le temps de cycle grâce à l'asynchronie, ce travail répond directement à l'un des reproches récurrents faits aux architectures de prédiction du monde en robotique : leur écart entre performance en simulation et viabilité pratique. Pour les intégrateurs et laboratoires qui évaluent ces approches face aux politiques vision-langage-action plus légères, ce type de résultat suggère qu'il n'est plus nécessaire de sacrifier la vitesse pour garder les bénéfices de la prédiction visuelle. Le travail se positionne comme une amélioration incrémentale par rapport à deux approches de référence citées dans l'article, Fast-WAM et Joint-WAM, qui servent de points de comparaison directs plutôt que de produits commerciaux. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé sur un seul benchmark simulé et une unique tâche physique réalisée en laboratoire, sans indication de partenariat industriel, de déploiement en usine ni de calendrier de commercialisation. La prochaine étape logique, non détaillée dans l'article, consisterait à étendre l'évaluation à un éventail plus large de tâches manuelles réelles et à des plateformes robotiques variées.

RecherchePaper
1 source
TacBPM : un modèle a priori comportemental conditionné par le tact pour la réorientation dextérique
4arXiv cs.RO 

TacBPM : un modèle a priori comportemental conditionné par le tact pour la réorientation dextérique

Une équipe de recherche en robotique propose TacBPM, un modèle de prior comportemental conditionné par le toucher destiné à la manipulation dextre en main, selon un article publié sur arXiv (référence 2609.18174) en septembre 2026. Le système cible la réorientation d'objets par une main robotique à haut nombre de degrés de liberté, un problème connu pour exiger une coordination fine des doigts lors de contacts intermittents. La méthode distille plusieurs "spécialistes sphère" opérant à différentes échelles dans un contrôleur latent unique, que les politiques en aval réutilisent ensuite via des actions latentes résiduelles plutôt que de repartir de zéro sur les commandes articulaires brutes. Ce prior se conditionne sur l'historique tactile et proprioceptif de la main, ce qui lui permet d'adapter le comportement latent à l'état réel du contact avec l'objet. Les auteurs testent l'approche sur trois scénarios : le transfert vers des poses cibles arbitraires sur des objets anisotropes, la rotation autour d'un axe commandé, et une tâche combinée bras-main baptisée Grasp-to-AnyPose, où le robot doit saisir, soulever, transporter puis positionner des outils de géométries inédites vers des emplacements généralisés. L'intérêt principal pour les acteurs de la robotique tient à la comparaison directe avec l'apprentissage par renforcement classique : les auteurs indiquent qu'un PPO entraîné sur actions brutes reste proche de l'échec sur ces tâches, alors que leur prior tactile accélère l'entraînement et produit des politiques stables. C'est un signal utile dans un secteur où la manipulation dextre en main reste l'un des goulots d'étranglement les plus tenaces des mains robotiques et humanoïdes, loin derrière la locomotion en maturité. Le résultat appuie l'idée que conditionner les politiques sur des signaux tactiles riches, plutôt que sur la seule proprioception articulaire, aide à généraliser à des géométries et poses non vues, un enjeu clé pour les intégrateurs visant des tâches d'assemblage ou de tri à objets variables. Il s'agit toutefois d'un travail de recherche évalué majoritairement en simulation, avec une validation sim-to-real limitée à des démonstrations sur banc en laboratoire pour les tâches en main et bras-main, et non d'un produit ou d'un déploiement industriel. L'abstract ne précise ni l'institution porteuse ni les auteurs, et ne fournit aucun chiffre de payload, de temps de cycle ou de coût, ce qui invite à la prudence avant d'extrapoler des performances au-delà du cadre expérimental décrit.

RecherchePaper
1 source