
Shengshu Technology dévoile Motus2, un modèle du monde auto-évolutif pour la manipulation dextérique
Shengshu Technology a dévoilé Motus2, un modèle de monde pour la manipulation robotique fine, présenté par son cofondateur et PDG Luo Yihang au Bund Summit 2026 ; le papier technique (arXiv 2608.30237) associe l'identité de recherche GensPI de Shengshu à l'université Tsinghua. Le système fusionne politique, simulation et évaluation dans un seul réseau vidéo-action, via trois modules : un modèle monde-action qui propose des séquences de gestes, un modèle de monde conditionné par l'action qui en prédit les conséquences visuelles, et un modèle de valeur qui les note pour choisir la meilleure à l'exécution ou affiner la politique par renforcement en post-entraînement. Sur des tâches réelles de placement de téléphone et de manipulation multi-doigts, la politique de base atteint environ 65% de réussite, contre 67,5% avec la planification seule, 72,5% avec le renforcement seul, et 75% en combinant les deux ; un module tactile complémentaire fait grimper la réussite sur l'extraction de tasses et le déchirement de papier de 60% à 72,5%. L'entraînement mobilise environ 130 000 heures de vidéo égocentrique humaine et plus de 100 heures de trajectoires robotiques, sur des plateformes à haut degré de liberté (DoF) comme Sharpa Wave et Wuji Hand 2 pour des tâches comme visser une ampoule ou tourner une page.
Pour les intégrateurs, l'apport concret n'est pas le qualificatif "auto-évolutif" mis en avant par Shengshu, mais la preuve chiffrée que planification et apprentissage par renforcement, adossés à un même modèle de monde, s'additionnent plutôt qu'ils ne se recouvrent, avec un gain net d'environ dix points sur la politique de base. Le bond obtenu grâce au retour tactile sur des tâches à contact riche cible directement le principal verrou du secteur, la manipulation fine, alors que la locomotion humanoïde est déjà largement démontrée par ailleurs. Ces chiffres restent des métriques de laboratoire communiquées par l'équipe elle-même, sur un nombre restreint de tâches et sans comparaison publique face aux modèles concurrents, ce qui laisse ouvert l'écart habituel entre démonstration filmée et fiabilité en conditions réelles. Shengshu cadre explicitement l'"auto-amélioration" comme un mécanisme récursif borné à des tâches définies, et non comme une autonomie ouverte en environnement non contraint.
Motus2 s'inscrit dans la feuille de route que Shengshu présente comme une progression de modèles de monde généraux "de L3 à L4", portée par sa structure de recherche GensPI avec Tsinghua. Il rejoint un paysage déjà dense de modèles vision-langage-action, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, tous engagés à transformer des heures de vidéo humaine en manipulation fiable sur robot réel. Aucun acteur français ou européen n'apparaît dans cette annonce, qui reste une publication de recherche assortie de démonstrations matérielles, sans calendrier de pilote industriel communiqué.
Dans nos dossiers




