RoboTwin-Phys : les WAM et VLA comprennent-ils vraiment le monde physique ?
Une équipe de recherche a publié en septembre 2026 sur arXiv (2609.26292) RoboTwin-Phys, un benchmark de manipulation robotique qui introduit la diversité des conditions physiques comme dimension explicite d'évaluation, aux côtés des variations visuelles et de disposition de scène déjà couvertes par les benchmarks existants. Le système fait varier en continu 13 attributs physiques, masse, friction, dynamique des articulations, dans des plages physiquement plausibles, pour constituer un cadre unifié de test des politiques robotiques face à des conditions d'opération diverses. Les auteurs publient également plus de 5 000 démonstrations expertes annotées avec leurs paramètres physiques exacts, ce qui permet l'estimation d'attributs physiques, la modélisation sensible aux conditions et l'entraînement de politiques conditionnées par la physique. Le benchmark sert à évaluer des modèles représentatifs des familles WAM et VLA, ces derniers désignant les architectures vision-language-action désormais courantes en manipulation robotique.
L'évaluation révèle un écart de robustesse important: des modèles qui résistent bien aux randomisations visuelles et de disposition de scène, devenues standard dans les benchmarks de simulation, voient leurs performances chuter nettement dès que les paramètres physiques changent. Ce résultat nuance un récit répandu dans le secteur robotique, celui d'une généralisation acquise grâce au volume de données et à l'échelle des modèles VLA: la robustesse démontrée sur des variations visuelles ne garantit pas la robustesse face à des variations de masse, de friction ou de dynamique articulaire, pourtant omniprésentes dans le monde réel. Pour les intégrateurs et les décideurs industriels, l'implication est concrète: une politique validée en simulation peut échouer sur un objet plus lourd, une surface plus glissante ou une chaîne cinématique légèrement différente, même sans aucun changement d'apparence, ce qui interroge la manière dont la robustesse des VLA et des WAM est actuellement testée et communiquée avant tout déploiement.
RoboTwin-Phys prolonge la lignée des benchmarks RoboTwin, qui avaient déjà élargi les tests de manipulation bimanuelle en simulation aux variations d'apparence des objets et de disposition des scènes, sans jamais toucher aux paramètres physiques sous-jacents restés jusqu'ici figés. En rendant publics le benchmark, le jeu de données et le protocole d'évaluation, les auteurs ouvrent la voie à une mesure systématique de la robustesse physique des politiques de manipulation et à l'entraînement de modèles conditionnés par la physique plutôt que par la seule perception visuelle. Aucun déploiement réel ni partenariat industriel n'est annoncé à ce stade: il s'agit d'un outil de recherche destiné à la communauté pour comparer WAM et VLA sur un axe jusqu'ici négligé, avec l'attente que les prochaines générations de politiques intègrent cette diversité physique dès l'entraînement plutôt que de la découvrir lors du passage en conditions réelles.
Le benchmark et le jeu de données publics permettent aux laboratoires et intégrateurs européens de tester la robustesse physique de leurs politiques de manipulation avant tout déploiement.
Dans nos dossiers




