
Traversée de porte poussée via des jumeaux numériques simulés (Video2DoorTraversal)
Un article publié sur arXiv (2608.20251v1) présente Video2DoorTraversal, un système permettant à des robots mobiles à roues-pattes d'ouvrir et de franchir des portes de façon autonome à partir d'une seule vidéo RGB. Le module DoorTwin reconstruit, à partir de cette vidéo, un jumeau numérique articulé et simulable de la porte, avec géométrie et apparence réalistes. Un agent de simulation transforme cette articulation en programme de compétences paramétré et affine les essais échoués pour produire des démonstrations exécutables, utilisées pour entraîner ArticuACT, une politique "dual-depth" qui prédit les commandes de la base, du bras et de la pince via une caméra embarquée centrée sur le robot. Avec perception et inférence exécutées entièrement à bord, le système atteint 96,57% de réussite moyenne sur cinq portes réelles, 80,95% en zero-shot sur des portes inédites structurellement similaires, et boucle la séquence complète d'approche, ouverture et franchissement en environ 13 secondes.
L'ouverture de porte reste l'une des tâches de loco-manipulation les plus difficiles pour les robots mobiles : elle exige une interaction précise avec une poignée et un contrôle coordonné base-bras sur un horizon long, un goulot d'étranglement classique pour le déploiement en bureaux, usines ou hôpitaux. L'apport principal est de montrer qu'une seule vidéo suffit à produire un jumeau simulable exploitable pour l'entraînement, sans scan 3D ni modélisation CAO dédiée à chaque porte, ce qui réduirait le coût d'intégration site par site pour les industriels. Le taux zero-shot de 80,95% sur des portes inédites est le chiffre le plus parlant pour des intégrateurs, car il suggère une réelle transférabilité au-delà du sur-apprentissage sur un jeu fermé de portes. Ces résultats restent néanmoins ceux d'un préprint académique testé sur cinq portes en laboratoire, sans validation indépendante ni déploiement en conditions réelles non contrôlées.
Le document ne mentionne aucune entreprise ni marque commerciale : il s'agit d'un travail académique publié sur arXiv, dans la lignée des efforts visant à combler l'écart simulation-réalité pour la manipulation fine, un problème que des modèles vision-langage-action génériques comme Pi-0, GR00T N2 ou Helix adressent aussi mais sans se spécialiser sur l'interaction avec des poignées et des portes. Le choix d'une plateforme à roues-pattes plutôt qu'un humanoïde bipède complet distingue cette approche des efforts type Figure 03 ou Optimus, en misant sur une base plus stable pour la manipulation fine en mouvement. Aucun calendrier de déploiement industriel ni partenariat n'est annoncé ; la suite logique évoquée par les auteurs est l'extension à davantage de types de portes, de poignées et de mécanismes de verrouillage, ainsi que des tests en environnements réels non contrôlés au-delà des cinq portes testées. Aucun acteur français ou européen n'apparaît dans ces travaux.
Dans nos dossiers




