
DepthWorld : un modèle du monde 3D pour la manipulation robotique
Des chercheurs publient sur arXiv (2610.08780) DepthWorld, un modèle du monde 3D destiné à la manipulation robotique, accompagné d'un jeu de données calibré, DROID-3D. Le point de départ est un constat : les modèles du monde vidéo actuels, entraînés uniquement sur du RGB, produisent des séquences plausibles image par image, mais qui ne forment pas un monde 3D cohérent. Pour y remédier, l'équipe a conçu un pipeline de calibration qui combine une estimation de profondeur stéréo apprise et un graphe de facteurs joint. Il regroupe tous les épisodes enregistrés avec un même robot physique afin de retrouver ses paramètres cinématiques partagés, en plus des extrinsèques propres à chaque scène. Appliqué à DROID, il produit DROID-3D : une profondeur métrique dense et des extrinsèques multi-vues recalibrées, avec une erreur de reprojection inférieure à 0,7 pixel sur 90 % des épisodes pour les caméras externes. Le modèle DepthWorld, bâti sur Stable Video Diffusion, prédit conjointement le RGB et la profondeur sur plusieurs vues grâce à un « tuilage latent spatial » (spatial latent tiling), qui laisse intact l'autoencodeur variationnel (VAE) pré-entraîné. À budget d'entraînement égal, la supervision par la profondeur améliore la prédiction RGB de 1,48 dB de PSNR par rapport à une base identique entraînée sur RGB seul, tout en fournissant une profondeur métrique exploitable.
Ces résultats comptent pour les équipes qui voient dans les modèles du monde une alternative pilotée par les données aux simulateurs classiques, pour l'évaluation, l'amélioration et la planification de politiques. Toutes ces utilisations supposent une géométrie fidèle. Un rollout visuellement convaincant mais géométriquement incohérent peut fausser l'évaluation d'une politique de préhension ou une planification de trajectoire. L'apport de la profondeur à la qualité du RGB lui-même suggère que la supervision 3D ne se limite pas à ajouter une sortie : elle renforce la prédiction visuelle. Le choix de ne pas toucher au VAE préserve les connaissances a priori des modèles vidéo pré-entraînés, ce qui évite de ré-entraîner à grande échelle. Pour les intégrateurs, l'enjeu à terme est de disposer d'un banc d'essai virtuel plus fiable avant de passer sur matériel réel. Il faut toutefois rester prudent : il s'agit d'un préprint, sans évaluation en boucle fermée sur des robots réels dans les éléments communiqués, et un gain de 1,48 dB de PSNR ne prouve pas à lui seul une meilleure réussite des tâches.
Le contexte est celui d'une course pour remplacer ou compléter la simulation physique par des modèles génératifs, nourrie par de grands jeux de données de téléopération comme DROID. Ces corpus sont riches en vidéo, mais leur calibration de caméras est souvent approximative et la profondeur métrique y est absente, ce qui a limité jusqu'ici la supervision 3D à grande échelle en manipulation. DROID-3D comble en partie ce manque. L'approche s'inscrit dans le courant des modèles du monde vidéo adaptés à la robotique, qui s'appuient sur des modèles de diffusion vidéo généralistes. La suite logique serait de tester si ces rollouts géométriquement cohérents améliorent réellement l'évaluation et l'amélioration de politiques VLA, puis de les valider sur des plateformes variées.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




