
StreamRig : exploiter la géométrie interne du rig pour l'odométrie multi-caméra en flux continu
Des chercheurs ont publié sur arXiv StreamRig, un cadre d'odométrie visuelle en flux continu pour les robots et véhicules équipés de caméras synchronisées et calibrées. Le principe, dit « freeze-and-stream », repose sur un modèle de fondation 3D multi-vues gelé, qui perçoit conjointement les images du rig grâce à la calibration. Trois modules seulement sont entraînés, pour 74,6 millions de paramètres au total. Un Rig-Resampler compresse les caractéristiques visuelles, un CausalBridge applique une attention causale avec cache clé-valeur, et une tête légère régresse les poses du rig. Un protocole de réancrage périodique stabilise l'estimation sur de longues séquences. La supervision se limite aux poses relatives, avec un entraînement en deux étapes : préentraînement de relocalisation de groupe, puis entraînement causal sur le rig. Les tests couvrent NCLT, TartanGround, KITTI-360 et ZJH, un jeu de données collecté par les auteurs sur un robot humanoïde. Pour ZJH, l'entraînement n'utilise que de la simulation et l'évaluation en conditions réelles se fait sans réglage préalable (zero-shot). Le code est publié sur GitHub.
Selon les auteurs, StreamRig obtient sur les quatre jeux de données une dérive en translation et en rotation inférieure à celle des modèles de streaming monoculaires et des modèles hors ligne exploitant le rig, tout en gardant un coût d'inférence faible. La comparaison exclut toutefois les modèles « oracle », et l'article ne donne pas, dans son résumé, de valeurs chiffrées de dérive ni de latence. Ces gains restent donc à vérifier sur les tableaux complets. L'intérêt pour l'industrie est double. D'abord, la plupart des modèles de fondation 3D en streaming sont conçus pour une seule caméra, alors que robots mobiles, véhicules autonomes et humanoïdes embarquent déjà plusieurs caméras synchronisées dont la géométrie fixe est gaspillée. Ensuite, la validation zero-shot sur un humanoïde réel, après entraînement purement simulé, est un indice en faveur du transfert sim-to-real. Elle repose cependant sur un seul jeu de données maison, sans pilote industriel.
Ces travaux s'inscrivent dans la vague de modèles de fondation géométriques multi-vues, dont la logique de feed-forward 3D remplace les pipelines SLAM classiques, et dans la recherche de variantes causales adaptées au temps réel. Les concurrents directs sont les approches monoculaires en streaming et les modèles multi-vues hors ligne, qui servent ici de références. L'approche de gel du modèle de base limite le coût d'entraînement, un argument pour les équipes sans grands moyens de calcul. Les auteurs étudient aussi l'effet de fenêtres d'entraînement plus longues sur l'inférence à long horizon, signe que la tenue de la dérive sur de très longs trajets reste un point ouvert. La suite probable passera par des évaluations indépendantes, des tests embarqués sur matériel contraint et une intégration à des piles de navigation de robots mobiles.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




