Aller au contenu principal
StreamRig : exploiter la géométrie interne du rig pour l'odométrie multi-caméra en flux continu
RecherchearXiv cs.RO 

StreamRig : exploiter la géométrie interne du rig pour l'odométrie multi-caméra en flux continu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv StreamRig, un cadre d'odométrie visuelle en flux continu pour les robots et véhicules équipés de caméras synchronisées et calibrées. Le principe, dit « freeze-and-stream », repose sur un modèle de fondation 3D multi-vues gelé, qui perçoit conjointement les images du rig grâce à la calibration. Trois modules seulement sont entraînés, pour 74,6 millions de paramètres au total. Un Rig-Resampler compresse les caractéristiques visuelles, un CausalBridge applique une attention causale avec cache clé-valeur, et une tête légère régresse les poses du rig. Un protocole de réancrage périodique stabilise l'estimation sur de longues séquences. La supervision se limite aux poses relatives, avec un entraînement en deux étapes : préentraînement de relocalisation de groupe, puis entraînement causal sur le rig. Les tests couvrent NCLT, TartanGround, KITTI-360 et ZJH, un jeu de données collecté par les auteurs sur un robot humanoïde. Pour ZJH, l'entraînement n'utilise que de la simulation et l'évaluation en conditions réelles se fait sans réglage préalable (zero-shot). Le code est publié sur GitHub.

Selon les auteurs, StreamRig obtient sur les quatre jeux de données une dérive en translation et en rotation inférieure à celle des modèles de streaming monoculaires et des modèles hors ligne exploitant le rig, tout en gardant un coût d'inférence faible. La comparaison exclut toutefois les modèles « oracle », et l'article ne donne pas, dans son résumé, de valeurs chiffrées de dérive ni de latence. Ces gains restent donc à vérifier sur les tableaux complets. L'intérêt pour l'industrie est double. D'abord, la plupart des modèles de fondation 3D en streaming sont conçus pour une seule caméra, alors que robots mobiles, véhicules autonomes et humanoïdes embarquent déjà plusieurs caméras synchronisées dont la géométrie fixe est gaspillée. Ensuite, la validation zero-shot sur un humanoïde réel, après entraînement purement simulé, est un indice en faveur du transfert sim-to-real. Elle repose cependant sur un seul jeu de données maison, sans pilote industriel.

Ces travaux s'inscrivent dans la vague de modèles de fondation géométriques multi-vues, dont la logique de feed-forward 3D remplace les pipelines SLAM classiques, et dans la recherche de variantes causales adaptées au temps réel. Les concurrents directs sont les approches monoculaires en streaming et les modèles multi-vues hors ligne, qui servent ici de références. L'approche de gel du modèle de base limite le coût d'entraînement, un argument pour les équipes sans grands moyens de calcul. Les auteurs étudient aussi l'effet de fenêtres d'entraînement plus longues sur l'inférence à long horizon, signe que la tenue de la dérive sur de très longs trajets reste un point ouvert. La suite probable passera par des évaluations indépendantes, des tests embarqués sur matériel contraint et une intégration à des piles de navigation de robots mobiles.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

NeuRIO : un estimateur neuronal en flux pour l'odométrie inertielle relative multi-robots, du simulateur au réel sans réentraînement
1arXiv cs.RO 

NeuRIO : un estimateur neuronal en flux pour l'odométrie inertielle relative multi-robots, du simulateur au réel sans réentraînement

Des chercheurs ont présenté NeuRIO, un estimateur neuronal en flux continu pour l'odométrie inertielle relative entre robots, sans ancre ni infrastructure externe, à partir de mesures de gisement et de distance entre robots et de centrales inertielles (IMU). Le système aligne les mesures sur la gravité et modélise chaque robot comme un nœud d'un réseau de graphes, combinant attention pour le raisonnement spatial et réseaux GRU pour la dynamique temporelle. Entraîné uniquement en simulation, avec des mouvements variés et des bruits de capteurs réalistes, il transfère en zero-shot vers le réel : sur 24 séquences réelles, l'erreur RMSE atteint 14,1 cm en position et 3,9 degrés en rotation, avec un coût de calcul sous 20 millisecondes jusqu'à 400 robots simulés, contre plus de 20 ms dès 24 robots pour les méthodes d'optimisation classiques. Ce résultat vise un verrou concret pour les essaims de robots et les flottes coordonnées, drones, AMR d'entrepôt ou robots mobiles multiples, où l'estimation de position relative sans GPS ni balises devient un goulot d'étranglement quand le nombre d'agents augmente, les méthodes d'optimisation classiques voyant leur coût calculatoire exploser. Qu'un réseau entraîné sur des équipes limitées se généralise directement à des flottes bien plus grandes, sans changement d'architecture ni réentraînement, est le résultat le plus significatif : il suggère qu'une approche neuronale scalable peut remplacer les pipelines d'optimisation pour la coordination d'essaims à grande échelle, un argument utile pour intégrateurs et chercheurs en robotique multi-agents. Il conforte aussi l'idée qu'un entraînement massif en simulation bien conçu peut se substituer à la collecte de données réelles pour ce type de tâche de perception. L'odométrie inertielle relative multi-robots reposait jusqu'ici sur des méthodes d'optimisation basées sur des graphes de facteurs, précises mais peu scalables au-delà de quelques dizaines d'agents, ou sur des systèmes dépendant d'ancres et d'infrastructures de positionnement externes. NeuRIO s'inscrit dans la tendance des estimateurs neuronaux appliqués à la navigation et à la fusion de capteurs, en exploitant la capacité des réseaux de graphes à traiter un nombre variable de nœuds et des topologies d'observation changeantes dans le temps. Publié en septembre 2026 sur arXiv, ce travail reste une contribution de recherche, validée sur 24 séquences réelles et des simulations jusqu'à 400 robots, sans intégration annoncée dans un produit commercial. Les suites attendues incluent des essais sur des flottes réelles plus nombreuses et une intégration dans des piles de navigation complètes pour la coordination d'essaims.

RecherchePaper
1 source
M3GD : une diffusion géométrique multimodale et multi-vue pour la synthèse de nouvelles vues caméra-LiDAR
2arXiv cs.RO 

M3GD : une diffusion géométrique multimodale et multi-vue pour la synthèse de nouvelles vues caméra-LiDAR

M3GD (Multi-Modal Multi-View Geometric Diffusion), publié sur arXiv le 25 septembre 2026, est une méthode de synthèse de nouvelles vues combinant caméra et LiDAR, là où la plupart des approches génératives existantes reposent uniquement sur l'image. Le système assemble des modèles de fondation 2D et 3D pré-entraînés séparément, sans traducteur cross-modal dédié : après projection caméra, les features LiDAR et image figées partagent déjà une structure spatiale commune exploitable. Des statistiques géométriques et des descripteurs de nuages de points, regroupés en paquets alignés sur la vue, sont injectés via un adaptateur résiduel léger dans un générateur multi-vues par flow-matching, sans modifier son espace latent, ses décodeurs ni son objectif d'entraînement. Sur le jeu de données GrandTour, M3GD améliore la synthèse RGB et de profondeur par rapport à une version image seule du même modèle, et a été déployé sur un robot terrestre, avec un compromis qualité/coût réglable via le nombre d'étapes d'intégration d'Euler. L'enjeu dépasse la curiosité académique : les rendus génératifs de synthèse de vues purement image peuvent paraître réalistes tout en étant géométriquement faux, un défaut rédhibitoire quand ces vues nourrissent l'entraînement, la simulation ou la navigation d'un robot. En démontrant que des features LiDAR et image pré-entraînées séparément partagent déjà une structure spatiale exploitable sans réentraînement lourd, M3GD ouvre une voie économique pour fusionner des capteurs hétérogènes dans des pipelines génératifs existants plutôt que de reconstruire des architectures dédiées, un argument qui parle directement aux équipes de perception multi-capteurs en robotique industrielle. Le travail s'inscrit dans la lignée des générateurs multi-vues par flow-matching, famille de modèles de diffusion déjà utilisée pour la synthèse de vues en robotique, jusque-là cantonnée aux données caméra. Le papier ne cite aucun concurrent commercial et reste une contribution de recherche académique, sans produit ni pilote industriel annoncé. Sa validation se limite au jeu de données GrandTour et à un unique déploiement sur robot terrestre, sans calendrier d'intégration commerciale communiqué, ce qui situe M3GD au stade de preuve de concept plutôt que de solution prête à l'industrialisation.

RecherchePaper
1 source
Robot en trompe d'éléphant : une caméra interne pour un sens du toucher
3New Atlas Robotics 

Robot en trompe d'éléphant : une caméra interne pour un sens du toucher

Les chercheurs du Japan Advanced Institute of Science and Technology (JAIST) ont développé un nouveau type de pince robotique souple baptisée EleTac, dont la conception s'inspire directement de l'extrémité préhensile de la trompe d'éléphant. Contrairement aux pinces industrielles classiques équipées de capteurs de force externes, EleTac intègre une caméra miniature directement à l'intérieur de sa structure souple en silicone. Cette caméra observe en continu les déformations internes du matériau lorsque celui-ci entre en contact avec un objet, permettant au système de reconstituer, par traitement d'image, la forme, la texture et la fermeté de ce qu'il saisit, un peu comme le fait un vrai appendice d'éléphant grâce à ses terminaisons nerveuses. Le dispositif s'inscrit dans la famille des capteurs tactiles dits "vision-based", une approche déjà popularisée par des systèmes comme GelSight, mais appliquée ici à un actionneur souple et non à un doigt rigide. Pour l'industrie robotique, cette approche confirme une tendance de fond: remplacer des réseaux de capteurs de force coûteux et fragiles par une simple caméra interne couplée à du traitement d'image, ce qui réduit le coût et la complexité de câblage tout en conservant une sensibilité fine au toucher. Pour les intégrateurs travaillant sur la préhension d'objets fragiles, irréguliers ou déformables (fruits, textiles, composants électroniques), un tel gripper biomimétique promet une manipulation plus adaptative que les pinces rigides classiques, sans nécessiter de modèle physique complexe de l'objet saisi. Cette recherche s'inscrit dans une lignée plus large de robotique bio-inspirée, où l'on retrouve aussi des robots capables de s'enrouler comme des tatous pour se protéger. EleTac reste à ce stade un prototype de laboratoire; les prochaines étapes attendues concernent la validation sur des tâches de préhension réelles et une possible intégration à des bras robotiques industriels ou des systèmes AMR.

RecherchePaper
1 source
AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue
4arXiv cs.RO 

AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue

Des chercheurs présentent AnyviewMeter, un framework d'adaptation pour les modèles de récompense robotiques utilisés pour évaluer visuellement la progression d'une tâche. Le problème identifié : ces modèles, une fois entraînés, voient leurs prédictions varier selon le point de vue de la caméra ou les occlusions, même quand l'état réel de la tâche n'a pas changé. AnyviewMeter combine un fine-tuning à faible rang avec des rayons de Plücker alignés sur les tokens, qui encodent la géométrie de la caméra directement dans les caractéristiques visuelles et dans les mécanismes d'attention, ainsi qu'une attention par blocs synchronisée qui fusionne plusieurs vues à l'intérieur du décodeur préentraîné. Le système s'appuie sur le modèle Robometer et fonctionne en configuration mono-vue comme en évaluation conjointe multi-vues. Sur la tâche simulée PickCube, l'adaptation mono-vue améliore la prédiction de progression pour chaque groupe de caméras et réduit l'erreur absolue moyenne d'environ 21% par rapport à un simple fine-tuning RGB lorsque le champ de vision change. Sur un ensemble plus large de tâches de manipulation simulées, la prédiction conjointe multi-vues réduit l'erreur de progression de 41 à 69% par rapport à une moyenne de prédictions mono-vues RGB, et améliore l'ordonnancement temporel dans environ 88% des combinaisons tâche-caméra. Sur des tâches réelles utilisant des caméras fixes et montées sur poignet, l'erreur absolue moyenne baisse d'environ 21%. Ces résultats visent un angle mort concret de la robotique par apprentissage : les modèles de récompense entraînés en simulation ou sur un jeu de caméras donné généralisent mal dès que la configuration physique change, un frein direct au déploiement chez des intégrateurs qui n'utilisent jamais exactement le même rig caméra que le laboratoire d'origine. En conditionnant explicitement le modèle sur la géométrie de la caméra plutôt qu'en espérant une généralisation implicite, AnyviewMeter propose une voie d'adaptation paramétrique légère, sans réentraînement complet, ce qui compte pour des équipes cherchant à réutiliser des modèles de récompense préentraînés sur des cellules robotiques hétérogènes. Cela nuance aussi l'idée que les VLA et modèles de supervision associés soient déjà robustes au changement de viewpoint dès la sortie du laboratoire. Le travail s'inscrit dans la lignée des modèles de récompense visuels type Robometer, dont il constitue une extension géométrique plutôt qu'une refonte, et se positionne dans le champ plus large des méthodes de supervision pour l'apprentissage par renforcement en robotique, aux côtés des approches VLA génériques (Pi-0, GR00T N2). Les auteurs ne mentionnent pas de déploiement industriel ni de partenaire commercial: il s'agit d'un résultat de recherche évalué en simulation et sur un nombre limité de tâches réelles, sans indication de calendrier vers une intégration produit.

RecherchePaper
1 source