Aller au contenu principal
J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés
RecherchearXiv cs.RO 

J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un préprint publié sur arXiv (identifiant 2606.28712) introduit J-LAW (Joint Localization and Actionable World Modeling), une architecture qui fusionne le SLAM classique et les modèles de monde conditionnés par l'action dans un unique graphe de facteurs probabilistes. L'objectif MAP (Maximum A Posteriori) commun optimise simultanément les poses métriques des objets, les états latents du monde et les embeddings latents de landmarks. Le pont entre ces deux formulations est un encodeur latent conditionné par la pose et un facteur de couplage pose-latent appris. Les expériences portent sur deux benchmarks : PushT, une tâche de manipulation planaire, et WildGS, un environnement de reconstruction 3D gaussienne. Les résultats montrent que la correction par graphe couplé réduit l'erreur quadratique moyenne de prédiction latente et la dérive de point final par rapport au rollout en boucle ouverte, tandis que la fermeture de boucle latente améliore la cohérence globale de trajectoire.

L'enjeu est structurant pour la robotique de manipulation : les systèmes actuels souffrent d'une dichotomie entre localisation précise et planification prédictive. Le SLAM produit des cartes métriques que les planificateurs ne savent pas exploiter directement ; les modèles de monde appris prédisent l'effet des actions mais perdent la cohérence spatiale sur des horizons longs, limitant leur utilité en déploiement réel. J-LAW démontre qu'en couplant ces deux estimations, chaque composante améliore l'autre : une meilleure localisation stabilise la prédiction latente, et réciproquement. C'est une réponse partielle à la dérive en open-loop, problème concret dans les pipelines de manipulation autonome. Pour les équipes travaillant sur des systèmes VLA ou de navigation, ce cadre suggère une représentation unifiée, métrique et actionnable, sans orchestrer deux pipelines distincts.

La séparation entre SLAM et modèles de monde appris est historiquement ancrée : le SLAM probabiliste date des années 2000, tandis que les modèles de monde deep (RSSM, DreamerV3) sont apparus dans la décennie suivante. Plusieurs travaux récents tentent ce rapprochement dans le champ des VLA, où la cohérence spatiale devient un enjeu croissant. J-LAW se positionne comme une contribution théorique structurée via la formalisation en graphe de facteurs, et non comme un système prêt au déploiement. Limite à noter : les expériences restent sur des benchmarks standardisés, sans validation sur robot physique réel en scène dynamique. Aucun partenariat industriel ni timeline de transfert n'est mentionné dans ce préprint.

Dans nos dossiers

À lire aussi

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint
1arXiv cs.RO 

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint

JEPA-WAM, un nouveau modèle de monde latent (world action model, WAM) pour le contrôle robotique, est présenté dans un article publié le 11 août 2026 sur arXiv (2608.09381v1). Le système s'appuie sur l'espace latent pré-entraîné V-JEPA, l'architecture d'auto-supervision vidéo développée par Meta AI, et couple prédiction de transition et génération d'action continue via un prédicteur partagé, plutôt que de générer explicitement des vidéos futures comme le font les WAM à base vidéo, coûteux à déployer. Sur le benchmark LIBERO-Plus, JEPA-WAM atteint 79,2 % de réussite, le meilleur score parmi les méthodes sans pré-entraînement à grande échelle sur des politiques robotiques. Instancié sur le modèle pi0.5 déjà pré-entraîné, il grimpe à 86,3 %, la meilleure performance globale rapportée dans l'article. Des expériences complémentaires sur le simulateur RoboTwin 2.0 et sur des tâches de manipulation bimanuelle en conditions réelles confirment une bonne généralisation face aux variations visuelles et spatiales. Ce travail s'attaque à un compromis central dans l'apprentissage de politiques vision-langage-action (VLA) : les modèles de monde générant explicitement des vidéos futures sont coûteux en calcul et en latence, tandis que les approches latentes existantes sacrifient souvent la richesse de la représentation prédictive ou la séparent du chemin utilisé pour générer l'action. En démontrant qu'un même prédicteur partagé peut porter à la fois la supervision de transition et la prédiction d'action sans déconnecter représentation et politique, JEPA-WAM fournit un argument empirique en faveur de l'unification des deux tâches dans une même colonne vertébrale visuelle. Pour les équipes de recherche et les intégrateurs en robotique, l'intérêt pratique tient au fait que la méthode s'applique aussi à des politiques VLA déjà pré-entraînées, comme pi0.5, sans modifier leurs chemins de perception et d'action d'origine, ce qui laisse entrevoir un gain applicable à des systèmes existants plutôt qu'une architecture entièrement nouvelle à réentraîner. Il s'agit d'un article de recherche publié sur arXiv, sans annonce de produit ni de déploiement commercial : les résultats reposent sur des benchmarks de simulation (LIBERO-Plus, RoboTwin 2.0) complétés par des essais réels limités en manipulation bimanuelle, sans précision sur le nombre de robots ou les sites concernés. JEPA-WAM s'inscrit dans la lignée des architectures d'apprentissage par prédiction latente issues de V-JEPA, et se positionne face à l'écosystème grandissant des politiques VLA telles que pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Les auteurs ne précisent aucun calendrier de suite, pilote industriel ou partenariat, ce qui situe cette publication au stade de la recherche fondamentale plutôt qu'à une étape de déploiement à court terme.

RechercheActu
1 source
Localisation par graphe de facteurs assistée par contact pour l'échantillonnage sous-marin
2arXiv cs.RO 

Localisation par graphe de facteurs assistée par contact pour l'échantillonnage sous-marin

Des chercheurs publient sur arXiv (référence 2608.26932v1) un système baptisé « Contact-Aided Factor-Graph Localization », conçu pour les véhicules sous-marins autonomes effectuant des prélèvements rapprochés sur le fond marin. Le système fusionne, dans un graphe de facteurs de type smoothing, les événements de contact d'un manipulateur à succion avec l'odométrie visuelle adaptative, des détections d'objets par apprentissage, et les capteurs embarqués, dont un loch Doppler (DVL) couplé à une centrale inertielle. Les facteurs d'odométrie visuelle et de repérage d'amers (bearing-range) sont pondérés selon les statistiques d'inliers, afin d'éviter que des images visuellement pauvres ne déstabilisent l'estimateur, tandis que les contacts physiques sont traités comme des facteurs à haute confiance générant des fermetures de boucle implicites, sans reconnaissance de lieu basée sur l'apparence. Le système peut s'initialiser entièrement en ligne, pendant le mouvement. Les auteurs ont validé l'approche en bassin, en environnement portuaire et en simulation. Pour les intégrateurs et opérateurs de robotique sous-marine, l'apport tient au traitement du contact physique comme primitive de localisation à part entière, et non comme simple sous-produit de la manipulation. Sur les fonds marins plats et peu texturés, les caméras orientées vers le bas souffrent d'ambiguïté d'échelle, de dégénérescence latérale et d'un suivi de features instable, tandis que la fusion inertielle-DVL seule ne corrige aucune dérive structurelle. En exploitant les événements de succion du bras manipulateur comme contraintes géométriques informatives, le système réduit la dérive de trajectoire et améliore la précision de revisite d'objets, comparé à une navigation par filtrage classique ou à des formulations en graphe sans contact. Le résultat conforte l'idée que l'interaction physique incarnée peut compenser la dégradation perceptuelle propre aux environnements sous-marins, un problème structurel pour l'échantillonnage automatisé en eaux profondes ou en zones de biofouling. L'estimation d'état sous-marine reste historiquement dépendante du couple DVL/centrale inertielle, complété ponctuellement par odométrie visuelle ou acoustique, deux approches connues pour dériver en l'absence de repères stables. Le papier s'inscrit dans une lignée de recherches sur la localisation SLAM sous-marine appliquée au prélèvement, à l'inspection d'infrastructures immergées ou à la biologie marine, un segment où les essais en conditions réelles au-delà du bassin ou du port restent rares. Les auteurs ne précisent ni calendrier de déploiement industriel ni partenaire commercial; les résultats publiés se limitent à des tests contrôlés, sans validation en mer ouverte ou en grande profondeur, ce qui laisse ouverte la question du passage à l'échelle vers des missions d'échantillonnage autonome en environnement opérationnel.

RecherchePaper
1 source
Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle
3arXiv cs.RO 

Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle

Hydra-0, un nouveau modèle du monde généraliste pour la robotique, a été présenté dans un preprint publié sur arXiv le 19 août 2026 (arXiv:2608.18077). Le système repose sur un concept baptisé "action flow" : les actions du robot y sont représentées comme un flux de mouvement de pixels plutôt que comme des commandes articulaires classiques, ce qui crée une interface visuelle commune permettant d'apprendre les conséquences des actions à travers différents robots, tâches, environnements et architectures de génération vidéo. Dans sa meilleure configuration, Hydra-0 réduit l'erreur de mouvement du robot de 90,4% et l'erreur de mouvement des objets de 60,2% par rapport à une base de référence conditionnée par l'action classique. Sur le benchmark RoboLab, le modèle atteint une corrélation de Pearson de r=0,96 entre les taux de réussite rejoués en simulation et les taux de réussite de référence, un signal de fidélité élevé pour l'évaluation de politiques en boucle ouverte. Les auteurs décrivent aussi un mode inverse émergent : le modèle peut prédire un mouvement robotique compatible à partir d'un flux d'objet désiré transféré depuis une démonstration humaine, une "tête d'action" entraînée convertissant ensuite ces représentations latentes en actions exécutables sans démonstration robotique experte spécifique à la tâche. Pour l'industrie robotique, ce travail s'attaque directement à deux goulots d'étranglement connus des approches vision-language-action (VLA) : la dépendance à des démonstrations robotiques coûteuses par tâche, et la difficulté à faire généraliser un modèle entre embodiments et environnements hétérogènes. En transformant l'action en un signal visuel partagé, l'approche promet une adaptation plus économe en données et une composition zero-shot de comportements, deux propriétés recherchées par les intégrateurs qui veulent déployer un même modèle sur plusieurs plateformes matérielles sans réentraînement lourd. Il faut toutefois noter qu'il s'agit d'un résultat de recherche publié en preprint, évalué sur un benchmark interne (RoboLab) et non d'un système déployé en production ou en usine ; les gains annoncés restent à confirmer par une évaluation indépendante et par des essais sur robots physiques réels au-delà du cadre expérimental décrit. Ce travail s'inscrit dans la vague plus large des modèles du monde et des architectures VLA développés ces dernières années pour unifier perception, prédiction et contrôle robotique, un axe de recherche où plusieurs laboratoires cherchent à résoudre le fossé entre démonstrations en simulation et transfert vers le réel. La piste ouverte par le mode inverse d'Hydra-0, apprendre le contrôle à partir de vidéos humaines sans démonstration robotique dédiée, pourrait, si elle se confirme à plus grande échelle, réduire significativement le coût de collecte de données pour l'entraînement de politiques robotiques généralistes. L'article ne précise pas de calendrier de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
Localisation robotique holistique : estimation d'état par graphes de facteurs, indépendante de la tâche et du dispositif
4arXiv cs.RO 

Localisation robotique holistique : estimation d'état par graphes de facteurs, indépendante de la tâche et du dispositif

Des chercheurs du Robotic Systems Lab de l'ETH Zurich, le laboratoire suisse connu pour le robot quadrupède ANYmal, ont publié la version 2 de leur article sur Holistic Fusion, un framework open source de fusion de capteurs pour la localisation et l'estimation d'état des robots mobiles. Le code est disponible sur GitHub (leggedrobotics/holistic_fusion) accompagné d'une page projet dédiée. Contrairement aux approches classiques conçues pour un scénario ou un robot précis, Holistic Fusion traite la fusion de capteurs comme un problème d'estimation combiné : l'état local et global du robot d'un côté, un nombre théoriquement illimité de variables dynamiques de l'autre, avec alignement automatique des référentiels. Techniquement, le système repose sur une formulation en graphe de facteurs qui intègre directement des mesures absolues, locales et de repères (landmarks) exprimées dans des référentiels différents, en les modélisant comme des marches aléatoires. Une attention particulière est portée à la fluidité et à la cohérence locale pour éviter les sauts d'estimation. Les auteurs rapportent une estimation d'état en ligne à faible latence sur du matériel robotique standard, avec une localisation globale à faible dérive calculée au rythme de mesure de la centrale inertielle (IMU). Pour l'industrie robotique, l'intérêt tient moins à un exploit spectaculaire qu'à la promesse d'un outil générique : la plupart des solutions de fusion de capteurs actuelles sont hard-codées pour une tâche donnée (drone, robot à pattes, véhicule à roues), ce qui oblige les intégrateurs à réécrire leurs pipelines de localisation à chaque nouveau cas d'usage. Un framework agnostique de la tâche et de la configuration matérielle, s'il tient ses promesses en conditions réelles au-delà des cinq scénarios testés, réduirait le travail d'ingénierie nécessaire pour porter une pile de navigation d'une plateforme à une autre, un enjeu concret pour les fabricants de robots mobiles industriels (AMR) et les intégrateurs multi-plateformes. L'équipe a validé le framework sur trois plateformes robotiques distinctes couvrant cinq scénarios réels, sans préciser lesquelles dans le résumé, ce qui limite l'évaluation indépendante des performances annoncées. Cette version 2 remplace une première publication d'avril 2025 sur arXiv, signe d'un travail itératif plutôt que d'une annonce ponctuelle. Le positionnement open source, plutôt inhabituel pour ce type de brique technique critique, s'inscrit dans la tradition du laboratoire, déjà connu pour la publication de ses outils autour d'ANYmal et de la navigation legged.

UELe framework open source pourrait être adopté par les intégrateurs européens de robots mobiles industriels, mais aucune entreprise ou institution française n'est directement impliquée.

RecherchePaper
1 source