Aller au contenu principal
RecherchearXiv cs.RO 

État du monde traçable : une représentation d'état tenant compte de la provenance et un cadre de rejeu déterministe pour les systèmes robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Traceable World State (TWS), une représentation sémantique et un runtime de référence, indépendants du middleware, destinés à rendre l'état du monde d'un robot traçable. Un instantané TWS contient les entités, les relations, les observations, les niveaux de confiance et les métadonnées de révision. Les mises à jour sont validées et produisent chacune un nouvel instantané immuable. Leur ordre permet un rejeu déterministe. Une chaîne de hachage SHA-256 canonique rend les journaux infalsifiables, au sens où toute modification est détectable. L'évaluation couvre la conformité au schéma, les cycles de vie complets d'état, le rejeu et l'injection de fautes. Le cadre passe 38 tests sous Python 3.10 à 3.14 et détecte les enregistrements corrompus, les liens de hachage rompus, les ruptures de séquence et les incohérences de monde. Sur dix définitions de tâches publiques de BEHAVIOR-1K, TWS a importé 153 entités et 146 relations avec validation réussie. Sur 103 trajectoires simulées d'un Unitree G1 dans l'environnement NVIDIA, soit 78 369 images, le rejeu a restitué exactement l'état terminal dans tous les épisodes. Les 412 corruptions injectées sur 412 ont été détectées, pour un surcoût de stockage de 1,72 % par rapport à un simple journal JSONL.

L'enjeu touche un angle mort de la robotique de service et d'usine. Un robot qui travaille sur de longues tâches agrège des observations arrivées à des instants différents, avec des confiances variables, et parfois révisées. La plupart des architectures ne gardent que la dernière estimation, ce qui empêche de savoir pourquoi le robot a décidé ce qu'il a décidé. Pour un intégrateur ou un responsable qualité, cette lacune bloque l'analyse d'incidents, l'audit d'exécution et la reproduction d'un comportement défaillant. Un journal infalsifiable avec rejeu exact répond à ces besoins, et peut intéresser les exigences de conformité qui montent autour des systèmes pilotés par des modèles d'IA. Un surcoût de 1,72 % rend l'approche économiquement plausible. Il faut toutefois relativiser. Toute la validation est faite en simulation ou sur des définitions de tâches, sans robot physique, sans perception bruitée réelle et sans mesure de latence en boucle de contrôle. Les 412 corruptions sont synthétiques, donc le taux de détection de 100 % reflète surtout la nature d'une chaîne de hachage face à des fautes que les auteurs ont eux-mêmes conçues.

Ce travail s'inscrit dans un mouvement plus large pour auditer les agents incarnés, à mesure que les politiques VLA (vision-langage-action) et les modèles de fondation remplacent les piles logicielles déterministes. Les représentations existantes, comme les graphes de scène sémantiques, les bases de connaissances ou les journaux de middleware de type rosbag dans ROS 2, enregistrent des données brutes ou le dernier état sans modèle commun de provenance ni de révision. TWS se positionne en couche neutre au-dessus de ces outils. Le choix de BEHAVIOR-1K et du G1 simulé s'appuie sur des bancs d'essai publics, ce qui facilite la reproduction par d'autres équipes. Les prochaines étapes logiques sont un test sur matériel réel, une intégration avec des politiques apprenantes et une mesure du coût en production. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé, et il s'agit d'un préprint arXiv en première version, non évalué par des pairs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

STAG : une représentation en graphe épars tenant compte de la traversabilité, issue de cartes de coûts en grille pour la navigation robotique

Des chercheurs proposent STAG (Sparse Traversability-Aware Graph), une méthode qui convertit les cartes de coûts en grille (costmaps) utilisées par les rovers autonomes en graphes compacts, afin d'accélérer la planification globale de trajectoire. Le graphe repose sur trois types d'éléments : un squelette topologique construit par axe médian, des nœuds représentatifs pour les zones de traversabilité homogène, et des nœuds de transition placés près des forts gradients de traversabilité. Les arêtes encodent à la fois la géométrie et la difficulté du terrain, de sorte que le calcul tient compte de la longueur du chemin et de la nature du sol. Les auteurs comparent l'algorithme A exécuté sur STAG avec A sur grille dense, sur des cartes de grottes synthétiques, des cartes de mines et le jeu de données DARPA CERBERUS. Sur cinq catégories de benchmarks, soit 203 cartes et 101 200 requêtes, STAG réduit le temps de planification médian d'un facteur 3,4 à 9,9 et la mémoire de pointe par requête d'un facteur 2,1 à 15,4. L'écart médian de longueur de trajectoire par rapport à la grille dense va de -2,9 % à +7,6 %. Le problème visé est concret pour la robotique mobile en environnement non structuré : la recherche sur grille dense voit son coût de calcul et de mémoire croître avec la surface cartographiée, ce qui devient pénalisant pour des rovers qui explorent de grandes zones, par exemple en mines, grottes ou tunnels, avec un calculateur embarqué limité. Un gain de 3 à 10 fois en temps et jusqu'à 15 fois en mémoire peut permettre une replanification plus fréquente ou l'usage de processeurs plus modestes. Il faut toutefois lire les résultats avec prudence. Les auteurs reconnaissent eux-mêmes un compromis : STAG sacrifie l'optimalité vis-à-vis de la traversabilité de la grille dense au profit de la vitesse. Un écart médian peut masquer des cas défavorables, et le benchmark est en partie synthétique. Aucun essai sur robot réel n'est mentionné dans le résumé. Il s'agit donc d'un résultat de recherche en simulation et sur données enregistrées, pas d'un système déployé. Le travail s'inscrit dans la lignée des méthodes de réduction de l'espace de recherche (graphes de visibilité, feuilles de route probabilistes, cartes topologiques, squelettes par axe médian) et dans l'effort autour de l'autonomie en milieux souterrains, dont le défi DARPA Subterranean a servi de référence, avec l'équipe CERBERUS comme source de données. L'apport de STAG est de combiner structure topologique et information de traversabilité dans un même graphe, là où beaucoup d'approches compactes traitent surtout la connectivité. Ce type de représentation concerne les acteurs de l'exploration planétaire, de l'inspection minière et de la robotique de terrain. Les suites logiques seraient une validation sur matériel, la gestion de cartes mises à jour en continu et une évaluation face à d'autres planificateurs hiérarchiques. Aucun calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques
2arXiv cs.RO 

FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques

Une équipe de chercheurs a publié sur arXiv (référence 2605.18047) FUSE, un cadre logiciel pour l'estimation d'état unifiée dans les systèmes SLAM robotiques. Le problème adressé est structurel : les architectures SLAM à couplage serré lient dans un même bloc monolithique le traitement temporel, l'association géométrique locale, la formulation de l'estimateur et la politique de mise à jour de carte, rendant toute modification d'un composant coûteuse. FUSE propose quatre interfaces standardisées (ingestion d'observations, propagation, mise à jour, requête d'état) pour séparer ces responsabilités. L'instanciation LiDAR-IMU a été évaluée sur une séquence corridor bouclée de 418 m et produit une erreur de trajectoire de 1,626 m bout en bout, soit une réduction relative de 7,9 % par rapport à Faster-LIO, meilleure référence sur cette séquence. Le gain de 7,9 % reste modeste, mais l'intérêt principal de FUSE est architectural. Découpler proprement les choix de conception dans un pipeline SLAM permet de changer l'estimateur, adapter la cadence de mise à jour ou intégrer un nouveau type de capteur sans réarchitecturer l'ensemble du système. Pour les intégrateurs d'AMR ou les équipes de navigation industrielle, cela réduit significativement le coût de portage entre plateformes. La gestion explicite de la dégénérescence directionnelle constitue un point technique concret : en environnement corridor, le LiDAR ne perçoit pas de contraintes suffisantes dans l'axe latéral, rendant l'estimation instable. FUSE intègre un mécanisme de correction adaptatif ciblant ces directions faiblement observables, un problème rarement traité proprement dans les frameworks publics existants. Le SLAM LiDAR-IMU est un domaine très concurrentiel. Les références académiques dominantes incluent FAST-LIO2 et Faster-LIO (équipe Cai, HKUST) ainsi que LIO-SAM (Shan et al., MIT). Dans l'industrie, des fournisseurs comme Exotec (France) ou MiR intègrent des stacks de localisation dérivées de ces travaux dans leurs flottes d'AMR. FUSE ne cherche pas à battre ces systèmes sur les benchmarks de performance pure, mais à proposer une abstraction permettant de composer des composants algorithmiques de façon indépendante. Il s'agit d'une prépublication arXiv sans code public annoncé à ce stade, ce qui en fait pour l'instant une contribution académique à valider plutôt qu'un outil industriel prêt à l'emploi. La suite logique serait une mise à disposition open-source permettant de tester des instanciations alternatives, radar ou RGB-D, à travers les mêmes interfaces standardisées.

UEExotec (France) est cité comme exemple d'intégrateur AMR susceptible de bénéficier de l'abstraction architecturale proposée ; une mise à disposition open-source de FUSE réduirait le coût de portage SLAM pour les équipes de navigation industrielle européennes.

RecherchePaper
1 source
OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle
3arXiv cs.RO 

OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle

Des chercheurs publient OntoPlan, un cadre de planification de tâches robotiques fondé sur une représentation ontologique de la scène, accompagné d'un code ouvert sur GitHub (dépôt namhyeongwoo/OntoPlan). Le système cible un défaut connu de la planification par grands modèles de langage (LLM) : sur les tâches à long horizon dans de vastes environnements, la performance se dégrade. Quand la géométrie de la scène est transmise sous forme de texte, le modèle saisit mal le contexte spatial, et le coût en tokens croît avec la taille de l'environnement. OntoPlan aligne objets, espaces, relations et états dans un vocabulaire symbolique commun. Un cadre agentique interprète l'instruction, récupère de façon sélective les informations utiles, formalise buts et contraintes, puis produit un plan exécutable. Sur 150 tâches générales réparties dans cinq environnements intérieurs et trois échelles de scène, il atteint un taux de réussite moyen de 0,89, contre 0,27 pour la meilleure méthode de référence. Il consomme en moyenne 18,1 k tokens par tâche, soit environ 5,6 fois moins que la référence la plus économe. L'enjeu est double pour les intégrateurs et les équipes qui déploient des robots pilotés par LLM. D'abord, l'écart de 0,89 contre 0,27 suggère que le goulot d'étranglement tient moins à la capacité de raisonnement du modèle qu'à la manière de lui présenter le monde : un LLM qui génère directement des séquences d'actions peine à respecter l'état courant et les préconditions, alors qu'une formalisation symbolique les rend vérifiables. Ensuite, le coût en tokens, rarement discuté dans les démonstrations, détermine la viabilité économique et la latence en exploitation. Les auteurs indiquent que l'avantage persiste quand l'échelle de la scène augmente, alors que les méthodes concurrentes perdent davantage en réussite et restent beaucoup plus coûteuses. Le système demande aussi des précisions face à une instruction ambiguë, ou signale un manque d'information face à une instruction infaisable, au lieu de s'engager dans un plan invalide. C'est un comportement de sécurité utile pour tout déploiement industriel. Plusieurs réserves s'imposent. Il s'agit d'un préprint arXiv (v1), non évalué par les pairs. Les résultats viennent d'un banc d'essai de 150 tâches, sans précision dans le résumé sur la nature des environnements (simulés ou réels) ni sur les méthodes de référence. Les chiffres ne disent donc rien de la robustesse en conditions réelles, où perception bruitée et échecs d'exécution compliquent la construction de l'ontologie. Ce travail s'inscrit dans le courant de la planification neuro-symbolique, qui combine LLM et planificateurs formels (type PDDL) pour pallier les limites des approches où le modèle génère directement les actions. Il se distingue des modèles vision-langage-action de bout en bout, qui traitent le bas niveau. La publication du code permettra une reproduction indépendante, étape décisive pour juger si l'écart de performance tient hors du banc d'essai des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RoboInter1.5 : une suite de représentations intermédiaires holistiques pour la modélisation du monde incarné et la manipulation robotique
4arXiv cs.RO 

RoboInter1.5 : une suite de représentations intermédiaires holistiques pour la modélisation du monde incarné et la manipulation robotique

Les chercheurs à l'origine du projet RoboInter publient RoboInter1.5, une suite de données et de modèles conçue pour standardiser les représentations intermédiaires utilisées dans la robotique manipulatrice, selon un article déposé sur arXiv (arXiv:2607.18709v1) le 24 juillet 2026. Ce travail prolonge une version antérieure, RoboInter1.0. Le cœur du système, RoboInter-Data, rassemble plus de 230 000 épisodes de manipulation répartis sur 571 scènes, chacun annoté image par image selon plus de dix types de représentations intermédiaires : sous-tâches, compétences élémentaires, ancrage des objets et du gripper, segmentation, cartes d'affordance, poses de préhension, points de contact et trajectoires de mouvement. Sur cette base, RoboInter-VQA introduit des tâches de question-réponse spatiales et temporelles pour évaluer et entraîner un modèle vision-langage dédié, RoboInter-VLM. RoboInter-VLA étudie ensuite comment ces représentations améliorent l'exécution d'actions, via trois approches distinctes : implicite, explicite, et modulaire en plan-puis-exécution. Enfin, RoboInter-World exploite ces mêmes annotations comme signaux de conditionnement pour prédire l'évolution future d'un environnement. L'enjeu dépasse la simple publication d'un jeu de données. Les modèles vision-langage-action (VLA) actuels, qu'il s'agisse de Pi-0, de GR00T N2 ou de Helix, souffrent d'un manque de données annotées finement et généralisables au-delà d'un robot ou d'un environnement précis, ce qui freine leur passage à l'échelle industrielle. En proposant une structure unifiée de représentations intermédiaires plutôt qu'un simple signal interprétable en sortie de modèle, RoboInter1.5 vise à combler l'écart entre démonstration en laboratoire et déploiement réel : ces annotations serviraient à la fois à contraindre les espaces d'action de bas niveau et à limiter les dérives des simulateurs physiques en monde ouvert, deux points de friction identifiés dans la course actuelle à l'IA embarquée pour la robotique. Le projet s'inscrit dans une tendance de recherche qui cherche à mutualiser les coûts de collecte de données robotiques, historiquement chers et spécifiques à chaque plateforme matérielle. En documentant explicitement l'ensemble des sous-composants (Data, VQA, VLM, VLA, World) et en publiant des benchmarks associés, les auteurs positionnent RoboInter1.5 comme une infrastructure de référence potentielle plutôt qu'un modèle isolé, ouvrant la voie à des comparaisons systématiques avec d'autres approches de représentations intermédiaires pour la manipulation.

RecherchePaper
1 source