Dossier arXiv cs.RO — page 42

2059 articles · page 42 sur 42

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

2051arXiv cs.RO RechercheOpinion

Modélisation d'actions généralement covariante : construction de variétés généralisées par découplage spatio-temporel

Un préprint soumis sur arXiv le 2 juin 2026 (identifiant 2606.00110) introduit le cadre GAM (Generalized Action Manifold), une approche architecturale pour améliorer la généralisation des politiques robotiques en intelligence incarnée. Le problème ciblé est précis : les méthodes actuelles de Vision-Language-Action (VLA) entraînent les robots à régresser des coordonnées absolues, liant la politique à un style de mouvement et une vitesse d'exécution fixes. GAM résout cela via deux mécanismes orthogonaux. Le premier, l'Arc-Length Parameterizer, sépare la géométrie spatiale d'une trajectoire de sa dynamique temporelle, rendant la politique insensible aux variations de vitesse. Le second, le Schema-Affine-Factorization, projette les trajectoires dans un repère normalisé (pose-normalized coordinate frame), distinguant les schémas géométriques invariants des modulations affines locales. Intégré dans une architecture VLA structurée, GAM permet à un faible nombre de démonstrations de peupler densément un manifold d'actions continu et valide. Les auteurs rapportent des performances supérieures aux baselines geometry-agnostic sur des benchmarks empiriques, sans préciser les robots ou plateformes testés. L'enjeu industriel est direct : la généralisation depuis un nombre limité de démonstrations reste l'un des verrous les plus coûteux du déploiement robotique. Dans les usines où les intégrateurs doivent collecter des milliers de trajectoires par variante de tâche, réduire ce volume a un impact économique concret. Le principe de covariance générale, emprunté à la physique relativiste, stipule qu'une loi ne doit pas dépendre du système de coordonnées choisi. Appliqué à la robotique, cela signifie apprendre la structure géométrique intrinsèque d'une tâche plutôt que les habitudes motrices d'un démonstrateur humain. Si validée à l'échelle, cette approche s'attaquerait directement au demo-to-reality gap et au sim-to-real transfer, deux obstacles persistants pour des systèmes VLA commerciaux comme Pi-0 de Physical Intelligence ou OpenVLA. La recherche VLA s'est accélérée depuis 2024 avec Pi-0, RDT-1B, Octo, et les travaux de NVIDIA sur GR00T N2. GAM se positionne comme une couche d'invariance structurelle compatible avec ces architectures existantes plutôt que comme un modèle concurrent. Ce papier reste à ce stade un preprint non relu par des pairs, sans validation sur des robots physiques identifiés ni données de déploiement réel. Aucun auteur, institution ou partenaire industriel n'est mentionné dans l'abstract disponible, ce qui limite l'évaluation de la crédibilité et de la roadmap concrète. La prochaine étape naturelle serait une soumission à CoRL, ICRA ou RSS avec des expériences sur manipulateurs physiques dans des environnements semi-structurés.

1 source

2052arXiv cs.RO

Validation sim-vers-réel d'une plateforme graphique open source à quatre niveaux de communication pour l'enseignement de la robotique

Des chercheurs publient sur arXiv (arXiv:2606.00550v1) un article de type Work-in-Progress présentant une architecture de communication à quatre niveaux destinée à l'enseignement de la robotique manipulatrice en laboratoire universitaire. La solution s'appuie sur GOSP (Graphical Open-Source Platform), un environnement graphique open-source, couplé à ROS comme middleware de backend. L'architecture gère la sérialisation, le routage et l'encapsulation des échanges de données entre des environnements visuels conceptuels 3D et des robots physiques réels. Une validation sim-to-real préliminaire, menée sur des trajectoires spatiales multi-axes, conclut que cette encapsulation des pipelines de communication fournit un chemin matériellement agnostique de fidélité jugée suffisante. L'enjeu est structurel : les laboratoires universitaires se heurtent depuis des années à une dichotomie difficile entre twins numériques commerciaux, souvent prohibitifs en coût et rigidement scriptés, et le middleware open-source ROS, dont la courbe d'apprentissage reste abrupte pour les étudiants novices. Cette architecture à quatre niveaux vise à combler ce fossé en découplant l'interface visuelle de la couche de communication bas niveau, ce qui permettrait à des curricula robotiques de monter en échelle sans dépendance à une plateforme matérielle spécifique. Pour les responsables de formations d'ingénieurs, c'est un argument concret : réduire la barrière à l'entrée sans sacrifier la transférabilité vers le hardware réel, à condition que les résultats préliminaires soient confirmés sur un périmètre plus large. Le contexte est celui d'un champ académique en pleine structuration autour de l'accessibilité des environnements de simulation robotique. Des initiatives comme Gazebo, Webots ou MuJoCo ont progressivement amélioré le sim-to-real dans la recherche, mais leur adoption pédagogique reste inégale. GOSP n'est pas encore un produit commercial ni une plateforme déployée à grande échelle : il s'agit d'une preuve de concept académique, et les auteurs signalent eux-mêmes le stade WiP de leurs travaux. Les prochaines étapes logiques impliqueraient une validation sur un spectre plus large de robots et de profils d'étudiants avant toute adoption institutionnelle.

RecherchePaper

1 source

2053arXiv cs.RO

Comment atténuer le problème de décalage de distribution dans le contrôle robotique : une approche robuste et adaptative par apprentissage par imitation hors ligne vers en ligne

Une équipe de recherche a déposé le 25 mai 2026 sur arXiv (réf. 2605.25414) un cadre d'apprentissage par imitation en deux phases pour traiter le décalage de distribution dans le contrôle robotique. Ce problème survient lorsqu'un agent entraîné sur des démonstrations expertes rencontre, au déploiement, des états non couverts pendant l'entraînement, sa couverture état-action étant structurellement limitée par la portée des démonstrations fournies. La méthode articule une phase hors ligne utilisant des démonstrations complémentaires filtrées par un discriminateur pour élargir cette couverture, et une phase en ligne qui détecte le décalage en temps réel et déclenche un apprentissage auto-supervisé à partir des expériences collectées. Les évaluations ont été conduites uniquement dans des environnements MuJoCo ; aucun test sur robot physique n'est rapporté. L'intérêt réside dans la nature lifelong du mécanisme : au lieu d'une politique figée après entraînement, le système s'adapte en continu lorsqu'il dérive hors de sa distribution. Pour un ingénieur robotique ou un intégrateur industriel, cela ouvre la perspective d'un robot capable de se recalibrer automatiquement en production sans re-collecte manuelle de données ni réentraînement complet. L'utilisation d'un discriminateur évoque les architectures GAIL (Generative Adversarial Imitation Learning), mais la contribution revendiquée tient à la détection en ligne du shift couplée à l'auto-supervision. Les auteurs rapportent de meilleures performances que les baselines sur robustesse et adaptation, bien que les métriques issues de MuJoCo restent éloignées des contraintes du monde réel. Le décalage de distribution est un problème structurel de l'apprentissage par imitation depuis DAgger (Ross et al., 2011) et GAIL (Ho & Ermon, 2016). Les approches concurrentes, comme l'offline RL à haute couverture de données, les politiques de diffusion de type pi-0 (Physical Intelligence) ou les VLA généralistes, traitent le problème principalement par la diversité des données d'entraînement, non par adaptation en ligne. Ce preprint n'a pas encore été soumis à évaluation par les pairs, et le vrai test restera le transfert sim-to-real : la validation sur robots physiques amplifierait précisément les écarts de distribution que ce cadre cherche à combler.

RecherchePaper

1 source

2054arXiv cs.RO

Perception active et contrôle tenant compte des conflits dans les champs de Gaussian Splatting 3D via des fonctions barrière de contrôle

Des chercheurs ont publié sur arXiv (référence 2605.20566) un cadre algorithmique baptisé "conflict-aware active perception and control" pour robots évoluant dans des environnements modélisés par 3D Gaussian Splatting (3DGS). L'approche repose sur un programme quadratique unifié qui traite simultanément deux objectifs antagonistes : la sécurité, imposée comme contrainte dure via une Control Barrier Function (CBF), et l'acquisition d'information, traitée comme contrainte souple assouplie par des variables de relâchement (slack variables). La CBF est dérivée d'une métrique de risque de collision dite Average Value-at-Risk (AV@R), qui intègre l'incertitude géométrique de la carte et garantit mathématiquement l'invariance avant d'un ensemble sûr. Pour maximiser la perception, le système sélectionne la prochaine meilleure vue (next-best-view) via une formulation risk-aware de l'Expected Information Gain (EIG), et oriente la caméra vers la direction de montée d'information locale grâce à des "perception barrier functions". Les résultats présentés sont issus de simulations uniquement, sans validation sur plateforme physique. Le problème central que ce travail adresse est structurel : dans un environnement partiellement inconnu, les vues les plus informatives se trouvent précisément dans les zones les moins cartographiées, donc les plus à risque de collision. Les approches existantes basées sur 3DGS traitaient ces deux objectifs séparément ou par simple pondération, sans garanties formelles. Formuler la sécurité comme contrainte inviolable tout en relaxant la perception permet aux décideurs B2B et aux intégrateurs robotiques d'envisager des robots d'exploration actifs qui cartographient des environnements industriels non balisés sans compromis ad hoc entre productivité et sécurité. L'amélioration simultanée de la sécurité et du gain d'information, comparée aux méthodes 3DGS concurrentes, constitue un signal technique intéressant, même si l'absence d'expériences réelles limite pour l'instant la portée de la validation. Le 3DGS s'est imposé comme représentation de référence pour les champs de radiance neuronaux depuis 2023, supplantant progressivement le NeRF grâce à sa vitesse de rendu et sa différentiabilité. Les CBF sont un outil établi en commande sûre, mais leur intégration dans des champs neuronaux pour la perception active reste un axe de recherche émergent. Aucune institution ni entreprise n'est explicitement nommée dans l'abstract, et aucun déploiement industriel n'est annoncé. Les concurrents directs sont les méthodes d'exploration active basées NeRF et les planificateurs next-best-view classiques. Les prochaines étapes naturelles seraient une validation sim-to-real sur plateforme physique et des tests dans des scènes plus complexes.

RecherchePaper

1 source

2055arXiv cs.RO

MUSE : quantification multimodale de l'incertitude dans l'estimation d'état

Une équipe de chercheurs a déposé sur arXiv (référence 2605.17421, mai 2026) un cadre d'apprentissage automatique baptisé MUSE (Multimodal Uncertainty Quantification of State Estimation), conçu pour quantifier en temps réel l'incertitude dans l'estimation d'état visuel. La contribution centrale porte sur l'odométrie visuelle-inertielle (VIO), technique qui fusionne données de caméra et unité de mesure inertielle (IMU) pour localiser un robot sans GPS. MUSE exploite l'architecture Mamba, modèle séquentiel à état discret proposé en 2023 comme alternative efficace aux Transformers, pour traiter plusieurs flux de capteurs asynchrones simultanément. Les expériences ont été conduites sur des jeux de données publics et des données propriétaires ; les auteurs rapportent une fiabilité et une robustesse supérieures aux méthodes existantes, sans fournir dans l'abstract de métriques chiffrées précises permettant une comparaison directe avec l'état de l'art. L'enjeu dépasse la simple précision de localisation : savoir quand ne pas faire confiance à une estimation est aussi critique que l'estimation elle-même. En navigation autonome, en conduite sans conducteur et en vol autonome, une erreur non détectée peut provoquer une collision ou un abandon de mission. Le problème est particulièrement difficile en VIO car la distribution des erreurs est hétéroscédastique (la variance évolue selon les conditions lumineuses, les textures, la vitesse) et multimodale (plusieurs hypothèses de pose simultanément plausibles). Une quantification d'incertitude fiable ouvre la voie à des mécanismes embarqués de détection de défaillance et de dégradation gracieuse, deux capacités très recherchées par les intégrateurs de systèmes autonomes en industrie. L'estimation d'état visuel est un domaine très actif, où filtres de Kalman étendus, graphes de facteurs (GTSAM, g2o) et méthodes neuronales récentes (DPVO, DROID-SLAM) se concurrencent sur des benchmarks standard comme EuRoC ou TUM-VI. Mamba gagne du terrain dans les tâches de séquences longues, et MUSE s'inscrit dans cette tendance en l'appliquant à la fusion sensorielle multi-modale. Aucune affiliation institutionnelle ni partenariat industriel n'est mentionné dans l'abstract, et le papier n'a pas encore été soumis à une revue à comité de lecture confirmée. Les performances annoncées restent donc à valider indépendamment avant toute intégration dans un pipeline de production.

RecherchePaper

1 source

2056arXiv cs.RO

Contrôle par planification réactive pour robots mobiles en environnements encombrés d'obstacles

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.14232v1) une méthode de contrôle de mouvement pour robots mobiles évoluant dans des environnements encombrés d'obstacles. L'approche, baptisée RPCS (Reactive Planning based Control Strategy), s'attaque à un problème classique de la robotique mobile : déplacer un robot d'un point de départ à une cible sans collision, en ne disposant que d'une information partielle sur l'environnement, c'est-à-dire sans carte globale préalable. Le système fonctionne en deux couches combinées : une trajectoire de référence est d'abord tracée en ligne droite entre les deux points, puis un module de planification réactive (RPS) la modifie localement à la volée lorsque des obstacles sont détectés. Un contrôleur de suivi adaptatif (ATCS), basé sur des techniques de discrétisation, assure ensuite l'exécution effective de cette trajectoire potentiellement modifiée. Les résultats présentés s'appuient uniquement sur des simulations numériques, sans validation hardware reportée. L'intérêt de cette architecture réside dans la séparation claire entre planification réactive et contrôle de suivi, ce qui permet théoriquement d'adapter chaque couche indépendamment selon le robot cible. Pour les intégrateurs travaillant sur des AGV ou AMR dans des entrepôts à géométrie variable, la capacité à opérer sans carte globale complète reste un enjeu réel, les approches purement réactives souffrent souvent de blocages locaux, et les approches globales peinent face aux environnements dynamiques. L'ATCS adaptatif suggère une robustesse potentielle aux perturbations de modèle, mais l'absence d'expérimentation physique limite la portée des conclusions à ce stade. Ce travail s'inscrit dans une longue tradition de recherche sur la navigation réactive, depuis les champs de potentiel de Khatib (1986) jusqu'aux approches VFH et DWA largement déployées dans ROS. Les chercheurs ne positionnent pas explicitement leur méthode face aux planificateurs modernes appris (RL, imitation learning) qui commencent à équiper des plateformes commerciales comme Spot de Boston Dynamics ou les AMR de MiR. La prochaine étape naturelle serait une validation sur robot réel en environnement semi-structuré, condition sine qua non pour que la méthode pèse dans le débat industriel.

RecherchePaper

1 source

2057arXiv cs.RO

Patrouille multi-robots : algorithme distribué, partitionnement émergent des zones et conscience situationnelle de la base

Une équipe de chercheurs a publié en mai 2026 sur arXiv (référence 2605.01501) un algorithme distribué baptisé LR-PT (Local Reactive and Partition) destiné à la patrouille multi-robots. Le principe central : chaque robot sélectionne sa cible de patrouille de manière autonome, à partir d'informations locales uniquement, en combinant dans une fonction d'utilité unifiée deux critères -- la fréquence de couverture des zones d'intérêt et l'urgence de remonter l'état de mission à la station de base. En simulation, LR-PT surpasse les algorithmes de référence existants sur deux métriques clés : la fréquence de visite de l'ensemble des points surveillés et la qualité de la "situation awareness" de l'opérateur à la base, c'est-à-dire sa capacité à prédire les comportements des robots, soutenir la prise de décision et déclencher des interventions d'urgence. L'intérêt technique tient à deux propriétés émergentes. Premièrement, la partition spatiale se forme spontanément sans coordinateur central, ce qui évite les pièges des optima locaux classiques dans les algorithmes de couverture. Deuxièmement, l'architecture entièrement locale confère une robustesse démontrée aux contraintes de communication et aux pannes de robots individuels -- un point critique pour les déploiements industriels en entrepôt, site industriel ou périmètre de sécurité. Pour les décideurs B2B, cela signifie une flotte de robots de surveillance qui continue de fonctionner de façon dégradée plutôt que de s'effondrer complètement en cas de défaillance partielle. La mise en avant explicite de la situation awareness opérateur est aussi notable : c'est un angle souvent négligé dans la littérature sur les essaims robotiques, davantage focalisée sur les métriques de couverture. La patrouille multi-robots est un domaine de recherche actif depuis les années 2000, avec des approches concurrentes comme les algorithmes à base de cartes d'idleness (Chevaleyre, Portugal & Rocha) ou les méthodes par apprentissage par renforcement. LR-PT se positionne dans la famille des algorithmes réactifs locaux, plus simples à déployer sur matériel contraint. Limite importante à noter : les résultats sont exclusivement issus de simulation, le fossé sim-to-real n'est pas adressé. Aucun déploiement réel ni partenariat industriel n'est mentionné, et aucune timeline vers une validation terrain n'est annoncée dans le papier.

RecherchePaper

1 source

2058arXiv cs.RO

Apprentissage par renforcement pour le contrôle adaptatif multi-tâches de robots bipèdes jouant au football

Des chercheurs ont publié sur arXiv (preprint arXiv:2604.19104, avril 2026) un cadre d'apprentissage par renforcement modulaire destiné aux robots bipèdes évoluant dans des environnements de football dynamiques. L'architecture propose deux modules distincts : un réseau de recherche et de frappe de balle (BSKN, Ball-Seeking and Kicking Network) et un réseau de récupération après chute (FRN, Fall Recovery Network), commutés par une machine à états basée sur la posture du robot. La génération de gaits de base est confiée à un oscillateur feedforward en boucle ouverte, tandis qu'un résiduel RL en boucle fermée gère les actions football plus complexes. Le FRN est entraîné via une stratégie de curriculum à atténuation progressive des forces. Les validations ont été conduites entièrement en simulation Unity, avec un temps de récupération après chute mesuré à 0,715 secondes en moyenne, et une capacité démontrée à localiser et frapper le ballon même depuis des angles de coin restrictifs. Ce travail s'attaque à un verrou connu en robotique humanoïde : le couplage profond entre stabilité locomotrice et exécution de tâches complexes, qui provoque typiquement des interférences d'état lors des transitions (marche droite, frappe, chute, relevé). La séparation explicite en deux réseaux spécialisés, pilotée par une machine à états posturale, contourne ce problème architecturalement plutôt que de tenter de le résoudre par un unique réseau généraliste. Cela valide partiellement l'hypothèse que la modularité reste une approche compétitive face aux VLA (Vision-Language-Action models) monolithiques pour des tâches à contraintes temporelles dures. Réserve importante : les résultats sont entièrement sim-to-real non validés, l'écart simulation-réalité (sim-to-real gap) n'est pas quantifié, et les vidéos sélectives de démonstration Unity ne permettent pas d'évaluer la robustesse au déploiement physique. Le contexte est celui de la RoboCup et des compétitions de football robotique bipède, terrain historique de benchmarking pour la locomotion dynamique depuis les années 2000. Les auteurs ne sont pas identifiés institutionnellement dans l'abstract, mais le style et la thématique évoquent des groupes de recherche est-asiatiques actifs sur cette compétition. Sur le plan concurrentiel, des approches similaires à base de RL modulaire ont été explorées par des équipes de l'ETH Zurich (ANYmal), de CMU et de Berkeley pour des robots quadrupèdes, avec transfert sim-to-real validé sur hardware. Pour les bipèdes football, la prochaine étape crédible serait un déploiement sur plateforme physique type DARwIn-OP ou NAO, dont ce papier ne mentionne aucune planification.

RecherchePaper

1 source

2059arXiv cs.RO

Modélisation du contact améliorée pour lier extéroception et proprioception dans les robots à croissance progressive

Une équipe de chercheurs présente dans un preprint arXiv (réf. 2507.10694v2) une approche permettant d'utiliser des robots souples "croissants" (soft growing robots) comme outils de cartographie autonome dans des environnements inconnus. Ces robots progressent en longueur depuis leur base sans déplacer leur corps, ce qui leur confère une aptitude naturelle aux espaces confinés et non structurés. Le coeur du travail consiste d'abord à caractériser précisément le comportement de collision lors des virages discrets, puis à construire un simulateur géométrique reproduisant les trajectoires en 2D. Le modèle est ensuite validé en situation réelle : un algorithme d'échantillonnage Monte Carlo sélectionne à chaque étape le prochain déploiement optimal en fonction de la carte déjà construite, sur des environnements aussi bien uniformes que non uniformes. L'apport conceptuel est de convertir la déformation passive, habituellement perçue comme une limitation à compenser, en source d'information tactile exploitable. En couplant extéroception (perception de la géométrie externe) et proprioception (état interne du robot), le système peut inférer la structure de son environnement à partir des seules déformations de contact, sans capteurs actifs de type LiDAR ou caméra. La convergence rapide de la sélection Monte Carlo vers des actions quasi-optimales, même dans des configurations irrégulières, suggère qu'une mécanique délibérément simple peut suffire à conduire une exploration utile. Pour des intégrateurs ciblant l'inspection de conduites, de tunnels ou de zones sinistrées, cette voie sans électronique embarquée complexe présente un intérêt opérationnel réel, même si les démonstrations restent limitées à la simulation 2D. Les soft growing robots ont été largement popularisés par les travaux du groupe Hawkes à l'UC Santa Barbara, dont plusieurs publications ont démontré la pénétration de milieux encombrés et l'évitement d'obstacles par déformation passive. Ce nouveau travail prolonge cet effort vers l'autonomie décisionnelle, jusqu'ici absente faute de modèles de contact fiables. Face aux approches classiques de cartographie (AMR à roues, drones miniatures), le robot souple reste marginal en termes de vitesse et de charge utile, mais occupe un créneau distinct pour les espaces très étroits. Les auteurs n'annoncent pas de timeline de commercialisation ni de partenariat industriel ; les prochaines étapes logiques porteront sur l'extension à des environnements 3D et l'intégration de boucles de contrôle temps réel.

RecherchePaper

1 source