Aller au contenu principal
Stratégie adaptative de recherche de source à tours alternés, guidée par estimation et direction d'amélioration
RecherchearXiv cs.RO 

Stratégie adaptative de recherche de source à tours alternés, guidée par estimation et direction d'amélioration

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose, dans un article publié le 25 août 2026 sur arXiv (référence 2608.23068v1), une nouvelle méthode de recherche de source pour la robotique mobile, combinant un filtre de Kalman étendu (EKF) et une sélection de direction basée sur la matrice d'information de Fisher (FIM). Le problème visé, dit "source seeking", consiste à localiser l'origine d'un signal inconnu, par exemple une fuite de gaz, une source de radiation ou un point de pollution, à partir de mesures scalaires bruitées collectées pendant le déplacement du robot, sans connaître à l'avance la position de la source. La méthode fonctionne par boucles : le robot met à jour son estimation de la position de la source en continu pendant le mouvement, puis change de cap à chaque frontière de boucle en combinant l'incertitude d'estimation et le gain d'information prédit. Une condition d'arrêt fondée directement sur les mesures permet de détecter la convergence sans connaissance préalable de la localisation réelle. Les auteurs valident l'approche en simulation, sur des scénarios de source fixe et de source mobile, avec des résultats montrant un meilleur suivi et une erreur d'estimation réduite par rapport aux stratégies purement pilotées par l'information ou purement pilotées par l'estimation.

Pour les intégrateurs en robotique mobile et drones, l'apport principal est méthodologique plutôt qu'un produit prêt à déployer : il s'agit de coupler explicitement la qualité de l'estimation statistique et la planification de trajectoire, un lien que les stratégies géométriques existantes, dites loop-based, laissaient largement implicite. Ce type d'algorithme intéresse directement les applications d'inspection industrielle, de surveillance environnementale et de radioprotection, où des robots ou drones autonomes doivent localiser une source sans capteur de gradient dédié ni carte préalable. À ce stade, il s'agit toutefois de résultats de simulation, pas d'une démonstration sur robot physique ni d'un déploiement terrain, une distinction que l'article ne dissimule pas.

Ce travail s'inscrit dans la lignée des méthodes dites d'extremum seeking et des approches bio-inspirées de chimiotaxie, historiquement utilisées pour la recherche de source robotique, mais qui reposent souvent sur des gradients locaux sensibles au bruit. En combinant estimation bayésienne et théorie de l'information, les auteurs cherchent à combler l'écart entre les approches purement géométriques et les méthodes purement statistiques. L'article ne mentionne pas de partenariat industriel, de pilote annoncé ni de calendrier de transfert vers un robot réel, laissant la validation expérimentale physique comme prochaine étape logique.

Dans nos dossiers

À lire aussi

Localisation probabiliste de source de gaz par plusieurs robots avec capteurs non calibrés : une approche d'estimation distribuée
1arXiv cs.RO 

Localisation probabiliste de source de gaz par plusieurs robots avec capteurs non calibrés : une approche d'estimation distribuée

Des chercheurs proposent une méthode probabiliste distribuée pour localiser une source de gaz avec une flotte de robots équipés de capteurs non calibrés et hétérogènes, un scénario où les réponses non linéaires et incohérentes des capteurs empêchent normalement toute fusion fiable des données. Décrite dans un article arXiv publié fin août 2026 (arXiv:2608.28214v1), l'approche fait que chaque robot calcule localement une croyance probabiliste à partir d'une caractéristique fondée sur le rang des observations, une mesure de l'évolution relative des lectures de capteur invariante à leur échelle et à leurs non-linéarités, donc utilisable sans étalonnage préalable. Ces croyances locales sont ensuite fusionnées entre robots via une formulation de type "produit d'experts" pour obtenir une estimation globale cohérente de la position de la source. Le système intègre aussi une stratégie d'allocation de zones et de planification de trajectoires qui réduit l'exploration redondante en équilibrant exploration et exploitation entre les robots. La validation a été menée uniquement en simulation haute-fidélité, avec des modèles réalistes de capteurs de gaz, sans déploiement physique annoncé à ce stade. Pour l'industrie robotique, ce travail s'attaque à un verrou concret de l'exploitation multi-robots en environnement industriel ou de sécurité civile : la nécessité, aujourd'hui, de calibrer précisément chaque capteur de gaz avant déploiement, une contrainte coûteuse et fragile dès qu'on mélange du matériel hétérogène ou vieillissant. Une méthode calibration-free change la logique de déploiement de flottes low-cost ou mixtes, pour des applications comme la détection de fuites industrielles, la surveillance environnementale ou les interventions après accident chimique, où l'homogénéité des capteurs n'est jamais garantie. Les résultats en simulation montrent une amélioration significative de la précision de localisation par rapport à une méthode de référence agrégeant les mesures brutes, ce qui valide l'intuition que les représentations invariantes au capteur généralisent mieux que la fusion de données calibrées classique, sans toutefois prouver la robustesse en conditions réelles. Ce travail s'inscrit dans le champ plus large de la localisation de sources (gaz, radiations, odeurs) par essaims robotiques, un domaine où la robustesse aux capteurs bon marché et hétérogènes reste un obstacle récurrent face aux capteurs de laboratoire calibrés utilisés en recherche. Les auteurs positionnent explicitement leur contribution comme une brique générique de "sensing invariant au capteur" potentiellement transférable à d'autres tâches d'estimation distribuée au-delà du gaz, comme la cartographie thermique ou radiologique. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur une validation en conditions réelles avec des capteurs physiques hétérogènes, seule étape capable de confirmer que le gain observé en simulation se maintient face au bruit et aux dérives des dispositifs réels.

RecherchePaper
1 source
Reconstruire, s'entraîner, passer au réel : l'auto-amélioration guidée des agents incarnés
2arXiv cs.RO 

Reconstruire, s'entraîner, passer au réel : l'auto-amélioration guidée des agents incarnés

Des chercheurs proposent Reconstruct, Practice, Go Real (RPG), un cadre d'amélioration autonome des systèmes d'exécution robotique qui ne touche à aucun poids de modèle. À partir d'un jeu de données hors ligne, RPG identifie les capacités de manipulation présentes et construit en simulation des tâches d'entraînement apparentées. Pendant cette phase de pratique, le système exploite les retours d'exécution, l'état privilégié du simulateur et les vidéos disponibles du jeu de données pour diagnostiquer les échecs. Il en tire de nouvelles compétences symboliques réutilisables, affine les compétences existantes et réécrit le prompt système. Chaque modification candidate, seule ou fusionnée avec d'autres, est testée sur plusieurs tâches avant d'être conservée. Au déploiement, un LLM multimodal s'appuie sur ce prompt et cette bibliothèque de compétences pour coordonner perception et contrôle. Sur 22 tâches de manipulation, avec des initialisations non vues, le taux de réussite passe de 28,6 % après le premier cycle de pratique à 95,0 % après 15 cycles. Les références testées sont dépassées : ASPIRE atteint 75,5 % et CaP-Agent0, piloté par GPT-6 Astra Pro, 60,0 %. Après une calibration et une adaptation matérielle communes, le système figé réussit les 30 essais physiques, soit dix essais sur chacune de trois tâches. L'intérêt tient à l'approche : l'amélioration passe par du code, des compétences et des prompts, pas par du réentraînement. Pour un intégrateur, cela rend le processus plus auditable et plus facile à versionner, puisque chaque compétence ajoutée est lisible et validée en simulation avant d'être retenue. Cela s'attaque directement au coût humain de la mise au point des compétences, des fonctions de récompense et de l'intégration perception-contrôle. La progression de 28,6 % à 95,0 % suggère aussi que le goulot d'étranglement des agents pilotés par LLM se situe moins dans le modèle que dans la qualité des compétences et des instructions qui l'entourent. Il faut toutefois relativiser. Les 30 essais réels, sur trois tâches seulement, forment un échantillon très mince comparé aux 22 tâches simulées. Ils interviennent après une phase de calibration et d'adaptation matérielle dont le coût n'est pas détaillé dans le résumé. Le transfert sim-to-real reste donc plus plausible que démontré à l'échelle. Ces travaux s'inscrivent dans la lignée des approches « code as policies », où un LLM compose des primitives de contrôle, et des méthodes d'auto-amélioration par bibliothèque de compétences, dont ASPIRE est ici le meilleur concurrent évalué. Ils se distinguent des modèles vision-langage-action (VLA) de type Pi-0 ou GR00T, qui font évoluer l'ensemble par réentraînement de poids. Les auteurs n'annoncent ni produit ni partenaire industriel. Les prochaines étapes à surveiller sont une validation sur davantage de tâches physiques, sur des manipulations plus riches et sur d'autres plateformes. La comparaison avec des VLA entraînés sur les mêmes données serait aussi utile. Le site du projet, rpg-robot.github.io, sert de point d'entrée pour vérifier les résultats.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond
3arXiv cs.RO 

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.25031) une nouvelle méthode de suivi humain-robot fondée sur l'apprentissage par renforcement profond (DRL), qui rompt avec les approches classiques imposant une position fixe au robot par rapport à la personne accompagnée, derrière, devant ou à ses côtés. Le système modélise un "espace d'interaction" liant humain, robot et environnement, utilisé comme espace d'état pour l'agent DRL, et s'appuie sur un contrôleur combinant Model Predictive Path Integral (MPPI) et Control Barrier Functions (CBF) pour suivre précisément la position et l'orientation de la cible tout en évitant les obstacles. Testé en conditions réelles, en intérieur comme en extérieur, et comparé à des méthodes existantes, le robot accompagne une personne marchant jusqu'à 1,7 m/s en ajustant dynamiquement sa stratégie de positionnement, avec un taux de réussite amélioré d'au moins 24% et une précision de suivi améliorée d'au moins 47%, tout en respectant l'espace intime de la personne pour garantir sécurité et confort. L'intérêt dépasse la démonstration technique: la plupart des robots d'accompagnement actuels, en logistique, en assistance ou en robotique de service, reposent sur des règles de positionnement figées, peu robustes face aux changements de vitesse, aux couloirs étroits ou à la densité de foule. Un positionnement adaptatif piloté par apprentissage, capable de basculer entre suivi latéral, frontal ou arrière selon le contexte, répond à une limite connue de la navigation sociale robotique, le compromis entre sécurité, fluidité de déplacement et acceptabilité sociale. Pour les intégrateurs travaillant sur des robots mobiles autonomes (AMR) destinés à l'accompagnement de personnes en environnement industriel ou de santé, cette approche laisse entrevoir des systèmes moins rigides et potentiellement plus sûrs en cohabitation avec des humains. Le travail s'inscrit dans un courant de recherche en interaction humain-robot (HRI) qui cherche à dépasser les schémas de suivi rigides documentés dans la littérature existante, et les auteurs comparent directement leurs résultats à ceux d'études antérieures. Comme souvent pour ce type de publication académique, les métriques de réussite et de confort restent définies et mesurées par les auteurs eux-mêmes sur un nombre limité de scénarios, ce qui appelle une validation indépendante avant toute généralisation. Aucune affiliation industrielle ni calendrier de transfert commercial n'est mentionné: il s'agit à ce stade d'une contribution de recherche, sans pilote ni déploiement annoncé, dont la suite logique serait une extension à des scénarios multi-personnes et une validation sur d'autres plateformes robotiques.

RecherchePaper
1 source
Recherche de source entièrement distribuée et résiliente pour essaims de robots
4arXiv cs.RO 

Recherche de source entièrement distribuée et résiliente pour essaims de robots

Une équipe de recherche propose un nouvel algorithme entièrement distribué permettant à un essaim de robots de localiser la source d'un signal physique (gaz, chaleur, champ électromagnétique) sans mesure directe du gradient ni formation géométrique imposée. L'architecture repose sur trois algorithmes à convergence exponentielle imbriqués dans une boucle fermée à deux échelles de temps, l'une rapide pour l'estimation locale, l'autre plus lente pour le déplacement collectif. Chaque robot calcule une direction ascendante vers la source à partir de mesures de champ purement locales et d'une estimation distribuée de sa position relative au centre de gravité de l'essaim, sans coordination centrale ni communication globale. La méthode est d'abord formulée pour des points cinématiques évoluant dans un espace de dimension quelconque, puis étendue à des robots unicycles 2D se déplaçant à vitesse constante. Les auteurs valident l'approche par des simulations sur des essaims de grande taille, sans toutefois rapporter d'expérimentation sur robots physiques à ce stade. L'intérêt de ces travaux tient à la levée de deux contraintes qui limitaient jusqu'ici les algorithmes de recherche de source en essaim: la nécessité de mesurer directement le gradient du signal, capteur souvent coûteux ou bruité, et l'obligation de maintenir une formation géométrique rigide entre robots, fragile en cas de panne ou de perte d'un agent. En autorisant des géométries d'essaim arbitraires et en caractérisant les formes optimales garantissant un alignement fiable avec le gradient réel, l'étude ouvre la voie à des essaims plus résilients, capables de continuer leur mission même si certains robots tombent en panne ou se désynchronisent. Ce type de robustesse distribuée intéresse directement les applications de détection de fuites, de surveillance environnementale ou de recherche et sauvetage par flottes de drones ou robots terrestres à bas coût. Le papier s'inscrit dans le champ du "source seeking" en robotique en essaim, où les approches historiques s'appuyaient soit sur des capteurs de gradient dédiés, soit sur des topologies figées type formation en losange ou en cercle. En démontrant qu'une estimation purement locale et distribuée suffit à reconstruire une direction de progression fiable, et en montrant comment une déformation contrôlée de la forme de l'essaim ("shape morphing") permet de piloter le mouvement collectif, les auteurs positionnent leur cadre comme une alternative plus flexible aux méthodes existantes. La validation reste pour l'instant limitée à la simulation, une transposition vers des essaims physiques réels constituant la suite logique de ces travaux.

RecherchePaper
1 source