Aller au contenu principal
RecherchearXiv cs.RO 

Télépathie latente : communication multi-robots par latents perceptuels auto-supervisés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv (2609.23269) le 22 septembre 2026, un article de recherche présente Latent Telepathy, un protocole de communication pour équipes de robots décentralisées évoluant sous observabilité partielle. Plutôt que d'échanger position ou trajectoire, chaque robot diffuse à ses coéquipiers le vecteur latent perceptif qu'il calcule déjà pour lui-même, issu d'un encodeur auto-supervisé de type JEPA (joint-embedding prédictive architecture) gelé avant tout entraînement de politique. Un coéquipier apprend à s'en servir uniquement via la récompense de tâche, sans jamais connaître sa signification. Dans un protocole où bande passante, latence et topologie restent fixées, ce seul signal permet d'éviter un danger occulté dans 99,7% des épisodes, un score équivalent à un message idéal conçu à la main. Les messages de position ou de trajectoire restent au niveau du hasard, et l'image caméra brute, 186 fois plus lourde en bande passante, s'avère moins fiable que le vecteur latent compressé. Sur un robot physique réel, l'encodeur décode correctement le danger dans 102 décisions sur 102 en conditions live.

Pour les intégrateurs de flottes de robots mobiles autonomes en entrepôt ou de robots de service coordonnés, ce travail comble un angle mort des architectures existantes: aucune ne transmettait ce qu'un robot perçoit mais que son coéquipier ne voit pas, comme un obstacle masqué. Les communications apprises en apprentissage par renforcement multi-agent existent depuis des années, mais produisent des messages opaques et couplés à la tâche d'entraînement, donc peu réutilisables d'un contexte à l'autre. Ici, un vecteur déjà calculé pour la perception, sans coût de calcul supplémentaire ni entraînement joint des politiques, suffit à approcher la fiabilité d'un canal idéal, ce qui ouvre une voie vers un canal de communication partagé et interprété de façon cohérente par des flottes hétérogènes, même sans supervision explicite du sens du message.

L'approche prolonge les travaux de communication apprise en RL multi-agent, jusqu'ici limités par l'opacité et le couplage à la tâche, en gelant l'encodeur perceptif avant tout entraînement de politique afin que le message garde le même sens pour toute l'équipe. Les auteurs identifient une condition nécessaire pour transposer ces résultats du RL discret au contrôle continu: la décision informée par le message doit rester atteignable par l'exploration du récepteur, et proposent une méthode pour la restaurer quand elle fait défaut. Les expériences vont d'un gridworld discret simplifié jusqu'à une validation sur robot physique réel, au-delà de la simple démonstration en simulation. L'abstract ne mentionne ni affiliation industrielle ni partenaire commercial: il s'agit d'une contribution de recherche fondamentale, sans pilote ni déploiement commercial annoncé à ce stade.

Dans nos dossiers

À lire aussi

OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots
1arXiv cs.RO 

OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots

Une équipe de recherche a publié sur arXiv (arXiv:2606.17317) OctoSense, une plateforme matérielle open-source de perception multimodale accompagnée d'un dataset de 59 heures de données embarquées synchronisées. Le rig intègre une paire de caméras RGB stéréo, une caméra à événements, un LiDAR, une caméra thermique, une centrale inertielle (IMU), un GPS RTK et des données de proprioception issues d'un bus CAN automobile et d'un robot quadrupède. Les données ont été collectées dans des environnements variés, à différentes heures du jour et de la nuit, y compris en conditions de dégradation sensorielle sévère. Sur ce dataset, les auteurs démontrent une architecture de foundation model baptisée "late-fusion masked autoencoder" : des tokeniseurs spécifiques par modalité gèrent les différences de résolution spatiotemporelle, de fréquence et de latence entre capteurs, puis les tokens sont mis en cache à l'inférence pour traiter les nouvelles mesures au fil de leur arrivée. Le temps de calcul de représentation atteint 6,68 ms sur GPU NVIDIA RTX 5090 et 112 ms sur module embarqué Jetson Orin NX. Ce résultat est notable pour les intégrateurs robotiques car il démontre qu'un modèle auto-supervisé entraîné sur des données réelles hétérogènes surpasse les foundation models vision-only (entraînés sur images seules) sur quatre tâches critiques : estimation du flot optique, reconstruction de profondeur, segmentation sémantique et estimation de l'ego-motion (translation, rotation, angle de braquage). L'absence de labels supervisés dans le pipeline d'entraînement réduit significativement le coût de constitution des datasets pour les équipes qui déploient sur des plateformes mobiles. La robustesse nocturne et en conditions dégradées adresse directement un point de friction récurrent dans les déploiements AMR en entrepôts logistiques et en robotique outdoor. OctoSense s'inscrit dans la tendance des foundation models perceptifs pour la robotique, un espace très actif depuis les travaux de type CLIP/DINOv2 et plus récemment les VLA (Vision-Language-Action models) poussés par Physical Intelligence (Pi-0) et NVIDIA (GR00T). Contrairement à ces approches centrées sur la manipulation ou la navigation en langage naturel, OctoSense cible la représentation sensorielle bas-niveau sur plateforme embarquée contrainte. Le projet est entièrement open-source (code, dataset et vidéos supplémentaires disponibles), ce qui le distingue des stacks propriétaires des acteurs commerciaux. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade ; il s'agit d'un preprint de recherche sans validation externe. La prochaine étape naturelle serait une évaluation sur des benchmarks robotiques standardisés (OpenX-Embodiment, CARLA) pour confirmer la généralisation hors-distribution.

RecherchePaper
1 source
Debate2Create : la co-conception de robots par débat multi-agents
2arXiv cs.RO 

Debate2Create : la co-conception de robots par débat multi-agents

Des chercheurs ont présenté sur arXiv (2510.25850, v3) Debate2Create (D2C), un cadre multi-agent LLM qui aborde la co-conception robotique comme un débat structuré et itératif entre agents spécialisés, ancré dans un évaluateur physique. Un agent de conception gère la morphologie du robot tandis qu'un agent de contrôle propose les fonctions de récompense ; les deux s'affrontent en boucle thèse-antithèse-synthèse, supervisés par des juges LLM dédiés à des critères distincts. Testé sur cinq benchmarks de locomotion MuJoCo (Ant, Swimmer, HalfCheetah, Hopper, Walker2d), D2C obtient le meilleur score normalisé parmi toutes les baselines LLM et boîte noire évaluées, avec des gains de 3,2x sur Ant et de près de 9x sur Swimmer. Le débat itératif génère 18 à 35 % de performance supplémentaire par rapport à une génération zero-shot à budget de calcul équivalent, et les récompenses produites transfèrent aux morphologies par défaut dans 4 tâches sur 5. La co-conception robotique, qui consiste à optimiser simultanément la morphologie et la politique de contrôle d'un robot, est un problème combinatoire difficile, traditionnellement confié à des algorithmes évolutionnaires ou à des méthodes d'optimisation bayésienne coûteuses en calcul. Le résultat clé de D2C n'est pas le score absolu mais le gain systématique du débat itératif sur le zero-shot à budget équivalent : cela signale un avantage architectural réel, pas un simple effet d'échelle. Le transfert des récompenses générées aux morphologies standards dans 4 cas sur 5 propose une séparation réutilisable entre exploration morphologique et politique de contrôle, directement pertinente pour les intégrateurs travaillant sur des plateformes matérielles fixes. Ce travail s'inscrit dans un courant actif qui mobilise les LLM pour automatiser la conception de robots, aux côtés de cadres comme EvoPrompting et des pipelines LLM-to-sim explorés par les équipes de Nvidia et DeepMind. La singularité de D2C est l'ancrage dans une évaluation physique en boucle fermée pendant le débat, plutôt que dans la seule génération de code. Les benchmarks restent contraints à des topologies fixes et le transfert sim-to-real n'est pas abordé, deux limites qui situent la contribution dans le registre de la recherche fondamentale ; les prochaines étapes naturelles sont l'extension à des morphologies à topologie variable et la validation sur matériel réel.

RecherchePaper
1 source
CoDiMAD : distillation privilégiée par diffusion pour la coordination multi-robots sans communication
3arXiv cs.RO 

CoDiMAD : distillation privilégiée par diffusion pour la coordination multi-robots sans communication

Des chercheurs proposent CoDiMAD (Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination), une méthode pour coordonner des robots en essaim sans qu'ils communiquent entre eux. Le principe repose sur trois étapes : d'abord entraîner un "oracle" privilégié qui voit l'état global du système via MAPPO, un algorithme d'apprentissage par renforcement multi-agents ; ensuite construire un jeu de données hors ligne associant observations locales de chaque robot et actions décidées par cet oracle ; enfin distiller ces connaissances dans des politiques décentralisées, chaque robot n'ayant accès qu'à ses propres capteurs, en les paramétrant comme des modèles de diffusion (DDPM, denoising diffusion probabilistic models) conditionnels plutôt que des réseaux déterministes classiques. Testée sur trois tâches coopératives, l'approche surpasse à la fois l'apprentissage multi-agents purement local et la distillation déterministe classique, avec une analyse théorique à l'appui. Le code doit être publié après acceptation de l'article, qui reste pour l'instant un preprint arXiv non encore évalué par les pairs. L'enjeu technique central est le problème du "mode-averaging" : une même observation locale (par exemple, voir un obstacle et un autre robot à proximité) peut correspondre à plusieurs configurations globales exigeant des actions coopératives très différentes. Une distillation déterministe classique moyenne ces possibilités et produit des actions invalides ou hésitantes, un défaut connu de l'apprentissage par imitation en environnement multimodal. En échantillonnant directement dans le processus inverse de diffusion, CoDiMAD choisit une action cohérente au lieu de la moyenner, ce qui est directement pertinent pour les flottes de robots mobiles autonomes (AMR) en entrepôt, les essaims de drones ou tout système devant rester fonctionnel en cas de perte de communication réseau. Cette approche s'inscrit dans deux lignées de recherche déjà établies : la distillation privilégiée enseignant-élève, popularisée en locomotion robotique pour transférer un savoir "avec triche" (accès à l'état complet) vers une politique embarquée limitée aux capteurs réels, et les politiques de diffusion en robotique, initialement développées pour la manipulation mono-robot (Diffusion Policy) et ici étendues au cas multi-agents décentralisé. Le travail reste à ce stade purement expérimental, sans déploiement sur robots physiques mentionné dans le résumé.

RecherchePaper
1 source
Exploration multi-robots sous contraintes de communication, avec fenêtres de communication adaptatives
4arXiv cs.RO 

Exploration multi-robots sous contraintes de communication, avec fenêtres de communication adaptatives

Une équipe de recherche présente MACE (Multi-robot Adaptive Communication-window Exploration), un cadre décentralisé destiné à l'exploration multi-robot en environnement où les communications sont intermittentes. Décrit dans un article publié le 12 septembre 2026 sur arXiv (arXiv:2609.12502v1), le système répond à un problème classique de la robotique en essaim : quand plusieurs robots explorent en parallèle une zone inconnue, ils doivent régulièrement partager leurs cartes pour éviter les redondances, mais dévier de leur trajectoire pour établir une liaison radio coûte du temps d'exploration. MACE introduit des fenêtres de communication planifiées, pendant lesquelles chaque robot évalue le coût de rejoindre un point de communication déjà identifié, en formulant cette décision comme une variante du problème d'orientation de véhicule (Vehicle Orienteering Problem). Concrètement, les robots choisissent leur route en pondérant le trajet nécessaire pour communiquer contre le gain d'exploration réalisable en chemin. Testé sur un ensemble d'environnements simulés de tailles et de géométries variées, MACE réduit le temps total d'exploration jusqu'à 23% par rapport aux stratégies existantes de coordination sous contrainte de communication. Pour les concepteurs de flottes robotiques destinées à des missions en zones sans infrastructure réseau fiable, comme l'inspection industrielle, la recherche et sauvetage ou l'exploration minière et souterraine, ce travail cible un compromis rarement traité de façon rigoureuse: la plupart des approches actuelles reposent soit sur une communication purement opportuniste (les robots ne se coordonnent que lorsqu'ils se croisent par hasard, ce qui retarde le partage d'information), soit sur des points de rendez-vous fixes qui imposent des détours inutiles même quand ils n'apportent rien de nouveau. En rendant la décision de communiquer dynamique et fondée sur un calcul de coût-bénéfice, MACE promet une fréquence de communication plus élevée qu'une stratégie opportuniste tout en évitant les trajets superflus des rendez-vous imposés. Le gain de 23% annoncé reste toutefois mesuré uniquement en simulation, sans validation sur robots physiques ni comparaison sur des cartes réelles bruitées, ce qui limite pour l'instant la portée de la conclusion à un résultat algorithmique prometteur plutôt qu'à une solution validée en conditions de terrain. Ce travail s'inscrit dans la lignée de la recherche en exploration multi-robot sous contrainte de communication, un axe actif depuis plusieurs années à mesure que les flottes de robots terrestres et aériens sont déployées dans des contextes où le Wi-Fi ou la 5G ne couvrent pas l'intégralité du terrain, comme les tunnels, les mines ou les zones sinistrées. Les stratégies antérieures se répartissaient jusqu'ici entre l'opportunisme pur et les rendez-vous fixes planifiés à l'avance, deux approches que les auteurs positionnent explicitement comme les points de comparaison de leur étude. Les prochaines étapes attendues pour ce type de recherche incluent généralement des essais sur plateformes robotiques réelles et une extension à des scénarios avec pertes de communication plus complexes, mais l'article ne mentionne pas de calendrier ni de partenaire industriel pour un tel passage à l'échelle.

RecherchePaper
1 source