Télépathie latente : communication multi-robots par latents perceptuels auto-supervisés
Publié sur arXiv (2609.23269) le 22 septembre 2026, un article de recherche présente Latent Telepathy, un protocole de communication pour équipes de robots décentralisées évoluant sous observabilité partielle. Plutôt que d'échanger position ou trajectoire, chaque robot diffuse à ses coéquipiers le vecteur latent perceptif qu'il calcule déjà pour lui-même, issu d'un encodeur auto-supervisé de type JEPA (joint-embedding prédictive architecture) gelé avant tout entraînement de politique. Un coéquipier apprend à s'en servir uniquement via la récompense de tâche, sans jamais connaître sa signification. Dans un protocole où bande passante, latence et topologie restent fixées, ce seul signal permet d'éviter un danger occulté dans 99,7% des épisodes, un score équivalent à un message idéal conçu à la main. Les messages de position ou de trajectoire restent au niveau du hasard, et l'image caméra brute, 186 fois plus lourde en bande passante, s'avère moins fiable que le vecteur latent compressé. Sur un robot physique réel, l'encodeur décode correctement le danger dans 102 décisions sur 102 en conditions live.
Pour les intégrateurs de flottes de robots mobiles autonomes en entrepôt ou de robots de service coordonnés, ce travail comble un angle mort des architectures existantes: aucune ne transmettait ce qu'un robot perçoit mais que son coéquipier ne voit pas, comme un obstacle masqué. Les communications apprises en apprentissage par renforcement multi-agent existent depuis des années, mais produisent des messages opaques et couplés à la tâche d'entraînement, donc peu réutilisables d'un contexte à l'autre. Ici, un vecteur déjà calculé pour la perception, sans coût de calcul supplémentaire ni entraînement joint des politiques, suffit à approcher la fiabilité d'un canal idéal, ce qui ouvre une voie vers un canal de communication partagé et interprété de façon cohérente par des flottes hétérogènes, même sans supervision explicite du sens du message.
L'approche prolonge les travaux de communication apprise en RL multi-agent, jusqu'ici limités par l'opacité et le couplage à la tâche, en gelant l'encodeur perceptif avant tout entraînement de politique afin que le message garde le même sens pour toute l'équipe. Les auteurs identifient une condition nécessaire pour transposer ces résultats du RL discret au contrôle continu: la décision informée par le message doit rester atteignable par l'exploration du récepteur, et proposent une méthode pour la restaurer quand elle fait défaut. Les expériences vont d'un gridworld discret simplifié jusqu'à une validation sur robot physique réel, au-delà de la simple démonstration en simulation. L'abstract ne mentionne ni affiliation industrielle ni partenaire commercial: il s'agit d'une contribution de recherche fondamentale, sans pilote ni déploiement commercial annoncé à ce stade.
Dans nos dossiers




