Aller au contenu principal
EVPeriscope : perception étendue entre drones et véhicules terrestres par suivi événementiel des hélices
RecherchearXiv cs.RO 

EVPeriscope : perception étendue entre drones et véhicules terrestres par suivi événementiel des hélices

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente EVPeriscope, un système de perception événementielle permettant à un robot terrestre de détecter, localiser et piloter un quadricoptère grâce à une caméra événementielle orientée vers le ciel. Décrit dans un article publié sur arXiv (identifiant 2609.11920v1), le système repère la signature visuelle haute fréquence produite par la rotation des hélices du drone plutôt que de s'appuyer sur des caméras classiques ou des marqueurs fiduciaires, sensibles au flou de mouvement, aux variations de lumière et aux contraintes de charge utile. Le duo forme un système dit marsupial, où le drone sert de relais de perception étendue pour le robot terrestre lorsque les capteurs embarqués de ce dernier sont dégradés ou occultés. Les expérimentations ont été menées en conditions réelles difficiles, avec des vents allant jusqu'à 15 mph (environ 24 km/h), de jour comme de nuit, et ont démontré une localisation et une navigation en boucle fermée à travers un feuillage dense masquant les capteurs du robot au sol. La boucle de contrôle du quadricoptère tourne à 200 Hz, entièrement à partir de capteurs et de calculs embarqués, sans dépendance à une infrastructure externe. Une page de projet et des vidéos d'expérience accompagnent la publication.

Le résultat intéresse directement les équipes travaillant sur la coordination de flottes hétérogènes air-sol, un axe encore peu mature comparé aux progrès rapides des robots humanoïdes ou des AMR industriels. Il illustre une alternative crédible aux caméras frame-based et aux marqueurs ArUco pour la localisation relative, dans des scénarios où ces méthodes échouent typiquement, occlusion, végétation dense, conditions de faible luminosité. Le fait que le système fonctionne entièrement en embarqué, à haute fréquence et en conditions de vent réel plutôt qu'en environnement contrôlé de laboratoire, répond directement à une critique récurrente du secteur sur l'écart entre démonstrations en intérieur et déploiement de terrain réel, pertinent pour l'agriculture, la surveillance d'infrastructures ou les opérations de recherche et sauvetage.

Le travail s'inscrit dans la lignée des recherches sur les caméras événementielles, des capteurs neuromorphiques déjà exploités dans la robotique à grande vitesse comme le vol de drones en environnement contraint, où leur faible latence et leur robustesse au flou de mouvement offrent un avantage sur l'imagerie conventionnelle. Le concept de robot marsupial, un porteur terrestre associé à un engin volant, existe depuis plusieurs années dans la recherche en robotique de terrain, mais l'apport ici est l'usage spécifique de la signature événementielle des hélices pour la localisation croisée. L'article ne mentionne pas de calendrier de transfert industriel ni de partenaire de déploiement, ce travail restant à ce stade une contribution de recherche académique plutôt qu'un produit commercialisé.

Dans nos dossiers

À lire aussi

Un système de gestion du trafic pour véhicules volumineux et hétérogènes en environnement industriel étroit
1arXiv cs.RO 

Un système de gestion du trafic pour véhicules volumineux et hétérogènes en environnement industriel étroit

Un article publié sur arXiv le 10 septembre 2026 (référence 2609.10400v1) présente un système de gestion du trafic pour flottes de véhicules à guidage automatique (AGV) opérant dans des environnements industriels étroits et non standardisés. L'approche associe un algorithme de planification multi-agents en continu (L-MAPF, pour Lifelong Multi-Agent Path Finding) appliqué à des cartes de circulation construites avec des courbes NURBS, une résolution de conflits à horizon glissant avec temps étendu par agent, une couche d'exécution pour interagir avec des AGV réels, et un mécanisme de détection des interblocages. Testée dans des environnements industriels dits "réalistes", la méthode revendique un gain de débit allant jusqu'à 11 % par rapport à un système classique à base de règles, à une méthode industrielle de référence et à une variante L-MAPF priorisée, tout en maintenant un fonctionnement continu de la flotte. La coordination des AGV dans les usines et entrepôts repose souvent sur une négociation de priorité au cas par cas, source de ralentissements dès que le trafic devient dense ou que les couloirs sont trop étroits pour des véhicules de tailles différentes. La plupart des méthodes MAPF académiques supposent une grille régulière, hypothèse rarement vérifiée dans une usine réelle aux allées sinueuses partagées par des flottes hétérogènes. En ciblant ce contexte non standardisé, les auteurs visent un angle mort des intégrateurs de logistique 4.0. Un gain de 11 %, s'il se confirme hors laboratoire, serait notable, mais il provient d'essais qualifiés de "réalistes" et non d'un déploiement chez un client industriel identifié. Ce travail prolonge les recherches en planification multi-agents appliquées à la logistique, un champ longtemps dominé par des approches pensées pour des entrepôts à grilles homogènes, à la manière des systèmes de type Kiva/Amazon Robotics. En s'attaquant plutôt aux corridors étroits d'ateliers existants, les auteurs visent le marché de la rénovation plutôt que celui des sites automatisés construits sur mesure. L'article ne cite aucun partenaire industriel ni fournisseur d'AGV nommé, ce qui situe ce travail au stade de la recherche académique ; les auteurs évoquent une validation en simulation, la suite logique étant un test sur des flottes AGV physiques en conditions réelles de production.

RecherchePaper
1 source
Estimation dense des forces par capteur tactile optique à événements
2arXiv cs.RO 

Estimation dense des forces par capteur tactile optique à événements

Des chercheurs ont présenté sur arXiv (arXiv:2606.09451) le premier framework de reconstruction dense de champ de force 3D à partir d'un capteur tactile optique à événements. L'approche combine deux modules complémentaires : un algorithme de suivi de marqueurs basé sur les événements pour estimer les déplacements de cisaillement (axes X et Y), et un réseau de neurones convolutif entraîné sur un jeu de données synchronisées force-déplacement-événements pour prédire les déplacements normaux (axe Z). Ces déplacements de surface sont ensuite convertis en forces via la méthode des éléments finis inverse (iFEM). Les performances mesurées atteignent une erreur absolue moyenne de 0,14 N, 0,10 N et 0,93 N sur des plages de force respectives de 4 N, 4 N et 20 N, avec une fréquence de traitement moyenne de 100 Hz. Ce résultat comble une lacune importante dans la perception tactile robotique. Les capteurs tactiles à base de caméra conventionnelle, comme le GelSight du MIT ou le DIGIT de Meta AI, permettent déjà une estimation dense des forces, mais butent sur les limites de framerate des capteurs CMOS, le flou de mouvement lors de contacts dynamiques rapides, et la bande passante nécessaire au transfert d'images. Les capteurs à événements, d'inspiration neuromorphique, contournent ces contraintes avec une résolution temporelle à la microseconde et un encodage asynchrone des variations de luminosité. Jusqu'ici, leur usage en tactile était restreint à la prédiction de forces nettes scalaires, sans distribution spatiale. Le framework présenté ouvre la voie à un retour de force géométriquement dense à haute fréquence, condition nécessaire pour des boucles de contrôle en préhension dextre réactive. La manipulation dextre reste l'un des problèmes ouverts les plus difficiles de la robotique, précisément parce que le toucher humain exploite simultanément la densité spatiale, la sensibilité à la géométrie de contact et la résolution temporelle fine. Le paysage des capteurs tactiles intelligents s'est structuré autour de deux familles : les capteurs visuels élastomère (GelSight, DIGIT, Finger Vision, Tactip) et les capteurs neuromorphiques à événements, encore peu exploités pour la reconstruction de champ. Ce travail constitue une première étape de preuve de concept ; les auteurs ciblent explicitement l'intégration dans des pipelines de contrôle haute fréquence pour la préhension robotique et la manipulation, sans annoncer de plateforme ou de timeline de déploiement précise.

RecherchePaper
1 source
1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique
3arXiv cs.RO 

1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique

Des chercheurs ont publié en juin 2026 (arXiv:2606.25620) le premier jeu de données à grande échelle pour la perception par caméra événementielle appliquée au ping-pong robotisé. Le dataset regroupe plus de 1 000 échanges (rallies) enregistrés auprès d'une population variée, des amateurs aux joueurs de niveau élite. Chaque séquence combine le flux événementiel avec 14 caméras haute vitesse synchronisées à 200 images par seconde, utilisées pour générer des labels pseudo-vérité à 1 kHz comprenant la position, la vitesse et l'effet de la balle. À partir de ce corpus, un réseau de neurones convolutif a été entraîné pour estimer conjointement position et vitesse de la balle dans le plan image, robuste aux mouvements de fond produits par le joueur. L'intégration de la vitesse prédite comme mesure additionnelle dans un filtre de Kalman réduit l'erreur de prédiction du point de rebond de 36 % par rapport à une baseline position seule. Le système a finalement été couplé à un bras robotisé Stäubli pour réaliser les premiers échanges humain-robot en temps réel pilotés intégralement par perception événementielle. Ce résultat est significatif pour le secteur de la robotique rapide car il valide, sur une tâche réelle et contrainte temporellement, l'avantage fondamental des caméras événementielles: une résolution temporelle de l'ordre de la microseconde, sans flou de mouvement, là où les caméras classiques imposent un arbitrage coûteux entre cadence et bande passante de traitement. La réduction de 36 % de l'erreur de prédiction du rebond, obtenue simplement en ajoutant la vitesse estimée au filtre de Kalman, illustre que la qualité de la mesure perceptive en amont détermine directement les performances de contrôle en boucle fermée, un argument concret pour les intégrateurs industriels qui travaillent sur des tâches de manipulation haute cadence ou de tri haute vitesse. Le ping-pong robotisé s'est imposé ces dernières années comme banc d'essai privilégié pour la perception et le contrôle à faible latence, notamment avec les travaux de Google DeepMind sur l'agent de tennis de table (2023-2024). Les caméras événementielles, dont le fabricant français Prophesee (Paris) est l'un des leaders mondiaux, restaient jusqu'ici sous-exploitées faute de datasets publics représentatifs. Stäubli Robotics, groupe franco-suisse basé à Faverges (Haute-Savoie), apporte ici une visibilité européenne au banc expérimental. Les auteurs ne précisent pas de roadmap de déploiement industriel, mais la combinaison dataset public + pipeline temps réel validé en boucle fermée constitue une base ouverte pour que d'autres équipes portent cette approche vers des applications comme le tri de pièces à haute cadence ou la manipulation de petits objets en mouvement.

UEProphesee (Paris), leader mondial des caméras événementielles, et Stäubli Robotics (Faverges, Haute-Savoie) sont directement impliqués dans le banc expérimental, renforçant la visibilité de la filière capteur et robotique franco-européenne sur la perception haute cadence.

RecherchePaper
1 source
Rule-VLN : unifier perception et respect des règles par raisonnement sémantique et rectification géométrique
4arXiv cs.RO 

Rule-VLN : unifier perception et respect des règles par raisonnement sémantique et rectification géométrique

Une équipe de chercheurs a publié sur arXiv (2604.16993) un article introduisant Rule-VLN, un benchmark urbain à grande échelle conçu pour évaluer la navigation par instruction langagière (Vision-and-Language Navigation, ou VLN) sous contraintes réglementaires. L'environnement couvre 29 000 nœuds de graphe urbain, avec 8 000 nœuds soumis à 177 catégories de règles distinctes réparties en quatre niveaux de difficulté croissante. Pour corriger les agents existants, les auteurs proposent le Semantic Navigation Rectification Module (SNRM), un module zero-shot greffable sur tout agent VLN pré-entraîné. Dans les expériences rapportées, SNRM réduit le taux de violation des contraintes (Constraint Violation Rate, CVR) de 19,26 % et améliore le taux de complétion de tâche (Task Completion, TC) de 5,97 % par rapport aux modèles de référence. Le problème identifié est structurel : les agents VLN actuels tombent dans ce que les auteurs appellent le "goal-driven trap", un biais où la géométrie physique ("puis-je passer ici ?") prime sur la sémantique réglementaire ("suis-je autorisé à passer ici ?"). Pour les intégrateurs de systèmes de navigation autonome en environnement urbain ou semi-public, cela signifie concrètement que les agents actuels ignorent des contraintes visibles pourtant critiques : panneaux d'interdiction, zones piétonnes, restrictions de circulation. Rule-VLN est le premier benchmark à formaliser ces contraintes à cette échelle, ce qui en fait un outil de qualification utile pour les développeurs souhaitant valider la conformité comportementale avant déploiement réel, au-delà des métriques classiques de succès de navigation. La VLN est un axe de recherche actif depuis les travaux fondateurs de l'environnement R2R (2018, Anderson et al.), majoritairement axés sur la reachability dans des environnements intérieurs. Rule-VLN étend explicitement ce cadre à l'urbain extérieur avec une dimension normative, un angle peu exploré jusqu'ici malgré la montée en charge des robots de livraison et des AMR en espace public. Côté concurrents directs, des benchmarks comme TouchDown ou CityNav posent des bases géographiques réalistes mais sans injection systématique de contraintes réglementaires. Le SNRM s'appuie sur un VLM (Vision-Language Model) en pipeline coarse-to-fine couplé à une carte mentale épistémique pour la planification de détours dynamiques. Les résultats sont présentés uniquement en conditions simulées : aucun déploiement réel n'est mentionné, et les gains de 19 % sur CVR restent à valider sur des environnements physiques avec une distribution de règles non contrôlée.

UEPertinent pour les intégrateurs de robots de livraison et AMR en espace public européen confrontés aux contraintes réglementaires urbaines, mais aucun acteur FR/EU n'est impliqué dans ces travaux.

RechercheOpinion
1 source