Aller au contenu principal
1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique
RecherchearXiv cs.RO 

1000 Rallies : jeu de données par caméra événementielle et estimation en temps réel de l'état de la balle pour le tennis de table robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en juin 2026 (arXiv:2606.25620) le premier jeu de données à grande échelle pour la perception par caméra événementielle appliquée au ping-pong robotisé. Le dataset regroupe plus de 1 000 échanges (rallies) enregistrés auprès d'une population variée, des amateurs aux joueurs de niveau élite. Chaque séquence combine le flux événementiel avec 14 caméras haute vitesse synchronisées à 200 images par seconde, utilisées pour générer des labels pseudo-vérité à 1 kHz comprenant la position, la vitesse et l'effet de la balle. À partir de ce corpus, un réseau de neurones convolutif a été entraîné pour estimer conjointement position et vitesse de la balle dans le plan image, robuste aux mouvements de fond produits par le joueur. L'intégration de la vitesse prédite comme mesure additionnelle dans un filtre de Kalman réduit l'erreur de prédiction du point de rebond de 36 % par rapport à une baseline position seule. Le système a finalement été couplé à un bras robotisé Stäubli pour réaliser les premiers échanges humain-robot en temps réel pilotés intégralement par perception événementielle.

Ce résultat est significatif pour le secteur de la robotique rapide car il valide, sur une tâche réelle et contrainte temporellement, l'avantage fondamental des caméras événementielles: une résolution temporelle de l'ordre de la microseconde, sans flou de mouvement, là où les caméras classiques imposent un arbitrage coûteux entre cadence et bande passante de traitement. La réduction de 36 % de l'erreur de prédiction du rebond, obtenue simplement en ajoutant la vitesse estimée au filtre de Kalman, illustre que la qualité de la mesure perceptive en amont détermine directement les performances de contrôle en boucle fermée, un argument concret pour les intégrateurs industriels qui travaillent sur des tâches de manipulation haute cadence ou de tri haute vitesse.

Le ping-pong robotisé s'est imposé ces dernières années comme banc d'essai privilégié pour la perception et le contrôle à faible latence, notamment avec les travaux de Google DeepMind sur l'agent de tennis de table (2023-2024). Les caméras événementielles, dont le fabricant français Prophesee (Paris) est l'un des leaders mondiaux, restaient jusqu'ici sous-exploitées faute de datasets publics représentatifs. Stäubli Robotics, groupe franco-suisse basé à Faverges (Haute-Savoie), apporte ici une visibilité européenne au banc expérimental. Les auteurs ne précisent pas de roadmap de déploiement industriel, mais la combinaison dataset public + pipeline temps réel validé en boucle fermée constitue une base ouverte pour que d'autres équipes portent cette approche vers des applications comme le tri de pièces à haute cadence ou la manipulation de petits objets en mouvement.

Impact France/UE

Prophesee (Paris), leader mondial des caméras événementielles, et Stäubli Robotics (Faverges, Haute-Savoie) sont directement impliqués dans le banc expérimental, renforçant la visibilité de la filière capteur et robotique franco-européenne sur la perception haute cadence.

Dans nos dossiers

À lire aussi

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
1arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de données en accès libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux équipes de recherche françaises et européennes travaillant sur le SLAM et l'estimation d'état pour robots a pattes.

RecherchePaper
1 source
Estimation de pose 6D temporellement cohérente des objets pour le contrôle robotique
2arXiv cs.RO 

Estimation de pose 6D temporellement cohérente des objets pour le contrôle robotique

Des chercheurs publient sur arXiv (2605.02708v1) une méthode d'estimation de pose 6D d'objets temporellement cohérente pour la commande de robots manipulateurs. L'approche repose sur un graphe de facteurs qui filtre et lisse en ligne les estimations produites par des estimateurs RGB monoculaires standard, sans recours à un capteur de profondeur. Le système combine trois composantes : un modèle de mouvement de l'objet, une estimation explicite de l'incertitude de mesure de pose, et un optimiseur en ligne intégrant les deux. Les auteurs rapportent une amélioration significative sur des benchmarks standardisés d'estimation de pose avec rejet des valeurs aberrantes, sans toutefois chiffrer précisément les gains. La validation expérimentale porte sur une tâche de suivi d'objet par une caméra embarquée sur un manipulateur à commande en couple (torque-controlled). L'estimation de pose 6D (trois degrés de translation, trois de rotation) est un prérequis pour toute manipulation robotique précise : saisie, assemblage, tri industriel. Les estimateurs RGB monoculaires récents atteignent des performances compétitives sur benchmarks, mais présentent des discontinuités temporelles, des sauts brusques d'une image à l'autre, incompatibles avec la stabilité d'une boucle de contrôle en temps réel. Ce travail s'attaque précisément à ce fossé entre performance sur benchmark et déploiement réel : non pas améliorer la précision frame par frame, mais garantir la cohérence temporelle nécessaire à un retour visuel stable. Pour un intégrateur de cellules robotisées, cela réduit la dépendance aux capteurs ToF ou RGBD, plus coûteux et plus sensibles aux conditions d'éclairage industriel. Les graphes de facteurs sont un outil classique du SLAM robotique (localisation et cartographie simultanées), utilisés depuis longtemps dans les estimateurs de navigation, mais leur application à l'estimation de pose d'objet reste moins répandue. Le champ concurrentiel inclut des approches par filtre de Kalman étendu, des méthodes de lissage sur SE(3), ainsi que des systèmes temps réel comme FoundationPose de NVIDIA ou HappyPose, solution open-source portée par des acteurs européens. L'article est pour l'heure un preprint sans validation industrielle publiée ni annonce de déploiement. Les étapes logiques suivantes incluent une comparaison directe avec les méthodes filtrées existantes sur des jeux de données de référence comme YCB-Video ou LINEMOD, et une extension aux scènes multi-objets.

UELa méthode se positionne en concurrent direct de HappyPose, solution open-source portée par des acteurs européens, sans impact opérationnel identifiable à ce stade de preprint non validé industriellement.

RecherchePaper
1 source
REACT : un modèle d'état entièrement à impulsions pour la perception temporelle événementielle en temps réel
3arXiv cs.RO 

REACT : un modèle d'état entièrement à impulsions pour la perception temporelle événementielle en temps réel

Des chercheurs présentent REACT, un modèle d'état spiking (state-space model) entièrement neuromorphique pour la perception événementielle en temps réel, dans un preprint arXiv (2609.19204v1) publié le 18 septembre 2026. À la différence des méthodes qui agrègent les événements captés par une caméra événementielle en images ou en fenêtres temporelles, ce qui introduit un délai d'intégration, REACT traite chaque événement individuellement via un neurone spiking à valeurs complexes baptisé C-SiLIF, dont la dynamique continue suit l'intervalle physique entre deux événements. Testé sur la reconnaissance de gestes et sur l'estimation du temps avant collision (TTC) à partir de flux événementiels complets, sans boîte englobante ni information de localisation de la cible, REACT atteint sur le jeu de données EvTTC une erreur relative de TTC de 9,59% avec 4,6 ms de latence d'inférence de bout en bout, à seulement 0,15 point de pourcentage de la meilleure méthode apprise existante. À la vitesse d'approche moyenne du jeu de données, cette latence correspond à 4 cm de déplacement du véhicule, contre 1 mètre pour la méthode concurrente la plus rapide. Une quantification INT8 ramène la consommation énergétique estimée de 18,5 à 2,8 millijoules pour 32 768 événements. Pour les systèmes robotiques évoluant en environnement dynamique (véhicules autonomes, robots mobiles, évitement de collision), ce travail s'attaque au goulot d'étranglement des caméras événementielles: leur résolution temporelle microseconde est aujourd'hui neutralisée par des pipelines d'apprentissage qui rebinnent les événements en trames, réintroduisant la latence que ces capteurs étaient censés éliminer. En égalant quasiment la précision des meilleures méthodes apprises classiques tout en réduisant d'un facteur 25 environ la distance parcourue pendant l'inférence, REACT apporte un argument concret en faveur des réseaux à impulsions pour la perception embarquée temps réel, un terrain longtemps cantonné à des démonstrations peu compétitives face au deep learning conventionnel. Le gain énergétique via quantification INT8 (facteur 6,6 environ) intéresse directement les intégrateurs de drones, d'AMR ou de systèmes ADAS contraints en puissance de calcul. Ce travail prolonge les recherches sur la vision événementielle, portée depuis plus d'une décennie par des capteurs asynchrones de type DVS, et sur les réseaux de neurones à impulsions, approche neuromorphique censée rapprocher le calcul du fonctionnement de la rétine biologique. Les auteurs pointent que l'essentiel des méthodes actuelles ignore l'asynchronie native des événements en les regroupant artificiellement en fenêtres temporelles; le neurone C-SiLIF vise justement à la préserver. Publié comme preprint arXiv de type "new", donc pas encore évalué par les pairs, le travail reste au stade de validation sur benchmarks (EvTTC, reconnaissance de gestes) comparés à des méthodes apprises existantes, sans partenaire industriel, déploiement réel ni calendrier de commercialisation mentionnés à ce stade.

RecherchePaper
1 source
MANIGUARD : référentiel et jeu de données pour l'évaluation et l'amélioration de la sécurité de la manipulation robotique
4arXiv cs.RO 

MANIGUARD : référentiel et jeu de données pour l'évaluation et l'amélioration de la sécurité de la manipulation robotique

Une équipe de recherche présente en août 2026 ManiGuard, un cadre pour évaluer et améliorer la sécurité des politiques de manipulation robotique fondées sur des modèles de fondation. Le benchmark associé, ManiGuard-Bench, couvre six familles de tâches domestiques à fort contact physique, organisées en 200 tâches de base testées en configuration standard et sous quatre perturbations hors distribution, soit 1000 scénarios verrouillés où la sécurité est contrôlée par des moniteurs à automates fondés sur la logique LTLf et des prédicats physiques, en simulation et sur un bras Franka réel. Le pipeline associé fournit 8000 démonstrations annotées pour la sécurité. Sur plus de 23000 épisodes testés avec des politiques VLA en zero-shot et affinées, 6 à 21% des épisodes pourtant réussis violent la spécification de sécurité, et l'affinage porte le taux de complétion sûre de quasi nul à 7,5-29,8%, avec 21 à 42% des épisodes engagés toujours en infraction. Ce travail est une publication de recherche, pas une annonce produit, mais son constat central interpelle : le succès d'une tâche et sa sécurité restent deux mesures distinctes, alors que l'évaluation des politiques VLA (vision-language-action) actuelles, du type Pi-0, GR00T N2 ou Helix, repose surtout sur des taux de réussite bruts. Pour les intégrateurs qui envisagent de déployer ces politiques en environnement domestique ou industriel à fort contact, le message est direct : même après affinage sur des données dédiées, deux des six familles de tâches restent quasi toujours dangereuses, et augmenter le volume de démonstrations ne comble pas cet écart. ManiGuard s'inscrit dans une montée en puissance rapide des politiques de manipulation fondées sur des modèles de fondation, dont les progrès en taux de réussite ont devancé les outils d'évaluation de leur sécurité, jusqu'ici basés sur des classifieurs appris ou des juges LLM que les auteurs jugent insuffisamment rigoureux. Le benchmark s'en distingue en ancrant ses contrôles dans la logique temporelle formelle et des prédicats physiques, vérifiés en simulation comme sur un bras Franka réel. Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, ne figure parmi les politiques testées. Les 8000 démonstrations et le benchmark sont publiés, ouvrant la voie à des campagnes d'affinage sécuritaire par d'autres laboratoires, sans calendrier de déploiement industriel annoncé à ce stade.

UEAucun acteur français ou européen n'est impliqué ni testé, mais le benchmark ouvert est directement utilisable par les intégrateurs européens pour évaluer la sécurité de leurs politiques VLA avant déploiement, un enjeu pertinent au regard des exigences de sécurité de l'AI Act.

RecherchePaper
1 source