Aller au contenu principal
FastBridge : combler l'écart de réalisation entre modèle et réel dans les filtres de sécurité, basé sur le splatting gaussien 3D pour un vol rapide de quadrirotor
RecherchearXiv cs.RO 

FastBridge : combler l'écart de réalisation entre modèle et réel dans les filtres de sécurité, basé sur le splatting gaussien 3D pour un vol rapide de quadrirotor

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent FastBridge, un nouveau filtre de sécurité pour le vol rapide de quadricoptères combiné à la représentation de scène 3D Gaussian Splatting (3DGS), détaillé dans un article publié sur arXiv (2607.01200). Le système s'appuie sur la dynamique complète du drone plutôt que sur des modèles simplifiés à intégrateur simple ou double, jusqu'ici standards dans les filtres de sécurité 3DGS mais qui ignorent les limites des actionneurs et supposent une exécution instantanée des accélérations commandées. Les auteurs dérivent une fonction barrière de contrôle exponentielle à cône de collision et à haut degré relatif, ainsi qu'une "backup CBF" qui préserve la faisabilité du programme quadratique sous contraintes d'entrée grâce à une politique de secours simulée à l'avance. Comparé à l'état de l'art des filtres de sécurité 3DGS, FastBridge réduit le jerk de trajectoire de 47% et s'exécute 2,25 fois plus vite. La méthode a été validée en simulation et sur banc matériel réel, en environnement encombré reconstruit par perception.

L'enjeu dépasse la seule performance technique: les filtres de sécurité existants créent un écart entre modèle et réalité, car ils supposent que le drone peut instantanément réaliser n'importe quelle commande, une hypothèse qui s'effondre en vol rapide dans un environnement dense. En intégrant explicitement les contraintes d'actionneurs, FastBridge comble ce fossé et rend l'évitement d'obstacles plus fiable à haute vitesse, un point critique pour les applications d'inspection, de logistique ou de sécurité civile où les drones doivent naviguer vite et sous contraintes de calcul embarqué strictes.

Le travail s'inscrit dans la continuité d'une barrière de collision analytique déjà développée pour 3DGS, que les auteurs étendent ici à un cadre non linéaire et conscient des actionneurs. Il se positionne face aux approches à modèles réduits utilisées par la génération précédente de filtres de sécurité basés sur 3DGS, en visant un compromis plus favorable entre robustesse, fluidité de trajectoire et charge de calcul embarquée, sans toutefois préciser à ce stade de calendrier de déploiement au-delà des tests en laboratoire.

Dans nos dossiers

À lire aussi

Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D
1arXiv cs.RO 

Contrôle de sécurité : navigation vers vue optimale sans collision dans des cartes en Gaussian Splatting 3D

Splat-CBF, une méthode de contrôle publiée sur arXiv (2609.23100, soumis en septembre 2026), s'attaque à un problème classique de la navigation robotique en environnement non cartographié : où regarder et comment se déplacer en même temps, sachant que les zones les plus intéressantes à observer sont aussi celles où le robot maîtrise le moins ses marges de sécurité. La méthode combine deux fonctions barrières de contrôle (control barrier functions, CBF) dans un seul programme quadratique. La première impose la sécurité comme contrainte dure, en convertissant l'Average Value-at-Risk du champ de gaussiennes 3D (Gaussian Splatting) de la carte en une contrainte lisse et unique. La seconde encourage, en contrainte souple, les orientations de caméra qui maximisent le gain d'information de Fisher attendu le long de la trajectoire planifiée, une approche dite de "next-best-view". Une pénalité de relâchement s'ajuste dynamiquement selon la fréquence à laquelle la contrainte de perception a déjà été assouplie et la proximité d'une zone incertaine. Les auteurs valident l'approche en simulation intérieure, sur un bras manipulateur Kinova dans Isaac Sim, et sur un robot mobile à direction Ackermann en conditions réelles. Les résultats indiquent une navigation plus rapide, une collecte d'informations accrue et un temps de calcul en ligne réduit par rapport à des approches de référence limitées soit à la sécurité seule, soit à la perception seule, le robot ne renonçant à un mouvement informatif que lorsque la sécurité l'exige. L'intérêt pour les intégrateurs et roboticiens tient à la démonstration qu'exploration active et garanties de sécurité formelles peuvent être unifiées dans une seule optimisation temps réel plutôt que traitées en pipelines séquentiels, un enjeu direct pour les AMR d'entrepôt, les robots d'inspection ou les manipulateurs opérant dans des environnements inconnus ou changeants où attendre une cartographie complète avant de bouger n'est pas viable. Le travail s'inscrit dans l'adoption croissante du Gaussian Splatting, initialement une technique de rendu graphique, comme représentation de carte différentiable et photoréaliste pour la robotique, en alternative aux nuages de points ou aux champs de radiance neuronaux, avec l'avantage de fournir des estimations d'incertitude exploitables analytiquement. Il s'agit d'une contribution de recherche, testée à petite échelle sur un seul bras et un seul robot roulant, sans annonce de déploiement industriel ni de partenaire commercial ; les suites logiques évoquées par les auteurs porteraient sur des environnements dynamiques plus complexes ou des scénarios multi-robots.

RecherchePaper
1 source
Plans rapides, actions fidèles : combler l'écart entre planification et exécution dans les modèles VLA hiérarchiques
2arXiv cs.RO 

Plans rapides, actions fidèles : combler l'écart entre planification et exécution dans les modèles VLA hiérarchiques

Une équipe de recherche publie sur arXiv (2609.30833) une étude sur les systèmes hiérarchiques vision-langage-action (VLA), où un planificateur vision-langage pilote un module d'action bas niveau. Sur un pipeline de waypoints adapté du modèle Pi-0.5 de Physical Intelligence, le décodage token par token (Token-AR) du planificateur exige jusqu'à 57 passes du modèle vision-langage par plan, un coût incompatible avec le temps réel ; effacer les points d'arrivée des trajectoires ne dégrade quasiment pas le taux de réussite. La solution proposée, un décodage par blocs (Block-AR) combiné à une modulation d'objectif normalisée (NGM), fait tomber ce nombre de passes de 57 à 8 sur le benchmark LIBERO et divise par 8,7 la latence sur un robot bimanuel Rokae, tandis que le taux de réussite sur LIBERO-Long grimpe de 91,0% à 96,2% et la moyenne des quatre suites de 95,85% à 98,45%. Ce travail met en lumière un angle mort des architectures VLA hiérarchiques, popularisées par des modèles comme GR00T N2 de NVIDIA ou Helix de Figure : la course actuelle privilégie les capacités du planificateur, alors que l'étude situe le véritable goulot d'étranglement dans l'articulation entre plan et exécution. Que des plans tronqués ou peu exploités n'affectent pas les performances contredit l'idée qu'une planification plus détaillée garantit plus de fiabilité. Pour les intégrateurs, la latence des VLM reste le principal frein à un déploiement en cadence réelle ; la diviser par plus de huit sans perte de précision, avec un gain de près de trois points sur les tâches longues, indique qu'un contrôle temps réel est atteignable sans sacrifier le raisonnement vision-langage. Le pipeline de référence s'appuie sur Pi-0.5, le modèle VLA hiérarchique de Physical Intelligence, dont l'approche par waypoints s'inscrit dans le même courant que GR00T N2 (NVIDIA) ou Helix (Figure). Il s'agit d'une contribution de recherche algorithmique, validée en simulation sur LIBERO et testée sur un bras bimanuel Rokae, non d'un produit commercialisé ni d'un déploiement industriel. Sans calendrier d'intégration à une plateforme commerciale annoncé, la publication vise à documenter une méthode reproductible pour réduire le coût de calcul des VLA hiérarchiques tout en renforçant la fidélité entre plan et action, une piste que d'autres laboratoires travaillant sur des architectures similaires pourraient reprendre.

RechercheOpinion
1 source
SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion
3arXiv cs.RO 

SplatSearch : navigation vers une image cible pour robots mobiles via 3D Gaussian Splatting et modèles de diffusion

Des chercheurs présentent SplatSearch, une nouvelle architecture de navigation robotique permettant à un robot mobile de retrouver un objet ou une personne spécifique à partir d'une seule image de référence, prise sous un angle arbitraire. Le système s'appuie sur des reconstructions 3D par Gaussian Splatting (3DGS) construites à partir de vues éparses, une technique bien moins gourmande en données que les reconstructions denses classiques. SplatSearch génère plusieurs points de vue synthétiques autour des objets candidats grâce à cette carte 3DGS, puis utilise un modèle de diffusion multi-vues pour compléter les zones manquantes des images rendues, ce qui permet une mise en correspondance robuste avec l'image cible. Une politique d'exploration de frontières a également été développée : elle combine le contexte visuel des vues synthétisées et le contexte sémantique de l'image but pour hiérarchiser les zones à explorer en priorité. Les auteurs rapportent des performances supérieures aux méthodes de référence actuelles, mesurées en taux de réussite et en longueur de chemin jusqu'au succès, sur des environnements domestiques photoréalistes et des tests en conditions réelles. Une étude d'ablation confirme la pertinence des choix de conception retenus. Cette avancée s'attaque à un problème central pour la robotique de service et l'inspection industrielle : la capacité d'un robot à localiser une cible précise dans un environnement inconnu, sans dépendre d'un scan 3D exhaustif préalable. La navigation par instance d'image (Instance Image Goal Navigation) est particulièrement exigeante lorsque l'image de référence est prise sous un angle très différent de celui du robot au moment de la recherche, un scénario fréquent en usage réel mais souvent contourné dans les benchmarks. En misant sur des reconstructions éparses complétées par diffusion plutôt que sur des cartes 3D denses coûteuses à construire, l'approche pourrait réduire le temps de calibration nécessaire au déploiement de robots de recherche et de récupération d'objets, un enjeu concret pour les intégrateurs travaillant sur des AMR en environnement domestique ou logistique. Le travail s'inscrit dans la lignée des recherches combinant 3D Gaussian Splatting et navigation robotique, une technique de rendu apparue en 2023 et rapidement adoptée pour la cartographie temps réel en raison de sa rapidité par rapport aux champs de radiance neuronaux (NeRF). SplatSearch se positionne face aux méthodes état de l'art existantes en IIN, qu'il dépasse selon les métriques de taux de réussite et de longueur de chemin rapportées dans l'article, republié en version 2 sur arXiv. Le papier ne précise pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution de recherche académique, validée par simulation et par des tests réels limités, sans indication d'un acteur français ou européen impliqué.

RecherchePaper
1 source
SafeVLA-Bench : un benchmark pour mesurer l'écart entre performance et sécurité dans les modèles VLA
4arXiv cs.RO 

SafeVLA-Bench : un benchmark pour mesurer l'écart entre performance et sécurité dans les modèles VLA

Une équipe de recherche a publié en juin 2026 SafeVLA-Bench (arXiv:2606.00773), un cadre d'évaluation de la sécurité conçu spécifiquement pour les modèles vision-langage-action (VLA). Contrairement aux benchmarks existants qui se limitent à mesurer si une tâche de manipulation a été accomplie ou non, SafeVLA-Bench évalue ce qui se passe pendant la trajectoire d'exécution : contact excessif avec l'environnement, perturbation d'objets adjacents, déstabilisation de l'objet tenu, ou auto-contact du robot. Le framework formalise ces critères sous forme de spécifications Signal Temporal Logic (STL) et introduit deux métriques complémentaires : SBU (Succ-But-Unsafe), la fraction des séquences d'exécution qui réussissent la tâche tout en violant une contrainte de sécurité, et VSI (Violation Severity Index), un score de profondeur de violation borné. Appliqué à deux environnements de simulation, LIBERO (manipulation sur table) et RoboCasa-365 (cuisine), sur neuf entrées politique-benchmark, le framework révèle des chiffres préoccupants : les meilleures baselines tabletop affichent encore 13 à 15 % d'épisodes non sécurisés, et 36 à 56 % des rollouts réussis de RoboCasa-365 violent au moins une clause de sécurité active. Ce travail met en évidence un angle mort systémique dans l'évaluation des VLA : un taux de succès élevé ne garantit pas une exécution sûre. Pour les intégrateurs industriels et les équipes qui envisagent de déployer des politiques VLA en environnement réel, cela signifie que les benchmarks habituels surestiment structurellement la maturité des modèles. La distinction que pose SafeVLA-Bench entre "tâche accomplie" et "accomplie de façon acceptable" est exactement le type de critère qui sépare une démo convaincante d'un déploiement industriellement viable. Il faut noter que l'ensemble des résultats repose sur des simulations, ce qui laisse entière la question du transfert sim-to-real pour les violations de sécurité elles-mêmes. L'initiative s'inscrit dans une dynamique plus large de maturation de l'évaluation des VLA, portée notamment par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et Helix (Figure), dont les capacités de manipulation généraliste progressent plus vite que les outils pour les qualifier rigoureusement. Jusqu'ici, la communauté s'appuyait sur des métriques de succès binaires héritées de l'ère pré-VLA, insuffisantes dès lors que les politiques sont intégrées dans des chaînes de production ou à proximité d'opérateurs humains. SafeVLA-Bench se positionne comme un outil post-hoc, applicable aux benchmarks existants sans refaire les évaluations depuis zéro. Les prochaines étapes naturelles incluent l'extension à des environnements physiques réels et l'intégration dans les pipelines de certification des systèmes cobotiques. Le projet est documenté sur safevla.org.

UESafeVLA-Bench pourrait alimenter les cadres de certification des systèmes cobotiques en Europe, notamment dans le contexte de l'AI Act qui impose des évaluations de sécurité rigoureuses pour les systèmes IA à haut risque déployés à proximité d'opérateurs humains.

RechercheOpinion
1 source