Aller au contenu principal
RecherchearXiv cs.RO 

Filtrage de sécurité multi-liens pour les politiques VLA autour d'obstacles mobiles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une politique vision-langage-action (VLA) peut mener à bien une tâche de manipulation tout en renversant des objets sans rapport avec elle, si bien que le taux de réussite seul ne dit rien de la sécurité en environnement encombré. Une équipe publiant sur arXiv propose un « bouclier » sans entraînement, qui s'ajoute à une politique VLA préentraînée sans la réentraîner. Il protège le gripper, le poignet et l'avant-bras avec cinq ellipsoïdes, et filtre chaque mouvement commandé par un seul programme de barrière, face à un ellipsoïde d'exclusion ajusté à partir d'une image RGB-D au reset. Un flux optique épars déplace ensuite le centre de cet ellipsoïde avec le danger, sans nouvelle détection ni nouvel ajustement. Sur six conditions simulées de mouvement du danger, la collision passe de 65,62 % à 27,27 % et le « safe-success » (tâche accomplie sans collision) de 29,35 % à 50,43 %. Sur matériel embarqué hétérogène, la barrière à cinq ellipsoïdes tourne sur CPU en 2,2 ms au 99e centile. L'élagage du préfixe vision-langage et la réduction des étapes de flow matching ramènent chaque appel à la politique π0.5 de 343 à 177,3 ms sur GPU intégré. Sur un bras physique SO-101, quatre tâches : le bras a touché le danger dans 3 épisodes protégés sur 16, contre 11 sur 16 sans bouclier.

L'intérêt tient à ce que ce travail s'attaque à un angle mort de l'évaluation des VLA : les benchmarks mesurent la complétion de tâche, pas les dégâts collatéraux, et un taux de réussite élevé peut masquer un comportement inacceptable dans un atelier ou une cuisine réels. Le résultat montre aussi qu'une couche de sécurité peut s'ajouter à un modèle figé, ce qui évite de reprendre un entraînement coûteux, et qu'elle tient dans le budget de calcul d'un système embarqué. Les ablations indiquent que protéger uniquement l'effecteur final est insuffisant, et que le suivi du danger récupère l'essentiel de la protection perdue quand son estimation reste figée au reset. Pour un intégrateur, c'est un argument concret en faveur de filtres de sécurité modulaires plutôt que d'une sécurité « apprise » dans la politique.

Il faut toutefois relativiser. Une collision résiduelle de 27 % en simulation reste élevée pour un déploiement industriel, et l'essai réel ne porte que sur 16 épisodes par condition, un échantillon trop mince pour une conclusion statistique ferme. Le danger y est modélisé par un seul ellipsoïde, ce qui limite la portée face à des obstacles multiples ou déformables. Ces résultats s'inscrivent dans la lignée des fonctions de barrière de contrôle (CBF) appliquées à la manipulation, désormais greffées sur des politiques génératives comme π0.5 de Physical Intelligence. Le SO-101, bras open source à bas coût issu de l'écosystème LeRobot de Hugging Face, rend l'approche reproductible par de petites équipes. La suite logique serait une validation sur des bras industriels et des obstacles multiples, sans calendrier annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
1arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
Actions vision-langage sécurisées par Poisson pour la sécurité corporelle complète des politiques apprises
2arXiv cs.RO 

Actions vision-langage sécurisées par Poisson pour la sécurité corporelle complète des politiques apprises

Une équipe de recherche en robotique a publié en septembre 2026 sur arXiv un article décrivant VLPSA (Vision-Language-Poisson-Safe Actions), un filtre de sécurité destiné aux politiques Vision-Language-Action (VLA) qui ne garantissent aujourd'hui aucune évitement de collision fiable, en particulier hors des distributions d'entraînement. Le système synthétise en ligne, à partir des données de perception, des fonctions de sécurité de Poisson (PSF), converties en fonction barrière de contrôle (CBF) appliquée via un filtre CBF-QP sur l'ensemble du corps du robot et sur tout objet saisi, traité comme une extension du dernier lien articulaire. Pour tenir le temps réel tout en gardant une résolution spatiale fine dans les zones critiques de la tâche, VLPSA combine deux résolutions de cette PSF grâce à des compositions booléennes de CBF. Testé sur le benchmark SafeLIBERO face à plusieurs méthodes de filtrage de sécurité existantes, VLPSA obtient le meilleur taux d'évitement de collision du lot: il fait passer ce taux de 23,1% pour la politique de base pi-0.5 à 91,2%, tout en dépassant le taux de réussite des tâches de cette même politique de base. Le système a aussi été déployé sur un bras robotique Franka FR3 dans des scènes encombrées avec obstacles dynamiques et interférence humaine. L'intérêt principal tient au fait que VLPSA agit comme une surcouche de sécurité sans nécessiter de réentraînement de la politique VLA sous-jacente, un point sensible pour les intégrateurs qui déploient des modèles génériques de manipulation dans des environnements industriels non contrôlés. Le résultat contredit l'hypothèse selon laquelle renforcer la sécurité dégraderait mécaniquement la performance de la tâche: ici, sécurité et taux de réussite progressent simultanément. Cela apporte une réponse concrète à un angle mort connu des modèles VLA génériques, souvent démontrés dans des environnements scénarisés mais fragiles face à des obstacles imprévus ou des humains dans la boucle. Le travail s'inscrit dans la lignée des recherches sur les politiques VLA génériques de manipulation, dont pi-0.5 sert ici de politique de référence, et dans le champ plus large des fonctions barrière de contrôle appliquées à la robotique de sécurité. Les auteurs comparent VLPSA à d'autres baselines de filtrage de sécurité sans les nommer précisément dans le résumé, et les prochaines étapes annoncées concernent l'extension des déploiements réels au-delà du Franka FR3 testé.

RecherchePaper
1 source
Évitement réactif d'obstacles sans apprentissage préalable pour les politiques génératives de robots
3arXiv cs.RO 

Évitement réactif d'obstacles sans apprentissage préalable pour les politiques génératives de robots

Des chercheurs proposent NUDGE (Nudge Update via Differentiable GEometry), une méthode d'évitement d'obstacles qui ne demande aucun réentraînement. Elle s'ajoute à toute politique robotique générative fondée sur la diffusion ou le flow matching, y compris les diffusion policies et les modèles vision-langage-action (VLA). À l'inférence, elle injecte dans la politique les gradients d'un champ de distance signée (SDF), une fonction qui donne la distance de chaque point à l'obstacle le plus proche, pour écarter la trajectoire générée des obstacles. Elle accepte les paramétrisations d'action usuelles (poses articulaires absolues ou relatives, poses de l'effecteur) grâce à un décodeur de trajectoire articulaire différentiable. Les auteurs affirment que la distribution de tâche de la politique est préservée et que le calcul tourne en temps réel. Il s'agit d'un preprint arXiv (version 2), et le résumé ne donne ni taux de succès, ni temps de calcul, ni liste de robots testés. Le point important est que l'évitement d'obstacles n'exige plus de redémonstrations ni de fine-tuning. Les politiques imitées sont bonnes sur la tâche mais mal armées face à un objet imprévu, surtout dans une cellule partagée avec des opérateurs. Si le procédé tient hors laboratoire, un intégrateur pourrait ajouter une couche de sécurité géométrique à une politique existante sans toucher à ses poids. Reste à vérifier la robustesse face aux obstacles dynamiques, la qualité du SDF fourni par la perception, et le compromis entre évitement et réussite de la tâche. Cette approche prolonge les techniques de guidage par gradient issues des modèles de diffusion, appliquées à un domaine où les VLA à flow matching, comme Pi-0, se multiplient sans garantie de collision. Elle concurrence les filtres de sécurité et les planificateurs de mouvement classiques, plus prévisibles mais moins intégrés à la politique. Aucune démonstration industrielle ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)
4arXiv cs.RO 

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)

Une équipe de chercheurs publie BOKBO (Best of K Bad Options), décrit comme la première couche d'abstention conforme pour l'inférence VLA à K échantillons. Le problème adressé est précis : les méthodes de scaling à l'inférence telles que RoboMonkey, SEAL, MG-Select et V-GPS génèrent K chunks d'actions candidates et exécutent celle validée comme la meilleure par un vérificateur. Mais lorsque les K candidates sont toutes non sûres, le système en exécute une sans aucun avertissement. BOKBO s'interpose en amont pour garantir, sans hypothèse sur la distribution des données, un taux maximal de violations exécutées. Deux variantes sont proposées : une globale et une par tâche dite Mondrian, cette dernière étant plus robuste sur les tâches les plus difficiles. Évalué sur le benchmark LIBERO avec OpenVLA-OFT à un seuil de risque ε=0,05, le bound conditionnel CRC tient sur 86% des splits bootstrap, avec une couverture de 78% et un taux de réussite nette de 70%. La variante Mondrian-BOKBO relève la fraction minimale de tenue conditionnelle par tâche de 0,71 à 0,93, sur 5 graines d'entraînement. Le résultat le plus saillant n'est pas la méthode elle-même mais l'échec structurel qu'elle expose. Les scores de non-conformité internes aux politiques VLA, utilisés comme proxies de sécurité dans les approches existantes, corrèlent à 0,98 avec l'hyperparamètre de bruit d'action σ, et pratiquement pas avec les violations réelles. Autrement dit, les filtres de sécurité actuels mesurent un réglage de bruit, non un risque réel. Pour les intégrateurs industriels et les équipes d'homologation, c'est un signal d'alarme : les garanties de sécurité des pipelines VLA déployés en production reposent peut-être sur un proxy invalide. Les auteurs montrent que l'échec est partiellement atténué avec un sampling stochastique au niveau des tokens plutôt que perturbation-based, mais le problème reste mécanisme-spécifique. Ils corrigent aussi un biais méthodologique courant : des seuils de force fixés globalement bien en dessous des forces typiques d'un expert humain gonflent artificiellement les taux de violation jusqu'à un facteur 5. Sur le plan du contexte, les VLA comme OpenVLA-OFT et π₀-FAST, testés tous deux dans l'étude, incarnent la convergence entre foundation models et contrôle robotique temps réel. Le benchmark LIBERO, utilisé comme terrain d'évaluation, est devenu une référence dans l'espace manipulation. BOKBO s'inscrit dans la théorie de la prédiction conforme, appliquée ici pour la première fois à l'abstention calibrée dans ce contexte. Les prochaines étapes logiques seraient une validation sur des environnements réels et des tâches hors distribution plus sévères, LIBERO restant un benchmark simulé aux distributions relativement contrôlées. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade.

UELes équipes d'homologation et intégrateurs industriels européens déployant des pipelines VLA en production devraient auditer leurs mécanismes de sécurité : cette étude montre que les scores de non-conformité utilisés comme proxies de sécurité mesurent un réglage de bruit, pas un risque réel.

RechercheActu
1 source