Aller au contenu principal
RecherchearXiv cs.RO 

CrossSafe : vers des filtres de sécurité latents transférables entre morphologies robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv le 25 septembre 2026 (2609.28984v1), intitulé "CrossSafe: Towards Cross-Embodiment Latent Safety Filters", propose un filtre de sécurité conditionné par la morphologie du robot et partageable entre plusieurs embodiments. La méthode applique une analyse de type Hamilton-Jacobi reachability directement dans un espace latent construit à partir d'une représentation morphology-aware du robot et de son environnement, plutôt que dans l'espace d'action brut de l'effecteur terminal qu'utilisent la plupart des modèles VLA (vision-language-action). L'approche est évaluée sur cinq embodiments de robots bimanuels et cinq tâches de manipulation, avec des contraintes d'évitement de collision portant sur l'ensemble du corps du robot. Une politique unique, entraînée conjointement sur les cinq tâches et quatre des cinq embodiments, généralise en zero-shot au cinquième embodiment laissé de côté à l'entraînement, réduisant le taux de collision par rapport à la politique nominale sans filtre; les auteurs montrent aussi que multiplier les embodiments à l'entraînement améliore cette généralisation.

Ce résultat vise un angle mort des politiques de manipulation généralistes de type VLA, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix: elles apprennent des actions dans un espace commun d'effecteur terminal sans capturer explicitement comment la sécurité dépend de la morphologie et de la cinématique propres à chaque robot, alors qu'une même action peut être sûre pour un bras et dangereuse pour un autre. Pour des intégrateurs qui déploient une même politique sur des flottes hétérogènes, cela suggère que le raisonnement de sécurité, détecter un obstacle puis décider de l'éviter, peut être mutualisé entre plateformes tout en restant conditionné à la morphologie de chacune, sans nécessiter un filtre réentraîné robot par robot. C'est un indice supplémentaire que la généralisation cross-embodiment, déjà démontrée pour les compétences de manipulation, s'étend à l'évitement de collision, un prérequis pour tout déploiement de VLA en environnement partagé avec des humains.

Le travail s'inscrit dans la recherche en apprentissage cross-embodiment et dans les méthodes de contrôle sûr par reachability Hamilton-Jacobi, historiquement coûteuses en calcul et limitées à des systèmes de faible dimension, une contrainte que l'encodage latent proposé ici cherche justement à contourner. Il s'agit à ce stade d'un article académique déposé sur arXiv, sans produit ni robot commercial nommé, et sans acteur français ou européen cité: les cinq embodiments bimanuels testés ne sont pas identifiés publiquement dans le résumé disponible. Aucun calendrier de déploiement réel ni partenariat industriel n'est communiqué; les auteurs indiquent vouloir étendre l'évaluation à davantage d'embodiments et de tâches pour confirmer la courbe de généralisation observée.

Dans nos dossiers

À lire aussi

Vers des filtres de sécurité latents généraux conditionnés par le langage
1arXiv cs.RO 

Vers des filtres de sécurité latents généraux conditionnés par le langage

Des chercheurs proposent une nouvelle approche de filtrage de sécurité pour les robots pilotés par des modèles vision-langage-action (VLA), détaillée dans un article publié le 1er août 2026 sur arXiv (2608.00315v1). Le système, baptisé filtre de sécurité latent conditionné par le langage, combine un acteur et un critique de sécurité fondés sur la théorie de Hamilton-Jacobi, tous deux conditionnés par des contraintes exprimées en langage naturel plutôt que codées en dur. Les auteurs l'ont testé sur trois tâches en environnement simulé et basé sur la vision : le pick-and-place, l'essuyage de table et l'empilement de blocs. Résultat annoncé : le filtre réduit les violations de contraintes de sécurité et parvient à transférer partiellement son comportement vers des instances de contraintes jamais vues pendant l'entraînement, à condition qu'elles appartiennent aux mêmes familles de contraintes déjà couvertes. Cette approche s'attaque à un vrai goulot d'étranglement industriel : jusqu'ici, chaque filtre de sécurité robotique devait être reconçu ou réentraîné dès que les exigences changeaient, par exemple passer d'un entrepôt à un environnement médical ou ajuster une distance de sécurité selon l'utilisateur. Pour les intégrateurs qui déploient des politiques VLA génériques capables d'exécuter des tâches variées à partir d'une simple instruction textuelle, un filtre reconfigurable par le langage éviterait un cycle de développement coûteux à chaque nouveau cas d'usage ou client. C'est un signal que le secteur cherche désormais à généraliser non seulement les capacités des robots, mais aussi les garde-fous qui les encadrent, un chantier resté à la traîne derrière les progrès spectaculaires des modèles de contrôle eux-mêmes. Le travail s'inscrit dans la lignée des filtres de sécurité par réchabilité de Hamilton-Jacobi, une méthode de contrôle formel déjà utilisée pour garantir des marges de sécurité vérifiables sur des systèmes robotiques, mais historiquement limitée à des contraintes fixes et spécifiques à une tâche. En la couplant à du conditionnement linguistique, les auteurs cherchent à suivre la tendance des VLA génériques type RT-2 ou OpenVLA, capables d'exécuter des instructions diverses avec une seule politique. L'étude reste toutefois cantonnée à des tâches de manipulation simulées et à un transfert partiel seulement sur des contraintes proches de celles déjà vues, loin d'une garantie de sécurité générale prête pour un déploiement industriel réel.

RecherchePaper
1 source
Pilotage des politiques dans l'espace latent : un cadre efficace et flexible pour le transfert entre morphologies
2arXiv cs.RO 

Pilotage des politiques dans l'espace latent : un cadre efficace et flexible pour le transfert entre morphologies

Un article déposé sur arXiv en septembre 2026 (2609.22521) présente Latent Policy Steering (LPS), un cadre destiné à réduire le coût de collecte de démonstrations pour l'apprentissage de politiques visuomotrices en robotique. Le principe repose sur une phase de pré-entraînement agnostique à l'embodiment : un modèle du monde (World Model, WM) basé sur l'image est entraîné avec du flux optique sur des données issues de plusieurs types de robots et d'humains, pour capturer la dynamique visuelle commune de la façon dont le monde réagit au mouvement. Ce WM est ensuite affiné sur l'embodiment cible avec de véritables actions robotiques, puis utilisé pour orienter la politique de base en recherchant, dans son espace latent, des plans proches des données de fine-tuning. LPS est présenté comme agnostique à la politique, donc compatible avec différents algorithmes sans nécessiter leur réentraînement. Sur les benchmarks Robomimic et en conditions réelles, les auteurs rapportent des gains relatifs de performance de 16% et 62% pour Diffusion Policy, et de 8% et 14% pour Pi0.5, obtenus avec seulement 50 démonstrations sur un embodiment cible jamais vu à l'entraînement. Ces résultats visent un point de blocage central de la robotique apprenante : les écarts d'embodiment et les espaces d'action incompatibles empêchent aujourd'hui de réutiliser directement les grands jeux de données robotiques et humains disponibles, obligeant chaque plateforme à collecter ses propres démonstrations coûteuses. Si les gains se confirment au-delà des conditions de test des auteurs, une méthode capable d'améliorer une politique existante avec seulement 50 démonstrations et sans réentraînement réduirait sensiblement le coût d'intégration pour les fabricants qui adaptent un modèle générique à un nouveau bras ou une nouvelle pince. Il s'agit toutefois d'un article de recherche non encore relu par les pairs, dont les chiffres reposent sur les évaluations propres des auteurs ; l'ampleur du gain de 62% en conditions réelles mérite d'être lue avec prudence tant qu'elle n'a pas été reproduite indépendamment. Le travail s'inscrit dans la lignée des politiques génératives comme Diffusion Policy et des modèles vision-langage-action tels que Pi0.5, utilisés ici comme bases à améliorer plutôt que comme concurrents directs. Il répond à une problématique déjà identifiée par les laboratoires travaillant sur des modèles généralistes multi-robots, où le transfert cross-embodiment reste un obstacle au passage à l'échelle malgré la multiplication des jeux de données publics. L'article ne mentionne aucun acteur industriel ni feuille de route de déploiement : LPS reste, à ce stade, une contribution méthodologique validée en simulation et sur un nombre limité de plateformes réelles, sans calendrier annoncé pour une intégration en dehors du cadre académique.

RecherchePaper
1 source
ContactFlow : un conditionnement d'action vidéo transférable entre morphologies
3arXiv cs.RO 

ContactFlow : un conditionnement d'action vidéo transférable entre morphologies

Des chercheurs présentent Contact Flow, une représentation d'action indépendante de l'embodiment destinée aux modèles du monde en robotique. Le principe consiste à encoder une manipulation via la trajectoire des points de contact 3D entre un acteur (main humaine ou pince robotique) et l'objet cible, en écartant l'apparence et la cinématique propres à chaque acteur. Ce signal sert à conditionner un modèle génératif vidéo entraîné à la fois sur des démonstrations humaines et des vidéos d'interaction robotique, produisant un modèle du monde capable de prédire des issues de manipulation physiquement plausibles. L'équipe l'intègre dans un pipeline en quatre étapes (proposer, imaginer, vérifier, agir), où chaque scénario généré est évalué par un modèle vision-langage avant exécution réelle. Les expériences s'appuient sur le jeu de données DROID ainsi que sur des tâches de manipulation de table en conditions réelles, avec un transfert démontré entre démonstrations humaines et plusieurs embodiments robotiques différents. Le papier est publié sur arXiv (2607.26579v1). Cette approche cible deux limites connues des modèles du monde vidéo actuels : leur difficulté à capturer les contraintes physiques du contact, et un conditionnement d'action généralement figé sur un embodiment précis, souvent une pince parallèle. En généralisant le signal au contact plutôt qu'à la cinématique de l'acteur, Contact Flow permet de mutualiser l'entraînement entre données humaines, bien plus abondantes et faciles à collecter, et données robotiques, un enjeu central pour les modèles VLA qui peinent encore à passer à l'échelle faute de données d'interaction physique suffisantes. Pour les laboratoires et intégrateurs, c'est un argument de plus en faveur des architectures agnostiques à l'embodiment, une piste explorée aussi par GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence. La vérification par modèle vision-langage avant action traduit également une prudence croissante face au risque d'exécuter des rollouts imaginés mais physiquement irréalistes. Les modèles du monde vidéo pour la robotique se sont multipliés depuis 2024, portés par les progrès des générateurs vidéo et la promesse de planifier des actions sans essais coûteux sur du matériel réel. La plupart restent toutefois liés à un type de préhenseur ou de robot donné, limitant le réemploi des données entre plateformes, un problème similaire à celui des modèles VLA comme Helix de Figure ou les familles Octo et RT-2. Contact Flow se positionne comme une brique de représentation plutôt qu'un produit fini : aucun déploiement industriel n'est mentionné, seulement une évaluation sur DROID et des tâches de table en laboratoire. Les suites logiques attendues sont l'extension à des manipulations plus complexes et multi-étapes, ainsi qu'un test de robustesse sur davantage de plateformes.

RecherchePaper
1 source
Apprentissage par transfert efficace des modèles dynamiques de robots grâce à la similarité morphologique
4arXiv cs.RO 

Apprentissage par transfert efficace des modèles dynamiques de robots grâce à la similarité morphologique

Une équipe de recherche présente une méthode de transfert d'apprentissage pour modéliser la dynamique de robots sous-marins souples à propulsion par nageoires, selon un article publié sur arXiv le 5 juillet 2026 (arXiv:2607.05665v1). Le problème visé : un modèle de dynamique entraîné sur un robot de grande taille (domaine source) doit être adapté à un robot plus petit (domaine cible) partageant la même morphologie mais des propriétés hydrodynamiques différentes, avec très peu de données labellisées disponibles sur ce second robot. Les chercheurs développent pour cela une approche d'adaptation de domaine fondée sur un autoencodeur, qui apprend une représentation latente partagée alignant les dynamiques des deux plateformes. Testée sur deux robots sous-marins réels, la méthode permet d'estimer avec précision les vitesses dans le référentiel du corps sur la plateforme cible, sans qu'aucune donnée labellisée ne soit nécessaire pour celle-ci. L'enjeu pratique dépasse le cas d'école : collecter des données de vérité terrain sous l'eau (via systèmes de capture de mouvement, capteurs externes) est coûteux, lent et souvent impraticable en conditions réelles de déploiement. Pouvoir réutiliser un modèle de dynamique d'un robot vers un autre, dès lors qu'ils partagent une morphologie proche, réduit drastiquement le besoin de re-calibration à chaque nouvelle plateforme ou variante d'échelle. Pour les opérateurs de flottes de robots sous-marins souples (inspection, surveillance environnementale, biomimétisme), cela ouvre la voie à un déploiement plus rapide de nouveaux engins sans campagne de collecte de données dédiée, et valide l'idée que des architectures de type autoencodeur peuvent capter des invariants dynamiques transférables entre robots morphologiquement similaires. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par transfert et l'adaptation de domaine, déjà explorées pour le sim-to-real en robotique terrestre et aérienne, mais encore peu appliquées à la robotique sous-marine souple, un domaine où la modélisation hydrodynamique reste particulièrement complexe. Les robots à nageoires bio-inspirés font l'objet d'un intérêt croissant en laboratoire pour leur efficacité énergétique et leur discrétion comparés aux propulseurs classiques à hélice. Les auteurs ne précisent pas de calendrier de validation en conditions opérationnelles, l'étude relevant pour l'instant de la preuve de concept en environnement contrôlé.

RecherchePaper
1 source