Aller au contenu principal
Sécurité prédictive calibrée pour robots hétérogènes : un cadre JEPA conditionné par l'action avec boucliers de sécurité basés modèle
RecherchearXiv cs.RO 

Sécurité prédictive calibrée pour robots hétérogènes : un cadre JEPA conditionné par l'action avec boucliers de sécurité basés modèle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2608.17496v1), intitulé « Calibrated Predictive Safety for Heterogeneous Robots », présente un pipeline de décision en cinq étapes pour des robots de types différents. Un module « proposer » génère K séquences d'actions candidates ; un modèle du monde de type JEPA (Joint-Embedding Predictive Architecture), conditionné par l'action et par l'identité du robot, simule chaque candidat dans un espace latent à encodeur figé ; deux têtes calibrées estiment ensuite le risque physique et la progression de la tâche pour chaque simulation, avec une mesure d'incertitude ; un filtre de sécurité déterministe propre à chaque robot élimine les candidats inadmissibles ; une procédure de repli prend le relais si aucun candidat ne passe le filtre. Testé selon un protocole pré-enregistré sur le benchmark de simulation LIBERO-Long, le système améliore le taux de réussite sur des lots de 600 épisodes par rapport à un filtre de sécurité utilisé seul, et réduit les faux négatifs de collision à rappel constant. Des mesures d'efficacité sur accélérateurs embarqués et de périphérie complètent l'évaluation.

Le travail cible une tension centrale du secteur : les politiques vision langage action généralisent largement mais n'offrent aucune garantie au moment de l'exécution, tandis que les planificateurs classiques respectent les contraintes cinématiques et géométriques mais généralisent mal. En couplant une prédiction de risque apprise à un filtre déterministe qui seul porte la garantie de sécurité, les chercheurs proposent une architecture où l'apprentissage améliore la performance sans jamais se substituer à la certification, un enjeu concret pour des intégrateurs devant faire cohabiter plusieurs types de robots sur un même site. L'approche illustre une conviction croissante dans l'industrie : la généralisation d'une politique apprise ne suffit pas, seule, à rendre un robot certifiable pour un déploiement réel.

Le travail reste cantonné à la simulation. Les auteurs précisent explicitement que les essais sur robot réel et un test statistique de significativité pour le reclassement hors ligne restent à mener, ce qui distingue nettement cette publication de recherche d'un système déployé ou d'un produit commercialisé. Elle s'inscrit dans un effort plus large de plusieurs laboratoires pour combiner modèles du monde appris et garanties formelles de sécurité, afin de répondre à l'écart régulièrement pointé entre les démonstrations de politiques génératives et leur fiabilité une fois embarquées sur du matériel physique. La prochaine étape annoncée consiste à valider le pipeline sur des robots physiques avant toute perspective de déploiement industriel.

Dans nos dossiers

À lire aussi

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique
1arXiv cs.RO 

JEPA-WAM : prédiction d'embeddings conjoints par étapes pour les modèles monde-action en manipulation robotique

Des chercheurs présentent JEPA-WAM (arXiv:2608.10780), qui ajoute a un World-Action Model fonde sur Motus un module Stage-JEPA, un prédicteur Joint-Embedding Predictive Architecture conditionne par objectif. L'architecture distingue un futur physique court terme, capturant l'évolution locale de la scene pour l'exécution du geste, d'un futur sémantique au niveau de l'étape, qui représente la progression de la tache d'une phase a la suivante. Stage-JEPA s'appuie sur un encodeur V-JEPA2 gelé pour extraire l'état courant a partir de l'observation et de l'instruction, puis prédit la cible latente de l'étape suivante inférée. Sur 50 taches du benchmark de simulation RoboTwin 2.0, en environnements propres et randomises, le système atteint 90,25 % de réussite globale et réduit de 5,97 % le nombre moyen d'étapes d'exécution dans les épisodes réussis par rapport a la meilleure base de comparaison testée. Ce travail cible une limite connue des politiques vision-langage-action généralistes : la plupart représentent le futur comme un court segment vidéo-action fixe, ce qui capture la dynamique locale mais ignore la progression d'une tache a plusieurs étapes. En séparant prédiction court terme et planification sémantique par étape, JEPA-WAM propose une piste pour réduire l'écart entre réactivité immédiate et raisonnement a plus long horizon, un enjeu partage par des architectures comme Pi-0, GR00T N2 ou Helix qui visent la généralisation entre taches. Le gain de 5,97 % en nombre d'étapes suggère une meilleure efficacité d'exécution sans perte de taux de réussite, un signal utile pour des intégrateurs cherchant a raccourcir les cycles, même si ces résultats restent obtenus en simulation et non en déploiement réel. L'approche s'inscrit dans la lignée des architectures Joint-Embedding Predictive popularisées par V-JEPA et V-JEPA2, des modèles du monde auto-supervises entraines sur vidéo et repris ici comme encodeur gelé plutôt que reentraine. Le choix d'un WAM fonde sur Motus situe la contribution dans la famille grandissante des modèles combinant prédiction du monde et génération d'action, en concurrence avec les approches VLA de Physical Intelligence (Pi-0), Nvidia (GR00T N2) ou Figure (Helix) ; aucun acteur européen n'apparait dans cette publication. L'article, publie sur arXiv sous la référence 2608.10780, ne fixe aucun calendrier de transfert vers des robots physiques ni de partenariat industriel, l'étape suivante habituelle pour ce type de recherche étant la validation hors simulation avant toute intégration commerciale.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
2arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source
L'AquaJEPA, des représentations prédictives multimodales conditionnées par action pour la dynamique des robots sous-marins
3arXiv cs.RO 

L'AquaJEPA, des représentations prédictives multimodales conditionnées par action pour la dynamique des robots sous-marins

AquaJEPA est un nouveau modèle prédictif conditionné par l'action, conçu pour la navigation de robots sous-marins en conditions dégradées. Le système fusionne trois sources de données, une caméra RGB, un sonar frontal et la proprioception, avec un indicateur explicite de validité de chaque capteur, puis prédit une représentation latente future à partir des commandes envoyées aux huit propulseurs du véhicule. Ces prédictions de vitesse et de profil sonar alimentent ensuite un planificateur à horizon glissant partagé. L'équipe a testé la méthode dans le simulateur Stonefish, face à cinq approches concurrentes (contrôle réactif, modèle état seul, multimodal ordinaire, dynamique supervisée, modèle du monde récurrent), avec une réplication préenregistrée sur 120 environnements croisant trois cartes d'obstacles inédites, quatre niveaux de turbidité de l'eau et des dynamiques nominales ou décalées, incluant des pertes intermittentes du DVL (loch Doppler). Résultat: sur 120 environnements inédits avec perte programmée du DVL, AquaJEPA atteint son objectif dans 74 cas, contre 68 pour le modèle état seul et pour le modèle du monde récurrent, avec l'erreur finale moyenne la plus faible (0,906 m). Les réductions d'erreur par rapport au multimodal ordinaire, à la dynamique supervisée et au modèle récurrent sont respectivement de 0,273 m, 0,364 m et 0,106 m, toutes statistiquement significatives; l'avantage sur le modèle état seul reste en revanche non tranché statistiquement. L'enjeu dépasse la simple performance en simulation: les robots sous-marins autonomes opèrent dans des conditions où la fiabilité des capteurs varie brutalement selon la turbidité, l'angle de vue ou les mouvements du véhicule, un problème classique de navigation dégradée que peu de modèles de monde traitent explicitement avec fusion multimodale conditionnée par capteur valide. Ce travail apporte une preuve empirique, avec intervalles de confiance et ablations sur la cible EMA, la marge d'action et le dropout de modalité, que l'architecture JEPA (joint-embedding prédictive architecture) tient face à des baselines établies en robotique sous-marine, un terrain où la littérature reste plus rare que pour les manipulateurs terrestres. AquaJEPA s'inscrit dans la lignée des architectures JEPA popularisées par les travaux de Yann LeCun sur l'apprentissage de représentations prédictives sans reconstruction pixel par pixel, ici adaptées à un cas d'usage robotique concret et multimodal. L'étude reste cantonnée à la simulation Stonefish; la validation en conditions réelles, en mer ou en bassin, constitue l'étape suivante logique pour confirmer que les gains observés résistent au bruit et aux dérives physiques d'un déploiement effectif.

RecherchePaper
1 source
OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples
4arXiv cs.RO 

OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples

Des chercheurs ont publié OSCAR (Omni-Embodiment Skeleton-Conditioned World Action Model), un modèle de monde vidéo conditionné par les actions, capable de généraliser à travers différentes morphologies de robots. Décrit dans un preprint arXiv (2606.04463), le système s'appuie sur deux éléments centraux : un pipeline de données à grande échelle qui agrège, filtre et déduplique des jeux de données robotiques et des séquences vidéo égocentrées humaines pour couvrir des tâches, scénarios et morphologies variés ; et un conditionnement par rendu de squelette cinématique 2D, représentation unifiée fonctionnant aussi bien pour des bras robotiques de morphologies différentes que pour des mains humaines. Le modèle de base Cosmos-Predict2.5-2B de NVIDIA a été fine-tuné sur un seul GPU GH200. OSCAR a ensuite été déployé pour évaluer des politiques de contrôle issues de RoboArena, plateforme de benchmark communautaire, et démontre une corrélation significative entre évaluations virtuelles et tests en conditions réelles. L'enjeu central est le sim-to-real gap dans l'évaluation des policies : les environnements de simulation classiques reproduisent mal la physique réelle, rendant les benchmarks peu prédictifs du comportement sur robot physique. OSCAR propose une alternative directe, générer des vidéos conditionnées par les trajectoires d'actions pour simuler l'exécution d'une politique sans déploiement matériel. Si la corrélation annoncée se confirme à plus grande échelle, cela réduirait significativement les coûts et les cycles d'itération pour les équipes développant des VLA (Vision-Language-Action models). La représentation par squelette 2D est également notable : en évitant une spécialisation par embodiment, elle adresse un blocage récurrent de la généralisation multi-robot. Le fine-tuning sur GPU unique, contre des baselines nécessitant des modèles plus grands ou davantage de ressources de calcul, améliore l'accessibilité de l'approche. Les video world models appliqués à la robotique constituent un domaine en forte compétition : UniSim, RoboDreamer et le World Model de 1X Technologies ont chacun tenté d'adresser la simulation vidéo pour l'entraînement ou l'évaluation de robots, avec des résultats limités en diversité de scénarios ou en généralisation inter-embodiment. Le recours au modèle Cosmos de NVIDIA comme base pré-entraînée positionne OSCAR dans l'écosystème robotique croissant de NVIDIA, qui comprend Isaac Lab et GR00T. Les auteurs ouvrent explicitement la perspective d'une évaluation purement virtuelle des politiques robots, une proposition qui intéresse directement les intégrateurs cherchant à réduire les cycles de test hardware. Les étapes naturelles seraient la validation sur des morphologies plus variées, des tâches de manipulation complexes, et un passage à l'échelle vers des configurations multi-GPU.

RechercheOpinion
1 source