Aller au contenu principal

Dossier arXiv cs.RO

3904 articles

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
1arXiv cs.RO RechercheActu

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

1 source
Planification sur des cartes différentiables de variétés à contraintes avec des solveurs IK généraux
2arXiv cs.RO 

Planification sur des cartes différentiables de variétés à contraintes avec des solveurs IK généraux

Des chercheurs présentent une nouvelle méthode pour planifier des trajectoires de bras robotiques manipulateurs soumis à des contraintes cinématiques d'égalité, un problème qui restreint les mouvements possibles à un sous-espace de mesure nulle dans l'espace des configurations. L'approche s'appuie sur des solveurs de cinématique inverse (IK) génériques comme IKFast, largement utilisés dans l'industrie mais dont les sorties ne sont normalement pas différentiables, ce qui les rend inutilisables pour l'optimisation de trajectoire par gradient. Les auteurs utilisent le théorème de la fonction inverse pour reconstruire les gradients recherchés à partir du jacobien de cinématique directe classique, une opération standard et déjà différentiable. Ils ajoutent aussi une extension de domaine par moindres carrés et une formulation de la contrainte d'accessibilité compatible avec l'optimisation, qui conserve un signal de gradient exploitable même en dehors de l'espace de travail atteignable. La méthode a été validée par des expériences numériques et une démonstration matérielle sur un bras RB-Y1, qui a saisi une boîte et l'a déposée sur une table. L'intérêt pratique est de rendre différentiables des solveurs IK automatisés déjà déployés massivement dans l'industrie, sans réécrire à la main des fonctions IK analytiques sur mesure pour chaque robot, une tâche coûteuse réservée jusqu'ici à des cas particuliers. Pour les intégrateurs et ingénieurs en robotique, cela signifie pouvoir brancher l'optimisation de trajectoire par gradient sur des chaînes d'outils IK existantes plutôt que de dépendre d'implémentations bespoke. Cela s'inscrit dans une tendance plus large de rapprochement entre planification classique basée sur des contraintes géométriques et optimisation différentiable, sans recourir à l'apprentissage profond ni aux modèles vision-langage-action (VLA) type Pi-0 ou GR00T N2. La démonstration reste toutefois limitée à une seule tâche de prise-dépose sur un unique bras, ce qui en fait une preuve de concept plutôt qu'un résultat généralisable à grande échelle. Le travail s'inscrit dans la littérature sur la planification sous variétés de contraintes, où paramétrer l'espace des configurations faisables via la cinématique inverse analytique est une stratégie reconnue, mais jusqu'ici limitée par le manque de différentiabilité des solveurs automatisés génériques. Publié le 10 septembre 2026 sur arXiv, l'article ne précise pas les auteurs ni leur affiliation dans le résumé fourni, mais met à disposition un site de projet dédié pour la reproduction des résultats. Aucun acteur français ou européen n'est mentionné dans cette publication.

RecherchePaper
1 source
CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
3arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source
HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle
4arXiv cs.RO 

HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle

Publié le 10 septembre 2026 sur arXiv (2609.10706), HuRo est un pipeline qui transforme des vidéos humaines hétérogènes en données d'entraînement pour des politiques vision-langage-action (VLA), en réalignant observations et trajectoires d'action sur la morphologie d'un robot et en reconstruisant les signaux intermédiaires absents des vidéos brutes. À partir de cinq sources de vidéos humaines, les auteurs ont constitué le jeu de données HuRo : environ 630 000 épisodes robotisés et 142 millions de frames traitées. Sur quatre tâches réelles de manipulation, ce pré-entraînement fait passer le taux de réussite global de 51,5% à 80,3% avec l'augmentation du volume de données, et le taux de réussite hors distribution, sous des variations spatiales et visuelles inédites, de 34,9% à 72,2%. Code et données sont publiés sur le site du projet. Le résultat cible un goulot d'étranglement connu du secteur : la collecte de données réelles par téléopération coûte cher et ne passe pas à l'échelle, alors que les vidéos humaines abondent sur internet. En montrant que la robotisation systématique de ces vidéos améliore les performances de façon quasi monotone avec le volume, HuRo apporte une preuve empirique qu'une loi d'échelle s'applique aussi à ce type de pré-entraînement, un point jusqu'ici débattu dans la communauté VLA. Le gain de robustesse hors distribution, plus marqué que le gain en distribution, répond directement à la critique récurrente faite aux démonstrations de robots humanoïdes, qui échouent souvent dès que l'éclairage ou la position d'un objet change. Les auteurs montrent aussi qu'un pré-entraînement de bout en bout avec des actions retargetées surpasse un simple transfert visuel, nuançant l'idée que la vision seule suffirait à combler l'écart d'incarnation entre humain et robot. Le problème n'est pas nouveau : les approches précédentes robotisaient des vidéos humaines soit dans des contextes déjà appariés à une tâche précise, soit en traitant séparément, à grande échelle, l'alignement des observations et celui des actions. HuRo comble ce vide en unifiant robotisation visuelle et retargeting d'action sur cinq sources vidéo hétérogènes, s'inscrivant dans un mouvement plus large de la recherche en robotique visant à réduire la dépendance des politiques VLA à la téléopération réelle. Aucun partenariat industriel ni déploiement sur du matériel commercial n'est mentionné à ce stade : il s'agit d'un travail de recherche publié en preprint, code et données ouverts, sans calendrier annoncé de transfert vers un produit ou un robot physique précis.

IA physiqueActu
1 source
DCReg : caractérisation découplée pour un recalage LiDAR dégénéré efficace
5arXiv cs.RO 

DCReg : caractérisation découplée pour un recalage LiDAR dégénéré efficace

Une équipe de chercheurs a publié la troisième révision de son article sur arXiv (2509.06285), présentant DCReg (Decoupled Characterization for Ill-conditioned Registration), une méthode de stabilisation du recalage de nuages de points LiDAR dans les environnements géométriquement dégénérés comme les couloirs, où certains mouvements restent trop faiblement contraints pour garantir une solution fiable. La méthode décompose la matrice hessienne par complément de Schur pour séparer le problème à 6 degrés de liberté (DoF) en sous-espaces de rotation et translation à 3 DoF, relie chaque valeur propre à une direction physique de mouvement, puis applique un préconditionneur structuré qui écrête les valeurs propres faibles sans modifier l'objectif de moindres carrés original, optimisé par gradient conjugué préconditionné à paramètre unique. Résultat: 20 à 50% de précision de localisation en plus sur de longues durées et des accélérations de 5 à 30 fois (jusqu'à 116 fois) face aux méthodes de référence sensibles à la dégénérescence; le code est publié sur GitHub, dépôt JokerJohn/DCReg. Le sujet touche un point sensible pour les intégrateurs robotiques: les méthodes existantes de type détection puis mitigation peinent à repérer et corriger la dégénérescence sans corrompre l'optimisation, d'où des dérives de trajectoire dans les tunnels, mines ou entrepôts aux allées étroites où opèrent des robots mobiles autonomes. En confinant la correction au seul préconditionneur plutôt qu'en modifiant le problème original, DCReg évite l'arbitrage habituel entre stabilité numérique et fidélité de la solution, un compromis qui limite la fiabilité des piles SLAM en déploiement réel au-delà des démonstrations contrôlées. Pour les intégrateurs de robots mobiles ou humanoïdes en environnements sans GPS, elle réduit l'écart entre démonstration et fiabilité en usage prolongé. DCReg s'inscrit dans un courant de recherche actif sur la détection de dégénérescence en SLAM LiDAR, qui cherche à dépasser les limites des analyses classiques par valeurs propres de la hessienne, jugées peu fiables en environnement complexe. Cette troisième révision de l'article suggère un travail de validation prolongé. Contrairement à une annonce produit, il s'agit d'une contribution académique ouverte dont le code est publié sur GitHub pour que la communauté robotique puisse le tester. Le résumé ne précise ni les plateformes ni les capteurs utilisés pour les comparaisons, une limite avant toute extrapolation à un déploiement industriel.

RecherchePaper
1 source
Aucun contrôleur gratuit : un état des lieux des vérificateurs pour politiques robotiques
6arXiv cs.RO 

Aucun contrôleur gratuit : un état des lieux des vérificateurs pour politiques robotiques

Un article de recherche publié sur arXiv le 9 septembre 2026 (référence 2609.09250v1) propose la première synthèse systématique des "verifiers", ces systèmes qui évaluent la qualité d'un comportement exécuté par une politique robotique et lui attribuent un score, utilisé aussi bien pour juger les politiques vision-langage-action (VLA) que pour les entraîner. Les auteurs recensent environ 150 verifiers existants dans la littérature et les comparent selon deux axes. Le premier, la disponibilité, mesure le coût d'un verdict, la rapidité avec laquelle il arrive pendant une exécution, et la fréquence à laquelle on peut le solliciter. Le second, la crédibilité, mesure ce qu'un score élevé indique réellement sur la réussite de la tâche, et diminue à mesure que le jugement devient manipulable ou auto-complaisant. L'étude classe ces verifiers en quatre familles selon la source du jugement : les évaluateurs humains, les vérificateurs à base de règles ou de logique formelle, les modèles appris ou pré-entraînés, et les mécanismes intrinsèques au modèle lui-même. Le constat central, valable pour les quatre familles sans exception, est que la crédibilité chute à mesure que la disponibilité augmente : aucun vérifier ne combine gratuitement rapidité, faible coût et fiabilité du jugement. Pour les équipes qui entraînent des politiques VLA par apprentissage par renforcement ou qui certifient des comportements robotiques avant déploiement, cela signifie que les métriques les moins chères à obtenir, souvent celles utilisées pour accélérer l'itération, sont aussi les plus exposées au reward hacking, où le modèle apprend à tromper le score sans réellement accomplir la tâche. Les auteurs proposent neuf métriques permettant de rendre vérifiable toute affirmation sur la qualité d'un vérifier, un outil utile pour les intégrateurs qui doivent comparer des politiques robotiques sans pouvoir se fier aux seules démonstrations vidéo des fournisseurs. Ce travail s'inscrit dans le contexte d'une industrie robotique qui multiplie les annonces de politiques VLA génériques entraînées sur des données massives, où l'écart entre démonstration filmée et performance réelle en usine reste une préoccupation majeure pour les décideurs B2B. En proposant trois critères de validation déjà présents dans la littérature (accord avec des annotations humaines, performance de la politique entraînée, comportement face au reward hacking), l'étude fournit une grille de lecture pour distinguer les évaluations rigoureuses des simples arguments marketing, et esquisse les verifiers restant à concevoir pour combler les angles morts actuels.

UEAucun acteur ni déploiement franco-européen n'est cité, mais le cadre d'évaluation proposé peut aider les intégrateurs industriels européens à juger les politiques VLA de leurs fournisseurs sans se fier aux seules démonstrations.

RecherchePaper
1 source
FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables
7arXiv cs.RO 

FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables

FolDeX, benchmark présenté dans un article arXiv publié le 10 septembre 2026, évalue la manipulation robotique longue durée d'objets déformables à partir de données collectées exclusivement sur robots réels, avec le pliage de vêtements comme tâche principale. Le jeu de données compte plus de 2000 heures d'expérience physique, plus de 20 tâches et plus de 10 types de robots différents. Il s'organise autour de quatre axes : réutilisation des interventions humaines et des récupérations effectuées en déploiement, transfert de données entre tâches (du rigide au déformable, entre catégories de vêtements), réutilisation entre scènes avec éclairage, arrière-plan et agencement variables, et transfert entre plateformes robotiques. Une plateforme d'évaluation publique, hébergée sur ai.midea.com/#/fold-challenge par le groupe chinois Midea, permet de soumettre des politiques externes selon un protocole standardisé, avec objets tenus à l'écart de l'entraînement et initialisations contrôlées. Le projet cible l'écart bien connu entre simulation et monde réel dans l'IA incarnée : les modèles vision-langage-action et monde-action qui réussissent en simulation se dégradent souvent sur robot physique, en particulier sur des séquences longues et bimanuelles exigeant un suivi continu de l'état de l'objet. Les benchmarks existants couvrent surtout des tâches courtes sur objets rigides, laissant un vide pour juger la fiabilité réelle des politiques généralistes à grande échelle. En imposant un protocole externe avec objets et initialisations non divulgués à l'avance, FolDeX limite le risque de démonstrations sélectionnées, fréquentes dans les annonces du secteur humanoïde, et donne aux intégrateurs un moyen concret de vérifier si la manipulation fine tient hors des vidéos contrôlées. FolDeX s'inscrit dans la course actuelle à l'IA incarnée généraliste, aux côtés d'approches comme Figure 03 et Helix chez Figure AI, Optimus Gen 3 chez Tesla, la famille Pi-0 chez Physical Intelligence ou GR00T N2 chez Nvidia. Contrairement à ces annonces produits, il s'agit d'un outil de recherche ouvert, non d'un robot ou d'un modèle commercial livré. Son hébergement par Midea, groupe chinois de l'électroménager également actionnaire majoritaire de l'allemand Kuka dans la robotique industrielle, traduit l'intérêt croissant des fabricants asiatiques pour la manipulation d'objets souples, un enjeu clé pour le textile ou la logistique. La plateforme est déjà accessible pour des soumissions externes, sans calendrier de résultats ni classement encore communiqué.

UELe fabricant allemand Kuka, actionnaire majoritaire détenu par Midea, est indirectement associe a cette initiative qui pourrait intéresser les intégrateurs européens de robotique industrielle pour le textile et la logistique.

RecherchePaper
1 source
Un cadre de fusion multimodale sensible à la confiance pour la collaboration humain-robot industrielle
8arXiv cs.RO 

Un cadre de fusion multimodale sensible à la confiance pour la collaboration humain-robot industrielle

Une équipe de recherche présente CAMF (Confidence-Aware Multimodal Fusion), un système de fusion multimodale conçu pour prédire l'intention humaine dans la collaboration homme-robot industrielle, décrit dans un article publié le 10 septembre 2026 sur arXiv (2609.10339v1). Le framework combine quatre types de signaux hétérogènes: la pose 6D des objets manipulés, le regard de l'opérateur, le mouvement squelettique et le mouvement de la main mesuré par capteur IMU. Un mécanisme de fusion dynamique piloté par la tendance de confiance est intégré à un réseau BiLSTM pour pondérer en temps réel la fiabilité de chaque modalité, complété par une stratégie d'apprentissage équilibré et un mécanisme de gel de confiance qui limite le bruit des capteurs de mauvaise qualité. Les auteurs ont validé l'approche sur une plateforme physique construite autour du bras collaboratif UR3 d'Universal Robots (Danemark), obtenant un taux de reconnaissance d'intention de 91,86%, supérieur selon eux aux approches de fusion multimodale existantes en précision comme en stabilité, y compris en conditions de faible luminosité ou d'occlusion partielle. Pour l'industrie de la cobotique, ce travail illustre une tendance de fond: la fiabilité de la perception d'intention, plus que la robotique elle-même, conditionne l'adoption des cellules homme-robot collaboratives en assemblage. La capacité à pondérer dynamiquement des capteurs peu coûteux (caméra, IMU) plutôt que de dépendre d'un seul flux répond directement au problème classique de dégradation en environnement réel, un des points faibles régulièrement pointés dans les démonstrations de cobotique. Le chiffre de 91,86% reste toutefois une mesure obtenue sur un banc d'essai contrôlé, sans détail public sur la taille du jeu de test ni sur les tâches couvertes au-delà de l'assemblage, ce qui appelle prudence avant extrapolation à des lignes de production réelles. Ce travail s'inscrit dans la lignée des recherches académiques sur la fusion de capteurs pour la cobotique, un domaine où les architectures purement visuelles ou purement inertielles montrent des limites en environnement industriel bruité. Aucune date de transfert industriel ni partenariat constructeur n'est annoncée à ce stade; il s'agit d'une publication de recherche, non d'un produit commercialisé.

UELe système CAMF est valide sur un bras collaboratif UR3 du fabricant danois Universal Robots, mais reste un travail de recherche académique sans déploiement industriel ni partenariat constructeur annonce en France ou en UE.

RecherchePaper
1 source
Pilotage de politique par proxy
9arXiv cs.RO 

Pilotage de politique par proxy

Les chercheurs à l'origine de l'article "Proxy Policy Steering" présentent une méthode d'adaptation à l'inférence pour les politiques robotiques généralistes, publiée sur arXiv (arXiv:2609.09148v2). La technique, baptisée PPS, entraîne deux petites politiques proxy en parallèle d'un modèle de base gelé : une "proxy de référence" reproduit le comportement du modèle de base sur les observations de la tâche cible, tandis qu'une "proxy de tâche", initialisée à partir de la première, capture comment ce comportement évolue sous supervision spécifique à la tâche. La différence calibrée entre ces deux proxys, dans l'espace des vitesses, vient orienter le processus de débruitage du modèle de base à chaque étape, sans jamais modifier ses paramètres. Testée sur 8 tâches de manipulation en conditions réelles et 4 en simulation, PPS améliore le taux de réussite du modèle pi-0.5, considéré comme référence actuelle du secteur, de 53 points de pourcentage en moyenne, avec des gains sur des tâches que ce modèle échouait systématiquement auparavant. Cette approche répond à un problème central pour l'industrie robotique : comment spécialiser un modèle généraliste entraîné sur des données massives à une nouvelle tâche, avec peu de démonstrations, sans dégrader ses capacités générales ni nécessiter un réentraînement complet. Contrairement au fine-tuning LoRA, aux politiques résiduelles ou aux spécialistes entraînés from scratch, PPS ne touche pas aux poids du modèle de base et ne requiert que ses prédictions de vitesse en sortie, ce qui la rend applicable même sans accès à ses paramètres internes, un atout pour des intégrateurs qui déploieraient des modèles propriétaires fermés. Le maintien des comportements de récupération après échec, jamais démontrés explicitement dans les données de spécialisation, illustre que la méthode préserve les priors larges du modèle plutôt que de les écraser, un problème récurrent des méthodes d'adaptation classiques. Le travail s'inscrit dans la lignée des modèles vision-langage-action (VLA) génériques comme pi-0 et sa version 0.5, GR00T N2 de NVIDIA ou Helix de Figure, tous confrontés au même goulot d'étranglement du déploiement : la généralisation en démonstration ne garantit pas la performance sur une tâche industrielle précise. PPS se positionne comme alternative aux méthodes de steering à l'inférence existantes et au fine-tuning paramétrique, en comparant ses résultats empiriquement contre ces baselines. L'article ne précise pas de partenaire industriel, de calendrier de déploiement ni de coût de licence associé, ce qui situe la contribution au stade de recherche méthodologique plutôt que de produit prêt à l'intégration.

IA physiqueActu
1 source
Curriculums de dynamique des actionneurs pour tâches à viabilité étroite dans l'apprentissage des robots à pattes
10arXiv cs.RO 

Curriculums de dynamique des actionneurs pour tâches à viabilité étroite dans l'apprentissage des robots à pattes

Boston Dynamics Spot, le robot quadrupède commercial, a servi de plateforme matérielle à une nouvelle méthode d'apprentissage par renforcement baptisée "Actuator Dynamics Curriculum", décrite dans un article publié sur arXiv (référence 2609.09492v1). La méthode consiste à initialiser la rigidité des articulations à une valeur artificiellement élevée, puis à la réduire progressivement vers la valeur réelle mesurée sur le système à mesure que les épisodes d'entraînement durent plus longtemps. Testée d'abord sur un pendule inversé sur chariot comme cas d'école, elle a ensuite été appliquée à une tâche bien plus exigeante : faire passer Spot d'une position de marche à un appui vertical sur ses seules pattes avant, pattes arrière dressées façon poirier. Avec la rigidité fixée à sa valeur réelle identifiée, l'entraînement standard plafonne sur une politique qui ne termine jamais la transition. Avec le curriculum proposé, la politique entraînée réussit le mouvement en simulation sur 10 graines aléatoires différentes et se transfère avec succès sur le robot physique. Le résultat cible un problème précis et non résolu du RL en robotique : certaines tâches échouent à converger non pas faute de signal de récompense, mais parce que presque toutes les trajectoires explorées se terminent par un échec avant de produire un gradient exploitable. En montrant qu'augmenter la fréquence naturelle des articulations en boucle fermée élargit le "noyau de viabilité" du problème de décision markovien sous-jacent, c'est-à-dire la part des états de départ depuis lesquels la tâche reste faisable, les auteurs ouvrent un axe de curriculum orthogonal aux approches classiques comme le domain randomization ou le reward shaping. Pour les équipes qui entraînent quadrupèdes et humanoïdes à des mouvements dynamiques extrêmes, cela offre un levier supplémentaire sur des tâches jusqu'ici jugées hors de portée du RL standard, sans toucher au matériel ni à la fonction de récompense. Ce travail s'inscrit dans la recherche académique en sim-to-real pour la locomotion, où Spot sert de banc d'essai matériel largement utilisé par les laboratoires, sans qu'il s'agisse d'une annonce produit de Boston Dynamics. La validation reste circonscrite à une seule tâche de transfert matériel et à un nombre limité de graines, sans données publiées sur le taux de réussite en conditions réelles variées. Les auteurs présentent leur méthode comme généralisable à toute tâche où l'exploration est bloquée par des conditions de terminaison précoces plutôt que par un signal de récompense insuffisant, ouvrant la voie à d'autres transitions dynamiques difficiles pour robots à pattes.

RecherchePaper
1 source
Apprentissage d'une locomotion humanoïde adaptée au terrain sur sol granulaire
11arXiv cs.RO 

Apprentissage d'une locomotion humanoïde adaptée au terrain sur sol granulaire

Un article publié sur arXiv (identifiant 2609.10286, soumis en septembre 2026) présente une méthode pour faire marcher des robots humanoïdes sur des terrains granulaires (sable, gravats basaltiques) en s'appuyant sur un modèle de contact physique baptisé 3D RFT (three-dimensional resistive force theory). Contrairement aux modèles de contact rigides ou aux modèles granulaires simplifiés qui reposent sur des heuristiques pour la composante tangentielle, ce solveur reproduit fidèlement la pénétration du pied dans le sol meuble et la traînée tangentielle qui en résulte. Les chercheurs entraînent ensuite un contrôleur de locomotion adaptatif par apprentissage par renforcement en configuration "teacher-student", où un autoencodeur variationnel (VAE) compresse les caractéristiques du terrain en une représentation latente compacte permettant une identification et une adaptation en zero-shot. Les simulations, menées avec la méthode des points matériels (MPM) sur le moteur physique NVIDIA Newton, montrent un taux de réussite nettement supérieur aux méthodes de référence sur des terrains granulaires jamais vus. La validation s'étend à des essais matériels réels sur basalte, sable sec et sable de plage. L'enjeu dépasse la simple prouesse académique : la marche sur sol meuble reste un angle mort connu des humanoïdes, dont les politiques de contrôle sont généralement entraînées sur des sols rigides et échouent lorsque le pied s'enfonce de façon imprévisible. En démontrant un transfert simulation vers réel fiable sur granulats, ce travail répond directement à une limite critique pour tout déploiement hors environnement d'usine parfaitement plat, chantiers, carrières, zones côtières ou terrains de secours, où les modèles de contact rigide échouent typiquement. Les auteurs revendiquent la première démonstration de locomotion humanoïde agile sur terrain granulaire réel, un signal utile pour les intégrateurs évaluant la robustesse réelle des plateformes VLA et RL au-delà des sols de laboratoire. Le travail s'inscrit dans la lignée des recherches en RFT appliquées à la locomotion sur sable, jusqu'ici surtout testées sur robots à pattes plus simples ou petits systèmes bio-inspirés, et profite des avancées récentes en simulation physique haute fidélité (MPM, moteur Newton de NVIDIA) pour rendre l'entraînement RL exploitable à l'échelle humanoïde. Les auteurs mettent à disposition une page de projet dédiée avec démonstrations vidéo, sans toutefois préciser de calendrier de déploiement industriel au-delà de la validation expérimentale publiée.

RecherchePaper
1 source
Vers un pont entre simulation et réalité : transfert simulation-réel systématique pour divers robots à pattes
12arXiv cs.RO 

Vers un pont entre simulation et réalité : transfert simulation-réel systématique pour divers robots à pattes

Des chercheurs publient sur arXiv (2509.06342v2, version révisée) un nouveau cadre combinant apprentissage par renforcement sim-to-real et modèle énergétique physique pour moteurs synchrones à aimants permanents, les actionneurs les plus courants sur les robots à pattes. La méthode ne nécessite qu'un jeu minimal de paramètres pour capturer l'écart entre simulation et réalité, et repose sur une fonction de récompense compacte à quatre termes intégrant une formulation de pertes énergétiques fondée sur les premiers principes, équilibrant dissipation électrique et mécanique. L'équipe valide son approche par une identification dynamique ascendante, des actionneurs individuels aux trajectoires complètes en l'air puis à la locomotion au sol. Le cadre est testé sur trois plateformes principales et déployé sur dix robots supplémentaires, soit treize systèmes au total, avec un transfert de politique fiable obtenu sans randomisation des paramètres dynamiques. Résultat clé : une réduction de 32% du coût de transport (Cost of Transport) du quadrupède ANYmal, ramené à une valeur de 1,27. Code, modèles et jeux de données sont publiés en accès libre. Ce travail s'attaque à deux limites récurrentes de la robotique à pattes entraînée en simulation : le transfert peu fiable vers le matériel réel, et la négligence quasi systématique des pertes énergétiques spécifiques aux actionneurs dans les fonctions de récompense, souvent bricolées à la main. En montrant qu'une modélisation physique du moteur peut remplacer une partie de la randomisation de domaine habituellement jugée indispensable pour généraliser, l'étude questionne une hypothèse répandue du secteur : que la robustesse sim-to-real passe nécessairement par une randomisation massive des paramètres. Pour les intégrateurs et équipes R&D travaillant sur des robots mobiles à pattes, l'efficacité énergétique conditionne directement l'autonomie en batterie et la charge utile disponible, ce qui rend ce gain de 32% concrètement exploitable au-delà du seul intérêt académique. Le problème du fossé sim-to-real occupe la recherche en locomotion par apprentissage depuis l'essor des quadrupèdes comme l'ANYmal d'ANYbotics, plateforme de référence académique pour ce type de benchmark. La plupart des approches existantes traitent les pertes énergétiques comme un ajout secondaire plutôt qu'une contrainte physique de premier ordre dès l'entraînement. En publiant intégralement code, modèles et données avec cette version révisée, les auteurs positionnent leur contribution comme reproductible pour les laboratoires et industriels développant des plateformes à actionneurs PMSM, sans qu'aucun déploiement commercial ne soit annoncé à ce stade : il s'agit d'une avancée de recherche, dont l'adoption dépendra désormais de son intégration dans les pipelines d'entraînement d'autres équipes robotique.

UELe code, les modèles et les jeux de données étant publiés en accès libre, les laboratoires et industriels européens travaillant sur des robots à pattes à actionneurs PMSM (dont ANYbotics, dont le quadrupède ANYmal sert de plateforme de référence) peuvent directement reproduire et intégrer cette méthode.

RecherchePaper
1 source
Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL
13arXiv cs.RO 

Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL

Le laboratoire à l'origine de ce papier arXiv (référence 2607.10991v1) présente HUMA, une architecture hybride de navigation sociale pour robots mobiles qui combine une politique d'apprentissage par renforcement (RL) avec un modèle vision-langage (VLM). Le principe : la politique RL, rapide et réactive, gère les déplacements courants à faible densité humaine, tandis qu'un VLM post-entraîné prend le relais uniquement quand une personne entre dans la zone de proximité sensible du robot. Évalué sur les benchmarks Social-MP3D et Social-HM3D, HUMA améliore le taux de réussite des tâches de 20% et 3% respectivement par rapport aux meilleures méthodes existantes, tout en réduisant significativement les violations d'espace personnel et les collisions avec des humains. Le système a aussi été testé en conditions réelles sur le robot mobile Mirokaï, conçu par la start-up française Enchanted Tools. Cette approche répond à un compromis central dans la navigation sociale robotique : les politiques RL sont rapides mais peinent à généraliser à des scénarios sociaux complexes, tandis que les VLM offrent un raisonnement sémantique plus fin mais restent trop lents pour un déploiement temps réel. En activant le VLM seulement de façon conditionnelle, HUMA évite l'écueil du tout-VLM (latence, coût de calcul) sans sacrifier la finesse de compréhension sociale dans les moments qui comptent le plus, c'est-à-dire l'interaction rapprochée avec des humains. Pour les intégrateurs et décideurs déployant des robots de service en environnement partagé (hôpitaux, bureaux, commerces), cela suggère une voie concrète pour rendre les VLM exploitables en production sans réécrire toute la pile de contrôle. Le travail s'inscrit dans la tendance récente consistant à substituer ou hybrider les VLM aux politiques RL classiques pour améliorer le raisonnement sémantique en navigation, une piste explorée notamment par des architectures VLA comme Pi-0 ou GR00T N2 dans d'autres contextes robotiques. Les auteurs ont mené des études d'ablation détaillées pour valider chaque composant architectural, et la démonstration sur Mirokaï, robot déployé par Enchanted Tools, ancre l'approche au-delà de la simulation, dans un cas d'usage réel de robot d'accueil et d'assistance en environnement humain.

UELa validation en conditions réelles de HUMA sur le robot Mirokaï, conçu par la start-up française Enchanted Tools, ancre cette avancée de recherche en navigation sociale dans un produit robotique européen déployé en environnement humain.

FR/EU ecosystemePaper
1 source
Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde
14arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source
Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026
15Pandaily 

Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026

Une équipe de recherche du LionRock AI Lab, rattaché à l'Institut de recherche en technologies avancées de China Merchants Group, publie à IROS 2026 une étude qui documente une fragilité critique des modèles Vision-Language-Action (VLA) : un déplacement de caméra de quelques millimètres seulement peut faire chuter de moitié le taux de réussite d'une tâche. Les chercheurs identifient trois formes d'apprentissage par raccourci. Le "Camera-Base Coupling" survient quand le modèle mémorise la position des objets par rapport à des coordonnées de caméra fixes plutôt que d'apprendre de vraies relations spatiales ; un changement de position de caméra fait chuter le taux de succès de 85% à 43% dans leurs tests. Le "Camera-Object Coupling" désigne une dépendance à des angles de vue spécifiques, le modèle traitant un même objet vu sous un angle différent comme une entité distincte. Le "Object-Position Coupling", le plus insidieux, apparaît même avec des données multi-vues si les relations entre objets restent fixes pendant la collecte : sur une tâche "saisir un stylo et le placer dans son support", le modèle atteint 95% de réussite tant que le support reste à sa position d'entraînement, mais chute à 72% dès que celui-ci est déplacé d'un seul diamètre, preuve que le modèle avait appris une coordonnée précise plutôt que le concept de "placer dans le support". Leur réponse, baptisée Hybrid Dynamic Data Collection (HDDC), introduit une variation contrôlée pendant la collecte de données en déplaçant dynamiquement caméra et objets, pour forcer l'apprentissage de relations spatiales réelles. Cette découverte pointe un obstacle central au déploiement de l'IA incarnée en conditions réelles : les benchmarks VLA actuels affichent des taux de succès supérieurs à 90% en conditions fixes, un chiffre qui ne dit rien de la robustesse face aux variations de position de caméra, d'éclairage ou d'agencement d'objets rencontrées hors laboratoire. En rendant explicite ce fossé entre démonstration et réalité opérationnelle, l'étude invite les intégrateurs et décideurs B2B à relativiser les métriques de succès communiquées par les fournisseurs de robots humanoïdes et de bras manipulateurs, et à exiger des tests en conditions variables avant tout déploiement industriel. L'atout de HDDC est d'être agnostique au modèle : la méthode a été validée sur plusieurs architectures VLA majeures avec une efficacité constante, ce qui en fait un correctif potentiellement générique plutôt qu'un patch propre à un seul système. Le diagnostic du LionRock AI Lab rejoint des constats similaires obtenus par des équipes de recherche conjointes Stanford-Google et Tongji-Fudan, ce qui suggère qu'il s'agit d'un problème systémique affectant l'ensemble du champ des modèles VLA, et non d'une faiblesse isolée à une architecture ou un laboratoire donné. L'article, intitulé "Hybrid Dynamic Data Collection: Breaking VLA Shortcut Learning for Spatial Generalization", ainsi que le code et les ressources associées, sont publiés en accès libre sur arXiv et GitHub, permettant à la communauté robotique de reproduire les tests de fragilité spatiale et d'évaluer HDDC sur leurs propres modèles avant l'intégration en environnement industriel.

RechercheActu
1 source
Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels
16arXiv cs.RO 

Audit des robots sociaux pilotés par des LLM selon des gradients moraux culturels

Des chercheurs ont publié sur arXiv (réf. 2606.28345) un cadre d'audit en gradient pour évaluer le comportement moral des LLMs embarqués dans des robots sociaux selon les cultures. L'étude porte sur quatre modèles de langage testés dans quatre paires pays-langue, sous quatre régimes de prompting différents, soit 57 600 décisions analysées. Les scénarios, dérivés de neuf revues de littérature en robotique sociale couvrant plus de 8 000 articles, transposent la logique du Moral Machine Experiment, originellement centré sur "qui épargner", vers des dilemmes d'assistance prioritaire : qui aider en premier, entre un groupe nombreux et un petit, entre une personne âgée et une jeune, entre statut élevé et statut bas. Ces scénarios couvrent les domaines des soins, de l'éducation et des services, avec des identités contrôlées pour isoler l'effet culturel. Les résultats révèlent des biais systématiques et asymétriques : la calibration des modèles est presque deux fois plus précise pour les décisions en langues occidentales que pour le chinois ou le japonais. Les LLMs tendent vers un déterminisme élevé sur les dilemmes "majorité d'abord", effaçant de fait les nuances culturelles transversales. La sensibilité partielle aux normes d'âge et de statut risque concrètement d'exclure des minorités de l'accès à l'assistance robotique. Ce n'est pas un problème de prompting : seuls les prompts avec exemples contrastifs améliorent consistamment le suivi des gradients culturels, tandis que les prompts "raisonnement seul" peuvent aggraver les écarts. Les auteurs concluent que les facteurs architecturaux du modèle constituent un levier plus robuste que l'ingénierie de prompt pour corriger ces dérives. L'enjeu est de taille alors que les robots sociaux pilotés par LLM entrent en déploiement dans des contextes de soins aux personnes âgées, d'accueil hospitalier ou d'éducation, en Asie comme en Europe. Cette recherche s'inscrit dans la continuité du Moral Machine Experiment du MIT, dont elle étend la méthodologie aux contextes incarnés et multilingues, territoire largement inexploré par les audits existants, quasi exclusivement anglophones. Les auteurs plaident pour que ces audits plurilingues et pluralistes deviennent une étape obligatoire avant tout déploiement de robot LLM-gouverné, au même titre que les tests de sécurité physique.

UELes biais culturels documentés (calibration deux fois moins précise pour les langues non-occidentales) sont directement pertinents pour la conformité à l'AI Act dans les secteurs à haut risque, robots sociaux en EHPAD, accueil hospitalier et éducation, où des déploiements LLM sont en cours en Europe.

RechercheActu
1 source
Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose
17arXiv cs.RO 

Où regardent les humains lors des démonstrations à des robots : analyse du comportement visuel dans les tâches de prise-et-dépose

Une équipe de chercheurs publie sur arXiv (référence 2506.05808v2) une étude expérimentale portant sur le comportement oculaire des opérateurs humains lors de sessions de téleopération robotique, dans le cadre spécifique de tâches de saisie et de dépose (pick-and-place). Le protocole expérimental compare plusieurs dispositifs de démonstration, des interfaces qui émulent l'incarnation et les conditions visuelles d'un robot, et mesure précisément où le regard humain se fixe pendant l'exécution. Les résultats montrent que certaines propriétés des dispositifs provoquent un déplacement systématique de l'attention visuelle : l'opérateur cesse de regarder les indices liés à l'objectif de la tâche (les objets à manipuler) pour se concentrer sur les indices de supervision du contrôle (l'effecteur terminal, c'est-à-dire la pince ou le bras du robot). Ce n'est pas un effet marginal, il est suffisamment prononcé pour mesurer son impact en aval sur les modèles d'apprentissage. L'enjeu pour les équipes qui construisent des pipelines d'imitation learning est direct. L'apprentissage par imitation, qui fonde une part croissante des architectures VLA (Vision-Language-Action) comme Pi-0, GR00T N2 ou OpenVLA, repose sur des volumes massifs de données de démonstration humaine, dont le coût de collecte est élevé. Une hypothèse structurante du domaine est que le regard humain encode des informations cognitives de haut niveau, priorité aux objets, anticipation de la trajectoire, que les modèles peuvent exploiter pour généraliser. Or cette étude montre que, selon le dispositif utilisé, ce signal se dégrade au point de faire chuter les performances des modèles gaze-based en dessous des baselines sans information oculaire. En d'autres termes, le choix du matériel de collecte de données n'est pas neutre : il peut silencieusement empoisonner le signal superviseur. Ce travail s'inscrit dans un débat actif autour de la qualité versus la quantité des données de démonstration, dans un secteur où Physical Intelligence, Hugging Face (LeRobot) et des laboratoires comme Stanford (ALOHA) ou Berkeley (DROID) investissent massivement dans des infrastructures de collecte standardisées. La question de quel dispositif utiliser, manette, bras maître, interface VR, exosquelette, n'avait jusqu'ici été abordée que sous l'angle ergonomique ou de la fidélité de contrôle. Cette étude introduit une nouvelle dimension : l'effet du dispositif sur la qualité du signal cognitif implicite, avec des implications directes pour la conception des futures campagnes de collecte de données à grande échelle.

UEHuggingFace (entreprise française, co-fondatrice de LeRobot) est explicitement citée parmi les organisations dont les infrastructures standardisées de collecte de démonstrations sont directement concernées par ces résultats sur la dégradation du signal gaze selon le dispositif utilisé.

RechercheOpinion
1 source
Point de vue : comment la perspective influence la sociabilité perçue des robots
18arXiv cs.RO 

Point de vue : comment la perspective influence la sociabilité perçue des robots

Des chercheurs ont publié sur arXiv (référence 2603.28272v2) une étude expérimentale portant sur la perception de la sociabilité des robots de navigation selon le point de vue de l'observateur. L'équipe a conçu un protocole en réalité virtuelle immersive permettant de soumettre des trajectoires robotiques identiques à trois types de perspectives : allocentrique (vue aérienne, type supervision), égocentrique-proximale (première personne, robot proche) et égocentrique-distale (première personne, robot loin). Deux politiques de navigation distinctes ont été testées pour vérifier si les résultats sont généralisables au-delà d'un seul type de trajectoire. Une variable additionnelle a été introduite : la présence ou l'absence d'un geste de hochement de tête du robot au moment du croisement. Le résultat central contredit une hypothèse largement répandue dans la communauté : les trajectoires jugées sociables en vue aérienne sont perçues comme significativement plus dérangeantes lorsqu'on les expérimente en première personne et à proximité immédiate. Ce décalage perceptif a des implications directes pour les équipes qui valident des algorithmes de navigation sociale (SFM, ORCA, politiques VLA embarquées) uniquement via simulation ou supervision vidéo. Les benchmarks actuels, qui s'appuient massivement sur des métriques calculées depuis une vue de dessus, risquent de valider des comportements qui resteraient inconfortables sur le terrain réel. L'étude montre également que la distance de dépassement influence le niveau de perturbation ressenti, mais que des signaux sociaux communicatifs, comme le hochement de tête, compensent partiellement cet effet en améliorant la sociabilité perçue, ce qui ouvre une piste concrète pour les robots humanoïdes ou à tête expressive. Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), actif depuis plus d'une décennie avec des travaux fondateurs sur la proxémique robotique et les espaces personnels. La validation humanoïde en environnement partagé est un enjeu croissant pour des acteurs comme Boston Dynamics, Agility Robotics ou Unitree, dont les robots opèrent déjà dans des entrepôts et espaces semi-publics. Côté européen, des initiatives comme Enchanted Tools (Mirokaï) ou les travaux de l'INRIA sur la navigation sociale font face au même verrou méthodologique pointé ici. La prochaine étape logique serait de valider ces résultats sur du matériel physique en conditions réelles, et d'intégrer des métriques égocentrique dans les pipelines de test standard des politiques de navigation.

UEINRIA et Enchanted Tools (Mirokaï) sont directement exposés au verrou méthodologique identifié : leurs pipelines de validation de navigation sociale reposent sur des métriques allocentriques qui risquent de valider des comportements inconfortables en conditions réelles.

RecherchePaper
1 source
Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert
19arXiv cs.RO 

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert

Une équipe de recherche a publié sur arXiv (identifiant 2510.08807v2) Humanoid Everyday, un jeu de données massif dédié à l'apprentissage de la manipulation par les robots humanoïdes en conditions ouvertes. Le dataset compile 10 300 trajectoires et plus de 3 millions de frames couvrant 260 tâches réparties en 7 catégories larges : manipulation dextère d'objets, interaction humain-humanoïde, actions intégrant de la locomotion bipède, et d'autres scénarios du quotidien. Les données sont multimodales, RGB, profondeur, LiDAR, retour tactile, accompagnées d'annotations en langage naturel. La collecte repose sur un pipeline de télé-opération supervisée par des humains, optimisé pour maximiser le débit tout en maintenant la qualité des démonstrations. Les auteurs publient simultanément une plateforme d'évaluation cloud permettant à des équipes extérieures de déployer leurs propres politiques de contrôle et d'obtenir des métriques comparables dans un environnement standardisé. Ce dataset comble un vide structurel dans la recherche robotique : la quasi-totalité des benchmarks existants (Open X-Embodiment, DROID, BridgeData V2) ciblent des bras fixes, et les rares datasets humanoïdes disponibles se limitent à des environnements contrôlés, un faible nombre de tâches, et excluent généralement la locomotion et l'interaction avec des personnes. Pour un intégrateur ou un décideur industriel, la portée pratique est double : des données hétérogènes permettent d'entraîner des politiques plus généralisables, notamment des architectures VLA (vision-language-action) ; la plateforme d'évaluation cloud offre pour la première fois un cadre reproductible pour comparer des méthodes d'apprentissage par imitation ou par renforcement sur des tâches humanoïdes réalistes. L'article analyse aussi les performances de plusieurs politiques de référence, en identifiant leurs forces et limites par catégorie. La publication intervient dans un contexte de forte concurrence autour des données d'entraînement pour humanoïdes. Physical Intelligence (Pi-0, π0.5), NVIDIA (GR00T N2), Unitree et Figure AI misent chacun sur des datasets propriétaires pour différencier leurs politiques de contrôle. Côté recherche ouverte, AgiBot World et RH20T ont posé des jalons, mais restent limités dans leur couverture humanoïde. Humanoid Everyday est rendu entièrement public, dataset, code de collecte et plateforme d'évaluation inclus, ce qui en fait une ressource directement exploitable par des laboratoires et startups sans accès à des infrastructures de collecte massives. Les auteurs présentent cette release comme un socle pour de futurs agents incarnés généralistes, sans préciser d'échéancier pour des suites expérimentales.

UELes équipes de recherche et startups européennes en robotique humanoïde peuvent exploiter directement ce dataset open-source, 10 300 trajectoires, 260 tâches, plateforme d'évaluation cloud, sans investir dans une infrastructure de collecte massive, ce qui réduit la barrière d'entrée face aux acteurs américains et asiatiques disposant de données propriétaires.

💬 Le vrai sujet ici, c'est pas juste le volume (10 300 trajectoires, bon), c'est que les benchmarks humanoïdes existants ignoraient presque tous la locomotion et l'interaction avec des humains réels depuis le début. Des acteurs comme Pi-0 ou GR00T N2 misaient sur leurs données propriétaires comme avantage concurrentiel, et une release open-source de cette ampleur vient rogner ce levier directement. Reste à voir si ça tient face à des politiques entraînées en conditions réelles, mais pour des labos sans infrastructure de collecte massive, ça change le rapport de force.

IA physiqueOpinion
1 source
Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot
20arXiv cs.RO 

Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot

Une étude publiée sur arXiv (identifiant 2606.20150) en juin 2026 évalue de manière systématique cinq méthodes de suivi d'état d'assemblage à partir de la reconnaissance d'actions humaines (HAR), dans le cadre de la collaboration homme-robot (HRC). Les chercheurs ont testé des approches à base de règles logiques, de modèles de Markov cachés (HMM) et de réseaux de neurones (NN) sur deux jeux de données aux caractéristiques différentes. Les tests combinent des entrées simulées avec différents niveaux de bruit et des entrées réalistes issues d'un modèle HAR opérationnel. L'objectif est de déterminer quelle méthode permet de suivre fidèlement l'état d'une tâche d'assemblage coopérative, étape par étape, à partir de la seule reconnaissance des gestes humains. Les résultats contredisent l'hypothèse dominante selon laquelle les approches par réseaux de neurones surpassent systématiquement les méthodes classiques. Les NN et HMM affichent de bonnes performances sur des tâches à faible variabilité, mais se révèlent fragiles face à des séquences atypiques ou bruitées. Les méthodes logiques, bien que moins sophistiquées, se montrent plus robustes dans les scénarios à haute variabilité. Par ailleurs, la modélisation de la durée attendue des actions s'avère critique pour les tâches comportant des actions répétées, notamment lorsqu'aucun capteur complémentaire ne fournit de signal de confirmation. Ce constat a des implications directes pour les intégrateurs industriels qui déploient des cellules HRC sur des lignes d'assemblage réelles : choisir un modèle d'inférence d'état inadapté au profil de la tâche peut entraîner des erreurs de synchronisation robot-opérateur difficiles à diagnostiquer. Ce travail s'inscrit dans un domaine de recherche en pleine effervescence, porté par l'essor des robots collaboratifs (cobots) dans les environnements manufacturiers. Des acteurs comme Universal Robots, FANUC ou encore des laboratoires européens tels que ceux du LAAS-CNRS et de Fraunhofer travaillent sur des pipelines HAR similaires pour des applications d'assistance à l'assemblage. La difficulté centrale, le "demo-to-reality gap" entre conditions de laboratoire et déploiement en usine, reste entière. Cette étude ne propose pas de solution universelle mais établit une carte comparative utile, à condition que les praticiens caractérisent d'abord la variabilité réelle de leur tâche avant de sélectionner une architecture de suivi d'état.

UELe LAAS-CNRS et Fraunhofer sont explicitement cités comme acteurs travaillant sur des pipelines HAR similaires, et les conclusions comparatives offrent une grille de décision directement utilisable par les intégrateurs européens qui déploient des cellules cobot sur des lignes d'assemblage réelles.

RecherchePaper
1 source
La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes
21arXiv cs.RO 

La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes

Des chercheurs publient sur arXiv (réf. 2606.19067) une évaluation systématique de méthodes SLAM (Simultaneous Localization and Mapping) appliquées aux robots quadrupèdes, en s'appuyant sur le dataset GrandTour enregistré sur un ANYmal D d'ANYbotics. Trois familles d'approches sont comparées : SLAM visuel pur, visuel-inertiel (VIO), et LiDAR-visuel-inertiel. L'étude isole trois variables matérielles : modalité caméra (monoculaire, stéréo, RGB-D), type d'obturateur (global shutter vs rolling shutter), et qualité de l'IMU. Résultats principaux : les configurations stéréo surpassent systématiquement le monoculaire et le RGB-D en précision de localisation ; les caméras à obturateur global réduisent significativement les échecs de tracking liés au mouvement ; et, point contre-intuitif, l'intégration d'une IMU standard peut dégrader les performances des frameworks principalement visuels sous les dynamiques agressives de la locomotion quadrupède. Les robots à pattes génèrent des perturbations sensorielles que les plateformes à roues ou les drones ne produisent pas à la même intensité : chocs d'impact au sol à chaque appui, vibrations mécaniques haute fréquence dans la structure, rotations angulaires rapides lors des corrections de posture. Ces phénomènes dégradent les pipelines de perception conçus pour des dynamiques plus lisses. L'enseignement clé pour les intégrateurs : le choix matériel conditionne la robustesse avant même le choix algorithmique. Que l'IMU standard puisse activement nuire à la perception visuelle, plutôt que simplement ne pas l'améliorer, remet en question la pratique courante d'ajouter une centrale inertielle bas de gamme par défaut dans un payload. Pour un responsable technique évaluant un quadrupède pour l'inspection d'infrastructure, l'étude fournit des critères de sélection hardware directement actionnables. L'ANYmal D, développé par ANYbotics (spin-off de l'ETH Zurich), est l'une des plateformes quadrupèdes les plus déployées en inspection industrielle, notamment dans le secteur pétrolier et gazier. Le SLAM visuel-inertiel a été largement validé sur drones et robots à roues, mais sa transposition aux systèmes à pattes reste un chantier de recherche actif. Les équipes travaillant sur Boston Dynamics Spot, Unitree B2 ou les plateformes d'Agility Robotics affrontent les mêmes contraintes d'embodiment. L'article formule des recommandations concrètes pour la constitution de payloads capteurs sur systèmes agiles, directement exploitables par les intégrateurs définissant les prochaines itérations de ces plateformes.

UELes critères de sélection hardware identifiés (stéréo + obturateur global, méfiance envers IMU bas de gamme) bénéficient directement aux intégrateurs européens déployant des quadrupèdes ANYmal D (ANYbotics, spin-off ETH Zurich) sur des sites d'inspection industrielle en Europe.

RecherchePaper
1 source
SoK : Sécurité et vie privée des robots à base de modèles fondation
22arXiv cs.RO 

SoK : Sécurité et vie privée des robots à base de modèles fondation

Une équipe de chercheurs a publié sur arXiv (référence 2606.16788) un article de type "Systematization of Knowledge" (SoK) qui dresse un panorama structuré des risques de sécurité et de confidentialité introduits par les modèles de fondation dans les systèmes robotiques. Le travail systématise 96 études antérieures et propose un cadre d'analyse à quatre couches baptisé F-E-S-G : la couche Modèle de fondation (F), la couche Système incarné (Embodied system, E), la couche Écosystème de support (S), et la couche Impact de gouvernance (G). À chaque couche correspond une taxonomie fine qui encode, pour chaque étude analysée, la cible visée, le stade du cycle de vie, le mécanisme d'attaque ou de défense, le niveau d'accès système requis, et les effets observés. L'intérêt de ce travail réside moins dans les vulnérabilités individuelles qu'il recense que dans les "defense mismatches" qu'il met en évidence : les mécanismes de robustesse conçus pour les modèles de langage ou de vision en contexte purement numérique ne s'appliquent pas directement à des pipelines d'exécution incarnés. Quand un robot piloté par un modèle VLA (Vision-Language-Action) interprète une instruction en langage naturel pour saisir un objet, une attaque adversariale ou une injection de prompt ne produit plus une réponse textuelle erronée mais un mouvement physique potentiellement dangereux. Pour un intégrateur industriel ou un COO déployant des flottes humanoïdes, cette propagation du risque à travers les quatre couches constitue un angle mort opérationnel que les grilles d'évaluation actuelles ne capturent pas. Le genre "SoK" est une convention bien établie dans la communauté sécurité, notamment via la conférence IEEE S&P, et signale une tentative de structurer un champ de recherche fragmenté. Cette publication arrive à un moment de transition dans la robotique commerciale : après des années de démos contrôlées, plusieurs acteurs (Figure, Apptronik, Unitree côté américain, Wandercraft et Enchanted Tools côté européen) engagent des déploiements en environnement réel avec des VLAs comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'absence de cadre normatif unifié, que ni l'EU AI Act ni les standards ISO robotiques actuels ne couvrent explicitement, donne à cette méta-analyse une pertinence directe pour les équipes réglementaires et les organismes de certification appelés à évaluer ces systèmes hybrides IA-robotique.

UEL'EU AI Act et les normes ISO robotiques actuelles ne couvrent pas explicitement les systèmes hybrides IA-robotique : ce SoK fournit aux équipes réglementaires européennes et aux acteurs français (Wandercraft, Enchanted Tools) déployant des VLAs un cadre d'analyse des risques directement utilisable pour anticiper les futures exigences de certification.

RechercheOpinion
1 source
VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action
23arXiv cs.RO 

VLALeaks : attaques par inférence d'appartenance contre les modèles vision-langage-action

Des chercheurs ont publié le 15 juin 2026 un article (arXiv:2606.15165) présentant VLALeaks, une méthode d'attaque par inférence d'appartenance (membership inference attack, MIA) ciblant spécifiquement les modèles Vision-Language-Action (VLA). Ces modèles, qui permettent le contrôle bout-en-bout d'un robot à partir d'instructions en langage naturel et d'entrées visuelles, sont au cœur des systèmes robotiques les plus récents, de Pi-0 (Physical Intelligence) à OpenVLA en passant par les variantes de RT-2. L'attaque repose sur une observation de divergences dans les mécanismes d'attention interne des VLA selon que l'exemple présenté appartient ou non aux données d'entraînement. Le pipeline proposé se décompose en deux étapes : extraction de caractéristiques d'appartenance, puis construction d'un modèle d'attaque supervisé. Les résultats sur plusieurs benchmarks VLA montrent des métriques élevées, notamment en AUC et en TPR à 1 % de taux de faux positifs (TPR@1%FPR), sans que les auteurs donnent les valeurs absolues dans le résumé disponible. L'enjeu est substantiel pour quiconque développe ou déploie des systèmes robotiques fondés sur des VLA. Les données de démonstration robotique sont coûteuses à collecter, téléopération, enregistrement de trajectoires, annotation, et constituent un actif industriel stratégique. Montrer qu'un adversaire peut déterminer, à partir du seul accès aux sorties du modèle, si une démonstration spécifique a servi à l'entraînement revient à exposer à la fois la propriété intellectuelle des intégrateurs et les données potentiellement personnelles des opérateurs ayant effectué les démonstrations. C'est la première étude systématique de ce type de vulnérabilité sur des VLA, un angle resté jusqu'ici largement ignoré alors que les MIA sont bien documentées pour les LLM et les modèles de vision. Les VLA ont émergé comme paradigme dominant dans la robotique généraliste depuis 2023, portés par des travaux comme RT-2 (Google DeepMind), Octo (Berkeley) et les modèles de Physical Intelligence. Leur adoption croissante dans des contextes industriels réels, où les données propriétaires d'entreprises comme Amazon Robotics, Boston Dynamics ou Exotec pourraient constituer le corpus d'entraînement, rend cette classe d'attaques particulièrement critique. Les prochaines étapes naturelles incluent l'évaluation de défenses (differential privacy, data augmentation, output perturbation) et l'extension des attaques à des architectures multimodales plus récentes. Les auteurs positionnent VLALeaks comme un outil de recherche pour construire des déploiements VLA sécurisés, mais la publication de la méthode en elle-même constitue aussi un signal d'alarme pour les équipes qui mutualisent des données de démonstration dans des pipelines de fine-tuning partagés.

UEExotec (France) figure parmi les entreprises dont les données de démonstration propriétaires pourraient être exposées par ce vecteur d'attaque, ce qui impose une révision des pratiques de sécurité pour tout déployeur de VLA mutuali­sant des pipelines de fine-tuning en Europe.

RechercheOpinion
1 source
Jumeau numérique pour la classification textile et la détection d'objets étrangers dans les systèmes de tri automatisé
24arXiv cs.RO 

Jumeau numérique pour la classification textile et la détection d'objets étrangers dans les systèmes de tri automatisé

Une équipe de chercheurs a présenté un système robotique de tri textile piloté par un jumeau numérique, conçu pour l'automatisation du recyclage de vêtements. La cellule à double bras intègre une perception RGBD, un retour tactile capacitif et une planification de trajectoires anticollision via MoveIt. Le pipeline autonome saisit des vêtements depuis un panier non trié, les transfère vers une zone d'inspection et les classifie via des modèles de vision-langage (VLM, Visual Language Models). Le benchmark porte sur neuf VLM issus de cinq familles de modèles, évalués sur 223 scénarios couvrant six catégories : chemises, chaussettes, pantalons, sous-vêtements, objets étrangers et scènes vides. La famille Qwen atteint la précision globale la plus élevée avec 87,9 %, assortie de solides performances sur la détection d'objets étrangers. Gemma3 offre un compromis vitesse/précision adapté au déploiement sur matériel embarqué (edge). Le travail est disponible sur arXiv sous la référence 2603.05230v2. Ce benchmark en conditions industrielles réelles, sur des objets déformables, constitue une validation plus rigoureuse que les démonstrations sur images synthétiques habituellement produites dans ce domaine. L'évaluation intègre le comportement aux hallucinations et les performances computationnelles sous contraintes matérielles, deux critères souvent absents des publications académiques sur la robotique manipulatrice. Pour les intégrateurs industriels, cela confirme que le tri automatisé de textiles par VLM est réalisable sans infrastructure GPU haute performance, et que le choix du modèle doit s'adapter aux contraintes du site de déploiement. L'intégration de nuages de points 3D segmentés dans le jumeau numérique réduit par ailleurs le fossé sim-to-real pour la planification de prises sur objets déformables. Ce travail s'inscrit dans un contexte de pression réglementaire croissante : l'UE impose depuis janvier 2025 la collecte séparée obligatoire des textiles usagés dans les États membres, accélérant la demande d'automatisation dans les centres de tri. Dans le paysage concurrentiel, Picvisa (Espagne) et Recycleye (Royaume-Uni) opèrent déjà sur le tri optique de déchets par vision, mais sans raisonnement sémantique par VLM. Les prochaines étapes naturelles pour ce système seraient la validation sur des lignes industrielles à plus grand débit et l'extension à d'autres catégories de matières, notamment les textiles synthétiques et les fibres techniques.

UELa directive UE sur la collecte séparée des textiles (en vigueur depuis janvier 2025) crée une demande directe pour ce type d'automatisation dans les centres de tri européens, et les acteurs ibérique (Picvisa) et britannique (Recycleye) déjà présents pourraient être concurrencés ou complétés par ce système.

RecherchePaper
1 source
La régularisation en sortie élimine la loterie des seeds dans le fine-tuning VLA sur GPU unique
25arXiv cs.RO 

La régularisation en sortie élimine la loterie des seeds dans le fine-tuning VLA sur GPU unique

Une équipe de chercheurs révèle dans un prépublication arXiv (2606.13856, juin 2026) un défaut structurel dans le fine-tuning des modèles vision-langage-action sur GPU unique : la "loterie de seed". En exécutant le même code d'entraînement sur VLA-JEPA treize fois avec des graines aléatoires différentes, mêmes données, même architecture, douze runs atteignent 91 à 94 % de taux de succès sur les benchmarks LIBERO, mais un run chute silencieusement à 65,2 %, soit un écart de 29 points de pourcentage, sans message d'erreur ni avertissement. La cause identifiée est un phénomène d'effondrement de sortie (output collapse) : le prédicteur d'action converge vers des sorties quasi-identiques quelle que soit l'observation visuelle. Les auteurs ont évalué 7 méthodes de régularisation sur jusqu'à 13 seeds et 3 benchmarks LIBERO, et montrent que trois régularisateurs au niveau des sorties, VICReg (n=12 seeds), Dropout (n=4), et un taux d'apprentissage divisé par deux (n=5), éliminent chaque run catastrophique : 0 effondrement sur 21 tentatives combinées, contre 1/13 pour la baseline (F(12,11)=28,7, p<0,001). Les méthodes classiques de régularisation au niveau des poids, L2 et EWC, laissent la loterie intacte. Ce résultat remet en cause une hypothèse implicite du secteur : que le fine-tuning sur GPU unique des VLA est reproductible par défaut. Pour les intégrateurs industriels et les laboratoires qui déploient Pi-0, GR00T N2, Helix ou des modèles similaires sur des robots réels, un écart de 29 pp non détectable est un risque opérationnel concret. Les méthodes L2 et EWC pénalisent les changements de poids mais restent aveugles à l'effondrement qui se produit dans le null-space jacobien, là où les poids peuvent varier librement sans modifier les sorties observables. La correction la plus simple demande un seul changement dans la configuration de l'optimiseur, ce qui rend la solution immédiatement déployable sans refonte d'architecture. Les VLA connaissent depuis 2024 une montée en puissance accélérée, avec des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et 1X (Helix) qui misent sur des politiques généralisables entraînées sur données hétérogènes. Le fine-tuning sur matériel modeste est devenu un enjeu clé pour démocratiser l'accès à ces modèles au-delà des grandes entreprises disposant de clusters de calcul. VICReg, issu des travaux de Meta AI sur l'apprentissage auto-supervisé, se retrouve ici appliqué avec succès à la stabilisation de l'espace d'action robotique. Les prochaines étapes naturelles incluent la validation sur robots physiques hors simulation LIBERO, et l'extension à d'autres architectures VLA pour confirmer la généralité du diagnostic.

UELes laboratoires et intégrateurs français/européens qui font du fine-tuning de VLA (Pi-0, GR00T N2, Helix) sur GPU unique sont directement exposés à ce risque opérationnel silencieux (-29 pp), mais peuvent l'éliminer immédiatement via VICReg ou un ajustement du taux d'apprentissage sans refonte d'architecture.

💬 Un run sur treize qui s'effondre à 65 % sans le moindre message d'erreur, c'est le genre de bombe à retardement qu'on découvre sur robot réel, pas en benchmark. Ce qui est malin ici, c'est d'avoir localisé le problème dans l'espace des sorties, là où L2 et EWC sont complètement aveugles. La correction tient en un paramètre d'optimiseur, donc si tu fais du fine-tuning VLA aujourd'hui, t'as pas vraiment d'excuse.

IA physiqueActu
1 source
Apprendre à assister : des modèles VLA collaboratifs pour la coopération implicite humain-robot
26arXiv cs.RO 

Apprendre à assister : des modèles VLA collaboratifs pour la coopération implicite humain-robot

Des chercheurs ont publié le 12 juin 2026 (arXiv:2606.12475) une étude sur l'usage de modèles vision-langage-action (VLA) entraînés par imitation learning pour la collaboration humain-robot (HRC) implicite, sans signal explicite déclenchant l'assistance robotique. Évaluant deux VLA de référence sur des tâches d'assemblage collaboratif, l'équipe identifie un défaut propre aux politiques d'action-chunking : la "fuite d'actions de démonstration" (demonstration action leakage). Ce phénomène survient lorsque des chunks d'actions enjambent des transitions latentes de sous-tâches, poussant le robot à assister l'humain trop tôt, comme tendre un outil avant que l'opérateur soit prêt à le saisir. Pour corriger ce comportement sans réentraîner le modèle, les auteurs proposent un pilotage à l'inférence (inference-time steering). Une étude à 16 participants sur une tâche d'assemblage longue horizon confirme que le steering réduit les interventions prématurées, accélère la collaboration et diminue les échecs par rapport à une politique à horizon court. Ce résultat ouvre une voie concrète pour l'intégration des VLA dans des workflows industriels collaboratifs, jusqu'ici dépendants de pipelines codés à la main, peu scalables vers de nouvelles tâches. La fuite d'actions constitue un avertissement direct pour les équipes déployant des politiques ACT ou diffusion en mode HRC : allonger l'horizon d'exécution, souvent souhaitable pour la fluidité du mouvement, aggrave le problème. Le steering à l'inférence fournit un correctif opérationnel sans modification du modèle entraîné, ce qui le rend attractif pour un déploiement rapide. Les VLA généralistes comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) ont prouvé leur efficacité en manipulation autonome, mais leur usage en HRC implicite restait peu documenté. Cette publication comble ce manque méthodologique. En Europe, des acteurs comme Enchanted Tools et Wandercraft, dont les robots sont conçus pour opérer aux côtés d'humains, pourraient réduire leur charge d'ingénierie manuelle en s'appuyant sur ces résultats. La prochaine étape sera d'étendre la méthode à des environnements industriels non contrôlés et à des tâches encore plus longues, afin d'évaluer la robustesse du steering face à la variabilité réelle des comportements humains.

UEEnchanted Tools et Wandercraft, acteurs européens de la robotique collaborative, pourraient réduire leur charge d'ingénierie manuelle en adoptant le steering à l'inférence pour corriger la fuite d'actions dans leurs déploiements VLA, sans réentraîner leurs modèles.

RechercheOpinion
1 source
IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation
27arXiv cs.RO 

IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation

Une équipe de chercheurs a publié sur arXiv Embodied-R1.5, un modèle de fondation incarné (EFM pour Embodied Foundation Model) de 8 milliards de paramètres intégrant cognition incarnée, planification, auto-correction et pointage d'affordances dans une architecture unifiée, entraîné sur un corpus dépassant 15 milliards de tokens construit via trois pipelines automatisés. Le cadre Planner-Grounder-Corrector (PGC) en boucle fermée permet l'exécution autonome et l'auto-correction sur des tâches longues, soutenu par une recette d'apprentissage par renforcement multi-tâches équilibré pour atténuer les conflits entre sous-domaines hétérogènes. Sur les benchmarks standardisés, Embodied-R1.5 atteint l'état de l'art sur 16 des 24 benchmarks de VLM incarnés, devançant Gemini-Robotics-ER-1.5 de Google DeepMind et GPT-5.4 d'OpenAI. Adapté en VLA (Vision-Language-Action) avec peu de données de fine-tuning, il surpasse pi-0.5 de Physical Intelligence sur quatre suites de benchmarks de manipulation. Des tests zero-shot sur robot réel valident les performances en suivi d'instructions, ancrage d'affordances, manipulation d'objets articulés et tâches longues, les poids, le code d'entraînement et EmbodiedEvalKit, un framework d'évaluation dédié, étant publiés en open source. Qu'un modèle de 8 milliards de paramètres surpasse des systèmes adossés aux ressources de Google et d'OpenAI est un signal notable pour les intégrateurs industriels, car la compacité ouvre la voie à un déploiement embarqué sur plateformes contraintes. L'auto-correction en boucle fermée du PGC répond directement au demo-to-reality gap qui freine la commercialisation des robots polyvalents, tandis que la capacité à fine-tuner en VLA avec peu de données cible le goulot d'étranglement central de la collecte de données de manipulation étiquetées. L'open source complet facilite la comparaison reproductible et devrait accélérer les itérations communautaires, à condition que les performances zero-shot annoncées soient confirmées dans des configurations adversariales que le papier ne documente pas. Embodied-R1.5 s'inscrit dans la vague des modèles de fondation robotiques généraux densifiée depuis RT-2 de Google et OpenVLA, avec pour concurrents directs Physical Intelligence (pi-0, pi-0.5) et Google DeepMind (Gemini Robotics). L'absence d'acteurs européens parmi les concurrents benchmarkés reflète le retard du continent, où des acteurs comme Wandercraft ou Enchanted Tools restent cantonnés à des niches spécialisées. L'approche open source total distingue ce travail des modèles propriétaires de Figure AI (Figure 03) ou de 1X Technologies, positionnant potentiellement Embodied-R1.5 comme base de référence pour les laboratoires et industriels souhaitant spécialiser un EFM sur leurs propres flux de manipulation.

UELes poids et le code d'Embodied-R1.5 publiés en open source constituent une base de référence accessible pour les laboratoires européens (CEA-List, INRIA) souhaitant spécialiser un EFM sur leurs propres flux de manipulation sans dépendre des modèles propriétaires de Google ou OpenAI.

💬 8 milliards de paramètres qui coiffent Gemini Robotics et GPT-5.4 sur leurs propres benchmarks, en open source total, c'est inattendu. L'auto-correction en boucle fermée s'attaque directement au fossé entre la démo en labo et le robot qui tient la route en prod, ce qui est le vrai mur depuis RT-2. Bon, le papier esquive les configurations difficiles, donc on verra ce que ça donne quand la communauté s'en empare.

IA physiqueOpinion
1 source
BadRobot : contourner les garde-fous des agents LLM incarnés dans le monde physique
28arXiv cs.RO 

BadRobot : contourner les garde-fous des agents LLM incarnés dans le monde physique

Des chercheurs ont publié BadRobot (arXiv:2407.20242, juillet 2024, v5), un cadre d'attaque ciblant les agents IA incarnés (embodied AI) : des robots et systèmes physiques dont la planification de tâches est pilotée par un grand modèle de langage. L'attaque exploite trois vecteurs distincts : la manipulation du LLM embarqué via des interactions vocales standard, le désalignement structurel entre les sorties linguistiques du modèle et les actions physiques réellement exécutées, et les comportements dangereux involontaires causés par des lacunes dans les connaissances du monde encodées dans le modèle. Pour évaluer la menace, les auteurs ont constitué un benchmark de requêtes d'actions physiques malveillantes, testé contre trois frameworks embodied AI de référence : VoxPoser, Code as Policies et ProgPrompt. Les expériences montrent que ces trois systèmes peuvent être amenés à exécuter des comportements nuisibles dans le monde physique, sans nécessiter de modification matérielle ni d'accès privilégié au système. Ce travail pointe un angle mort structurel : les techniques de jailbreaking, jusqu'à présent évaluées sur des sorties textuelles, produisent des conséquences physiques irréversibles lorsque le LLM pilote un effecteur. Le désalignement documenté est systémique, car les guardrails de sécurité sont appliqués à la couche linguistique sans validation cohérente lors de la planification motrice ou de l'exécution de tâches. Pour un intégrateur industriel déployant un robot manipulateur ou un AMR guidé par LLM, cela signifie que les mécanismes de conformité conçus pour les chatbots sont insuffisants en contexte physique. La démonstration sur trois frameworks activement utilisés en recherche et en prototypage industriel renforce la portée opérationnelle de l'alerte. VoxPoser (2023) et Code as Policies (Google, 2022) ont popularisé l'utilisation des LLM comme planificateurs de tâches haut niveau en robotique, tandis que ProgPrompt (2022) ciblait les robots de service autonomes. BadRobot paraît alors que des systèmes commerciaux comme Figure 02, l'Optimus de Tesla ou les robots Agility déployés chez Amazon commencent à intégrer des pipelines LLM en production réelle, rendant la surface d'attaque concrète. Aucun acteur français ou européen n'est directement mentionné dans l'étude, mais des entreprises comme Enchanted Tools (Mirokaï) ou Pollen Robotics (Reachy), qui explorent l'intégration de LLM dans leurs plateformes, sont exposées aux mêmes vecteurs. Les auteurs ont mis leur code en accès libre sur GitHub, ouvrant la voie à des reproductions indépendantes et au développement de contre-mesures architecturales spécifiques à l'embodied AI.

UEEnchanted Tools (Mirokaï) et Pollen Robotics (Reachy), deux acteurs français intégrant des LLM dans leurs plateformes robotiques, sont explicitement cités comme exposés aux mêmes vecteurs d'attaque documentés par BadRobot.

RechercheOpinion
1 source
Prise de contrôle adversariale en temps réel des politiques de diffusion robotique
29arXiv cs.RO 

Prise de contrôle adversariale en temps réel des politiques de diffusion robotique

Une équipe de chercheurs a publié le 10 juin 2026 sur arXiv (réf. 2606.10371) une attaque baptisée TAKO (Test-time Adversarial Takeover), qui permet de prendre le contrôle en temps réel d'un robot opérant sous une politique de diffusion visuomotrice, sans modifier le modèle cible. La méthode repose sur un vocabulaire restreint de patches adversariaux universels et réutilisables, appris hors ligne via inférence de diffusion différentiable. À l'exécution, un opérateur humain injecte ces patches dans le flux caméra du robot et les commute dynamiquement pour composer des trajectoires de son choix. Sur quatre tâches évaluées (manipulation 2D, livraison aérienne simulée, navigation sol simulée et navigation sol en environnement physique réel), deux encodeurs visuels (ResNet-18 et EfficientNet-B0 + Transformer) et trois familles d'inférence générative (DDPM, DDIM et flow matching), les opérateurs attaquants ont atteint 100 % de succès de détournement dans l'ensemble des scénarios testés. Ce résultat interpelle directement les intégrateurs robotiques et les équipes de sécurité industrielle qui déploient des systèmes pilotés par des politiques de diffusion ou des VLA (Vision-Language-Action models). Jusqu'ici, la quasi-totalité des attaques adversariales sur robots visaient la dégradation des performances, induire un échec de tâche ou un comportement erratique. TAKO introduit une menace qualitativement différente : le robot ne s'arrête pas, il obéit à un attaquant distant. La perturbation agit sur le chemin de conditionnement visuel de la politique, et le biais introduit se propage à travers le processus de génération itératif propre aux modèles de diffusion, ce qui le rend difficile à détecter par supervision classique. Les auteurs démontrent aussi que la baseline naturelle "target-policy matching" échoue, car la politique victime ne peut pas se superviser fiablement sur des shifts hors distribution, invalidant une hypothèse de défense couramment avancée. Les politiques de diffusion pour la robotique se sont imposées comme paradigme dominant depuis 2023, portées par Diffusion Policy (Chi et al.) et intégrées dans des systèmes tels que pi0 de Physical Intelligence, les pipelines de Figure AI ou les robots de 1X Technologies. Ces architectures conditionnent l'action sur une observation visuelle, ce qui les rend structurellement vulnérables aux perturbations du flux caméra. Les pistes de défense habituelles, détection d'anomalies ou purification adversariale, restent largement expérimentales à cette échelle. L'évaluation demeure dans un cadre académique contrôlé, sans partenaire industriel ni calendrier de déploiement annoncé. Pour les équipes préparant des déploiements en logistique, livraison autonome ou manipulation industrielle, TAKO pose une question de sécurité concrète à laquelle le secteur n'a pas encore de réponse standardisée.

UELes intégrateurs robotiques européens déployant des systèmes à politiques de diffusion en logistique ou industrie doivent intégrer ce vecteur d'attaque dans leur modèle de menace, en l'absence de défense standardisée disponible.

RechercheActu
1 source
Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées
30arXiv cs.RO 

Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées

Une équipe de chercheurs a publié en juin 2026 sur arXiv (référence 2606.10208) une analyse de synthèse portant sur l'intégration des modèles de fondation dans les robots de soin aux personnes âgées et aux patients. L'article, classé comme Perspective, passe en revue l'état de l'art sur trois axes : les caractéristiques de conception, l'expérience utilisateur mesurée, et les preuves d'impact sur les soins. Le constat central est que les architectures dominantes utilisent les modèles de fondation comme couche de conversation et de raisonnement au sein d'incarnations socioassistives centrées sur la voix, des agents qui parlent et écoutent mais dont l'autonomie physique et la compréhension multimodale restent fortement limitées. Les évaluations empiriques rapportent des bénéfices positifs en termes d'utilisabilité et d'engagement, mais des défaillances de fiabilité persistent : hallucinations, ruptures conversationnelles et pannes dans le pipeline d'interaction. L'enjeu pour les intégrateurs et décideurs du secteur santé est précisément là : les métriques actuellement rapportées portent sur des résultats proximaux comme l'engagement cognitif ou la participation, et non sur des indicateurs cliniques validés. Les robots sociaux conversationnels améliorent peut-être le ressenti ou l'interaction, mais aucun système décrit dans la littérature ne démontre d'impact mesurable sur des outcomes de santé standardisés. Cette lacune est critique pour tout déploiement en EHPAD ou à l'hôpital, où la responsabilité médicale exige traçabilité et supervision humaine explicite. Les auteurs soulignent que les benchmarks génériques importés du NLP ou de la robotique généraliste ne sont pas adaptés aux contraintes des environnements de soin. Le contexte est celui d'une accélération massive des modèles de fondation en robotique, de PaLM-E à Pi-0 de Physical Intelligence en passant par GR00T N2 de NVIDIA, qui creuse un écart croissant entre capacités techniques et readiness clinique. Du côté des plateformes établies, Pepper (SoftBank) et PARO (AIST, Japon) restent les références les plus documentées en milieu de soin. Des acteurs européens comme Enchanted Tools avec Mirokaï, ou des projets portés par l'Inria, s'inscrivent dans cette dynamique. Les auteurs appellent à une transition vers des standards d'évaluation spécifiques aux soins, une autonomie avec supervision humaine intégrée dès la conception, et une intégration réelle dans les flux de travail cliniques, trois conditions encore largement non remplies par les systèmes actuels.

UEEnchanted Tools (Mirokaï) et l'Inria sont explicitement cités comme acteurs européens engagés dans la robotique de soin, et les lacunes identifiées (absence de standards d'évaluation cliniques, supervision humaine insuffisante) concernent directement les déploiements en EHPAD et hôpitaux français soumis à la réglementation médicale.

RecherchePaper
1 source
Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation
31arXiv cs.RO 

Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation

Des chercheurs ont publié le 10 juin 2026 (arXiv:2606.10501) une étude identifiant une vulnérabilité critique des modèles Vision-Language-Action (VLA) face aux défauts physiques articulaires. Ces modèles, qui traduisent instructions en langage naturel et observations visuelles en commandes motrices, équipent aujourd'hui les robots humanoïdes et manipulateurs les plus avancés. Les auteurs montrent que des failles réalistes, notamment dégradation d'actionneur, friction excessive due à l'usure, dommages de collision ou limites de sécurité restreintes, cassent la boucle fermée entre action commandée, mouvement réalisé et observation suivante, dégradant les taux de succès même pour des défauts physiquement « faisables ». L'impact varie selon l'articulation affectée, rendant toute mitigation générique difficile. En réponse, les auteurs proposent J-PARC (Joint-level Physical-fault Aware Residual Calibrator), un module léger ajouté au-dessus d'une politique VLA figée, qui infère un régime de défaut latent depuis la dynamique articulaire récente et applique une correction résiduelle adaptative sans modifier le modèle de base. Ce résultat comble un angle mort réel dans la validation des systèmes robotiques à base de VLA. L'effort de robustification s'est jusqu'ici concentré sur les variations perceptuelles et sémantiques : éclairage, occlusion, reformulation d'instructions. Or tout robot industriel accumule friction, chocs et dégradation d'actionneur au fil du temps. Montrer que ces perturbations physiquement réalisables suffisent à faire chuter les performances remet en cause l'hypothèse implicite qu'un VLA entraîné sur hardware neuf reste fiable tout au long de son cycle de vie opérationnel. Pour les intégrateurs et responsables de certification, c'est un signal fort : la robustesse mécanique doit entrer dans les critères de qualification aux côtés de la généralisation sémantique. L'approche J-PARC, sans fine-tuning ni capteur supplémentaire, offre une piste d'adaptation réaliste pour les déploiements existants. Les VLA ont connu une montée en puissance rapide depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), avec des déploiements annoncés chez Figure (modèle 03), Agility Robotics et 1X Technologies. Malgré leurs performances en laboratoire, leur comportement sur hardware vieillissant reste peu documenté dans la littérature. Ce papier s'inscrit dans une tendance croissante sur la fiabilité opérationnelle à long terme, aux côtés des travaux sur le sim-to-real gap. En Europe, des acteurs comme Enchanted Tools avec Mirokaï ou Wandercraft, où la dégradation articulaire est un enjeu quotidien en milieu médical ou logistique, sont directement concernés par ces résultats. Les prochaines étapes naturelles seront une validation sur hardware en vieillissement accéléré et l'intégration de J-PARC dans des pipelines de déploiement continu.

UELes acteurs français Enchanted Tools et Wandercraft, confrontés à la dégradation articulaire en milieu médical et logistique, peuvent directement intégrer J-PARC pour fiabiliser leurs déploiements VLA sans modifier leurs modèles de base.

💬 On a tous fait cette hypothèse implicite : un VLA entraîné en labo reste fiable sur un robot qui a pris des coups après 18 mois en prod. Ce papier montre que non, et c'est un angle mort réel pour tous les intégrateurs qui déploient en milieu industriel ou médical. J-PARC corrige ça sans toucher au modèle de base, bon, reste à voir si ça tient sur du vrai hardware vieilli.

IA physiqueOpinion
1 source
Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel
32arXiv cs.RO 

Contrôle de flux : piloter les modèles vision-langage-action avec des entrées simples en temps réel

Des chercheurs publient en juin 2026 une méthode baptisée "flow control" (arXiv:2606.10180) permettant de piloter en temps réel les modèles VLA (Vision-Language-Action) via des entrées génériques, comme un clavier ou un joystick, sans aucun ré-entraînement ni fine-tuning. L'approche opère à l'inférence en orientant l'échantillonnage du modèle vers des actions qui reflètent l'intention de l'opérateur tout en restant dans la distribution experte apprise à l'entraînement. Les auteurs documentent dans ce preprint quatre propriétés mesurées : guidage précis et réactif, robustesse aux commandes imprécises, taux de succès améliorés avec réduction des temps de tâche, et enfin un gain de performance autonome lorsqu'on fine-tune le VLA sur les trajectoires corrigées par flow control. L'enjeu est concret pour les intégrateurs : les VLAs montrent des performances solides en démo, mais leurs taux d'échec en déploiement réel restent non nuls face aux variations d'environnement et aux instructions ambiguës. Plutôt que de corriger ces défauts par du ré-entraînement coûteux, flow control permet à un opérateur de guider le robot à la volée sans dégrader la qualité des mouvements générés. La boucle est vertueuse : les corrections humaines produisent des trajectoires haute qualité réutilisables comme données d'entraînement, traçant un chemin de déploiement progressif où la supervision humaine se retire au fil des itérations. Les VLAs ont pris de l'ampleur avec Pi-0 de Physical Intelligence (publié fin 2024), dont l'architecture repose précisément sur le flow matching, d'où le jeu de mots du titre. NVIDIA GR00T N2, OpenVLA (Berkeley/Stanford), et les modèles LeRobot de Hugging Face (Paris) constituent les autres plateformes où cette couche de contrôle pourrait s'intégrer sans modifier le pipeline d'entraînement existant. L'idée de guidage conditionné à l'inférence existe déjà en génération d'images via le classifier guidance des modèles de diffusion, mais son application à la robotique physique restait peu explorée. Les prochaines étapes annoncées dans le papier incluent le fine-tuning systématique sur trajectoires flow-control pour quantifier le gain autonome à plus grande échelle.

UEHugging Face (Paris) est explicitement cité comme plateforme d'intégration via LeRobot, ce qui rend cette méthode directement applicable à l'initiative robotique open-source française sans modifier le pipeline d'entraînement existant.

💬 C'est exactement le problème que personne ne veut admettre sur les VLAs : ils impressionnent en démo et flanchent en prod dès que l'environnement bouge un peu. L'idée de guider l'échantillonnage à l'inférence plutôt que de tout ré-entraîner, c'est le genre de solution pragmatique qu'on attendait. La boucle où les corrections humaines deviennent des données d'entraînement, c'est propre, et si ça marche à l'échelle avec LeRobot, Hugging Face tient quelque chose de sérieux.

IA physiqueOpinion
1 source
Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes
33arXiv cs.RO 

Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes

Des chercheurs ont publié sur arXiv (référence 2602.05791) un framework baptisé XHugWBC, conçu pour entraîner un contrôleur de locomotion whole-body universel sur une large distribution de morphologies humanoïdes, puis le déployer en zero-shot sur des robots non vus durant l'entraînement. Les expériences couvrent douze humanoïdes simulés et sept robots réels. Le système repose sur trois briques techniques : une randomisation morphologique physiquement cohérente (masse des segments, longueur des membres, inertie), des espaces d'observation et d'action alignés sémantiquement entre châssis hétérogènes, et une architecture de politique qui encode explicitement les propriétés morphologiques et dynamiques de chaque instance. L'entraînement est unique, "one-time training" : aucun fine-tuning par robot n'est requis à l'inférence. L'enjeu industriel est direct. Aujourd'hui, chaque équipe robotique entraîne ses contrôleurs de locomotion depuis zéro pour chaque châssis, ce qui représente des semaines de simulation et d'itérations sim-to-real. XHugWBC déplace ce coût vers une phase d'entraînement généraliste unique, ouvrant la voie à un modèle de déploiement où un intégrateur peut adopter un nouveau châssis humanoïde sans reconstruire l'intégralité de sa stack de contrôle. La validation sur sept robots physiques est plus convaincante que les résultats purement simulés habituels, même si la nature exacte des tâches testées et les taux de succès détaillés ne figurent pas dans le résumé disponible. La capacité de transfert zero-shot sur morphologies inédites renforce l'hypothèse que les biais structuraux appris sur distributions larges surpassent les politiques spécialisées sur certains régimes de locomotion, ce que le secteur débattait encore il y a dix-huit mois. Ce travail s'inscrit dans un mouvement vers les contrôleurs dits "fondation" pour la robotique incarnée. En manipulation, des systèmes comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont déjà exploré la généralisation cross-embodiment sur bras et effecteurs; l'extension à la locomotion whole-body humanoïde est plus contrainte par la stabilité dynamique. Les acteurs du secteur, Figure Robotics (Figure 03), Unitree (G1, H1), Agility Robotics (Digit), Fourier Intelligence et 1X Technologies, maintiennent tous des pipelines de contrôle propriétaires et spécialisés. Si XHugWBC tient ses promesses à l'échelle, il réduirait significativement la barrière à l'entrée pour les nouveaux constructeurs, notamment les acteurs européens comme Enchanted Tools (Mirokaï) ou Wandercraft, qui ne disposent pas des ressources d'entraînement des géants américains. Le preprint n'a pas encore fait l'objet d'une évaluation par les pairs.

UELes constructeurs humanoïdes français Wandercraft et Enchanted Tools (Mirokaï) sont explicitement identifiés comme bénéficiaires potentiels, ce framework pouvant réduire significativement leurs coûts d'entraînement de locomotion sans nécessiter les ressources des géants américains.

💬 C'est le genre de papier qui résout un vrai problème industriel : chaque robot humanoïde qui sort oblige aujourd'hui à tout réentraîner depuis zéro. Sept robots physiques en zero-shot, c'est pas du tout la même chose que des résultats simulés, ça valide quelque chose de sérieux. Pour Wandercraft ou Enchanted Tools, bien plus contraints en ressources que Figure ou Unitree, ce type de contrôleur généraliste c'est du concret.

IA physiqueOpinion
1 source
Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération
34arXiv cs.RO 

Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération

Une équipe de chercheurs a publié le 10 juin 2026 (arXiv:2606.08881) un benchmark standardisé pour évaluer des modèles Vision-Language-Action (VLA) sur le robot SO-101, une plateforme manipulatrice à faible coût issue de la communauté open-source. Quatre politiques ont été comparées sur quatre tâches de manipulation représentatives avec des protocoles d'évaluation unifiés : Pi-0.5 (Physical Intelligence), SmolVLA (HuggingFace), Wall-X et ACT (Action Chunking with Transformers, référence en imitation learning). Toutes ont été fine-tunées directement sur le matériel physique à partir de démonstrations télé-opérées en conditions réelles, sans passer par la simulation. Au-delà du simple taux de succès binaire, l'étude introduit une taxonomie structurée des échecs, une décomposition sémantique et d'exécution, ainsi que des métriques de récupération (recovery-aware metrics) pour qualifier la robustesse de chaque architecture. Les résultats confirment que les VLA pré-entraînés sur de larges corpus surpassent globalement la baseline en imitation learning pure, mais cette supériorité reste fortement dépendante de la tâche. Ce point est crucial pour les intégrateurs : l'instabilité d'exécution, et non les erreurs de compréhension sémantique, constitue la source d'échec dominante. La capacité de récupération varie significativement selon les architectures, ce qui suggère que les benchmarks centrés uniquement sur le taux de succès final masquent des différences opérationnelles importantes. Pour un COO industriel, cela signifie que le choix d'un modèle VLA ne peut pas se faire sur des métriques agrégées sans analyser le comportement en cas d'échec partiel. Le SO-101 s'est imposé comme plateforme de référence communautaire grâce à son coût accessible, là où la plupart des évaluations VLA existantes reposent sur des robots industriels onéreux (Franka, UR, Boston Dynamics Spot) ou restent cantonnées à la simulation. Ce travail s'inscrit dans un effort plus large de démocratisation des benchmarks robotiques, face à des acteurs comme Figure AI, Agility Robotics ou 1X Technologies qui évaluent leurs systèmes en environnements propriétaires non reproductibles. Les auteurs positionnent explicitement le SO-101 comme socle pratique pour l'évaluation de l'IA incarnée dans des conditions de déploiement réalistes à faible coût. La prochaine étape naturelle serait d'étendre ce protocole à des scénarios de manipulation plus complexes et à davantage d'architectures VLA émergentes, notamment celles intégrant des retours haptiques.

UESmolVLA de HuggingFace (entreprise française) est directement comparé à Pi-0.5, Wall-X et ACT dans ce benchmark standardisé, offrant une visibilité internationale sur les forces et faiblesses du modèle français face aux architectures VLA concurrentes.

FR/EU ecosystemeActu
1 source
vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)
35arXiv cs.RO 

vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)

Des chercheurs de FAI ModelOpt Tech ont publié en juin 2026 vla.cpp (arXiv 2606.08094), un moteur d'inférence C++ portable construit sur llama.cpp pour exécuter des politiques VLA (Vision-Language-Action) directement sur le matériel embarqué des robots. L'engine prend en charge sept architectures couvrant cinq familles de backbones et quatre têtes d'action via un protocole requête/réponse unifié, incluant les schémas d'inférence par flow-matching et par diffusion propres aux VLA récents. Sur le benchmark LIBERO-Object, il reproduit le meilleur checkpoint SOTA à un épisode près sur 200 ; BitVLA y atteint 100 % de succès dans 1,3 Gio de mémoire. Le même bundle s'exécute sans modification sur trois niveaux matériels, d'un GPU grand public jusqu'à un module embarqué de 8 Go de RAM. Un noyau GEMM IMMA en escalier, dérivé d'une analyse roofline multi-hardware, réduit la latence par étape de BitVLA d'un facteur 4,5. Les auteurs ont également conduit un test de stress sur un bras ALOHA pour mesurer la contrainte de latence de replanification face à une cible mobile. Le problème structurel que vla.cpp attaque est la dépendance des stacks Python/PyTorch actuels à un GPU de station de travail, hypothèse incompatible avec l'électronique embarquée des robots commerciaux ou des cobots industriels. Démontrer une exécution à succès complet dans 1,3 Gio ouvre concrètement la voie au déploiement edge sans serveur distant ni dépendance cloud pour des tâches de manipulation. L'analyse roofline publiée dans le papier établit un résultat contre-intuitif pour les intégrateurs : l'inférence VLA en batch-1 est compute-bound, non bandwidth-bound, ce qui déplace le levier d'optimisation vers le taux d'utilisation du calcul. L'unification de sept architectures sous un seul protocole réduit également la fragmentation de l'écosystème VLA, frein réel à l'adoption en production. vla.cpp hérite de l'approche de quantification ggml et de la portabilité de llama.cpp de Georgi Gerganov. Les modèles ciblés incluent des architectures issues de Physical Intelligence (pi0) et des projets ouverts comme OpenVLA. La concurrence directe sur ce segment est limitée : la plupart des équipes robotiques maintiennent des pipelines Python maison dépendants de GPU Nvidia RTX 3090/4090 ; ROS 2 et Isaac ROS de Nvidia offrent des primitives d'intégration mais pas de runtime VLA unifié. Aucun acteur français ou européen n'est directement cité dans le papier. Le code, les vidéos de démonstration et le scaffold de benchmark reproductible sont disponibles sur le site du projet.

UEAucun acteur européen impliqué dans le développement, mais le runtime portable est directement exploitable par les équipes R&D françaises et européennes cherchant à déployer des politiques VLA sur matériel embarqué sans dépendance cloud.

💬 Faire tourner une politique VLA dans 1,3 Gio sans GPU de workstation, c'est le vrai débloqueur que les équipes robotique attendaient. Le reste, les sept architectures unifiées, le protocole commun, c'est utile, mais ce qui compte c'est que le déploiement edge devient une option sérieuse sans serveur distant. Reste à voir si ça tient sur des tâches moins sages que LIBERO-Object.

IA physiqueOpinion
1 source
Attaquer les modèles du monde pour compromettre les pipelines d'apprentissage robotique
36arXiv cs.RO 

Attaquer les modèles du monde pour compromettre les pipelines d'apprentissage robotique

Un preprint déposé sur arXiv le 9 juin 2026 (arXiv:2606.09499) expose une classe inédite d'attaques par empoisonnement de données ciblant les world models intégrés aux pipelines d'apprentissage robotique. Contrairement aux attaques traditionnelles qui insèrent directement des trajectoires dangereuses dans un jeu de données vendu ou publié, la méthode décrite ici injecte des prompts malveillants ou des dynamiques de transition compromises dans des datasets de téléopération en apparence sûrs. L'attaque reste dormante jusqu'à ce que ces données soient traitées par un world model, lequel génère alors des trajectoires synthétiques d'entraînement dangereuses, aboutissant au déploiement d'une politique robotique unsafe. Les chercheurs démontrent l'efficacité de l'attaque sur deux paradigmes distincts : les world models conditionnés par l'action (action-conditioned) et ceux conditionnés par le texte (text-conditioned). Résultat concret : un backdoor de bout en bout sur une politique DRL (Deep Reinforcement Learning) en aval, et une preuve de concept dans le cadre VLA (Vision-Language-Action). L'enjeu pour l'industrie est structurel. Les world models sont désormais utilisés comme substituts de données dans les pipelines d'entraînement de robots humanoïdes et industriels, notamment pour réduire le coût de la collecte téléopérée. L'attaque décrite contourne l'hypothèse fondatrice de sécurité dans ces pipelines : que des données ground truth visuellement propres garantissent une politique sûre. Ce n'est pas le cas si le world model interposé est lui-même vulnérable. Pour les intégrateurs qui achètent ou mutualisent des datasets de téléopération, et pour les fournisseurs qui commercialisent des world models pré-entraînés, c'est un vecteur d'attaque supply chain directement actionnable, d'autant plus redoutable qu'il ne laisse aucune trace visible dans les données source. Les world models ont connu une adoption rapide ces dix-huit derniers mois, portée par des travaux comme UniSim, IRASim ou le framework GR00T N2 de NVIDIA, promus comme solution au sim-to-real gap et à la pénurie de données réelles. La recherche s'inscrit dans un contexte où Figure, Agility Robotics et 1X accélèrent leurs déploiements en environnement industriel, rendant la surface d'attaque potentielle concrète et non purement théorique. Les auteurs appellent à reconsidérer la position des world models dans la chaîne d'entraînement et à ouvrir un axe de recherche dédié à leur sécurisation, un chantier aujourd'hui quasi inexistant dans la littérature.

UELes acteurs européens de la robotique qui mutualisent des datasets de téléopération ou intègrent des world models pré-entraînés (startups, intégrateurs, labos comme le CEA-List ou l'INRIA) sont exposés au même vecteur d'attaque supply chain, sans qu'aucun standard de sécurité européen ne couvre encore ce risque spécifique.

RechercheOpinion
1 source
La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?
37arXiv cs.RO 

La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?

Une équipe de chercheurs publie sur arXiv (référence 2507.06219) une étude systématique sur le rôle de la diversité des données dans l'apprentissage de la manipulation robotique, remettant en cause l'intuition du "plus c'est divers, mieux c'est". Trois dimensions sont examinées indépendamment. La diversité des tâches s'avère plus critique que le volume de démonstrations par tâche pour le transfert vers de nouveaux scénarios. L'entraînement multi-robots (multi-embodiment) n'est pas nécessaire au transfert inter-plateformes : un modèle entraîné sur un seul type de robot avec des données de haute qualité transfère aussi efficacement, avec de meilleures propriétés de scaling au fine-tuning. Enfin, la diversité des experts humains peut nuire à l'apprentissage via la multimodalité des vitesses d'exécution, chaque opérateur ayant ses propres rythmes et préférences gestuelles. Pour corriger ce biais, les auteurs introduisent une méthode de distribution debiasing appliquée à leur modèle GO-1-Pro, qui gagne 15% de performance, l'équivalent de multiplier par 2,5 le volume de pré-entraînement. Ces résultats ont des implications directes pour les équipes qui conçoivent des pipelines de collecte de données. La conclusion sur le multi-embodiment est particulièrement contre-intuitive : constituer un corpus mono-robot de haute qualité avant de fine-tuner est plus efficace qu'accumuler des datasets disparates multi-robots. Pour un intégrateur ou un décideur industriel, cela redéfinit les priorités de curation : couvrir un maximum de tâches prime sur l'accumulation brute de démonstrations, et standardiser les démonstrations expert devient un levier de performance mesurable. La multimodalité des vitesses est désormais un biais identifiable et corrigeable en amont du pipeline, pas une fatalité inhérente à la collecte humaine. Ce travail s'inscrit dans la dynamique portée par Google DeepMind (RT-2), Physical Intelligence (Pi-0) et les équipes de Berkeley (OpenVLA, Octo), qui cherchent à construire des fondations généralistes pour la manipulation depuis 2023. Contrairement au texte ou aux images, les données de démonstration robotique restent coûteuses à produire, ce qui rend les choix de stratégie de scaling particulièrement stratégiques. Les conclusions orientent directement les acteurs comme Figure AI (Figure 03), Agility Robotics ou, en France, Enchanted Tools (Mirokaï), qui investissent dans de larges datasets de manipulation. Ce travail est purement académique : aucun déploiement ni partenariat commercial n'est annoncé.

UEEnchanted Tools (Mirokaï) est explicitement citée comme acteur concerné par ces stratégies de scaling des données de manipulation, rendant les conclusions directement applicables à leur R&D en France.

RecherchePaper
1 source
OLIVE : apprentissage incrémental en ligne à faible rang pour exosquelettes adaptatifs efficaces
38arXiv cs.RO 

OLIVE : apprentissage incrémental en ligne à faible rang pour exosquelettes adaptatifs efficaces

Des chercheurs ont publié le 5 juin 2026 sur arXiv (2606.05234) OLIVE, un framework d'adaptation en ligne pour exosquelettes portables basé sur une décomposition de rang faible. Le principe central : plutôt que de recalculer l'intégralité de la politique de contrôle, OLIVE décompose la composante adaptative en une forme résiduelle ΔW = A·Bᵀ de rang r très inférieur aux dimensions du modèle, ce qui réduit le coût de mise à jour de O(dk) à O(r(d+k)). Concrètement, le contrôleur de base pré-entraîné reste stable, tandis qu'une couche légère se personnalise en continu à partir des capteurs embarqués : EMG (électromyographie), IMU et vibrations, sans trajectoire de référence hors ligne. Un mécanisme de gating module l'intensité de la personnalisation selon le contexte, et un ordonnanceur de rang dynamique alloue une faible capacité sur terrain plat, puis monte en rang sur surfaces irrégulières, escaliers ou pentes. Les résultats expérimentaux sur plateforme réelle annoncent des gains de +13 points de pourcentage en fluidité de marche, +22 en réduction d'effort musculaire, et +15 en stabilité du mouvement par rapport à la meilleure baseline testée, avec convergence en environ 1 800 pas de marche et une latence bout-en-bout de 7,4 ms. L'enjeu clinique et industriel est significatif. Les exosquelettes existants (Ekso, ReWalk, Wandercraft avec son Atalante) s'appuient majoritairement sur des politiques de marche statiques, calibrées en laboratoire et peu robustes aux variations de terrain ou de morphologie individuelle. OLIVE propose une alternative déployable à l'embarqué, sans cloud, sans session de calibration préalable longue, et sans capteurs de force au sol. La latence de 7,4 ms est compatible avec les exigences temps-réel des systèmes de contrôle d'exosquelettes (généralement sous 10 ms). Si les gains annoncés tiennent en dehors du cadre expérimental contrôlé, cela réduirait substantiellement le temps d'adaptation à un nouvel utilisateur ou à un environnement non familier, un frein majeur à la commercialisation des dispositifs d'assistance à la mobilité. Le travail s'inscrit dans la vague des méthodes d'adaptation paramétrique légère issues du fine-tuning de LLMs (LoRA, notamment), transposées ici au contrôle robotique continu. Les approches concurrentes dans l'espace exosquelette incluent les méthodes d'apprentissage par renforcement avec modèles appris (model-based RL) et les politiques meta-apprises (MAML-style), généralement plus lourdes à déployer sur matériel embarqué. L'équipe derrière OLIVE a rendu le code public sur GitHub (FastLM/OLIVE). Les prochaines étapes non précisées dans le papier concerneront vraisemblablement la validation sur cohortes cliniques plus larges et l'intégration sur des plateformes commerciales, où la certification médicale reste le principal obstacle au déploiement à grande échelle.

UEWandercraft (fabricant français de l'Atalante) est explicitement cité comme référence concurrentielle ; si les gains d'OLIVE sont confirmés sur cohortes cliniques, cela pourrait contraindre Wandercraft à intégrer une couche d'adaptation en ligne dans sa prochaine génération d'exosquelettes pour rester compétitif sur le critère de personnalisation utilisateur.

ExosquelettesPaper
1 source
Ce que mesurent réellement les benchmarks en manipulation robotique
39arXiv cs.RO 

Ce que mesurent réellement les benchmarks en manipulation robotique

Un article de recherche déposé sur arXiv le 4 juin 2026 (arXiv:2606.04233) remet en cause la fiabilité de cinq benchmarks standards en manipulation robotique : LIBERO, CALVIN, SimplerEnv, RoboCasa et RoboTwin 2.0. Les auteurs identifient quatre modes de défaillance structurelle qui invalident leur usage comme proxy de la capacité de manipulation générale : résolution par raccourci (shortcut solvability), absence de significativité statistique, surapprentissage rampant (creeping overfitting) et dépendance à la source de données. Sur LIBERO, une sonde de 90 millions de paramètres, sans encodeur de langage, atteint des scores au niveau ou proches de l'état de l'art rapporté dans la littérature récente, ce qui suggère que les modèles exploitent des artefacts du benchmark plutôt que des compétences réelles. Sur CALVIN, la simple randomisation des positions des blocs dans la plage d'entraînement fait chuter les performances de toutes les politiques testées, révélant une généralisation quasi nulle même dans des conditions marginalement différentes. Ces résultats ont des implications directes pour les équipes qui évaluent des architectures VLA (Vision-Language-Action). Si LIBERO et CALVIN échouent à plusieurs diagnostics, les progrès revendiqués sur ces benchmarks ne constituent pas une preuve crédible de capacité de manipulation générale. La plupart des gains rapportés sur LIBERO ne sont pas statistiquement significatifs, ce qui signifie que de nombreuses publications revendiquent des améliorations qui pourraient n'être que du bruit. Pour les intégrateurs et les décideurs industriels, cela signifie que les scores de benchmarks courants ne sont pas des indicateurs fiables de la maturité réelle d'un système avant déploiement. Le problème n'est pas nouveau, mais il devient critique au moment où des VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA sont massivement benchmarkés dans la littérature. RoboCasa et RoboTwin 2.0, moins fréquemment cités dans les claims de progression récents, résistent mieux aux diagnostics proposés et constituent des alternatives plus robustes pour mesurer des progrès réels. Les auteurs publient leurs quatre diagnostics avec des implémentations de référence sur ripl.github.io/manipulationbenchmarkaudit, à destination des chercheurs et des reviewers, pour application avant soumission ou acceptation. La prochaine question est de savoir si des conférences majeures comme CoRL, ICRA ou RSS adopteront ces outils comme critère d'évaluation des soumissions.

UELes équipes de recherche françaises et européennes (INRIA, CEA-List) évaluant des architectures VLA devront appliquer ces diagnostics avant soumission pour ne pas revendiquer des gains qui pourraient n'être que du bruit statistique.

RecherchePaper
1 source
Comment les utilisateurs évaluent les performances des modèles fondation robotiques au-delà du taux de réussite des tâches
40arXiv cs.RO 

Comment les utilisateurs évaluent les performances des modèles fondation robotiques au-delà du taux de réussite des tâches

Une étude publiée sur arXiv (arXiv:2602.03920) examine comment des utilisateurs non-spécialistes interprètent les données de performance des modèles de fondation robotiques (RFM, Robot Foundation Models), ces architectures d'IA généraliste conçues pour piloter des robots domestiques polyvalents comme ceux développés par Physical Intelligence (pi0), Google DeepMind (GR00T N2) ou Figure AI. Le cœur du problème : lorsqu'un utilisateur demande à un robot RFM d'effectuer une tâche hors de son domaine d'entraînement, il doit pouvoir évaluer le risque d'échec, qui peut être coûteux, voire dangereux. Les chercheurs ont exposé des participants à des données réelles issues de plusieurs projets RFM publiés, incluant le taux de succès aux tâches (TSR, Task Success Rate), des descriptions de cas d'échec et des vidéos de démos. Les résultats montrent que les non-experts comprennent et utilisent le TSR de façon conforme aux attentes des spécialistes, ce qui valide son usage comme métrique primaire dans les publications académiques. Mais la découverte la plus significative est ailleurs : les utilisateurs accordent une valeur élevée aux descriptions de cas d'échec, une information rarement reportée de façon systématique dans les évaluations de RFMs. Par extension, ils souhaitent disposer à la fois de données historiques issues des évaluations passées du modèle et d'estimations proactives du robot sur ses chances de succès face à une tâche inédite. Cette attente soulève un défi concret pour les intégrateurs et les équipes produit : la transparence sur les limites du modèle n'est pas optionnelle si l'on vise un déploiement grand public. Ce travail s'inscrit dans un débat plus large sur le fossé entre les démos laboratoire et l'usage réel, souvent qualifié de "demo-to-reality gap". Alors que le secteur converge vers des benchmarks standardisés comme DROID ou Open-X-Embodiment pour comparer les RFMs entre eux, la question de leur lisibilité par les décideurs non-techniques reste largement ouverte. Des acteurs comme Enchanted Tools en France ou Wandercraft misent sur des interfaces d'interaction proches de l'utilisateur final, mais peu d'équipes formalisent encore la communication sur les taux d'échec. Cette étude plaide pour l'intégration de "failure reporting" structuré dans les fiches produit et les publications techniques, une évolution qui pourrait devenir un critère de certification dans les futures réglementations européennes sur la robotique.

UEL'étude plaide pour un 'failure reporting' structuré qui pourrait devenir un critère de certification dans les futures réglementations européennes sur la robotique, concernant directement Enchanted Tools et Wandercraft pour leurs fiches produit.

RecherchePaper
1 source
TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux
41arXiv cs.RO 

TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux

Des chercheurs ont publié sur arXiv (réf. 2603.23117) une attaque baptisée TRAP (Targeted Reasoning Adversarial Patch), démontrant pour la première fois qu'un patch adversarial physique peut détourner le comportement d'un robot manipulateur piloté par un modèle Vision-Language-Action (VLA) à raisonnement Chain-of-Thought (CoT). Dans les expériences présentées, un patch imprimé sur papier et déposé sur la surface de travail, tel qu'une nappe aux motifs spécifiques, suffit à faire en sorte que le robot remette un couteau à l'opérateur au lieu d'une pomme, sans qu'aucune modification de l'instruction utilisateur ne soit nécessaire. L'attaque a été validée sur trois VLA représentatifs intégrant des mécanismes CoT distincts, et mise en oeuvre en conditions réelles avec un simple imprimé papier. Ce résultat pointe une vulnérabilité structurelle dans les VLA à raisonnement intermédiaire, famille de modèles qui inclut notamment π0 de Physical Intelligence, OpenVLA-OFT ou les variantes de GR00T (NVIDIA) basées sur des CoT explicites. Les auteurs montrent empiriquement que le raisonnement CoT gouverne la génération d'actions de façon prépondérante, même lorsqu'il est sémantiquement incohérent avec l'instruction initiale : le modèle suit la chaîne de pensée corrompue plutôt que l'intention de l'utilisateur. Pour les intégrateurs déployant des bras robotisés en environnement ouvert, entrepôts, blocs opératoires ou assistance à domicile, cela signifie qu'un adversaire pourrait modifier le comportement du robot par simple altération visuelle de l'environnement, sans accès au modèle ni au flux de commandes, ce qui rend l'attaque particulièrement préoccupante en contexte de sécurité physique. Les VLA à raisonnement CoT ont émergé comme réponse aux limites des modèles action-réflexe classiques : le CoT améliore la généralisation et offre une trace d'interprétabilité utile pour la certification. TRAP montre que cette avancée introduit simultanément une surface d'attaque inédite. La recherche en sécurité des systèmes robotiques autonomes reste largement sous-investie par rapport à la sécurité des LLM textuels, et ce travail rejoint un corpus naissant incluant des attaques sur les politiques de diffusion et les modèles de perception. Aucun correctif ni benchmark défensif n'est proposé dans cette version ; les auteurs appellent à une sécurisation urgente des pipelines CoT dans les VLA avant tout déploiement à grande échelle dans des environnements critiques.

UELes intégrateurs européens déployant des VLA sur des bras robotisés en environnement industriel, médical ou d'assistance doivent suspendre tout déploiement à grande échelle dans des environnements critiques et auditer leurs pipelines CoT, en l'absence totale de correctifs défensifs disponibles.

RechercheOpinion
1 source
Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique
42arXiv cs.RO 

Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique

NVIDIA a publié Cosmos 3, une famille de modèles du monde omnimodaux capables de traiter et générer conjointement du texte, des images, de la vidéo, de l'audio et des séquences d'actions au sein d'une architecture unifiée de type mixture-of-transformers. Présenté dans un preprint arXiv (2606.02800) le 3 juin 2026, Cosmos 3 fusionne en un seul framework quatre catégories de modèles jusqu'ici distinctes : modèles vision-langage (VLM), générateurs vidéo, simulateurs de monde et modèles action-monde. Les variantes post-entraînées ont été classées meilleures modèles open-source texte-vers-image et image-vers-vidéo par Artificial Analysis, et meilleur modèle de politique robotique par RoboArena. Code, checkpoints, datasets synthétiques et benchmarks d'évaluation sont publiés sous la licence OpenMDW-1.1 de la Linux Foundation, sur GitHub et HuggingFace. L'intégration de ces modalités dans un backbone scalable unique représente un changement architectural structurant pour l'IA physique. Pour un intégrateur robotique ou un décideur industriel, Cosmos 3 signifie qu'un seul modèle peut simultanément percevoir une scène, simuler des séquences vidéo plausibles, produire des instructions en langage naturel et prédire des séquences d'actions, sans recourir à plusieurs stacks spécialisés. La performance sur RoboArena, benchmark indépendant d'évaluation des politiques de contrôle robot, suggère que l'approche omnimodale ne sacrifie pas la précision des politiques à la généralité, une hypothèse régulièrement contestée dans le secteur. La mise à disposition des benchmarks sous licence ouverte offre en outre la possibilité d'un audit externe des performances, ce que les publications classiques de laboratoire ne permettent pas toujours. Cosmos 3 prolonge la trajectoire de NVIDIA en Physical AI amorcée avec Cosmos 1.x, présenté début 2025 comme plateforme de simulation pour l'entraînement robotique. L'architecture mixture-of-transformers rappelle des choix similaires chez Google DeepMind (Gemini) et Meta (Chameleon), mais avec un focus explicite sur l'embodiment et le contrôle moteur. Les concurrents directs sur le segment world-model pour robots incluent Physical Intelligence avec Pi-0, Google DeepMind avec ses successeurs de RT-2, et Skild AI. L'ouverture complète du code et des poids sous licence permissive est un signal stratégique clair : NVIDIA mise sur l'adoption par l'écosystème pour faire de Cosmos l'infrastructure de référence de l'IA physique, répliquant la dynamique qui a fait de CUDA le standard incontournable du calcul GPU.

UELes laboratoires et intégrateurs robotiques européens peuvent immédiatement adopter Cosmos 3 comme infrastructure open-source (licence permissive OpenMDW-1.1) pour leurs développements en IA physique, sans frais de licence et avec des benchmarks auditables.

💬 La comparaison avec CUDA n'est pas anodine. NVIDIA ne publie pas Cosmos 3 par générosité open-source, ils font exactement ce qu'ils ont fait en 2007 : poser le layer d'infrastructure que tout le monde finira par utiliser, et vendre les GPU par-dessus. Vu les benchmarks sur RoboArena, les labos robotiques ont peu de raisons de résister.

IA physiqueOpinion
1 source
SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA
43arXiv cs.RO 

SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA

Des chercheurs en sécurité informatique ont publié sur arXiv (référence 2601.14323) une attaque baptisée SilentDrift, ciblant les modèles Vision-Language-Action (VLA) utilisés pour piloter des robots manipulateurs. L'attaque exploite deux mécanismes devenus standards dans les architectures VLA modernes : l'action chunking, qui consiste à générer des séquences de K actions d'un coup plutôt qu'action par action, et la représentation en delta de pose, qui encode chaque mouvement sous forme d'incrément relatif à la position précédente. Cette combinaison crée une boucle ouverte visuelle intra-chunk : une fois la séquence lancée, le robot l'exécute sans relire le flux caméra à chaque pas. Des perturbations imperceptibles à l'échelle d'un pas s'accumulent alors par intégration, déviant la trajectoire finale de manière significative. Sur le benchmark LIBERO, SilentDrift atteint un taux de succès d'attaque de 93,2 % avec un taux d'empoisonnement inférieur à 2 % des données d'entraînement, tout en maintenant un taux de réussite sur tâches propres de 95,3 %, rendant la backdoor pratiquement indétectable par les métriques standards. L'impact pour les intégrateurs et décideurs B2B est direct : les VLA comme pi-0 de Physical Intelligence, OpenVLA ou les variantes de RT-2 s'appuient précisément sur ces mécanismes d'action chunking pour obtenir des mouvements fluides et cohérents. Un attaquant ayant accès à une fraction marginale des données d'entraînement peut donc compromettre un système de manipulation robotique déployé en environnement industriel sans déclencher d'alarme sur les métriques de performance habituelles. Les trajectoires empoisonnées sont visuellement identiques aux démonstrations saines, ce qui invalide les audits visuels comme contrôle de qualité suffisant. La stratégie dite "keyframe attack" de SilentDrift cible spécifiquement la phase d'approche critique d'une saisie, maximisant l'effet de déviation tout en minimisant l'exposition du trigger. Ce travail s'inscrit dans un courant de recherche naissant sur la sécurité des modèles de fondation pour la robotique, un champ largement ignoré jusqu'ici face à l'effervescence autour des performances. Les VLA connaissent une adoption rapide depuis 2023, portée par des acteurs comme Physical Intelligence (pi-0), Google DeepMind (RT-2, GR00T N2 de Nvidia) et les laboratoires académiques via des benchmarks comme LIBERO ou Open-X Embodiment. SilentDrift est une attaque en boîte noire, ce qui signifie qu'elle ne nécessite pas d'accès au modèle entraîné, uniquement aux données. Les auteurs n'annoncent pas de contre-mesure, ouvrant un chantier de recherche défensive urgent à mesure que ces modèles approchent de déploiements réels dans la logistique et l'assemblage manufacturier.

UELes intégrateurs européens qui déploient ou évaluent des VLA (pi-0, OpenVLA, RT-2) dans la logistique ou l'assemblage doivent intégrer l'audit de sécurité des données d'entraînement dans leurs processus de qualification, car les métriques de performance standards ne détectent pas ce vecteur d'attaque.

RechercheOpinion
1 source
Erreur par groupe, pas MSE totale : affinage de modèles VLA pour la manipulation mobile à 11 DOF
44arXiv cs.RO 

Erreur par groupe, pas MSE totale : affinage de modèles VLA pour la manipulation mobile à 11 DOF

Des chercheurs ont publié le 1er juin 2026 sur arXiv une étude portant sur le fine-tuning de modèles Vision-Language-Action (VLA) pour manipulateurs mobiles à 11 degrés de liberté (DoF), en l'occurrence le Toyota HSR. Ils ont comparé SmolVLA (450 millions de paramètres, entraînement sur la tête d'action uniquement) et π0.5 de Physical Intelligence (3,3 milliards de paramètres), évalués sur 60 essais réels (20 par variante). Le résultat central : le checkpoint affichant la meilleure erreur quadratique moyenne (MSE) agrégée n'est pas celui qui performe le mieux sur le robot physique. π0.5 à 80 000 étapes obtient un score de 4,0/4, devançant la variante expert-only à 3 000 étapes (3,75/4) et HSR-SmolVLA (3,5/4), avec une significativité statistique confirmée (Mann-Whitney p ≤ 0,010), malgré une MSE totale plus élevée pour le modèle gagnant. L'enjeu est méthodologique autant que pratique. Sur un robot hétérogène comme le HSR, les articulations faciles à prédire (tête, base) tirent la MSE agrégée vers le bas et masquent les joints critiques (bras) qui continuent d'échouer. Dans la variante expert-only de π0.5, geler le backbone et n'entraîner que la tête d'action fait chuter la MSE totale sous la baseline, mais dégrade précisément la précision du bras. L'analyse par groupe (bras, pince, tête, base roulante) révèle que c'est l'erreur du groupe bras hors ligne, et non la MSE totale ni l'erreur de la base, qui corrèle le plus fidèlement avec la performance réelle. Ce constat remet en question une pratique courante dans le déploiement de VLA sur robots multi-segments. Le Toyota HSR est une plateforme de référence en manipulation domestique et en recherche académique. Les modèles VLA s'imposent comme paradigme dominant depuis les travaux RT-2 de Google DeepMind (2023), suivis de π0 et π0.5 de Physical Intelligence (San Francisco), SmolVLA de HuggingFace (Paris), ou encore OpenVLA de Stanford. Le problème de la sélection de checkpoint par MSE agrégée était jusqu'ici peu documenté pour les espaces d'action hétérogènes. Le code de cette étude est publié en open source sur GitHub, ce qui permet une réplication directe. Prochaine étape logique : valider cette approche per-group sur d'autres plateformes humanoïdes à espace d'action encore plus fragmenté.

UESmolVLA de HuggingFace (Paris) est l'un des deux modèles centralement évalués, et les résultats méthodologiques (sélection de checkpoint par groupe d'articulations) guident directement les équipes européennes déployant des VLA sur manipulateurs mobiles hétérogènes.

💬 Évaluer un checkpoint VLA par la MSE totale sur un robot à 11 DOF, c'est se raconter des histoires. Les articulations simples, tête et base roulante, tirent le score agrégé vers le bas et cachent que le bras, lui, continue de foirer : le modèle gagnant sur la métrique standard n'est pas celui qui tient en conditions réelles. Ce papier le prouve proprement avec 60 essais physiques, et avec SmolVLA de HuggingFace dans le lot, c'est pas juste un résultat académique.

IA physiqueOpinion
1 source
Wall-OSS-0.5 : rapport technique
45arXiv cs.RO 

Wall-OSS-0.5 : rapport technique

Une équipe de chercheurs a publié sur arXiv (2605.30877) le rapport technique de Wall-OSS-0.5, un modèle Vision-Language-Action (VLA) open source de 4 milliards de paramètres, construit sur un backbone VLM de 3B paramètres auquel sont greffés des composants de génération d'actions. Le modèle a été pré-entraîné sur plus de 20 morphologies robotiques différentes, en ingérant plus d'un million de trajectoires robot par époque, couplées à un corpus multimodal ancré. La recette d'entraînement repose sur un co-entraînement à gradient bridgé combinant trois objectifs complémentaires : prédiction d'actions discrètes pour faire circuler des gradients VLM forts dans le backbone, prédiction multimodale pour préserver la compréhension vision-langage, et flow matching continu comme interface d'action au moment du déploiement. Avant tout fine-tuning spécifique, le checkpoint pré-entraîné atteint des comportements zero-shot non triviaux sur un banc de 17 tâches réelles, y compris une tâche de manipulation d'objets déformables hors distribution. Après fine-tuning, il affiche 60,5% de progression moyenne sur 15 tâches réelles et surpasse Pi-0.5 de 17,5 points de pourcentage. Ce résultat repose la question fondamentale du pré-entraînement VLA : jusqu'ici, la quasi-totalité des preuves de performance étaient mesurées après fine-tuning, rendant impossible la distinction entre "le pré-entraînement forme une politique utilisable" et "le pré-entraînement fournit juste une meilleure initialisation". Wall-OSS-0.5 démontre que le checkpoint brut produit des comportements exécutables sur matériel physique, y compris sur des tâches jamais vues. Le fait que l'entraînement sur données d'action ne dégrade pas les capacités vision-langage générales est également significatif pour les intégrateurs : cela suggère qu'un seul modèle fondation peut couvrir perception, raisonnement et contrôle sans compromis majeur, ce qui simplifie l'architecture système. Wall-OSS-0.5 s'inscrit dans la dynamique des VLA fondationnels initiée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa publication open source le distingue dans un secteur dominé par des checkpoints propriétaires, et permet des comparaisons reproductibles. La performance zero-shot sur manipulation déformable est notable car ce type de tâche est réputé difficile à généraliser : c'est précisément le type de gap sim-to-real que les approches purement simulées peinent à combler. Les prochaines étapes probables incluent un scaling du corpus et des évaluations sur des plateformes humanoïdes commerciales, où la generalisation cross-embodiment du modèle pourra être testée en conditions industrielles.

UELe caractère open source de Wall-OSS-0.5 permet aux équipes de R&D françaises et européennes d'accéder librement à un modèle VLA fondationnel compétitif, réduisant la dépendance aux checkpoints propriétaires américains et asiatiques.

💬 Le vrai truc ici, c'est pas les 60,5% sur le benchmark. C'est que le checkpoint pré-entraîné produit des comportements exécutables sur du vrai matériel, sans fine-tuning, y compris sur des tâches jamais vues. Et open source par-dessus le marché, dans un secteur où tout le monde garde jalousement ses poids pour soi.

IA physiqueOpinion
1 source
Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements
46arXiv cs.RO 

Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements

Des chercheurs associés à Siemens ont publié le 28 mai 2026 sur arXiv (2605.27461) une étude de déploiement industriel d'une politique VLA (Vision-Language-Action) dans l'usine Siemens GWE d'Erlangen, en Allemagne. La tâche ciblée est précisément définie : un bras robotique doit saisir un sachet d'accessoires transparent au sein d'un tas encombré, l'insérer dans la cavité restante d'un emballage carton, puis vérifier que le sachet et son contenu restent en dessous du plan de fermeture du carton. Le modèle de base utilisé est Pi0.5, la politique VLA de Physical Intelligence, affinée de manière itérative sur données terrain. L'équipe a accumulé 2535 épisodes d'entraînement, soit environ 10 heures de données collectées directement en conditions d'usine, via un pipeline cyclique comprenant collecte, curation, fine-tuning, évaluation et collecte de données de récupération ciblées. Ce qui rend cette publication notable, c'est son positionnement éditorial délibérément empirique : les auteurs ne communiquent pas sur un taux de succès global, mais documentent les modes de défaillances récurrents et les ajustements nécessaires à chaque cycle. C'est précisément ce type de retour d'expérience qui manque dans la littérature robotique, où les démonstrations sélectionnées occultent souvent le coût réel d'adaptation d'un modèle généraliste à une tâche industrielle spécifique. La gestion d'objets transparents, notoire pour tromper les systèmes de vision par profondeur, illustre ici les limites concrètes du sim-to-real et du transfert zero-shot. L'étude confirme que le fine-tuning dirigé par les échecs terrain, plutôt que la montée en données brutes, reste le levier dominant pour atteindre la fiabilité industrielle. Pi0.5 est le successeur de π0, lancé par Physical Intelligence (San Francisco) fin 2024, conçu comme politique généraliste pour la manipulation dextère. Son déploiement chez Siemens marque une étape significative dans la commercialisation B2B des VLA, un segment que se disputent actuellement Figure AI avec sa pile Helix, 1X Technologies avec NEO, et des initiatives internes comme GR00T N2 de NVIDIA ou les travaux de Boston Dynamics sur Atlas. Aucun acteur européen n'est directement impliqué dans ce déploiement, bien que Wandercraft et Enchanted Tools positionnent des produits complémentaires sur le segment français. La prochaine étape logique de ce type d'étude serait une généralisation multi-tâches ou multi-sites, mais les auteurs restent prudents : l'article conclut sur des leçons méthodologiques, non sur un déploiement à l'échelle.

UELe déploiement de Pi0.5 dans l'usine Siemens d'Erlangen fournit le premier retour d'expérience empirique documenté d'un modèle VLA généraliste en conditions industrielles réelles au sein d'un acteur EU majeur, directement exploitable par les intégrateurs et équipementiers robotiques européens.

FR/EU ecosystemeOpinion
1 source
SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données
47arXiv cs.RO 

SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données

Des chercheurs publient sur arXiv (arXiv:2605.11114, mai 2025) une méthode baptisée SEVO (Semantic-Enhanced Virtual Observation) visant à résoudre l'un des problèmes les plus documentés des politiques VLA (Vision-Language-Action) et d'apprentissage par imitation : leur effondrement dès qu'elles quittent l'environnement d'entraînement. Sans modification de l'architecture du modèle, SEVO agit sur le flux caméra RGB brut via trois mécanismes combinés : des caméras fixes sur le corps du robot dont les champs de vision couvrent l'intégralité de l'espace de manipulation, un éclairage actif en spectre rouge qui normalise physiquement l'apparence des objets, et une segmentation YOLO en temps réel qui produit une représentation sémantique invariante au fond. Les tests portent sur des bouteilles d'eau transparentes -- objets délibérément difficiles car ils se confondent visuellement avec leur environnement -- dans une tâche de pick-and-place répétée sur deux plateformes mobiles. Avec SEVO, la politique ACT atteint 95 % de succès en environnement d'entraînement et 85 % en environnement inédit ; SmolVLA atteint 83 % et 75 % respectivement. Sans SEVO, ces mêmes politiques plafonnent à 75 %/70 % en entraînement et s'effondrent à 30-35 % hors contexte. Ces résultats remettent directement en cause le paradigme dominant qui consiste à compenser le manque de robustesse par une mise à l'échelle des modèles. Les praticiens de la communauté open source rapportaient déjà des taux de transfert quasi nuls avec les benchmarks ACT et SmolVLA standards, pourtant affichant des scores élevés en laboratoire. SEVO démontre que la conception de l'observation -- ce que le robot "voit" et comment -- combinée à une diversification systématique des données de téléopération (variations d'éclairage, de fond, d'objets distracteurs) constitue le levier de généralisation le plus efficace, bien devant le choix du modèle. Pour un intégrateur ou un COO industriel, l'implication est directe : un robot à bas coût bien "observé" et entraîné sur des données variées surpasse un modèle plus sophistiqué entraîné dans des conditions homogènes. Le contexte est celui de l'essor des toolchains communautaires autour des VLA, notamment les frameworks lekiwi et SO-101 sur lesquels ACT et SmolVLA sont régulièrement évalués. La "sim-to-real gap" et le "domain shift" sont des problèmes ouverts depuis des années dans la manipulation robotique ; des approches comme domain randomization ou data augmentation tentaient déjà d'y répondre par le calcul. SEVO prend le parti inverse : agir sur le hardware d'observation et le protocole de collecte plutôt que sur l'architecture ou la puissance de calcul. Les suites logiques de ces travaux incluent l'extension à des tâches multi-étapes, à des objets plus variés, et potentiellement à des bases mobiles commerciales -- un terrain sur lequel des acteurs comme Boston Dynamics (Spot), AgileX ou les startups européennes de manipulation à coût réduit sont directement concernés.

UESmolVLA, développé par HuggingFace (entreprise franco-américaine), est directement évalué dans cette étude, les équipes européennes travaillant sur la manipulation VLA disposent d'un levier hardware-protocole immédiatement applicable pour multiplier leurs taux de succès hors environnement d'entraînement, sans changer d'architecture ni investir dans des modèles plus lourds.

💬 J'attendais quelqu'un pour le montrer proprement : le domain shift, c'est pas un problème de modèle, c'est un problème d'observation. SEVO passe de 30 à 85 % de succès hors environnement d'entraînement en contrôlant l'éclairage, les angles de caméra et la segmentation temps réel, sans changer une ligne d'architecture. Un robot bas coût bien observé bat un modèle sophistiqué entraîné dans une bulle.

IA physiqueOpinion
1 source
QDTraj : exploration de primitives de trajectoires variées pour la manipulation robotique d'objets articulés
48arXiv cs.RO 

QDTraj : exploration de primitives de trajectoires variées pour la manipulation robotique d'objets articulés

Des chercheurs de l'ISIR (Institut des Systèmes Intelligents et de Robotique, Sorbonne Université/CNRS) publient sur arXiv en avril 2026 une méthode baptisée QDTraj, destinée à générer automatiquement des primitives de trajectoires diversifiées pour la manipulation d'objets articulés par des robots domestiques. L'approche repose sur des algorithmes Quality-Diversity (QD) couplés à une exploration par récompense sparse. Évaluée sur 30 articulations du dataset PartNetMobility, QDTraj produit en moyenne 704 trajectoires distinctes par tâche, contre un ratio au moins 5 fois inférieur pour les méthodes concurrentes testées sur des tâches d'activation de charnières (hinge) et de glissières (slider). La méthode a été validée d'abord en simulation, puis déployée en conditions réelles sur robot physique. Le code est rendu public sur le site de l'ISIR. La diversité des trajectoires n'est pas un détail académique : en environnement réel, un robot qui ne dispose que d'une seule séquence motrice pour ouvrir un tiroir échoue dès que cette trajectoire est bloquée par un obstacle ou une contrainte dynamique imprévue. QDTraj adresse directement ce verrou en dotant le robot d'un répertoire de solutions alternatives sélectionnables au runtime selon les contraintes du moment. La validation sim-to-real apporte un crédit concret à l'approche, au-delà de la démonstration en simulation. L'utilisation des algorithmes QD, issus de la robotique évolutionnaire (famille MAP-Elites), est un signe de maturité méthodologique : ces approches explorent des espaces de solutions larges sans converger prématurément vers un optimum local, contrairement aux méthodes par gradient classiques. L'ISIR est l'un des laboratoires de référence en robotique française, avec une longue tradition en planification de mouvement et manipulation dextre. Ce travail s'inscrit dans un contexte où les approches dominantes, imitation learning ou reinforcement learning standard, produisent généralement des politiques à trajectoire unique, fragiles hors distribution. Les modèles VLA (Vision-Language-Action), très suivis en 2025-2026 chez Physical Intelligence (pi0), Google DeepMind ou Boston Dynamics, abordent le problème différemment en conditionnant les actions sur le langage, sans garantir la diversité bas niveau que QDTraj cible explicitement. La méthode se positionne donc comme une couche de planification complémentaire, en amont des politiques haut niveau. Les extensions naturelles concerneraient les objets déformables et l'intégration dans des architectures de contrôle hiérarchique pour robots manipulateurs polyvalents.

UEL'ISIR (Sorbonne/CNRS) publie en open source une méthode de planification de trajectoires qui comble un verrou concret de la manipulation robotique, avec un bénéfice direct pour les équipes de R&D françaises et européennes travaillant sur les robots manipulateurs.

💬 Un robot qui n'a qu'une seule trajectoire pour ouvrir un tiroir, c'est un robot qui échoue dès qu'un obstacle se met en travers. QDTraj répond à ça en générant 700+ alternatives exploitables au runtime, avec des algorithmes QD qui explorent des espaces de solutions larges sans converger trop vite vers un optimum unique (contrairement au RL classique). Reste à voir comment ça s'articule avec des VLA au-dessus, mais comme brique de planification bas niveau, c'est du concret qui sort de l'ISIR.

FR/EU ecosystemePaper
1 source
Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)
49arXiv cs.RO 

Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 22 avril 2026 un article sur arXiv (référence 2604.18000) introduisant BeTTER, un benchmark de diagnostic conçu pour tester le raisonnement incarné réel dans les modèles de type Vision-Language-Action (VLA). L'objectif : vérifier si les taux de succès élevés affichés par des modèles comme pi-0, OpenVLA ou RoboVLMs sur les benchmarks standards reflètent une véritable intelligence physique, ou un artefact d'évaluation. BeTTER applique des interventions causales ciblées, modifications de la disposition spatiale, extrapolation temporelle, tout en isolant cinématiquement les échecs de raisonnement de haut niveau des limites d'exécution motrice de bas niveau. Résultat : les VLA de pointe s'effondrent dans des scénarios dynamiques, exhibant des raccourcis lexico-cinématiques (le modèle associe des mots à des patterns moteurs sans vraiment "comprendre"), une inertie comportementale, et un effondrement de la représentation sémantique. Ces résultats remettent en cause l'un des postulats les plus optimistes du secteur : que les hauts scores sur benchmarks constituent une preuve de généralisation. L'analyse mécaniste des auteurs identifie deux goulots d'étranglement architecturaux structurels, la compression de capacité et le sous-échantillonnage myope, qui dégradent systématiquement la représentation sémantique fondamentale du modèle. En d'autres termes, les architectures VLA actuelles sont structurellement contraintes à sacrifier le raisonnement de haut niveau pour maintenir la fréquence de contrôle nécessaire à l'exécution motrice en temps réel. Les protocoles d'évaluation trop statiques masquent cette dégradation en permettant au modèle d'overfitter aux priors sensorimoteurs du dataset, ce qui est un signal d'alarme direct pour les intégrateurs industriels qui évaluent ces systèmes avant déploiement. La famille VLA a connu une accélération marquée depuis fin 2023, avec les travaux de Physical Intelligence (pi-0), Google DeepMind (RT-2, puis Helix en collaboration avec Figure AI), et des efforts académiques nombreux autour de modèles open-source comme OpenVLA. Le gap benchmark-réalité est un problème récurrent en robotique, le sim-to-real transfer en est la version la plus connue, mais BeTTER le documente cette fois au niveau du raisonnement cognitif plutôt que de la dynamique physique. Les auteurs valident leurs conclusions sur robot réel, ce qui exclut l'hypothèse d'un artefact de simulation. La prochaine étape logique pour le secteur est de repenser les architectures VLA pour résoudre la tension structurelle entre contrôle haute fréquence et raisonnement sémantique robuste, probablement via des approches hiérarchiques déjà explorées par des équipes comme Wandercraft côté locomotion, ou Enchanted Tools pour la manipulation expressive.

UEWandercraft et Enchanted Tools, acteurs français actifs sur la locomotion et la manipulation expressive, sont directement concernés par les goulots d'étranglement architecturaux identifiés par BeTTER, qui constitue un signal d'alarme pour tout intégrateur européen évaluant des systèmes VLA avant déploiement industriel.

RechercheOpinion
1 source
ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites
50arXiv cs.RO 

ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites

Des chercheurs ont publié ROBOGATE (arXiv:2603.22126), un framework open-source de validation pré-déploiement pour les politiques de manipulation robotique, conçu pour identifier les zones de défaillance avant mise en production industrielle. Le système repose sur un échantillonnage adaptatif en deux étapes dans un espace de paramètres à huit dimensions : une première phase par Latin Hypercube Sampling (LHS) couvre l'espace global, puis une seconde phase concentre l'effort sur la zone de transition critique entre 30 % et 70 % de taux de réussite, là où les échecs sont les plus révélateurs. Le tout est exécuté dans NVIDIA Isaac Sim avec le moteur physique Newton, sur quatre morphologies robotiques : Franka Panda (7-DOF), UR3e, UR5e et UR10e (tous 6-DOF). Au total, plus de 50 000 expériences ont été simulées, produisant un modèle de régression logistique avec une AUC de 0,780 et une équation analytique fermée de la frontière de défaillance. Le framework a également benchmarké huit politiques VLA, dont une version fine-tunée de NVIDIA GR00T N1.6 (3 milliards de paramètres), entraînée sur LIBERO-Spatial pendant 20 000 étapes. Le chiffre le plus frappant de l'étude est un écart de 97,65 points de pourcentage entre les environnements de simulation : le même checkpoint GR00T N1.6 atteint 97,65 % de réussite sur le benchmark LIBERO sous MuJoCo, mais tombe à 0 % sur les 68 scénarios industriels de ROBOGATE sous Isaac Sim. Ce résultat met en lumière un problème structurel du déploiement des VLA : les scores de benchmark en simulation ne prédisent pas le comportement dans un simulateur différent, a fortiori dans le monde réel. Pour les intégrateurs et les décideurs industriels, cela signifie qu'un modèle validé sur benchmark standard peut être totalement non opérationnel dans leur environnement cible. ROBOGATE propose une couche de validation intermédiaire, inspirée du paradigme que NVIDIA a formalisé pour le calcul quantique avec Ising, transposé ici à l'IA physique. Le gap sim-to-real reste l'un des verrous majeurs de la robotique manipulatrice apprise, et la plupart des acteurs du secteur, de Figure AI (Figure 03) à Physical Intelligence (Pi-0) en passant par Boston Dynamics ou les équipes internes de NVIDIA, travaillent à le réduire via des pipelines sim-to-real renforcés ou de la synthèse de données domain-randomisée. ROBOGATE ne prétend pas résoudre ce gap mais fournit un outil de diagnostic structuré : cartographier les frontières d'échec avant déploiement, ce qui est précisément ce qui manque dans les workflows industriels actuels. Le framework est publié en open-source, ce qui devrait faciliter son adoption par les équipes de validation, en particulier celles qui travaillent sur des cellules pick-and-place standardisées avec des bras industriels UR ou Franka. Les prochaines étapes naturelles seraient l'extension à des morphologies mobiles-manipulatrices et l'intégration dans des pipelines CI/CD robotiques, un domaine encore embryonnaire mais en progression rapide chez des acteurs comme Intrinsic (Alphabet) ou Covariant.

UELes équipes R&D européennes travaillant sur des cellules robotiques avec bras UR (Universal Robots, Danemark) ou Franka Panda peuvent adopter ce framework open-source pour structurer leur validation pré-déploiement et éviter des échecs coûteux en production.

IA physiqueActu
1 source