Aller au contenu principal

Dossier arXiv cs.RO

2862 articles

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

CycleVLA : correction proactive et autonome des modèles vision-langage-action par retour en arrière des sous-tâches et décodage à risque bayésien minimal
1arXiv cs.RO IA physiqueActu

CycleVLA : correction proactive et autonome des modèles vision-langage-action par retour en arrière des sous-tâches et décodage à risque bayésien minimal

Des chercheurs présentent CycleVLA, un système qui dote les modèles Vision-Language-Action (VLA) d'une capacité d'autocorrection proactive, c'est à dire anticiper un échec avant qu'il ne se produise plutôt que le corriger après coup comme le font les approches existantes. L'architecture combine trois briques : un VLA conscient de sa progression qui repère les points de transition critiques entre sous-tâches, là où les échecs surviennent le plus souvent, un prédicteur d'échec basé sur un VLM qui déclenche un retour en arrière ciblé (subtask backtracking) dès qu'un risque est détecté, et une stratégie de test-time scaling fondée sur le décodage à risque bayésien minimal (Minimum Bayes Risk, MBR) pour améliorer les chances de réussite lors des tentatives suivantes. Sur les bancs d'essai en simulation LIBERO et LIBERO-Plus, CycleVLA dépasse le modèle de référence pi-0.5 et améliore les taux de réussite sur des politiques VLA de maturité variable, des modèles sous-entraînés aux versions pleinement convergées. Sur robot réel, le système atteint un taux de réussite moyen de 91% sur trois tâches de manipulation, dont une exigeant une grande précision et deux à horizon long. Des tests de robustesse avec perturbations injectées manuellement, comme l'échange d'un objet distracteur à l'emplacement attendu pendant que la vraie cible est déplacée en cours d'exécution, montrent que CycleVLA corrige environ 80% des échecs provoqués artificiellement. Ce travail s'attaque à un point faible connu des VLA en conditions réelles : la plupart des systèmes actuels ne réagissent qu'après l'échec constaté, ce qui coûte du temps et de la fiabilité en environnement industriel ou domestique. Démontrer une correction proactive, avant la manifestation complète de l'erreur, constitue un argument concret pour rapprocher les démonstrations en simulation des déploiements réels, un écart qui reste l'un des principaux freins à l'adoption des VLA par les intégrateurs robotiques. CycleVLA s'inscrit dans la lignée des travaux récents sur la détection et la correction d'échecs pour les modèles de type VLA, aux côtés de références comme GR00T N2 ou Helix, et se positionne explicitement contre pi-0.5 dans ses comparaisons de performance. Les auteurs présentent leur travail comme une réplique (replace) sur arXiv, signe d'une itération après une première version, et mettent à disposition une page projet dédiée avec démonstrations vidéo pour documenter les résultats sur robot réel.

1 source
FIRMGrasp : une marge de risque tenant compte du frottement pour une synthèse de prise robuste
2arXiv cs.RO 

FIRMGrasp : une marge de risque tenant compte du frottement pour une synthèse de prise robuste

Une équipe de recherche présente FIRMGrasp, une nouvelle famille de métriques de qualité de préhension robotique fondée sur la mesure de risque CVaR (Conditional Value-at-Risk), dans un article publié le 25 juillet sur arXiv. Contrairement aux métriques classiques comme l'epsilon de Ferrari-Canny, qui supposent un coefficient de friction unique et déterministe, FIRMGrasp évalue la marge de force-closure au point le plus défavorable de la distribution de friction, produisant une marge ajustée au risque notée epsilon^(bêta). Les chercheurs démontrent sa monotonie selon le niveau de confiance bêta, sa différentiabilité par rapport aux paramètres de préhension, et un certificat probabiliste garantissant la fermeture de force avec une probabilité au moins égale à bêta. Sur un jeu de 1599 préhensions testées avec des mains robotiques LEAP Hand et Allegro Hand, 53% des prises jugées fiables par la métrique Ferrari-Canny perdent en réalité leur fermeture de force dans les conditions de friction défavorables. Ce résultat est significatif pour l'industrie de la préhension robotique car il expose une faille méthodologique répandue dans l'évaluation des grippers et mains articulées : les métriques standards surestiment systématiquement la robustesse des prises face à l'incertitude réelle des surfaces de contact. Concrètement, epsilon^(bêta) prédit mieux les échecs observés que la métrique nominale, avec des probabilités de discrimination de 0,63 et 0,78 contre 0,53 et 0,67 pour distinguer respectivement les échecs de secousse (shake) et de prise (pick) réussis. Dans des essais de levage simulés avec gravité activée et un coefficient de friction dégradé à 0,2, les prises validées par epsilon^(bêta) atteignent un taux de réussite de 70% sous traction latérale, contre seulement 25% pour les prises validées uniquement par la marge classique. Pour les intégrateurs et concepteurs de systèmes de préhension, cela suggère qu'intégrer une marge de risque friction-dépendante dès la phase de planification de prise réduirait sensiblement les échecs en conditions réelles, où la friction des surfaces varie selon l'usure, l'humidité ou les matériaux manipulés. Le travail s'inscrit dans la lignée des recherches sur la synthèse de préhension robuste, un domaine où les métriques analytiques historiques comme celle de Ferrari-Canny font référence depuis des décennies mais peinent à capturer l'incertitude physique réelle. Les auteurs comparent leur approche à des méthodes différentiables récentes, positionnant FIRMGrasp comme une alternative directement intégrable dans des pipelines d'optimisation de préhension existants, sans changement matériel requis.

RecherchePaper
1 source
Localisation intervues à l'échelle d'une ville grâce aux cartes sémantiques
3arXiv cs.RO 

Localisation intervues à l'échelle d'une ville grâce aux cartes sémantiques

Des chercheurs proposent une méthode pour localiser un robot dans un environnement qu'il n'a jamais parcouru en s'appuyant sur les cartes sémantiques déjà disponibles, comme celles d'OpenStreetMap. Publiée sur arXiv le 25 juillet 2026 (arXiv:2607.25215), l'étude combine des modèles vision-langage (VLM) pour extraire des points de repère à partir de panoramas capturés par le robot, avec un appariement léger entraîné par distillation pour les relier aux repères d'une carte aérienne préexistante, potentiellement immense: jusqu'à 628 km² dans les tests. Les correspondances alimentent un filtre bayésien qui affine en continu l'estimation de position dans le temps. Les auteurs publient aussi un jeu de données couvrant onze environnements, avec des panoramas collectés dans des conditions extrêmes, dont une tempête de neige et des prises de nuit à Boston. Le modèle a été entraîné uniquement sur les données d'une seule ville par beau temps, et testé ailleurs. L'enjeu dépasse la simple curiosité académique: la localisation cross-view, faire correspondre la vue au sol d'un robot à une imagerie aérienne ou cartographique, reste un verrou pour déployer des robots mobiles hors des zones cartographiées en 3D dense (LiDAR, SLAM préalable). Utiliser des cartes sémantiques publiques comme OpenStreetMap réduirait fortement le coût de préparation d'un site avant déploiement, un frein réel pour les intégrateurs en logistique ou robotique de service urbaine. Le résultat le plus notable ici est la généralisation: un système entraîné sur une seule ville et une météo dégagée tient face à des lieux, éclairages et conditions météo différents, ce qui, si confirmé à plus grande échelle, contredirait l'idée reçue que ces méthodes de localisation restent fragiles dès qu'on change de contexte visuel. Les approches précédentes de matching panorama/imagerie aérienne ignoraient l'information sémantique ou la réduisaient à un petit nombre de classes fixes, limitant leur richesse descriptive. Le principal obstacle contourné par cette équipe est le passage à l'échelle: interroger un VLM pour chaque correspondance possible devient intraitable quand la carte grossit, d'où l'idée de distiller un modèle plus léger. Code et jeu de données sont publiés sur efahnestock.github.io/loci/, ouvrant la voie à des comparaisons futures sur d'autres villes et conditions.

RecherchePaper
1 source
Quand les données héritées commencent-elles à aider ? Transfert émergent dans l'apprentissage robotique multi-configurations
4arXiv cs.RO 

Quand les données héritées commencent-elles à aider ? Transfert émergent dans l'apprentissage robotique multi-configurations

Des chercheurs publient une étude (arXiv:2507.25593) sur un problème concret pour l'industrie robotique : que faire des données de démonstration collectées sur une ancienne génération de robot quand le matériel change ? L'équipe a testé la question sur une plateforme humanoïde à roues, en comparant deux générations de matériel où la caméra et la pince ont été remplacées, la morphologie générale restant identique. Sur plusieurs tâches de manipulation réelles, ils observent trois régimes distincts selon le niveau de compétence déjà atteint par le robot mis à jour sur la nouvelle configuration : à faible compétence, les données historiques n'apportent strictement aucun gain (10,0 % de réussite reste à 10,0 % même en co-entraînant avec les anciennes données) ; une fois un certain seuil de compétence franchi, le gain devient brutal, comme sur une tâche d'insertion de fleur où le taux de réussite passe de 23,3 % à 86,7 % ; enfin, près de la saturation, les gains redeviennent marginaux, à l'image d'une tâche d'insertion de stylo qui progresse seulement de 85,0 % à 93,3 %. Une quatrième tâche de manipulation bimanuelle mobile (arrosage) confirme ce même schéma en trois phases. Ce résultat va à l'encontre d'une hypothèse répandue dans le secteur, celle qu'accumuler un maximum de données cross-configuration est toujours bénéfique pour l'apprentissage par imitation. Pour les équipes qui entraînent des politiques de type VLA (vision-language-action) sur des flottes de robots en évolution matérielle constante, ce papier fournit un critère pratique : il ne sert à rien de réutiliser des démonstrations legacy tant que le nouveau matériel n'a pas atteint un seuil minimal de compétence sur la tâche visée, et au-delà d'un certain point de saturation, continuer à collecter de nouvelles données coûte plus cher que ça ne rapporte. C'est un signal utile pour les intégrateurs et laboratoires qui doivent arbitrer entre collecter de nouvelles démonstrations coûteuses sur le matériel actuel ou recycler des jeux de données déjà constitués. Les auteurs proposent une explication théorique basée sur l'alignement des gradients et l'incertitude résiduelle de la politique, ce qui leur permet de formaliser une règle « phase-aware » pour décider quand collecter versus quand réutiliser. Le travail s'inscrit dans la lignée des recherches sur le transfert de données entre configurations robotiques, un sujet devenu central à mesure que les fabricants itèrent rapidement sur leurs capteurs et effecteurs sans vouloir jeter les données déjà accumulées.

RecherchePaper
1 source
RoboMME-Interference : évaluation de la mémoire des robots sous interférence
5arXiv cs.RO 

RoboMME-Interference : évaluation de la mémoire des robots sous interférence

Des chercheurs publient RoboMME-Interference, un nouveau benchmark conçu pour mesurer la mémoire des robots sur de longues sessions parsemées de distracteurs (arXiv:2606.22338v2, version corrigée). Construit à partir du benchmark existant RoboMME, ce protocole confronte un modèle VLA (vision-language-action) à une séquence de sessions : une démonstration pertinente issue d'une session antérieure, suivie d'un nombre contrôlé de sessions sans rapport, le tout fourni comme contexte mémoire avant d'évaluer la réussite de la tâche. Les auteurs testent les variantes de π0.5 augmentées de mémoire déjà publiées par RoboMME, sans modification. Résultat : les variantes à mémoire perceptuelle améliorent bien le taux de réussite lorsqu'aucun distracteur n'est présent, mais leurs performances se dégradent fortement et de façon continue à mesure que des sessions sans rapport s'accumulent dans l'historique. En ajoutant une étape de récupération (retrieval) à la variante la plus performante, laquelle identifie la démonstration pertinente par similarité visuelle et ne transmet que celle-ci à la politique, les chercheurs retrouvent le niveau de réussite obtenu sans distracteur, et ce quel que soit le niveau d'interférence testé. Ce travail pointe un écart concret entre les démonstrations de mémoire robotique en conditions contrôlées et les exigences réelles du déploiement : un robot industriel accumule de l'expérience sur des dizaines, voire des centaines de sessions, et doit retrouver l'information utile au milieu du bruit. Les résultats montrent que le simple fait de "donner accès" à l'historique complet à un VLA ne suffit pas ; sans mécanisme de récupération explicite, la mémoire devient un handicap plutôt qu'un atout dès que le contexte s'allonge. Pour les intégrateurs qui envisagent des déploiements de longue durée, c'est un signal que l'architecture de mémoire, et non la seule capacité du modèle de base, conditionnera la fiabilité en production. Le projet s'inscrit dans la continuité de RoboMME, benchmark de référence pour la mémoire cross-session en robotique, et cible spécifiquement les modèles π0.5 de type VLA. Code, vidéos et données sont publiés sur robotmemorybench.com, ouvrant la voie à des comparaisons avec d'autres approches de mémoire ou de récupération que la communauté pourra tester sur ce même protocole d'interférence.

RecherchePaper
1 source
πR²: politiques de flux réactives en temps réel
6arXiv cs.RO 

πR²: politiques de flux réactives en temps réel

Des chercheurs présentent πR² (Reactive Real-time Flow Policies), une méthode qui rend les politiques de manipulation robotique par flow matching capables de réagir en temps réel aux données sensorielles, sans sacrifier la taille des modèles ni la prédiction multi-actions. Le problème identifié : les politiques actuelles à base d'"action chunking" (comme GR00T ou Pi-0) génèrent des séquences d'actions en boucle ouverte via de multiples étapes de débruitage sur de gros backbones, ce qui les rend trop lentes pour replanifier fréquemment ; les actions engagées deviennent obsolètes avant d'être exécutées. πR² s'appuie sur le "diffusion forcing" à échéancier de bruit par position et introduit deux mécanismes : un canal rapide de proprioception rafraîchi à chaque tick, découplé d'un canal lent de features vision-langage mis à jour de façon asynchrone, et un échéancier de flow adaptatif à la latence qui traite les actions en cours comme contrainte d'inpainting et n'émet qu'une seule étape de débruitage par appel. Appliqué par fine-tuning à GR00T-N1.7 sur une plateforme réelle xArm6 avec main XHand, πR² replanifie environ 4 fois plus vite que la politique de base, à environ 25Hz sur un GPU A5000, avec une observation fraîche prise en compte toutes les 40 millisecondes. Les auteurs rapportent des gains de taux de réussite allant jusqu'à 23% en simulation et 30% en conditions réelles face à la meilleure référence testée. Pour l'industrie de la manipulation robotique, ce travail s'attaque à un angle mort connu des politiques VLA (vision-language-action) génératives : la démonstration en environnement contrôlé masque souvent une latence de contrôle incompatible avec des tâches dynamiques (objets en mouvement, contacts imprévus, correction de trajectoire). En dissociant la fréquence de mise à jour proprioceptive de celle, plus coûteuse, de la perception visuo-langagière, πR² propose une piste concrète pour combler l'écart entre boucle ouverte et contrôle réactif sans reconstruire les backbones existants ni renoncer à leur expressivité. C'est un signal utile pour les intégrateurs qui évaluent des plateformes comme GR00T pour des applications nécessitant du contact fin ou de la réactivité, un terrain où les chunks figés posent problème. Le travail s'inscrit dans la lignée du diffusion forcing, une technique de génération séquentielle par bruitage différencié selon la position, ici adaptée au contrôle robotique. Il se positionne face aux grandes familles de politiques VLA actuelles telles que GR00T N1.7 de NVIDIA (utilisé comme base pour les expériences), Pi-0 de Physical Intelligence ou Helix de Figure, toutes construites sur le même compromis entre taille de backbone et latence. Les auteurs présentent πR² comme une modification légère, applicable par fine-tuning à une politique déjà entraînée plutôt que par un réentraînement complet, ce qui en facilite l'adoption potentielle. Le papier, publié en préprint sur arXiv, reste à ce stade une contribution de recherche testée en laboratoire sur un bras xArm6 et une main XHand, sans indication de déploiement industriel ni de partenaire commercial annoncé.

IA physiqueActu
1 source
Amortissement de l'optimisation de trajectoire pour la MPC résiduelle via différentiation implicite du contact
7arXiv cs.RO 

Amortissement de l'optimisation de trajectoire pour la MPC résiduelle via différentiation implicite du contact

Cette étude publiée sur arXiv (2607.24959v1) s'attaque à un goulot d'étranglement classique de la robotique de contact : l'optimisation de trajectoire dans des simulateurs différentiables. Les chercheurs introduisent une méthode de dérivation implicite assistée par différentiation automatique (AD), appliquée au moteur MuJoCo MJX et fondée sur le théorème des fonctions implicites (IFT). Contrairement aux différences finies, coûteuses et sensibles au choix du pas, ou au déroulement complet de l'AD à travers un solveur de contact itératif, qui fait exploser la trace de calcul stockée en mémoire, leur approche différencie directement le résidu de stationnarité à la solution convergée, sans reconstruire à la main les systèmes KKT propres à chaque solveur. Résultat mesuré : la mémoire temporaire compilée reste quasi constante quel que soit l'effort du solveur, avec moins de 4% de variation entre une et dix itérations, contre une croissance de 10,6 fois pour l'AD déroulée classique. Le gain s'accentue avec la complexité du problème : 20 fois moins de mémoire à 256 contacts actifs, 6 fois moins à 16 contacts et 96 degrés de liberté. L'équipe va plus loin avec une technique de "distillation d'optimiseur" pour le contrôle prédictif résiduel (residual MPC) : un iLQR complet, calculé en batch sur tout l'horizon temporel, est condensé en une politique qui guide ensuite un iLQR résiduel à horizon court, bien moins coûteux à exécuter en ligne. Sur trois bancs d'essai (Finger, bras Franka, quadrupède Unitree), cette approche améliore le taux de succès à six pas de 28 à 98 points de pourcentage par rapport à un iLQR standard. Pour les équipes qui développent du contrôle robotique riche en contacts, manipulation fine, locomotion sur terrain irrégulier, l'intérêt est double : réduire drastiquement l'empreinte mémoire permet de faire tourner des simulations différentiables à plus grande échelle ou en temps réel embarqué, tandis que la distillation d'optimiseur offre une voie pour transférer la qualité d'une planification hors-ligne coûteuse vers un contrôleur exécutable en boucle rapide sur le robot. Le travail s'inscrit dans la lignée des efforts récents autour de MuJoCo MJX et de la simulation différentiable pour la robotique, un axe de recherche actif depuis que des laboratoires comme DeepMind ou des groupes académiques cherchent à exploiter les gradients de simulateurs physiques pour accélérer l'apprentissage et la planification, plutôt que de s'appuyer uniquement sur l'apprentissage par renforcement sans modèle. La méthode proposée ici comble un vide méthodologique entre les approches génériques mais gourmandes en mémoire et les dérivations KKT sur mesure, difficiles à maintenir et à généraliser d'un solveur à l'autre. Les auteurs ne précisent pas de calendrier de publication du code ni de partenariat industriel, mais la validation croisée sur des plateformes hétérogènes (doigt robotique, bras manipulateur Franka, quadrupède Unitree) suggère une ambition de généralisation au-delà d'un cas d'usage unique, avec un potentiel d'intégration dans des piles de contrôle MPC pour la manipulation ou la locomotion dynamique.

RecherchePaper
1 source
Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement
8arXiv cs.RO 

Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement

Une équipe de recherche publie sur arXiv (2607.25798v1) un nouveau modèle baptisé Transformer Transformer, conçu pour la co-conception de robots conditionnée par le mouvement. L'idée : générer automatiquement des architectures robotiques complètes capables de suivre des trajectoires d'effecteur cibles issues de démonstrations humaines, tout en optimisant des fonctions de récompense définies par l'utilisateur. Le système repose sur les RoboTokens, une tokenisation unifiée des morphologies, états et actions des robots, qui permet à une seule architecture de diffusion transformer de fonctionner sur des espaces d'embodiment très différents : robots bimanuels à roues, quadrupèdes, humanoïdes. Plutôt que d'optimiser pour une récompense unique, le modèle agit comme un modèle de dynamique générique, dont les prédictions d'état et d'action servent ensuite à calculer des valeurs spécifiques à chaque objectif, via une procédure nommée Dynamics Self-Guidance qui guide la diffusion vers des designs à haute valeur. Preuve concrète : les chercheurs ont fabriqué une version optimisée de la plateforme ALOHA, réduisant l'erreur de suivi de trajectoire de plus de 70 % par rapport au design d'origine. L'intérêt pour le secteur tient à ce que la conception mécanique des robots reste largement découplée du contrôle et de l'apprentissage, alors que la performance en manipulation dépend fortement de l'embodiment. Un modèle capable d'optimiser en zero-shot pour des récompenses et trajectoires jamais vues, plus rapidement qu'une baseline évolutionniste, ouvre la voie à des cycles de co-conception matériel-logiciel beaucoup plus rapides pour les intégrateurs et les fabricants de bras ou de plateformes bimanuelles. C'est un signal supplémentaire que les architectures de type transformer/diffusion, déjà dominantes pour les politiques VLA, s'étendent maintenant à la conception physique elle-même, et pas seulement au contrôle. Le travail s'inscrit dans la lignée de la recherche sur la co-conception robotique, historiquement dominée par des algorithmes évolutionnistes coûteux en calcul et spécifiques à une seule récompense. ALOHA, plateforme bimanuelle open source popularisée par les travaux de Stanford et Google, sert ici de banc d'essai matériel concret plutôt que de simple simulation. Le papier ne précise pas de calendrier de déploiement industriel ni de partenaire, il s'agit à ce stade d'un résultat de recherche fraîchement publié, dont la portée reste à confirmer sur des espaces de conception plus larges.

RecherchePaper
1 source
Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur
9arXiv cs.RO 

Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur

Tripody, un robot parallèle sur roues à 3 degrés de liberté conçu pour les travaux de construction en hauteur, notamment le perçage de plafonds, a été présenté par une équipe de recherche dans une publication arXiv (2607.25781, juillet 2026). Pesant 33 kg, l'engin s'étend de 1,7 m à 3,4 m de hauteur et supporte une charge continue de 32 kg via une interface d'effecteur modulaire. Sa cinématique reprend l'architecture classique 3-SPR (trois jambes, joint sphérique à la base, articulation prismatique actionnée, joint de rotation à l'effecteur), mais remplace les joints sphériques par des joints universels, ce qui surcontraint volontairement le mécanisme ; de petites déflexions élastiques réparties absorbent les incompatibilités cinématiques résultantes tout en préservant un mouvement essentiellement translationnel. Les essais montrent une rigidité en plan comparable à celle d'une variante à base sphérique, mais une rigidité en torsion nettement supérieure : +67% à 1,7 m, +196% à 2,6 m et +454% à 3,4 m, avec un couplage inter-axes négligeable. Le positionnement en boucle fermée, mesuré par station totale, converge sous 0,6 mm sur tout l'espace de travail, tandis que la simple extrapolation par modèle atteint une erreur au 95e centile de 2,7 mm (maximum 3,6 mm). Une démonstration de perçage de plafond en boucle ouverte, avec un motif de 15 trous, affiche une erreur de position relative maximale de 4,5 mm après alignement rigide. Ces résultats s'adressent directement à un problème concret du secteur de la construction : les manipulateurs sériels lourds actuellement utilisés pour les travaux en hauteur sont difficiles à déployer dans des intérieurs encombrés, faute de compacité et de mobilité. En misant sur une architecture surcontrainte qui tolère la compliance plutôt que de la combattre, les auteurs proposent une voie pratique vers des robots légers, à grande portée verticale et à précision millimétrique, un compromis rarement atteint simultanément par les solutions existantes. Pour les intégrateurs et décideurs du BTP, l'intérêt tient moins à la performance brute qu'à la validation en conditions quasi réelles : le perçage de 15 trous avec une précision de l'ordre de quelques millimètres démontre une faisabilité tâche par tâche, au-delà d'une simple preuve de concept en laboratoire. Le papier reste toutefois prudent : il s'agit d'une étude en boucle ouverte sur un motif limité, pas d'un déploiement chantier. L'approche s'inscrit dans une lignée de recherches en robotique parallèle explorant les architectures 3-SPR pour des tâches nécessitant rigidité et précision sur de grands espaces de travail, un terrain habituellement dominé par les bras sériels ou les portiques fixes. En intégrant des actionneurs linéaires sur mesure et une pile de contrôle combinant estimation d'état SE(3), cinématique directe et commande dans l'espace des tâches, les auteurs positionnent Tripody comme une alternative mobile et reconfigurable aux solutions de perçage plafond existantes, qu'elles soient manuelles ou robotisées de type portique. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur un contrôle en boucle fermée pour la tâche de perçage elle-même et sur des essais en environnement de chantier réel plutôt qu'en conditions contrôlées de laboratoire.

RecherchePaper
1 source
Station holding égocentrique d'un poisson robotique dans un écoulement turbulent inconnu
10arXiv cs.RO 

Station holding égocentrique d'un poisson robotique dans un écoulement turbulent inconnu

Des chercheurs présentent SWiFT (Swimming With Flow Toolbox), un cadre d'apprentissage par renforcement permettant à un poisson robotique de type BCF (corps et nageoire caudale) de maintenir sa position dans un courant turbulent inconnu, sans capteur de flux dédié. Le système combine un banc d'essai en canal hydraulique avec nage libre, un simulateur de mécanique des fluides numérique (CFD) conçu pour rester physiquement cohérent tout en restant efficace en calcul, et un pipeline de transfert simulation vers réel. La politique de contrôle obtenue s'appuie uniquement sur un retour égocentrique, c'est à dire la perception du robot sur son propre état, sans mesure explicite du courant environnant. Selon les auteurs, elle dépasse les méthodes de référence existantes sur l'ensemble des métriques testées, avec une amélioration notable de l'erreur quadratique moyenne (RMSE) sur la distance à la position cible. L'article, publié sur arXiv fin juillet 2026, reste un préprint de recherche et non un produit ou un système déployé en conditions réelles. L'enjeu est significatif pour la robotique sous marine: tenir une station fixe face à un courant est une brique de base pour l'inspection de structures, la surveillance environnementale ou l'intervention en eaux naturelles, un environnement bien plus imprévisible que les bassins contrôlés où la plupart des poissons robotiques ont jusqu'ici été testés. Le résultat suggère qu'un contrôle purement égocentrique suffit à répliquer un comportement proche de la rhéotaxie observée chez les poissons biologiques, ce qui simplifierait l'instrumentation nécessaire sur de futurs robots sous-marins tout en améliorant leur robustesse face à des flux non caractérisés à l'avance. Ce travail s'inscrit dans une lignée de recherches sur l'efficacité et la maniabilité des poissons robotiques, un domaine actif depuis plusieurs décennies mais où la tenue de station en flux inconnu restait peu explorée, faute de modèles fiables des interactions fluide-structure fortement non linéaires en nage libre. Les auteurs positionnent SWiFT comme une fondation réutilisable pour des tâches de nage plus complexes, avec pour prochaine étape l'extension à d'autres scénarios de manœuvre en environnement turbulent réel.

RecherchePaper
1 source
HOME : méthode robuste de correspondance dans l'espace de Hough pour vidéos structurées et sans texture
11arXiv cs.RO 

HOME : méthode robuste de correspondance dans l'espace de Hough pour vidéos structurées et sans texture

Des chercheurs publient sur arXiv (2607.25389v1) une nouvelle méthode de mise en correspondance de caractéristiques visuelles baptisée HOME, pour Hough-space One-dimensional Matching of Extrema. Conçue pour les systèmes de localisation robotique, cette approche transforme les images en espace de Hough, où les structures linéaires globales de la scène se traduisent en extrema locaux stables servant de points d'intérêt. Cette reformulation permet de ramener un problème de mise en correspondance de segments de droite, normalement coûteux, à une simple recherche de correspondance de points en une dimension. HOME s'appuie sur un descripteur radial 1D qui garantit mathématiquement l'invariance en rotation et en translation, sans passer par une estimation explicite de l'orientation, ce qui allège considérablement les calculs. La méthode ne nécessite aucun entraînement préalable. Les auteurs valident leur approche via une tâche d'estimation d'homographie, utilisée ici comme preuve de concept. L'enjeu dépasse le simple exercice académique. Les fronts visuels de type SLAM (localisation et cartographie simultanées) reposent aujourd'hui majoritairement sur des descripteurs de points comme ORB, qui échouent régulièrement dans les environnements industriels dominés par des lignes droites ou des surfaces sans texture, entrepôts, couloirs, sols lisses. Les alternatives à base de lignes existent mais restent trop gourmandes en calcul pour tourner en temps réel sur du matériel embarqué de robotique. En démontrant une robustesse supérieure aux méthodes ponctuelles dans ces scénarios difficiles, tout en restant nettement plus rapide que les méthodes de lignes existantes, HOME répond directement à une contrainte concrète pour les intégrateurs de robots mobiles et de systèmes de navigation autonome en environnement contraint. Le travail s'inscrit dans la lignée des recherches visant à contourner les limites des descripteurs classiques type ORB ou des extracteurs de lignes conventionnels, jugés trop lourds pour l'edge computing. Les auteurs présentent ce résultat comme une étape intermédiaire: l'extension de ce moteur de correspondance à une estimation de pose complète en 3D, au-delà de la seule homographie, est annoncée comme une direction de recherche future prometteuse, sans calendrier ni implémentation précisée à ce stade.

RecherchePaper
1 source
SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale
12arXiv cs.RO 

SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale

Sortie automatisée de mouvements corporels complets à partir de ces trajectoires. Un chercheur propose SONG, une plateforme de simulation pour la navigation sociale robotique, construite sur le 3D Gaussian Splatting (3DGS), une technique de rendu photoréaliste qui reconstruit à la fois les scènes et les avatars humains évoluant dedans. Les piétons virtuels ne suivent pas des scripts fixes: leurs trajectoires sont générées par un grand modèle de langage de façon sémantiquement cohérente, puis converties en mouvements corporels continus via un générateur conditionné par trajectoire. Autour de cette plateforme, les auteurs construisent SONG-Bench, un ensemble de scénarios d'évaluation classés par niveau de difficulté, associé à une suite de métriques multidimensionnelles couvrant l'efficacité du déplacement, la sécurité et le respect des conventions sociales. Le travail est décrit dans un article déposé sur arXiv (2607.25219v1) comme une nouvelle soumission. L'enjeu dépasse le simple outil de test. Jusqu'ici, les simulateurs de navigation sociale souffraient d'un compromis frustrant: soit ils offraient des observations visuelles pauvres, soit ils manquaient d'avatars humains mobiles, soit leur rendu et le comportement des piétons restaient trop éloignés du réel pour valider des algorithmes de navigation guidés uniquement par la vision embarquée. En évaluant des méthodes de référence sur SONG-Bench, les auteurs tirent trois constats qui pèsent sur tout le secteur de la robotique mobile: la navigation sociale basée vision est loin d'être résolue, les modèles actuels présentent un déficit de sécurité plus criant encore que leurs manquements en étiquette sociale, et l'entraînement sur des données réelles compte davantage que la simple augmentation de la taille des modèles. Point notable, les auteurs montrent qu'un ajustement fin sur les données qu'ils ont constituées améliore concrètement le taux de réussite en conditions réelles, ce qui distingue cette contribution d'une simple démonstration en simulation. Ce travail s'inscrit dans une trajectoire de recherche qui est passée d'environnements 2D simplifiés à des cadres visuels plus exigeants, où le robot ne dispose que de sa caméra embarquée pour se comporter correctement en présence d'humains. Les auteurs présentent SONG comme un banc d'essai destiné à structurer la prochaine génération de recherches sur la navigation sociale visuelle, sans toutefois annoncer de partenariat industriel ou de déploiement au-delà du cadre académique à ce stade.

RecherchePaper
1 source
DC-WAM : supervision et raisonnement visuels centrés sur la dynamique pour les modèles monde-action
13arXiv cs.RO 

DC-WAM : supervision et raisonnement visuels centrés sur la dynamique pour les modèles monde-action

Une nouvelle publication arXiv (2607.25918v1) présente DC-WAM (Dynamic-Centric World-Action Model), un framework qui repense la manière dont les modèles monde-action (WAM) utilisés pour piloter des robots doivent exploiter la vidéo prédictive. Les WAM couplent une politique de contrôle à une prédiction du futur visuel de la scène, mais jusqu'ici la question de ce que cette modalité vidéo doit réellement apprendre restait ouverte : une prédiction photoréaliste dense coûte cher en calcul et gaspille de la capacité sur la texture, l'éclairage ou l'arrière-plan, des éléments peu liés à la décision d'action. DC-WAM redistribue la supervision et le calcul de la branche vidéo RGB sans ajouter d'entrée ou de prédiction supplémentaire au déploiement. Concrètement, la méthode combine un appariement de flux par différence temporelle avec une pondération guidée par la trajectoire, pour concentrer l'apprentissage sur les changements denses et les zones où la pince, les objets manipulés et les points de contact bougent. Un second mécanisme, DynaRoute, prédit une pertinence dynamique token par token et la convertit en biais d'attention pour orienter le modèle vers les tokens futurs réellement utiles au contrôle. L'intérêt principal tient à la validation expérimentale : en simulation comme sur des tâches réelles de manipulation, DC-WAM améliore systématiquement la performance des politiques, avec un gain particulièrement marqué sous perturbations hors distribution (changements d'éclairage, d'apparence des objets, de texture de fond). Cela conforte une intuition déjà présente dans les WAM efficaces récents : le bénéfice de la branche vidéo ne vient pas tant du rendu futur en lui-même que des représentations visuelles orientées contrôle qu'elle induit pendant l'entraînement. Pour les équipes qui développent des politiques robotiques génériques, c'est un argument concret contre le tout-photoréaliste et en faveur d'une supervision ciblée sur la dynamique d'interaction, un axe pertinent face à l'écart classique entre performance en démonstration et robustesse en conditions réelles. DC-WAM s'inscrit dans la lignée des travaux sur les modèles monde appliqués au contrôle robotique et sur les architectures vision-langage-action (VLA), où plusieurs équipes cherchent à réduire le coût de la prédiction future tout en conservant son bénéfice pour l'apprentissage de politiques. La démarche des auteurs consiste à repartir d'un WAM RGB existant plutôt que d'ajouter une modalité dédiée, une approche incrémentale qui vise l'adoption pratique plutôt que la rupture architecturale. Le papier ne précise pas de partenaire industriel ni de calendrier de déploiement : il s'agit à ce stade d'un résultat de recherche, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques plus variées et des tâches de manipulation plus complexes.

RecherchePaper
1 source
Belief-Aware Influence and Trust (BAIT) : façonner les croyances humaines lors d'interactions répétées avec un robot
14arXiv cs.RO 

Belief-Aware Influence and Trust (BAIT) : façonner les croyances humaines lors d'interactions répétées avec un robot

Une équipe de recherche présente BAIT (Belief-Aware Influence and Trust), un contrôleur pensé pour les interactions répétées entre humains et robots, où l'humain ajuste continuellement sa perception du robot au fil des rencontres. Le système combine un filtre particulaire hiérarchique, capable d'inférer à la fois les changements stratégiques rapides de l'humain et l'évolution plus lente de ses croyances perceptives, avec un planificateur MPPI (Model Predictive Path Integral) intégrant explicitement ces croyances. BAIT a été évalué en simulation, lors d'une étude impliquant des sujets humains, puis en conditions réelles sur un véhicule de recherche GEM, dans des scénarios répétés d'insertion de voie (lane-merging). Résultat annoncé: une performance de tâche équivalente à celle des méthodes de référence qui maximisent l'influence à long terme via un comportement imprévisible, mais avec un niveau de confiance de l'utilisateur nettement supérieur. L'enjeu dépasse le simple exercice académique. Dans les interactions répétées, homme-robot ou véhicule autonome-conducteur, deux écueils dominent aujourd'hui: soit traiter chaque rencontre comme isolée, ce qui dégrade progressivement la performance à mesure que la perception humaine dérive, soit maintenir une influence durable par des comportements erratiques, au prix d'une confiance érodée et de calculs difficilement généralisables à grande échelle. BAIT propose de traiter le compromis entre influence à long terme et confiance humaine comme un objectif d'optimisation explicite, tout en imposant la performance immédiate de la tâche comme contrainte stricte plutôt que comme variable négociable. Pour des intégrateurs travaillant sur des flottes de véhicules autonomes ou des robots collaboratifs amenés à interagir de façon répétée avec les mêmes opérateurs, cela suggère une voie pour préserver l'acceptabilité sans sacrifier l'efficacité. Le travail s'inscrit dans la lignée des recherches en interaction homme-robot centrées sur la calibration de la confiance, un terrain d'étude classique pour les véhicules autonomes, où l'insertion de voie sert souvent de banc d'essai standardisé. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé par simulation, étude utilisateur et déploiement réel limité sur véhicule GEM, et non d'un produit commercialisé. L'article ne précise pas de calendrier de généralisation à d'autres scénarios d'interaction répétée.

RecherchePaper
1 source
Décomposer et réorganiser : planification par primitives et politiques visuomotrices apprises par démonstration
15arXiv cs.RO 

Décomposer et réorganiser : planification par primitives et politiques visuomotrices apprises par démonstration

Traduction/résumé en cours, article de recherche robotique (arXiv), pas de deploiement produit, j'adapte la structure à ce contenu académique. Une équipe de chercheurs propose DR-LfD (Decomposed and Reorganized Skills Learned from Demonstrations), un nouveau cadre pour la manipulation robotique dextre à long horizon, détaillé dans un article publié sur arXiv (référence 2607.25397v1). Le système décompose des démonstrations humaines en compétences élémentaires ("atomic skills"), identifiées à partir des relations de contact entre le robot et les objets manipulés. Chaque compétence est ensuite reproduite soit sous forme de politique visuomotrice (un modèle qui associe directement perception visuelle et commande motrice), soit sous forme de primitive centrée sur l'objet. Ces briques sont intégrées dans un système de planification de tâches et de mouvements (TAMP), avec un modélisation précise des conditions de déclenchement, d'arrêt et des contraintes de chaque politique. Les auteurs ont testé leur approche sur des bancs d'essai réels et simulés couvrant des scénarios variés, incluant des tâches à étapes multiples, des configurations inédites et des contraintes physiques spécifiques. L'enjeu principal est de résoudre une tension classique du secteur : les méthodes de planification symbolique (TAMP) excellent en raisonnement de haut niveau mais deviennent fragiles dès que les opérations impliquent des contacts complexes, tandis que l'apprentissage par imitation (IL) gère bien le retour visuel mais généralise mal dans l'espace et peine sur les tâches multi-étapes. En combinant les deux, DR-LfD change surtout l'économie des données d'entraînement : au lieu de nécessiter un volume de démonstrations qui croît de façon exponentielle avec le nombre de séquences de tâches possibles, le besoin en données ne dépend plus que du nombre de types de compétences distincts, chacune nécessitant relativement peu d'exemples. C'est une piste concrète pour réduire le coût d'apprentissage sur des tâches longues et variées, un frein connu au déploiement de politiques visuomotrices à l'échelle industrielle. Le travail s'inscrit dans la lignée des recherches cherchant à réconcilier planification symbolique et apprentissage par démonstration, deux approches historiquement développées séparément dans la littérature robotique. Les auteurs mettent en avant la capacité de leur méthode à réorganiser des compétences apprises depuis des sources différentes, un point clé pour la modularité. Le site du projet (dr-lfd.github.io) propose des démonstrations complémentaires à l'article.

RecherchePaper
1 source
Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude
16arXiv cs.RO 

Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude

Une nouvelle version (v2) de l'article arXiv:2410.24035 propose un cadre de politique adaptatif au contexte pour la manipulation robotique, combinant robustesse et réactivité. Les auteurs s'appuient sur l'apprentissage par démonstration (Learning from Demonstration, LfD), et plus précisément sur les approches basées sur des systèmes dynamiques (DS), pour apprendre une politique conditionnée à la fois par l'état du robot et par des paramètres de tâche de basse dimension représentant le contexte environnant. Cette politique est ensuite combinée à des politiques additionnelles sensibles à l'incertitude via une formulation de type mélange d'experts (Mixture of Experts, MoE). Le système est validé sur le jeu de données de référence LASA handwriting, utilisé classiquement pour évaluer l'apprentissage de trajectoires, ainsi que sur un robot réel à 7 degrés de liberté (7-DoF), dans trois scénarios concrets : la saisie conditionnée par la force appliquée, la manipulation d'aliments déformables, et la saisie centrée sur l'objet. L'enjeu technique visé est précis : les approches DS de l'état de l'art excellent généralement en robustesse mais restent rigides face aux variations de contexte, car elles ne modulent pas leur comportement selon des variables dépendantes de la tâche. En articulant fusion de politiques et quantification d'incertitude, ce cadre cherche à améliorer le comportement hors distribution (out-of-distribution) et la convergence des trajectoires générées, deux propriétés critiques pour tout déploiement en environnement réel non contrôlé. Pour les intégrateurs robotiques, l'intérêt pratique tient surtout à la manipulation d'objets déformables, un cas d'usage encore mal résolu dans l'industrie (agroalimentaire, logistique), et à la promesse d'une politique réutilisable sans réentraînement complet à chaque changement de tâche ou d'environnement. Sur le plan du contexte scientifique, le LfD via systèmes dynamiques est un axe de recherche établi depuis plusieurs années pour produire des politiques de contrôle réactives en robotique. Ce travail se positionne comme une extension de recherches antérieures sur la fusion de politiques et l'estimation d'incertitude, plutôt que comme une rupture méthodologique. L'abstract ne mentionne ni laboratoire ni entreprise associée, et il s'agit d'une publication académique (statut « replace », donc une révision d'un article déjà soumis) sans indication de déploiement industriel à ce stade.

RecherchePaper
1 source
Adaptation de modalité en test, un cadre causal d'inférence-diagnostic-raffinement pour les modèles VLA
17arXiv cs.RO 

Adaptation de modalité en test, un cadre causal d'inférence-diagnostic-raffinement pour les modèles VLA

Une équipe de chercheurs publie sur arXiv un nouveau cadre baptisé infer-diagnose-refine (IDR), conçu pour améliorer les modèles vision-langage-action (VLA) qui pilotent des bras ou des robots humanoïdes à partir d'instructions en langage naturel, d'images et de l'état proprioceptif du robot. Le problème ciblé: dans une tâche de manipulation, l'importance de la vision varie selon la phase, un déplacement longue distance dépendant surtout de la caméra tandis qu'une prise fine dépend davantage du retour proprioceptif, et les VLA actuels fusionnent ces modalités de façon statique. IDR corrige cela au moment du test, sans réentraînement: le modèle infère d'abord une action factuelle avec l'image réelle, puis une action contrefactuelle en neutralisant l'image via une intervention de type "zero-padding", avant qu'un module ne quantifie l'écart entre les deux par une mesure de norme pour estimer l'importance causale de la vision à cet instant précis, puis qu'une fusion résiduelle à gate ajustable ne recombine les deux prédictions. Les auteurs rapportent des gains de performance sur plusieurs benchmarks de simulation et sur des tâches réelles, avec plusieurs architectures VLA testées comme backbones. Pour l'industrie robotique, l'intérêt tient au fait que ce travail s'attaque à une limite bien identifiée mais rarement corrigée des VLA: leur incapacité à pondérer dynamiquement les modalités selon le contexte, ce qui pèse sur la robustesse en conditions réelles (occlusions, éclairage variable, phases de contact). Le caractère "model-agnostic" et "training-free" est ce qui retient le plus l'attention des intégrateurs: si la méthode tient ses promesses hors cadre académique, elle pourrait s'appliquer en post-traitement à des VLA déjà déployés, sans le coût d'un réentraînement complet, rare parmi les correctifs proposés dans la littérature. Il s'agit toutefois d'une publication de recherche évaluée sur des benchmarks propres aux auteurs, pas d'un produit ni d'un déploiement industriel, et le gain réel dépendra d'une reproduction indépendante sur des tâches de manipulation hors laboratoire. Ce travail s'inscrit dans une vague de recherche plus large autour des VLA, catégorie qui regroupe aujourd'hui des systèmes comme RT-2, OpenVLA, pi-0 de Physical Intelligence ou GR00T de Nvidia, tous confrontés au même arbitrage entre richesse perceptuelle et robustesse d'exécution. Chercher des gains de fiabilité au moment de l'inférence, plutôt que via un réentraînement massif, reflète une tendance récente à vouloir corriger à moindre coût des modèles déjà volumineux. Les auteurs ne précisent ni calendrier d'intégration industrielle ni partenariat avec un fabricant de robots; la suite logique serait une validation sur des plateformes commerciales et une comparaison directe avec les méthodes de fusion de modalités déjà employées par les principaux acteurs du secteur.

RechercheActu
1 source
Pyramide de données pour la manipulation incarnée
18arXiv cs.RO 

Pyramide de données pour la manipulation incarnée

Une équipe de recherche publie sur arXiv (2607.24744) une revue structurant l'écosystème des données pour l'apprentissage robotique en une "pyramide" à cinq niveaux : données réelles issues de robots physiques, données de type UMI (capture de démonstrations humaines avec interface portable), vidéos égocentriques et exocentriques, données de simulation, et données vision-langage générales issues du web. Les auteurs organisent cette pyramide autour d'un compromis central entre scalabilité et alignement robotique, et évaluent chaque source selon quatre critères : qualité, diversité, réutilisabilité et fidélité physique. Ils passent ensuite en revue les modèles fondation récents pour la robotique, qu'il s'agisse de modèles de "cerveau" incarné, de modèles vision-langage-action (VLA) ou de modèles monde-action, en analysant comment chacun sélectionne, aligne et mélange ces différentes sources lors du pré-entraînement, et comment ce choix conditionne leurs capacités de perception, de raisonnement, de planification et de prédiction. Cette cartographie répond à un problème identifié depuis plusieurs années dans le secteur : contrairement aux modèles de langage ou de vision, qui s'entraînent sur la quasi-totalité du contenu textuel et visuel disponible sur internet, les agents incarnés ne peuvent pas se contenter de données passives puisqu'ils doivent apprendre le couplage entre observation, état physique et action. C'est ce goulot d'étranglement qui explique pourquoi des modèles comme Pi-0, GR00T N2 ou Helix combinent systématiquement plusieurs sources de données plutôt qu'une seule, et pourquoi des plateformes comme Figure 03 ou Optimus Gen 3 misent autant sur la collecte de données réelles en usine que sur la simulation. Les auteurs terminent par six chantiers non résolus : constituer des jeux de données tactiles à grande échelle, capturer des séquences d'échec et de récupération, développer des pipelines de collecte scalables, aligner les actions entre différentes morphologies de robots, exploiter les données égocentriques pour la manipulation dextre, et concevoir des recettes de données principielles plutôt qu'empiriques, autant de points de friction qui continuent de freiner le passage de la démonstration au déploiement industriel fiable.

RecherchePaper
1 source
N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches
19arXiv cs.RO 

N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches

Des chercheurs présentent N0-TWAM, un modèle monde-action "tactile natif" conçu pour la manipulation robotique dans des tâches à contact riche, capable de prédire à la fois l'image future et le contact physique futur. Selon les auteurs, il s'agirait du premier modèle monde-action tactile entraîné à grande échelle, une affirmation à prendre avec la prudence habituelle pour ce type de papier arXiv (2607.23783, non encore relu par les pairs). Le pré-entraînement combine vision et tactile sur des démonstrations couvrant six morphologies de robots différentes et 450 tâches. Le système s'appuie sur NeoForce, une représentation tactile unifiée basée sur la force, censée fournir un signal de contact physiquement ancré pour guider la génération d'actions. Pour gérer les tâches longues et multi-étapes, les auteurs introduisent des "événements de contact tactile" qui marquent la progression d'une étape à l'autre. Côté architecture, un Mixture-of-Transformers asymétrique associe un expert large pour la prédiction vidéo à des experts plus légers pour l'action et le tactile, dans un souci d'efficacité temps réel. Le modèle a été évalué sur des benchmarks réels et simulés, et le code ainsi que les poids seront publiés en open source. L'enjeu dépasse la simple prouesse technique. Les modèles vision-langage-action actuels, de π0 à GR00T N2 en passant par Helix, reposent presque exclusivement sur la vision, ce qui explique une bonne partie de leurs échecs sur les tâches fines de contact : insertion de pièces, préhension d'objets déformables, assemblage. Un modèle qui démontre un gain mesurable grâce au passage à l'échelle des données tactiles apporterait un signal utile pour les intégrateurs industriels confrontés à ce fossé entre démonstration en vidéo et fiabilité en production. Le manque de jeux de données tactiles standardisés à grande échelle est resté un frein connu du secteur, contrairement à la vision où les corpus type RT-X abondent. En couvrant six embodiments, N0-TWAM s'inscrit dans cette logique de généralisation multi-robots. La publication annoncée du code et des checkpoints permettra à la communauté de vérifier ces résultats et d'évaluer si l'approche tient face à des déploiements réels sur des tâches d'assemblage ou de manipulation fine.

RecherchePaper
1 source
Real2Sim2Real pour la manipulation vision-langage-action : un pipeline basé sur AMD ROCm
20arXiv cs.RO 

Real2Sim2Real pour la manipulation vision-langage-action : un pipeline basé sur AMD ROCm

Des chercheurs publient sur arXiv (2607.22997v1) une pile logicielle de bout en bout entièrement basée sur ROCm, l'écosystème ouvert d'AMD, pour entraîner et déployer des modèles vision-langage-action (VLA) en robotique de manipulation. L'architecture couvre trois niveaux de matériel AMD : silicium d'entraînement en datacenter, cartes Radeon PRO pour la simulation et le rendu, et puces Ryzen AI pour le calcul embarqué. Quatre démonstrations illustrent la pile : un pipeline sim-to-real entraîné avec le modèle SmolVLA et déployé sur un bras robotique Franka ; une tâche de sélection d'objet guidée par le langage baptisée « one-of-three » ; un pipeline real-to-sim qui associe des reconstructions de scènes réelles par 3D Gaussian Splatting (3DGS) au moteur physique Genesis pour générer des données d'entraînement synthétiques ; et un entraînement par renforcement à grande échelle pour la locomotion de robots quadrupèdes et humanoïdes, benchmarké sur plusieurs plateformes matérielles. L'ensemble fonctionne nativement sous ROCm et PyTorch sur des GPU RDNA4 (Radeon AI PRO R9700) et RDNA3.5 (Radeon PRO W7900), et les pipelines sont reproductibles gratuitement sur la Radeon Cloud Platform. L'enjeu dépasse la simple démonstration technique : la quasi-totalité des pipelines VLA publiés jusqu'ici, de SmolVLA à Pi-0 en passant par GR00T N2 ou Helix, s'entraînent et se déploient sur des écosystèmes CUDA de Nvidia, aujourd'hui quasi incontournable dans l'IA physique. En montrant qu'un pipeline sim-to-real complet, du rendu 3DGS à l'inférence embarquée, tient sur ROCm sans réécriture lourde, les auteurs ouvrent une alternative matérielle crédible pour les intégrateurs et laboratoires cherchant à diversifier leurs fournisseurs de calcul ou à réduire leurs coûts. Pour les décideurs B2B, le signal principal reste la reproductibilité gratuite via la Radeon Cloud Platform, qui abaisse la barrière d'entrée pour tester des politiques VLA sans investir dans du matériel Nvidia. Le papier demeure toutefois une preuve de faisabilité technique sur des tâches de manipulation limitées (un bras Franka, un tri à trois objets), sans démonstration de déploiement industriel à l'échelle ni de comparaison chiffrée de performance face aux stacks CUDA équivalentes. Cette publication s'inscrit dans la course engagée par AMD pour rattraper son retard face à Nvidia sur le marché de l'IA, et plus spécifiquement sur celui, naissant, de l'IA physique évoqué par Lisa Su au CES 2026 et par Jensen Huang lors de la GTC Paris de juin 2025. Le choix des briques logicielles, SmolVLA (Hugging Face), Genesis (moteur physique open source) et 3D Gaussian Splatting, situe les auteurs dans la mouvance open source de la robotique généraliste, aux côtés d'acteurs comme Physical Intelligence (Pi-0) ou Nvidia lui-même avec GR00T. Aucun acteur français ou européen n'apparaît dans cette publication centrée sur l'infrastructure matérielle. Les auteurs annoncent code et pipelines reproductibles dès aujourd'hui sur la Radeon Cloud Platform, sans toutefois préciser de calendrier de commercialisation ni de partenariats industriels concrets à ce stade.

InfrastructureActu
1 source
τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future
21arXiv cs.RO 

τ : apprendre des modèles vision-langage-action augmentés par le toucher à partir d'une supervision visuelle future

Un article publié sur arXiv (référence 2607.24485v1, catégorie "new") présente τ (tau), un framework qui enrichit les modèles Vision-Language-Action (VLA) avec une représentation tactile spatio-temporelle conditionnée par l'action. La méthode s'inspire du JEPA (Joint-Embedding Predictive Architecture) : elle apprend cette représentation en prédisant les futures observations visuelles à partir du signal tactile, puis fusionne cette information avec les caractéristiques vision-langage pour générer les actions du robot. Cette supervision opère uniquement dans l'espace latent et pendant l'entraînement, sans surcoût au moment du déploiement. Les auteurs publient également TacAura, un jeu de données synchronisant vision, proprioception et signaux tactiles à base de capteurs visuels, collecté sur quatre tâches de manipulation impliquant des contacts riches. L'enjeu est la sous-exploitation du toucher dans les modèles VLA actuels, qui reposent majoritairement sur la vision et le langage, ou au mieux sur une détection binaire de contact ou des séquences de torseurs 6D, insuffisantes pour exploiter des signaux tactiles haute dimension. Le papier s'attaque frontalement au problème de rareté des données : les démonstrations spécifiques à une tâche sont limitées, tandis qu'un pré-entraînement tactile à grande échelle reste coûteux. En montrant qu'une supervision auto-supervisée de type JEPA permet d'extraire une représentation tactile exploitable avec peu de données, l'étude touche à un débat central du secteur, celui de l'efficacité des données pour des tâches de manipulation fine (insertion, préhension d'objets déformables) où la seule vision atteint ses limites, un enjeu direct pour les intégrateurs industriels visant l'assemblage de précision. Ce travail s'inscrit dans la lignée des modèles VLA généralistes (Pi-0, GR00T N2, Helix) qui combinent perception et langage pour piloter des robots, mais qui ont historiquement négligé le tactile faute de capteurs standardisés et à cause du coût de collecte. Les auteurs comparent τ à des approches existantes centrées sur les états de contact instantanés, et démontrent une meilleure généralisation à des objets et scènes inédits. Il s'agit à ce stade d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenariat commercial.

RecherchePaper
1 source
Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique
22arXiv cs.RO 

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique

Un article de recherche publié sur arXiv (2607.21725v1) présente Pigey, un orchestrateur d'agence physique conçu pour piloter des robots généralistes sans données supplémentaires ni post-entraînement. Plutôt que d'entasser perception, planification, détection de succès, récupération d'erreurs et contrôle bas niveau dans une seule politique apprise par pré-entraînement massif, comme le font les modèles vision-langage-action (VLA) actuels, les auteurs séparent le problème en deux couches : un agent de contrôle langage-conditionné classique, et un gestionnaire de haut niveau qui décompose les objectifs en sous-tâches, envoie des commandes moteur, vérifie les résultats à partir des observations bas niveau et déclenche des routines de récupération en cas d'échec. Pigey peut commander aussi bien des politiques VLA existantes que des compétences paramétrées préexistantes. Sur le benchmark de simulation LIBERO-PRO, le taux de réussite passe de 12,8% à 53,3%, soit plus du quadruple, sans aucun réglage spécifique à la tâche. Sur un robot réel, les tâches nécessitant du raisonnement voient leur taux de succès grimper de quasi zéro à plus de 90% une fois la politique figée intégrée dans la boucle agentique de Pigey. Ce résultat vient alimenter un débat déjà vif dans la robotique humanoïde et manipulatrice : les modèles VLA de bout en bout, aussi impressionnants soient-ils en démonstration, échouent souvent dès que la tâche exige un raisonnement séquentiel ou une récupération après erreur, un écart que les auteurs baptisent "orchestration gap". En montrant qu'une simple couche d'orchestration explicite, sans ré-entraînement, suffit à multiplier par quatre les performances, l'étude suggère que l'échelle des données de pré-entraînement n'est pas le seul levier disponible pour combler ce fossé entre démonstration et fiabilité réelle, un enjeu direct pour les intégrateurs qui doivent déployer ces systèmes en environnement industriel non contrôlé. Cette approche s'inscrit dans une tendance plus large de la recherche en robotique généraliste, où des laboratoires développent des modèles comme Pi-0, GR00T N2 ou Helix pour unifier perception et action. Pigey se positionne comme une alternative complémentaire plutôt qu'un concurrent direct : il ne remplace pas ces politiques mais les pilote depuis l'extérieur, ce qui laisse ouverte la question de son adoption par les fournisseurs de VLA propriétaires et de son passage à l'échelle sur des tâches de manipulation encore plus complexes.

RecherchePaper
1 source
StARS : recommandation d'actions robotiques socialement appropriées via un système de recommandation
23arXiv cs.RO 

StARS : recommandation d'actions robotiques socialement appropriées via un système de recommandation

Des chercheurs de l'Université de Cambridge (groupe Cambridge-AFAR) publient StARS, un nouveau cadre pour générer des actions robotiques socialement appropriées en tenant compte de la variabilité des jugements humains. Le constat de départ est simple : deux personnes peuvent juger différemment la même action d'un robot dans une situation identique, ce qui rend obsolète l'idée d'un score d'appropriation universel. Plutôt que d'entraîner un modèle unique censé plaire à tout le monde, l'équipe reformule le problème comme un système de recommandation, en traitant les annotateurs comme des utilisateurs, les scènes ou contextes comme des items, et les scores d'appropriation attribués à un ensemble d'actions candidates comme les cibles à prédire. StARS combine du filtrage collaboratif avec des représentations de scène apprenables, et reste agnostique au modèle sous-jacent : il peut s'intégrer à différents encodeurs de scène et backbones sans redesign complet. Les auteurs l'ont testé sur deux jeux de données de référence en robotique sociale, MannersDB+ et SocNav1, avec une analyse de robustesse en cas de retours de préférence peu nombreux. Le code est disponible publiquement sur GitHub. Pour l'industrie de l'interaction humain-robot, cette approche s'attaque à un angle mort classique des systèmes actuels : la plupart des modèles d'appropriation sociale produisent un score moyen, sans distinguer les préférences individuelles des utilisateurs, ce qui limite leur usage réel en contexte domestique, hospitalier ou en espace public partagé. En montrant des gains constants d'accord avec les annotateurs sur plusieurs jeux de données et plusieurs architectures, StARS suggère qu'une personnalisation légère, sans réentraîner le modèle de base, est possible pour affiner le comportement social des robots selon l'utilisateur. Ce travail s'inscrit dans la lignée des travaux sur l'évaluation de l'appropriation sociale en HRI (notamment les jeux de données MannersDB et SocNav utilisés ici) et dans la tradition plus large des systèmes de recommandation appliqués hors du e-commerce. Il reste à ce stade une contribution académique, publiée en préprint sur arXiv sans annonce de déploiement industriel ni de partenariat commercial ; la suite logique serait une validation sur des interactions robot-humain en conditions réelles, au-delà des jeux de données existants.

RecherchePaper
1 source
ACME : jeu de données multiculturel et multi-incarnation pour la navigation sociale
24arXiv cs.RO 

ACME : jeu de données multiculturel et multi-incarnation pour la navigation sociale

Wandercraft, Pollen Robotics ou tout autre acteur français ne figurent pas dans cette étude, qui reste une publication de recherche pure sur arXiv. Voici la synthèse. Une équipe de chercheurs publie ACME (Cross-cultural, Multi-Embodiment dataset), un jeu de données destiné à la navigation sociale des robots, collecté sur 8 sites répartis dans 5 pays et utilisant 7 embodiments robotiques différents. Le corpus totalise 29,35 heures de données embarquées capturées directement par les robots et 43,5 heures de suivi piéton en vue aérienne. Contrairement aux jeux de données existants, ACME cible spécifiquement des scénarios de navigation orientée objectif en environnement social complexe, avec des interactions explicites robot-foule incluant la parole du robot comme signal d'interaction. Le dataset fournit des features de scène en 2D et 3D, des données d'odométrie, des informations d'interaction et des trajectoires piétonnes annotées manuellement, disponibles à la fois en format brut binaire et en version lisible par sensor modality. L'enjeu pour l'industrie robotique est celui de la généralisation. Les politiques de navigation sociale entraînées aujourd'hui reposent souvent sur des corpus captés dans un seul pays, avec un seul type de robot, ce qui expose les systèmes déployés à un risque de mauvaise généralisation face à des normes culturelles de proxémie ou de comportement piéton différentes. En couvrant plusieurs cultures et embodiments simultanément, ACME répond directement à cette limite documentée dans la littérature. Les auteurs affirment que leur dataset capture des scénarios plus complexes et une distribution de comportements piétons plus large que les jeux de données précédents, une évaluation qualitative et quantitative qui reste toutefois auto-rapportée par l'équipe elle-même et mériterait une validation indépendante avant d'être prise comme référence de facto. Ce travail s'inscrit dans une dynamique plus large de la recherche en robotique mobile, où la multiplication des robots de service et de livraison en espace partagé avec des humains a rendu criante l'absence de données d'entraînement culturellement diverses. La publication ouverte du dataset, avec formats bruts et annotés, vise à en faire un benchmark communautaire pour entraîner des politiques de navigation et des modèles de prédiction de trajectoires piétonnes, sans qu'aucune date de disponibilité publique ou dépôt associé ne soit précisé dans l'abstract.

RecherchePaper
1 source
Robot conforme : cadre modulaire pour l'impédance variable en ligne avec axes de compliance orientés arbitrairement
25arXiv cs.RO 

Robot conforme : cadre modulaire pour l'impédance variable en ligne avec axes de compliance orientés arbitrairement

Un article publié sur arXiv (2607.22483v1) présente un framework de contrôle en compliance robot-agnostique qui étend l'écosystème ROS control avec des interfaces de commande standardisées, en espace articulaire et cartésien. Le problème ciblé est concret : il n'existe pas aujourd'hui d'infrastructure logicielle réutilisable pour implémenter des algorithmes de contrôle compliant sur différents bras manipulateurs tout en conservant une interface commune vers les applications de plus haut niveau. La solution proposée repose sur une architecture à plugins qui sépare l'infrastructure du contrôleur de l'implémentation de la loi de commande : des wrappers génériques exploitent les abstractions matérielles existantes pour piloter différents robots, tandis que des plugins chargés au runtime n'implémentent que la loi de contrôle elle-même. Les interfaces gèrent des références en espace articulaire ou cartésien, des gains de raideur et d'amortissement, des cibles en nullspace et des termes feedforward, permettant de l'impédance variable et diverses formulations de compliance. La cinématique et la dynamique sont calculées à partir de modèles URDF via la bibliothèque Pinocchio. Le contrôleur d'impédance cartésienne de référence permet en particulier de faire tourner en ligne les axes principaux de raideur et d'amortissement (translation et rotation) selon la géométrie locale de la tâche, plutôt que de les figer dans le repère du robot ou de l'outil. Pour l'industrie robotique, l'intérêt est la portabilité : la même implémentation de contrôleur peut être déployée sans modification sur des manipulateurs aux caractéristiques cinématiques et dynamiques très différentes, ce qui réduit le travail de ré-ingénierie habituellement nécessaire à chaque changement de plateforme. La possibilité de réorienter dynamiquement les directions de compliance répond directement à un besoin identifié en manipulation en contact riche, où les directions de mouvement, de contrainte et de compliance évoluent en cours de tâche plutôt que de rester fixes. Le framework complet, comprenant les contrôleurs de référence, les interfaces de tâche de haut niveau et des configurations d'exemple pour plusieurs manipulateurs, est publié en open source. Les auteurs valident l'approche par des expériences sur robot réel démontrant la compliance dépendante de la tâche en manipulation en contact riche, complétées par des simulations montrant la portabilité du framework sur des manipulateurs aux propriétés distinctes.

RecherchePaper
1 source
AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle
26arXiv cs.RO 

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle

Des chercheurs ont présenté AXIS, un moteur de données communautaire et évolutif pour l'apprentissage de la manipulation robotique, décrit dans un article déposé sur arXiv le 24 juillet 2026. Le système permet de collecter des démonstrations à grande échelle via téléopération directement dans le navigateur, sans matériel spécialisé ni opérateurs centralisés, et génère puis valide automatiquement de nouvelles tâches de manipulation. Un pipeline automatisé filtre la qualité des trajectoires, les lisse et applique des augmentations visuelles et physiques pour produire des données prêtes à l'entraînement. Le jeu de données AXIS compte actuellement 207 tâches diverses et plus de 50 000 trajectoires, organisées en "task snapshots" évalués selon un protocole strict à données retenues (held-out). Ce travail cible un goulot d'étranglement bien identifié du secteur : la difficulté à faire grandir les jeux de démonstrations utilisés pour entraîner les politiques vision-langage-action (VLA), jusqu'ici souvent limités par du matériel dédié ou des catalogues de tâches figés. Les auteurs montrent que le pré-entraînement continu sur AXIS améliore le taux de réussite global du modèle π0.5 de 5,8 points, et dépasse de 37,3 points un modèle pré-entraîné sur RoboCasa365, avec des gains qui s'accentuent à mesure que le volume de données augmente. Les progrès les plus nets apparaissent sous perturbations de disposition, de bruit capteur et de point de vue caméra, un signal utile pour les intégrateurs cherchant des politiques robustes hors laboratoire plutôt que de simples démonstrations réussies en conditions idéales. Le projet s'inscrit dans une tendance émergente consistant à traiter la collecte de données robotiques comme un problème d'échelle communautaire, à l'image de ce que le crowdsourcing a permis pour les grands modèles de langage. Il se positionne explicitement face à RoboCasa365, utilisé comme référence de comparaison, et s'appuie sur des politiques VLA existantes telles que π0.5 pour évaluer l'apport réel des données AXIS. Il s'agit à ce stade d'un article de recherche déposé en preprint, dont les résultats n'ont pas encore été validés par relecture par les pairs ni reproduits par des équipes tierces.

RecherchePaper
1 source
Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL
27arXiv cs.RO 

Pense quand c'est important : raisonnement VLM conditionnel pour la navigation sociale avec des politiques RL

Le laboratoire à l'origine de ce papier arXiv (référence 2607.10991v1) présente HUMA, une architecture hybride de navigation sociale pour robots mobiles qui combine une politique d'apprentissage par renforcement (RL) avec un modèle vision-langage (VLM). Le principe : la politique RL, rapide et réactive, gère les déplacements courants à faible densité humaine, tandis qu'un VLM post-entraîné prend le relais uniquement quand une personne entre dans la zone de proximité sensible du robot. Évalué sur les benchmarks Social-MP3D et Social-HM3D, HUMA améliore le taux de réussite des tâches de 20% et 3% respectivement par rapport aux meilleures méthodes existantes, tout en réduisant significativement les violations d'espace personnel et les collisions avec des humains. Le système a aussi été testé en conditions réelles sur le robot mobile Mirokaï, conçu par la start-up française Enchanted Tools. Cette approche répond à un compromis central dans la navigation sociale robotique : les politiques RL sont rapides mais peinent à généraliser à des scénarios sociaux complexes, tandis que les VLM offrent un raisonnement sémantique plus fin mais restent trop lents pour un déploiement temps réel. En activant le VLM seulement de façon conditionnelle, HUMA évite l'écueil du tout-VLM (latence, coût de calcul) sans sacrifier la finesse de compréhension sociale dans les moments qui comptent le plus, c'est-à-dire l'interaction rapprochée avec des humains. Pour les intégrateurs et décideurs déployant des robots de service en environnement partagé (hôpitaux, bureaux, commerces), cela suggère une voie concrète pour rendre les VLM exploitables en production sans réécrire toute la pile de contrôle. Le travail s'inscrit dans la tendance récente consistant à substituer ou hybrider les VLM aux politiques RL classiques pour améliorer le raisonnement sémantique en navigation, une piste explorée notamment par des architectures VLA comme Pi-0 ou GR00T N2 dans d'autres contextes robotiques. Les auteurs ont mené des études d'ablation détaillées pour valider chaque composant architectural, et la démonstration sur Mirokaï, robot déployé par Enchanted Tools, ancre l'approche au-delà de la simulation, dans un cas d'usage réel de robot d'accueil et d'assistance en environnement humain.

UELa validation en conditions reelles de HUMA sur le robot Mirokaï, concu par la start-up francaise Enchanted Tools, ancre cette avancee de recherche en navigation sociale dans un produit robotique europeen deploye en environnement humain.

FR/EU ecosystemePaper
1 source
Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde
28arXiv cs.RO 

Xiaomi-Robotics-U0 : synthèse incarnée unifiée avec modèle fondation du monde

Xiaomi Robotics a publié U0, un modèle multimodal autorégressif de 38 milliards de paramètres conçu pour unifier plusieurs tâches de génération liées à la robotique au sein d'un seul système. Décrit dans un article déposé sur arXiv, U0 traite la synthèse de contenus "incarnés" comme une extension directe des modèles de génération d'images et de vidéos fondationnels, en optimisant conjointement le texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée. Selon les auteurs, il s'agit du premier modèle capable de générer des scènes cohérentes en multi-vues pour plusieurs types de robots différents, et il introduit un mécanisme de transfert structuré et contrôlable permettant une édition fine tout en préservant la cohérence géométrique et la dynamique d'interaction. Les résultats rapportés indiquent que U0 dépasse GPT-Image-2.0 lors d'évaluations humaines sur la génération et le transfert de scènes incarnées, se classe premier sur le classement World Arena pour la génération vidéo incarnée, et fait passer le taux de succès hors distribution du modèle de manipulation pi0.5 de 36,9% à 63,2% sur des tâches de manipulation réelle jugées difficiles. Le code et les checkpoints sont mis à disposition sur le site de Xiaomi Robotics. L'enjeu principal ne se situe pas dans la démonstration visuelle mais dans l'usage de U0 comme moteur de données synthétiques pour l'entraînement de politiques robotiques. Le gain mesuré sur pi0.5, un modèle vision-langage-action tiers développé par Physical Intelligence, est le point le plus significatif: il suggère qu'un monde fondationnel bien conçu peut générer des données d'entraînement suffisamment réalistes pour améliorer la généralisation d'un VLA existant sur des tâches de manipulation réelles, et pas seulement sur des métriques internes. C'est une piste concrète pour réduire l'écart simulation-vers-réel qui freine encore le déploiement à grande échelle des robots humanoïdes et bras manipulateurs, en offrant une alternative à la collecte coûteuse de données physiques. Le travail part d'un constat classique dans le secteur: adapter un modèle fondationnel pré-entraîné avec des données robotiques limitées tend à dégrader les connaissances visuelles acquises lors du pré-entraînement à grande échelle. U0 cherche à préserver cette généralisation tout en l'adaptant aux contraintes des embodiments robotiques. Il se positionne face à des approches comme GR00T N2 de NVIDIA ou les modèles Pi de Physical Intelligence, dans une course où Xiaomi investit désormais explicitement la recherche en IA incarnée. Pour l'instant, la publication reste au stade recherche: code et poids sont ouverts, mais aucun déploiement produit ni pilote industriel n'est annoncé.

IA physiqueOpinion
1 source
Point de vue : comment la perspective influence la sociabilité perçue des robots
29arXiv cs.RO 

Point de vue : comment la perspective influence la sociabilité perçue des robots

Des chercheurs ont publié sur arXiv (référence 2603.28272v2) une étude expérimentale portant sur la perception de la sociabilité des robots de navigation selon le point de vue de l'observateur. L'équipe a conçu un protocole en réalité virtuelle immersive permettant de soumettre des trajectoires robotiques identiques à trois types de perspectives : allocentrique (vue aérienne, type supervision), égocentrique-proximale (première personne, robot proche) et égocentrique-distale (première personne, robot loin). Deux politiques de navigation distinctes ont été testées pour vérifier si les résultats sont généralisables au-delà d'un seul type de trajectoire. Une variable additionnelle a été introduite : la présence ou l'absence d'un geste de hochement de tête du robot au moment du croisement. Le résultat central contredit une hypothèse largement répandue dans la communauté : les trajectoires jugées sociables en vue aérienne sont perçues comme significativement plus dérangeantes lorsqu'on les expérimente en première personne et à proximité immédiate. Ce décalage perceptif a des implications directes pour les équipes qui valident des algorithmes de navigation sociale (SFM, ORCA, politiques VLA embarquées) uniquement via simulation ou supervision vidéo. Les benchmarks actuels, qui s'appuient massivement sur des métriques calculées depuis une vue de dessus, risquent de valider des comportements qui resteraient inconfortables sur le terrain réel. L'étude montre également que la distance de dépassement influence le niveau de perturbation ressenti, mais que des signaux sociaux communicatifs, comme le hochement de tête, compensent partiellement cet effet en améliorant la sociabilité perçue, ce qui ouvre une piste concrète pour les robots humanoïdes ou à tête expressive. Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), actif depuis plus d'une décennie avec des travaux fondateurs sur la proxémique robotique et les espaces personnels. La validation humanoïde en environnement partagé est un enjeu croissant pour des acteurs comme Boston Dynamics, Agility Robotics ou Unitree, dont les robots opèrent déjà dans des entrepôts et espaces semi-publics. Côté européen, des initiatives comme Enchanted Tools (Mirokaï) ou les travaux de l'INRIA sur la navigation sociale font face au même verrou méthodologique pointé ici. La prochaine étape logique serait de valider ces résultats sur du matériel physique en conditions réelles, et d'intégrer des métriques égocentrique dans les pipelines de test standard des politiques de navigation.

UEINRIA et Enchanted Tools (Mirokaï) sont directement exposés au verrou méthodologique identifié : leurs pipelines de validation de navigation sociale reposent sur des métriques allocentriques qui risquent de valider des comportements inconfortables en conditions réelles.

RecherchePaper
1 source
Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert
30arXiv cs.RO 

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert

Une équipe de recherche a publié sur arXiv (identifiant 2510.08807v2) Humanoid Everyday, un jeu de données massif dédié à l'apprentissage de la manipulation par les robots humanoïdes en conditions ouvertes. Le dataset compile 10 300 trajectoires et plus de 3 millions de frames couvrant 260 tâches réparties en 7 catégories larges : manipulation dextère d'objets, interaction humain-humanoïde, actions intégrant de la locomotion bipède, et d'autres scénarios du quotidien. Les données sont multimodales, RGB, profondeur, LiDAR, retour tactile, accompagnées d'annotations en langage naturel. La collecte repose sur un pipeline de télé-opération supervisée par des humains, optimisé pour maximiser le débit tout en maintenant la qualité des démonstrations. Les auteurs publient simultanément une plateforme d'évaluation cloud permettant à des équipes extérieures de déployer leurs propres politiques de contrôle et d'obtenir des métriques comparables dans un environnement standardisé. Ce dataset comble un vide structurel dans la recherche robotique : la quasi-totalité des benchmarks existants (Open X-Embodiment, DROID, BridgeData V2) ciblent des bras fixes, et les rares datasets humanoïdes disponibles se limitent à des environnements contrôlés, un faible nombre de tâches, et excluent généralement la locomotion et l'interaction avec des personnes. Pour un intégrateur ou un décideur industriel, la portée pratique est double : des données hétérogènes permettent d'entraîner des politiques plus généralisables, notamment des architectures VLA (vision-language-action) ; la plateforme d'évaluation cloud offre pour la première fois un cadre reproductible pour comparer des méthodes d'apprentissage par imitation ou par renforcement sur des tâches humanoïdes réalistes. L'article analyse aussi les performances de plusieurs politiques de référence, en identifiant leurs forces et limites par catégorie. La publication intervient dans un contexte de forte concurrence autour des données d'entraînement pour humanoïdes. Physical Intelligence (Pi-0, π0.5), NVIDIA (GR00T N2), Unitree et Figure AI misent chacun sur des datasets propriétaires pour différencier leurs politiques de contrôle. Côté recherche ouverte, AgiBot World et RH20T ont posé des jalons, mais restent limités dans leur couverture humanoïde. Humanoid Everyday est rendu entièrement public, dataset, code de collecte et plateforme d'évaluation inclus, ce qui en fait une ressource directement exploitable par des laboratoires et startups sans accès à des infrastructures de collecte massives. Les auteurs présentent cette release comme un socle pour de futurs agents incarnés généralistes, sans préciser d'échéancier pour des suites expérimentales.

UELes équipes de recherche et startups européennes en robotique humanoïde peuvent exploiter directement ce dataset open-source, 10 300 trajectoires, 260 tâches, plateforme d'évaluation cloud, sans investir dans une infrastructure de collecte massive, ce qui réduit la barrière d'entrée face aux acteurs américains et asiatiques disposant de données propriétaires.

💬 Le vrai sujet ici, c'est pas juste le volume (10 300 trajectoires, bon), c'est que les benchmarks humanoïdes existants ignoraient presque tous la locomotion et l'interaction avec des humains réels depuis le début. Des acteurs comme Pi-0 ou GR00T N2 misaient sur leurs données propriétaires comme avantage concurrentiel, et une release open-source de cette ampleur vient rogner ce levier directement. Reste à voir si ça tient face à des politiques entraînées en conditions réelles, mais pour des labos sans infrastructure de collecte massive, ça change le rapport de force.

IA physiqueOpinion
1 source
SoK : Sécurité et vie privée des robots à base de modèles fondation
31arXiv cs.RO 

SoK : Sécurité et vie privée des robots à base de modèles fondation

Une équipe de chercheurs a publié sur arXiv (référence 2606.16788) un article de type "Systematization of Knowledge" (SoK) qui dresse un panorama structuré des risques de sécurité et de confidentialité introduits par les modèles de fondation dans les systèmes robotiques. Le travail systématise 96 études antérieures et propose un cadre d'analyse à quatre couches baptisé F-E-S-G : la couche Modèle de fondation (F), la couche Système incarné (Embodied system, E), la couche Écosystème de support (S), et la couche Impact de gouvernance (G). À chaque couche correspond une taxonomie fine qui encode, pour chaque étude analysée, la cible visée, le stade du cycle de vie, le mécanisme d'attaque ou de défense, le niveau d'accès système requis, et les effets observés. L'intérêt de ce travail réside moins dans les vulnérabilités individuelles qu'il recense que dans les "defense mismatches" qu'il met en évidence : les mécanismes de robustesse conçus pour les modèles de langage ou de vision en contexte purement numérique ne s'appliquent pas directement à des pipelines d'exécution incarnés. Quand un robot piloté par un modèle VLA (Vision-Language-Action) interprète une instruction en langage naturel pour saisir un objet, une attaque adversariale ou une injection de prompt ne produit plus une réponse textuelle erronée mais un mouvement physique potentiellement dangereux. Pour un intégrateur industriel ou un COO déployant des flottes humanoïdes, cette propagation du risque à travers les quatre couches constitue un angle mort opérationnel que les grilles d'évaluation actuelles ne capturent pas. Le genre "SoK" est une convention bien établie dans la communauté sécurité, notamment via la conférence IEEE S&P, et signale une tentative de structurer un champ de recherche fragmenté. Cette publication arrive à un moment de transition dans la robotique commerciale : après des années de démos contrôlées, plusieurs acteurs (Figure, Apptronik, Unitree côté américain, Wandercraft et Enchanted Tools côté européen) engagent des déploiements en environnement réel avec des VLAs comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). L'absence de cadre normatif unifié, que ni l'EU AI Act ni les standards ISO robotiques actuels ne couvrent explicitement, donne à cette méta-analyse une pertinence directe pour les équipes réglementaires et les organismes de certification appelés à évaluer ces systèmes hybrides IA-robotique.

UEL'EU AI Act et les normes ISO robotiques actuelles ne couvrent pas explicitement les systèmes hybrides IA-robotique : ce SoK fournit aux équipes réglementaires européennes et aux acteurs français (Wandercraft, Enchanted Tools) déployant des VLAs un cadre d'analyse des risques directement utilisable pour anticiper les futures exigences de certification.

RechercheOpinion
1 source
Jumeau numérique pour la classification textile et la détection d'objets étrangers dans les systèmes de tri automatisé
32arXiv cs.RO 

Jumeau numérique pour la classification textile et la détection d'objets étrangers dans les systèmes de tri automatisé

Une équipe de chercheurs a présenté un système robotique de tri textile piloté par un jumeau numérique, conçu pour l'automatisation du recyclage de vêtements. La cellule à double bras intègre une perception RGBD, un retour tactile capacitif et une planification de trajectoires anticollision via MoveIt. Le pipeline autonome saisit des vêtements depuis un panier non trié, les transfère vers une zone d'inspection et les classifie via des modèles de vision-langage (VLM, Visual Language Models). Le benchmark porte sur neuf VLM issus de cinq familles de modèles, évalués sur 223 scénarios couvrant six catégories : chemises, chaussettes, pantalons, sous-vêtements, objets étrangers et scènes vides. La famille Qwen atteint la précision globale la plus élevée avec 87,9 %, assortie de solides performances sur la détection d'objets étrangers. Gemma3 offre un compromis vitesse/précision adapté au déploiement sur matériel embarqué (edge). Le travail est disponible sur arXiv sous la référence 2603.05230v2. Ce benchmark en conditions industrielles réelles, sur des objets déformables, constitue une validation plus rigoureuse que les démonstrations sur images synthétiques habituellement produites dans ce domaine. L'évaluation intègre le comportement aux hallucinations et les performances computationnelles sous contraintes matérielles, deux critères souvent absents des publications académiques sur la robotique manipulatrice. Pour les intégrateurs industriels, cela confirme que le tri automatisé de textiles par VLM est réalisable sans infrastructure GPU haute performance, et que le choix du modèle doit s'adapter aux contraintes du site de déploiement. L'intégration de nuages de points 3D segmentés dans le jumeau numérique réduit par ailleurs le fossé sim-to-real pour la planification de prises sur objets déformables. Ce travail s'inscrit dans un contexte de pression réglementaire croissante : l'UE impose depuis janvier 2025 la collecte séparée obligatoire des textiles usagés dans les États membres, accélérant la demande d'automatisation dans les centres de tri. Dans le paysage concurrentiel, Picvisa (Espagne) et Recycleye (Royaume-Uni) opèrent déjà sur le tri optique de déchets par vision, mais sans raisonnement sémantique par VLM. Les prochaines étapes naturelles pour ce système seraient la validation sur des lignes industrielles à plus grand débit et l'extension à d'autres catégories de matières, notamment les textiles synthétiques et les fibres techniques.

UELa directive UE sur la collecte séparée des textiles (en vigueur depuis janvier 2025) crée une demande directe pour ce type d'automatisation dans les centres de tri européens, et les acteurs ibérique (Picvisa) et britannique (Recycleye) déjà présents pourraient être concurrencés ou complétés par ce système.

RecherchePaper
1 source
BadRobot : contourner les garde-fous des agents LLM incarnés dans le monde physique
33arXiv cs.RO 

BadRobot : contourner les garde-fous des agents LLM incarnés dans le monde physique

Des chercheurs ont publié BadRobot (arXiv:2407.20242, juillet 2024, v5), un cadre d'attaque ciblant les agents IA incarnés (embodied AI) : des robots et systèmes physiques dont la planification de tâches est pilotée par un grand modèle de langage. L'attaque exploite trois vecteurs distincts : la manipulation du LLM embarqué via des interactions vocales standard, le désalignement structurel entre les sorties linguistiques du modèle et les actions physiques réellement exécutées, et les comportements dangereux involontaires causés par des lacunes dans les connaissances du monde encodées dans le modèle. Pour évaluer la menace, les auteurs ont constitué un benchmark de requêtes d'actions physiques malveillantes, testé contre trois frameworks embodied AI de référence : VoxPoser, Code as Policies et ProgPrompt. Les expériences montrent que ces trois systèmes peuvent être amenés à exécuter des comportements nuisibles dans le monde physique, sans nécessiter de modification matérielle ni d'accès privilégié au système. Ce travail pointe un angle mort structurel : les techniques de jailbreaking, jusqu'à présent évaluées sur des sorties textuelles, produisent des conséquences physiques irréversibles lorsque le LLM pilote un effecteur. Le désalignement documenté est systémique, car les guardrails de sécurité sont appliqués à la couche linguistique sans validation cohérente lors de la planification motrice ou de l'exécution de tâches. Pour un intégrateur industriel déployant un robot manipulateur ou un AMR guidé par LLM, cela signifie que les mécanismes de conformité conçus pour les chatbots sont insuffisants en contexte physique. La démonstration sur trois frameworks activement utilisés en recherche et en prototypage industriel renforce la portée opérationnelle de l'alerte. VoxPoser (2023) et Code as Policies (Google, 2022) ont popularisé l'utilisation des LLM comme planificateurs de tâches haut niveau en robotique, tandis que ProgPrompt (2022) ciblait les robots de service autonomes. BadRobot paraît alors que des systèmes commerciaux comme Figure 02, l'Optimus de Tesla ou les robots Agility déployés chez Amazon commencent à intégrer des pipelines LLM en production réelle, rendant la surface d'attaque concrète. Aucun acteur français ou européen n'est directement mentionné dans l'étude, mais des entreprises comme Enchanted Tools (Mirokaï) ou Pollen Robotics (Reachy), qui explorent l'intégration de LLM dans leurs plateformes, sont exposées aux mêmes vecteurs. Les auteurs ont mis leur code en accès libre sur GitHub, ouvrant la voie à des reproductions indépendantes et au développement de contre-mesures architecturales spécifiques à l'embodied AI.

UEEnchanted Tools (Mirokaï) et Pollen Robotics (Reachy), deux acteurs français intégrant des LLM dans leurs plateformes robotiques, sont explicitement cités comme exposés aux mêmes vecteurs d'attaque documentés par BadRobot.

RechercheOpinion
1 source
Prise de contrôle adversariale en temps réel des politiques de diffusion robotique
34arXiv cs.RO 

Prise de contrôle adversariale en temps réel des politiques de diffusion robotique

Une équipe de chercheurs a publié le 10 juin 2026 sur arXiv (réf. 2606.10371) une attaque baptisée TAKO (Test-time Adversarial Takeover), qui permet de prendre le contrôle en temps réel d'un robot opérant sous une politique de diffusion visuomotrice, sans modifier le modèle cible. La méthode repose sur un vocabulaire restreint de patches adversariaux universels et réutilisables, appris hors ligne via inférence de diffusion différentiable. À l'exécution, un opérateur humain injecte ces patches dans le flux caméra du robot et les commute dynamiquement pour composer des trajectoires de son choix. Sur quatre tâches évaluées (manipulation 2D, livraison aérienne simulée, navigation sol simulée et navigation sol en environnement physique réel), deux encodeurs visuels (ResNet-18 et EfficientNet-B0 + Transformer) et trois familles d'inférence générative (DDPM, DDIM et flow matching), les opérateurs attaquants ont atteint 100 % de succès de détournement dans l'ensemble des scénarios testés. Ce résultat interpelle directement les intégrateurs robotiques et les équipes de sécurité industrielle qui déploient des systèmes pilotés par des politiques de diffusion ou des VLA (Vision-Language-Action models). Jusqu'ici, la quasi-totalité des attaques adversariales sur robots visaient la dégradation des performances, induire un échec de tâche ou un comportement erratique. TAKO introduit une menace qualitativement différente : le robot ne s'arrête pas, il obéit à un attaquant distant. La perturbation agit sur le chemin de conditionnement visuel de la politique, et le biais introduit se propage à travers le processus de génération itératif propre aux modèles de diffusion, ce qui le rend difficile à détecter par supervision classique. Les auteurs démontrent aussi que la baseline naturelle "target-policy matching" échoue, car la politique victime ne peut pas se superviser fiablement sur des shifts hors distribution, invalidant une hypothèse de défense couramment avancée. Les politiques de diffusion pour la robotique se sont imposées comme paradigme dominant depuis 2023, portées par Diffusion Policy (Chi et al.) et intégrées dans des systèmes tels que pi0 de Physical Intelligence, les pipelines de Figure AI ou les robots de 1X Technologies. Ces architectures conditionnent l'action sur une observation visuelle, ce qui les rend structurellement vulnérables aux perturbations du flux caméra. Les pistes de défense habituelles, détection d'anomalies ou purification adversariale, restent largement expérimentales à cette échelle. L'évaluation demeure dans un cadre académique contrôlé, sans partenaire industriel ni calendrier de déploiement annoncé. Pour les équipes préparant des déploiements en logistique, livraison autonome ou manipulation industrielle, TAKO pose une question de sécurité concrète à laquelle le secteur n'a pas encore de réponse standardisée.

UELes intégrateurs robotiques européens déployant des systèmes à politiques de diffusion en logistique ou industrie doivent intégrer ce vecteur d'attaque dans leur modèle de menace, en l'absence de défense standardisée disponible.

RechercheActu
1 source
Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées
35arXiv cs.RO 

Exploration des robots à base de modèles fondation dans les soins aux patients et aux personnes âgées

Une équipe de chercheurs a publié en juin 2026 sur arXiv (référence 2606.10208) une analyse de synthèse portant sur l'intégration des modèles de fondation dans les robots de soin aux personnes âgées et aux patients. L'article, classé comme Perspective, passe en revue l'état de l'art sur trois axes : les caractéristiques de conception, l'expérience utilisateur mesurée, et les preuves d'impact sur les soins. Le constat central est que les architectures dominantes utilisent les modèles de fondation comme couche de conversation et de raisonnement au sein d'incarnations socioassistives centrées sur la voix, des agents qui parlent et écoutent mais dont l'autonomie physique et la compréhension multimodale restent fortement limitées. Les évaluations empiriques rapportent des bénéfices positifs en termes d'utilisabilité et d'engagement, mais des défaillances de fiabilité persistent : hallucinations, ruptures conversationnelles et pannes dans le pipeline d'interaction. L'enjeu pour les intégrateurs et décideurs du secteur santé est précisément là : les métriques actuellement rapportées portent sur des résultats proximaux comme l'engagement cognitif ou la participation, et non sur des indicateurs cliniques validés. Les robots sociaux conversationnels améliorent peut-être le ressenti ou l'interaction, mais aucun système décrit dans la littérature ne démontre d'impact mesurable sur des outcomes de santé standardisés. Cette lacune est critique pour tout déploiement en EHPAD ou à l'hôpital, où la responsabilité médicale exige traçabilité et supervision humaine explicite. Les auteurs soulignent que les benchmarks génériques importés du NLP ou de la robotique généraliste ne sont pas adaptés aux contraintes des environnements de soin. Le contexte est celui d'une accélération massive des modèles de fondation en robotique, de PaLM-E à Pi-0 de Physical Intelligence en passant par GR00T N2 de NVIDIA, qui creuse un écart croissant entre capacités techniques et readiness clinique. Du côté des plateformes établies, Pepper (SoftBank) et PARO (AIST, Japon) restent les références les plus documentées en milieu de soin. Des acteurs européens comme Enchanted Tools avec Mirokaï, ou des projets portés par l'Inria, s'inscrivent dans cette dynamique. Les auteurs appellent à une transition vers des standards d'évaluation spécifiques aux soins, une autonomie avec supervision humaine intégrée dès la conception, et une intégration réelle dans les flux de travail cliniques, trois conditions encore largement non remplies par les systèmes actuels.

UEEnchanted Tools (Mirokaï) et l'Inria sont explicitement cités comme acteurs européens engagés dans la robotique de soin, et les lacunes identifiées (absence de standards d'évaluation cliniques, supervision humaine insuffisante) concernent directement les déploiements en EHPAD et hôpitaux français soumis à la réglementation médicale.

RecherchePaper
1 source
Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation
36arXiv cs.RO 

Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation

Des chercheurs ont publié le 10 juin 2026 (arXiv:2606.10501) une étude identifiant une vulnérabilité critique des modèles Vision-Language-Action (VLA) face aux défauts physiques articulaires. Ces modèles, qui traduisent instructions en langage naturel et observations visuelles en commandes motrices, équipent aujourd'hui les robots humanoïdes et manipulateurs les plus avancés. Les auteurs montrent que des failles réalistes, notamment dégradation d'actionneur, friction excessive due à l'usure, dommages de collision ou limites de sécurité restreintes, cassent la boucle fermée entre action commandée, mouvement réalisé et observation suivante, dégradant les taux de succès même pour des défauts physiquement « faisables ». L'impact varie selon l'articulation affectée, rendant toute mitigation générique difficile. En réponse, les auteurs proposent J-PARC (Joint-level Physical-fault Aware Residual Calibrator), un module léger ajouté au-dessus d'une politique VLA figée, qui infère un régime de défaut latent depuis la dynamique articulaire récente et applique une correction résiduelle adaptative sans modifier le modèle de base. Ce résultat comble un angle mort réel dans la validation des systèmes robotiques à base de VLA. L'effort de robustification s'est jusqu'ici concentré sur les variations perceptuelles et sémantiques : éclairage, occlusion, reformulation d'instructions. Or tout robot industriel accumule friction, chocs et dégradation d'actionneur au fil du temps. Montrer que ces perturbations physiquement réalisables suffisent à faire chuter les performances remet en cause l'hypothèse implicite qu'un VLA entraîné sur hardware neuf reste fiable tout au long de son cycle de vie opérationnel. Pour les intégrateurs et responsables de certification, c'est un signal fort : la robustesse mécanique doit entrer dans les critères de qualification aux côtés de la généralisation sémantique. L'approche J-PARC, sans fine-tuning ni capteur supplémentaire, offre une piste d'adaptation réaliste pour les déploiements existants. Les VLA ont connu une montée en puissance rapide depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), avec des déploiements annoncés chez Figure (modèle 03), Agility Robotics et 1X Technologies. Malgré leurs performances en laboratoire, leur comportement sur hardware vieillissant reste peu documenté dans la littérature. Ce papier s'inscrit dans une tendance croissante sur la fiabilité opérationnelle à long terme, aux côtés des travaux sur le sim-to-real gap. En Europe, des acteurs comme Enchanted Tools avec Mirokaï ou Wandercraft, où la dégradation articulaire est un enjeu quotidien en milieu médical ou logistique, sont directement concernés par ces résultats. Les prochaines étapes naturelles seront une validation sur hardware en vieillissement accéléré et l'intégration de J-PARC dans des pipelines de déploiement continu.

UELes acteurs français Enchanted Tools et Wandercraft, confrontés à la dégradation articulaire en milieu médical et logistique, peuvent directement intégrer J-PARC pour fiabiliser leurs déploiements VLA sans modifier leurs modèles de base.

💬 On a tous fait cette hypothèse implicite : un VLA entraîné en labo reste fiable sur un robot qui a pris des coups après 18 mois en prod. Ce papier montre que non, et c'est un angle mort réel pour tous les intégrateurs qui déploient en milieu industriel ou médical. J-PARC corrige ça sans toucher au modèle de base, bon, reste à voir si ça tient sur du vrai hardware vieilli.

IA physiqueOpinion
1 source
Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération
37arXiv cs.RO 

Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération

Une équipe de chercheurs a publié le 10 juin 2026 (arXiv:2606.08881) un benchmark standardisé pour évaluer des modèles Vision-Language-Action (VLA) sur le robot SO-101, une plateforme manipulatrice à faible coût issue de la communauté open-source. Quatre politiques ont été comparées sur quatre tâches de manipulation représentatives avec des protocoles d'évaluation unifiés : Pi-0.5 (Physical Intelligence), SmolVLA (HuggingFace), Wall-X et ACT (Action Chunking with Transformers, référence en imitation learning). Toutes ont été fine-tunées directement sur le matériel physique à partir de démonstrations télé-opérées en conditions réelles, sans passer par la simulation. Au-delà du simple taux de succès binaire, l'étude introduit une taxonomie structurée des échecs, une décomposition sémantique et d'exécution, ainsi que des métriques de récupération (recovery-aware metrics) pour qualifier la robustesse de chaque architecture. Les résultats confirment que les VLA pré-entraînés sur de larges corpus surpassent globalement la baseline en imitation learning pure, mais cette supériorité reste fortement dépendante de la tâche. Ce point est crucial pour les intégrateurs : l'instabilité d'exécution, et non les erreurs de compréhension sémantique, constitue la source d'échec dominante. La capacité de récupération varie significativement selon les architectures, ce qui suggère que les benchmarks centrés uniquement sur le taux de succès final masquent des différences opérationnelles importantes. Pour un COO industriel, cela signifie que le choix d'un modèle VLA ne peut pas se faire sur des métriques agrégées sans analyser le comportement en cas d'échec partiel. Le SO-101 s'est imposé comme plateforme de référence communautaire grâce à son coût accessible, là où la plupart des évaluations VLA existantes reposent sur des robots industriels onéreux (Franka, UR, Boston Dynamics Spot) ou restent cantonnées à la simulation. Ce travail s'inscrit dans un effort plus large de démocratisation des benchmarks robotiques, face à des acteurs comme Figure AI, Agility Robotics ou 1X Technologies qui évaluent leurs systèmes en environnements propriétaires non reproductibles. Les auteurs positionnent explicitement le SO-101 comme socle pratique pour l'évaluation de l'IA incarnée dans des conditions de déploiement réalistes à faible coût. La prochaine étape naturelle serait d'étendre ce protocole à des scénarios de manipulation plus complexes et à davantage d'architectures VLA émergentes, notamment celles intégrant des retours haptiques.

UESmolVLA de HuggingFace (entreprise française) est directement comparé à Pi-0.5, Wall-X et ACT dans ce benchmark standardisé, offrant une visibilité internationale sur les forces et faiblesses du modèle français face aux architectures VLA concurrentes.

FR/EU ecosystemeActu
1 source
vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)
38arXiv cs.RO 

vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)

Des chercheurs de FAI ModelOpt Tech ont publié en juin 2026 vla.cpp (arXiv 2606.08094), un moteur d'inférence C++ portable construit sur llama.cpp pour exécuter des politiques VLA (Vision-Language-Action) directement sur le matériel embarqué des robots. L'engine prend en charge sept architectures couvrant cinq familles de backbones et quatre têtes d'action via un protocole requête/réponse unifié, incluant les schémas d'inférence par flow-matching et par diffusion propres aux VLA récents. Sur le benchmark LIBERO-Object, il reproduit le meilleur checkpoint SOTA à un épisode près sur 200 ; BitVLA y atteint 100 % de succès dans 1,3 Gio de mémoire. Le même bundle s'exécute sans modification sur trois niveaux matériels, d'un GPU grand public jusqu'à un module embarqué de 8 Go de RAM. Un noyau GEMM IMMA en escalier, dérivé d'une analyse roofline multi-hardware, réduit la latence par étape de BitVLA d'un facteur 4,5. Les auteurs ont également conduit un test de stress sur un bras ALOHA pour mesurer la contrainte de latence de replanification face à une cible mobile. Le problème structurel que vla.cpp attaque est la dépendance des stacks Python/PyTorch actuels à un GPU de station de travail, hypothèse incompatible avec l'électronique embarquée des robots commerciaux ou des cobots industriels. Démontrer une exécution à succès complet dans 1,3 Gio ouvre concrètement la voie au déploiement edge sans serveur distant ni dépendance cloud pour des tâches de manipulation. L'analyse roofline publiée dans le papier établit un résultat contre-intuitif pour les intégrateurs : l'inférence VLA en batch-1 est compute-bound, non bandwidth-bound, ce qui déplace le levier d'optimisation vers le taux d'utilisation du calcul. L'unification de sept architectures sous un seul protocole réduit également la fragmentation de l'écosystème VLA, frein réel à l'adoption en production. vla.cpp hérite de l'approche de quantification ggml et de la portabilité de llama.cpp de Georgi Gerganov. Les modèles ciblés incluent des architectures issues de Physical Intelligence (pi0) et des projets ouverts comme OpenVLA. La concurrence directe sur ce segment est limitée : la plupart des équipes robotiques maintiennent des pipelines Python maison dépendants de GPU Nvidia RTX 3090/4090 ; ROS 2 et Isaac ROS de Nvidia offrent des primitives d'intégration mais pas de runtime VLA unifié. Aucun acteur français ou européen n'est directement cité dans le papier. Le code, les vidéos de démonstration et le scaffold de benchmark reproductible sont disponibles sur le site du projet.

UEAucun acteur européen impliqué dans le développement, mais le runtime portable est directement exploitable par les équipes R&D françaises et européennes cherchant à déployer des politiques VLA sur matériel embarqué sans dépendance cloud.

💬 Faire tourner une politique VLA dans 1,3 Gio sans GPU de workstation, c'est le vrai débloqueur que les équipes robotique attendaient. Le reste, les sept architectures unifiées, le protocole commun, c'est utile, mais ce qui compte c'est que le déploiement edge devient une option sérieuse sans serveur distant. Reste à voir si ça tient sur des tâches moins sages que LIBERO-Object.

IA physiqueOpinion
1 source
La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?
39arXiv cs.RO 

La diversité est-elle tout ce qu'il faut pour la manipulation robotique à grande échelle ?

Une équipe de chercheurs publie sur arXiv (référence 2507.06219) une étude systématique sur le rôle de la diversité des données dans l'apprentissage de la manipulation robotique, remettant en cause l'intuition du "plus c'est divers, mieux c'est". Trois dimensions sont examinées indépendamment. La diversité des tâches s'avère plus critique que le volume de démonstrations par tâche pour le transfert vers de nouveaux scénarios. L'entraînement multi-robots (multi-embodiment) n'est pas nécessaire au transfert inter-plateformes : un modèle entraîné sur un seul type de robot avec des données de haute qualité transfère aussi efficacement, avec de meilleures propriétés de scaling au fine-tuning. Enfin, la diversité des experts humains peut nuire à l'apprentissage via la multimodalité des vitesses d'exécution, chaque opérateur ayant ses propres rythmes et préférences gestuelles. Pour corriger ce biais, les auteurs introduisent une méthode de distribution debiasing appliquée à leur modèle GO-1-Pro, qui gagne 15% de performance, l'équivalent de multiplier par 2,5 le volume de pré-entraînement. Ces résultats ont des implications directes pour les équipes qui conçoivent des pipelines de collecte de données. La conclusion sur le multi-embodiment est particulièrement contre-intuitive : constituer un corpus mono-robot de haute qualité avant de fine-tuner est plus efficace qu'accumuler des datasets disparates multi-robots. Pour un intégrateur ou un décideur industriel, cela redéfinit les priorités de curation : couvrir un maximum de tâches prime sur l'accumulation brute de démonstrations, et standardiser les démonstrations expert devient un levier de performance mesurable. La multimodalité des vitesses est désormais un biais identifiable et corrigeable en amont du pipeline, pas une fatalité inhérente à la collecte humaine. Ce travail s'inscrit dans la dynamique portée par Google DeepMind (RT-2), Physical Intelligence (Pi-0) et les équipes de Berkeley (OpenVLA, Octo), qui cherchent à construire des fondations généralistes pour la manipulation depuis 2023. Contrairement au texte ou aux images, les données de démonstration robotique restent coûteuses à produire, ce qui rend les choix de stratégie de scaling particulièrement stratégiques. Les conclusions orientent directement les acteurs comme Figure AI (Figure 03), Agility Robotics ou, en France, Enchanted Tools (Mirokaï), qui investissent dans de larges datasets de manipulation. Ce travail est purement académique : aucun déploiement ni partenariat commercial n'est annoncé.

UEEnchanted Tools (Mirokaï) est explicitement citée comme acteur concerné par ces stratégies de scaling des données de manipulation, rendant les conclusions directement applicables à leur R&D en France.

RecherchePaper
1 source
Ce que mesurent réellement les benchmarks en manipulation robotique
40arXiv cs.RO 

Ce que mesurent réellement les benchmarks en manipulation robotique

Un article de recherche déposé sur arXiv le 4 juin 2026 (arXiv:2606.04233) remet en cause la fiabilité de cinq benchmarks standards en manipulation robotique : LIBERO, CALVIN, SimplerEnv, RoboCasa et RoboTwin 2.0. Les auteurs identifient quatre modes de défaillance structurelle qui invalident leur usage comme proxy de la capacité de manipulation générale : résolution par raccourci (shortcut solvability), absence de significativité statistique, surapprentissage rampant (creeping overfitting) et dépendance à la source de données. Sur LIBERO, une sonde de 90 millions de paramètres, sans encodeur de langage, atteint des scores au niveau ou proches de l'état de l'art rapporté dans la littérature récente, ce qui suggère que les modèles exploitent des artefacts du benchmark plutôt que des compétences réelles. Sur CALVIN, la simple randomisation des positions des blocs dans la plage d'entraînement fait chuter les performances de toutes les politiques testées, révélant une généralisation quasi nulle même dans des conditions marginalement différentes. Ces résultats ont des implications directes pour les équipes qui évaluent des architectures VLA (Vision-Language-Action). Si LIBERO et CALVIN échouent à plusieurs diagnostics, les progrès revendiqués sur ces benchmarks ne constituent pas une preuve crédible de capacité de manipulation générale. La plupart des gains rapportés sur LIBERO ne sont pas statistiquement significatifs, ce qui signifie que de nombreuses publications revendiquent des améliorations qui pourraient n'être que du bruit. Pour les intégrateurs et les décideurs industriels, cela signifie que les scores de benchmarks courants ne sont pas des indicateurs fiables de la maturité réelle d'un système avant déploiement. Le problème n'est pas nouveau, mais il devient critique au moment où des VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA sont massivement benchmarkés dans la littérature. RoboCasa et RoboTwin 2.0, moins fréquemment cités dans les claims de progression récents, résistent mieux aux diagnostics proposés et constituent des alternatives plus robustes pour mesurer des progrès réels. Les auteurs publient leurs quatre diagnostics avec des implémentations de référence sur ripl.github.io/manipulationbenchmarkaudit, à destination des chercheurs et des reviewers, pour application avant soumission ou acceptation. La prochaine question est de savoir si des conférences majeures comme CoRL, ICRA ou RSS adopteront ces outils comme critère d'évaluation des soumissions.

UELes équipes de recherche françaises et européennes (INRIA, CEA-List) évaluant des architectures VLA devront appliquer ces diagnostics avant soumission pour ne pas revendiquer des gains qui pourraient n'être que du bruit statistique.

RecherchePaper
1 source
Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique
41arXiv cs.RO 

Cosmos 3 : des modèles du monde omnimodaux pour l'IA physique

NVIDIA a publié Cosmos 3, une famille de modèles du monde omnimodaux capables de traiter et générer conjointement du texte, des images, de la vidéo, de l'audio et des séquences d'actions au sein d'une architecture unifiée de type mixture-of-transformers. Présenté dans un preprint arXiv (2606.02800) le 3 juin 2026, Cosmos 3 fusionne en un seul framework quatre catégories de modèles jusqu'ici distinctes : modèles vision-langage (VLM), générateurs vidéo, simulateurs de monde et modèles action-monde. Les variantes post-entraînées ont été classées meilleures modèles open-source texte-vers-image et image-vers-vidéo par Artificial Analysis, et meilleur modèle de politique robotique par RoboArena. Code, checkpoints, datasets synthétiques et benchmarks d'évaluation sont publiés sous la licence OpenMDW-1.1 de la Linux Foundation, sur GitHub et HuggingFace. L'intégration de ces modalités dans un backbone scalable unique représente un changement architectural structurant pour l'IA physique. Pour un intégrateur robotique ou un décideur industriel, Cosmos 3 signifie qu'un seul modèle peut simultanément percevoir une scène, simuler des séquences vidéo plausibles, produire des instructions en langage naturel et prédire des séquences d'actions, sans recourir à plusieurs stacks spécialisés. La performance sur RoboArena, benchmark indépendant d'évaluation des politiques de contrôle robot, suggère que l'approche omnimodale ne sacrifie pas la précision des politiques à la généralité, une hypothèse régulièrement contestée dans le secteur. La mise à disposition des benchmarks sous licence ouverte offre en outre la possibilité d'un audit externe des performances, ce que les publications classiques de laboratoire ne permettent pas toujours. Cosmos 3 prolonge la trajectoire de NVIDIA en Physical AI amorcée avec Cosmos 1.x, présenté début 2025 comme plateforme de simulation pour l'entraînement robotique. L'architecture mixture-of-transformers rappelle des choix similaires chez Google DeepMind (Gemini) et Meta (Chameleon), mais avec un focus explicite sur l'embodiment et le contrôle moteur. Les concurrents directs sur le segment world-model pour robots incluent Physical Intelligence avec Pi-0, Google DeepMind avec ses successeurs de RT-2, et Skild AI. L'ouverture complète du code et des poids sous licence permissive est un signal stratégique clair : NVIDIA mise sur l'adoption par l'écosystème pour faire de Cosmos l'infrastructure de référence de l'IA physique, répliquant la dynamique qui a fait de CUDA le standard incontournable du calcul GPU.

UELes laboratoires et intégrateurs robotiques européens peuvent immédiatement adopter Cosmos 3 comme infrastructure open-source (licence permissive OpenMDW-1.1) pour leurs développements en IA physique, sans frais de licence et avec des benchmarks auditables.

💬 La comparaison avec CUDA n'est pas anodine. NVIDIA ne publie pas Cosmos 3 par générosité open-source, ils font exactement ce qu'ils ont fait en 2007 : poser le layer d'infrastructure que tout le monde finira par utiliser, et vendre les GPU par-dessus. Vu les benchmarks sur RoboArena, les labos robotiques ont peu de raisons de résister.

IA physiqueOpinion
1 source
TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux
42arXiv cs.RO 

TRAP : détournement du raisonnement CoT dans les VLA par patches adversariaux

Des chercheurs ont publié sur arXiv (réf. 2603.23117) une attaque baptisée TRAP (Targeted Reasoning Adversarial Patch), démontrant pour la première fois qu'un patch adversarial physique peut détourner le comportement d'un robot manipulateur piloté par un modèle Vision-Language-Action (VLA) à raisonnement Chain-of-Thought (CoT). Dans les expériences présentées, un patch imprimé sur papier et déposé sur la surface de travail, tel qu'une nappe aux motifs spécifiques, suffit à faire en sorte que le robot remette un couteau à l'opérateur au lieu d'une pomme, sans qu'aucune modification de l'instruction utilisateur ne soit nécessaire. L'attaque a été validée sur trois VLA représentatifs intégrant des mécanismes CoT distincts, et mise en oeuvre en conditions réelles avec un simple imprimé papier. Ce résultat pointe une vulnérabilité structurelle dans les VLA à raisonnement intermédiaire, famille de modèles qui inclut notamment π0 de Physical Intelligence, OpenVLA-OFT ou les variantes de GR00T (NVIDIA) basées sur des CoT explicites. Les auteurs montrent empiriquement que le raisonnement CoT gouverne la génération d'actions de façon prépondérante, même lorsqu'il est sémantiquement incohérent avec l'instruction initiale : le modèle suit la chaîne de pensée corrompue plutôt que l'intention de l'utilisateur. Pour les intégrateurs déployant des bras robotisés en environnement ouvert, entrepôts, blocs opératoires ou assistance à domicile, cela signifie qu'un adversaire pourrait modifier le comportement du robot par simple altération visuelle de l'environnement, sans accès au modèle ni au flux de commandes, ce qui rend l'attaque particulièrement préoccupante en contexte de sécurité physique. Les VLA à raisonnement CoT ont émergé comme réponse aux limites des modèles action-réflexe classiques : le CoT améliore la généralisation et offre une trace d'interprétabilité utile pour la certification. TRAP montre que cette avancée introduit simultanément une surface d'attaque inédite. La recherche en sécurité des systèmes robotiques autonomes reste largement sous-investie par rapport à la sécurité des LLM textuels, et ce travail rejoint un corpus naissant incluant des attaques sur les politiques de diffusion et les modèles de perception. Aucun correctif ni benchmark défensif n'est proposé dans cette version ; les auteurs appellent à une sécurisation urgente des pipelines CoT dans les VLA avant tout déploiement à grande échelle dans des environnements critiques.

UELes intégrateurs européens déployant des VLA sur des bras robotisés en environnement industriel, médical ou d'assistance doivent suspendre tout déploiement à grande échelle dans des environnements critiques et auditer leurs pipelines CoT, en l'absence totale de correctifs défensifs disponibles.

RechercheOpinion
1 source
SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA
43arXiv cs.RO 

SilentDrift : exploiter le découpage en actions pour des attaques par porte dérobée furtives sur les modèles VLA

Des chercheurs en sécurité informatique ont publié sur arXiv (référence 2601.14323) une attaque baptisée SilentDrift, ciblant les modèles Vision-Language-Action (VLA) utilisés pour piloter des robots manipulateurs. L'attaque exploite deux mécanismes devenus standards dans les architectures VLA modernes : l'action chunking, qui consiste à générer des séquences de K actions d'un coup plutôt qu'action par action, et la représentation en delta de pose, qui encode chaque mouvement sous forme d'incrément relatif à la position précédente. Cette combinaison crée une boucle ouverte visuelle intra-chunk : une fois la séquence lancée, le robot l'exécute sans relire le flux caméra à chaque pas. Des perturbations imperceptibles à l'échelle d'un pas s'accumulent alors par intégration, déviant la trajectoire finale de manière significative. Sur le benchmark LIBERO, SilentDrift atteint un taux de succès d'attaque de 93,2 % avec un taux d'empoisonnement inférieur à 2 % des données d'entraînement, tout en maintenant un taux de réussite sur tâches propres de 95,3 %, rendant la backdoor pratiquement indétectable par les métriques standards. L'impact pour les intégrateurs et décideurs B2B est direct : les VLA comme pi-0 de Physical Intelligence, OpenVLA ou les variantes de RT-2 s'appuient précisément sur ces mécanismes d'action chunking pour obtenir des mouvements fluides et cohérents. Un attaquant ayant accès à une fraction marginale des données d'entraînement peut donc compromettre un système de manipulation robotique déployé en environnement industriel sans déclencher d'alarme sur les métriques de performance habituelles. Les trajectoires empoisonnées sont visuellement identiques aux démonstrations saines, ce qui invalide les audits visuels comme contrôle de qualité suffisant. La stratégie dite "keyframe attack" de SilentDrift cible spécifiquement la phase d'approche critique d'une saisie, maximisant l'effet de déviation tout en minimisant l'exposition du trigger. Ce travail s'inscrit dans un courant de recherche naissant sur la sécurité des modèles de fondation pour la robotique, un champ largement ignoré jusqu'ici face à l'effervescence autour des performances. Les VLA connaissent une adoption rapide depuis 2023, portée par des acteurs comme Physical Intelligence (pi-0), Google DeepMind (RT-2, GR00T N2 de Nvidia) et les laboratoires académiques via des benchmarks comme LIBERO ou Open-X Embodiment. SilentDrift est une attaque en boîte noire, ce qui signifie qu'elle ne nécessite pas d'accès au modèle entraîné, uniquement aux données. Les auteurs n'annoncent pas de contre-mesure, ouvrant un chantier de recherche défensive urgent à mesure que ces modèles approchent de déploiements réels dans la logistique et l'assemblage manufacturier.

UELes intégrateurs européens qui déploient ou évaluent des VLA (pi-0, OpenVLA, RT-2) dans la logistique ou l'assemblage doivent intégrer l'audit de sécurité des données d'entraînement dans leurs processus de qualification, car les métriques de performance standards ne détectent pas ce vecteur d'attaque.

RechercheOpinion
1 source
Erreur par groupe, pas MSE totale : affinage de modèles VLA pour la manipulation mobile à 11 DOF
44arXiv cs.RO 

Erreur par groupe, pas MSE totale : affinage de modèles VLA pour la manipulation mobile à 11 DOF

Des chercheurs ont publié le 1er juin 2026 sur arXiv une étude portant sur le fine-tuning de modèles Vision-Language-Action (VLA) pour manipulateurs mobiles à 11 degrés de liberté (DoF), en l'occurrence le Toyota HSR. Ils ont comparé SmolVLA (450 millions de paramètres, entraînement sur la tête d'action uniquement) et π0.5 de Physical Intelligence (3,3 milliards de paramètres), évalués sur 60 essais réels (20 par variante). Le résultat central : le checkpoint affichant la meilleure erreur quadratique moyenne (MSE) agrégée n'est pas celui qui performe le mieux sur le robot physique. π0.5 à 80 000 étapes obtient un score de 4,0/4, devançant la variante expert-only à 3 000 étapes (3,75/4) et HSR-SmolVLA (3,5/4), avec une significativité statistique confirmée (Mann-Whitney p ≤ 0,010), malgré une MSE totale plus élevée pour le modèle gagnant. L'enjeu est méthodologique autant que pratique. Sur un robot hétérogène comme le HSR, les articulations faciles à prédire (tête, base) tirent la MSE agrégée vers le bas et masquent les joints critiques (bras) qui continuent d'échouer. Dans la variante expert-only de π0.5, geler le backbone et n'entraîner que la tête d'action fait chuter la MSE totale sous la baseline, mais dégrade précisément la précision du bras. L'analyse par groupe (bras, pince, tête, base roulante) révèle que c'est l'erreur du groupe bras hors ligne, et non la MSE totale ni l'erreur de la base, qui corrèle le plus fidèlement avec la performance réelle. Ce constat remet en question une pratique courante dans le déploiement de VLA sur robots multi-segments. Le Toyota HSR est une plateforme de référence en manipulation domestique et en recherche académique. Les modèles VLA s'imposent comme paradigme dominant depuis les travaux RT-2 de Google DeepMind (2023), suivis de π0 et π0.5 de Physical Intelligence (San Francisco), SmolVLA de HuggingFace (Paris), ou encore OpenVLA de Stanford. Le problème de la sélection de checkpoint par MSE agrégée était jusqu'ici peu documenté pour les espaces d'action hétérogènes. Le code de cette étude est publié en open source sur GitHub, ce qui permet une réplication directe. Prochaine étape logique : valider cette approche per-group sur d'autres plateformes humanoïdes à espace d'action encore plus fragmenté.

UESmolVLA de HuggingFace (Paris) est l'un des deux modèles centralement évalués, et les résultats méthodologiques (sélection de checkpoint par groupe d'articulations) guident directement les équipes européennes déployant des VLA sur manipulateurs mobiles hétérogènes.

💬 Évaluer un checkpoint VLA par la MSE totale sur un robot à 11 DOF, c'est se raconter des histoires. Les articulations simples, tête et base roulante, tirent le score agrégé vers le bas et cachent que le bras, lui, continue de foirer : le modèle gagnant sur la métrique standard n'est pas celui qui tient en conditions réelles. Ce papier le prouve proprement avec 60 essais physiques, et avec SmolVLA de HuggingFace dans le lot, c'est pas juste un résultat académique.

IA physiqueOpinion
1 source
Wall-OSS-0.5 : rapport technique
45arXiv cs.RO 

Wall-OSS-0.5 : rapport technique

Une équipe de chercheurs a publié sur arXiv (2605.30877) le rapport technique de Wall-OSS-0.5, un modèle Vision-Language-Action (VLA) open source de 4 milliards de paramètres, construit sur un backbone VLM de 3B paramètres auquel sont greffés des composants de génération d'actions. Le modèle a été pré-entraîné sur plus de 20 morphologies robotiques différentes, en ingérant plus d'un million de trajectoires robot par époque, couplées à un corpus multimodal ancré. La recette d'entraînement repose sur un co-entraînement à gradient bridgé combinant trois objectifs complémentaires : prédiction d'actions discrètes pour faire circuler des gradients VLM forts dans le backbone, prédiction multimodale pour préserver la compréhension vision-langage, et flow matching continu comme interface d'action au moment du déploiement. Avant tout fine-tuning spécifique, le checkpoint pré-entraîné atteint des comportements zero-shot non triviaux sur un banc de 17 tâches réelles, y compris une tâche de manipulation d'objets déformables hors distribution. Après fine-tuning, il affiche 60,5% de progression moyenne sur 15 tâches réelles et surpasse Pi-0.5 de 17,5 points de pourcentage. Ce résultat repose la question fondamentale du pré-entraînement VLA : jusqu'ici, la quasi-totalité des preuves de performance étaient mesurées après fine-tuning, rendant impossible la distinction entre "le pré-entraînement forme une politique utilisable" et "le pré-entraînement fournit juste une meilleure initialisation". Wall-OSS-0.5 démontre que le checkpoint brut produit des comportements exécutables sur matériel physique, y compris sur des tâches jamais vues. Le fait que l'entraînement sur données d'action ne dégrade pas les capacités vision-langage générales est également significatif pour les intégrateurs : cela suggère qu'un seul modèle fondation peut couvrir perception, raisonnement et contrôle sans compromis majeur, ce qui simplifie l'architecture système. Wall-OSS-0.5 s'inscrit dans la dynamique des VLA fondationnels initiée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa publication open source le distingue dans un secteur dominé par des checkpoints propriétaires, et permet des comparaisons reproductibles. La performance zero-shot sur manipulation déformable est notable car ce type de tâche est réputé difficile à généraliser : c'est précisément le type de gap sim-to-real que les approches purement simulées peinent à combler. Les prochaines étapes probables incluent un scaling du corpus et des évaluations sur des plateformes humanoïdes commerciales, où la generalisation cross-embodiment du modèle pourra être testée en conditions industrielles.

UELe caractère open source de Wall-OSS-0.5 permet aux équipes de R&D françaises et européennes d'accéder librement à un modèle VLA fondationnel compétitif, réduisant la dépendance aux checkpoints propriétaires américains et asiatiques.

💬 Le vrai truc ici, c'est pas les 60,5% sur le benchmark. C'est que le checkpoint pré-entraîné produit des comportements exécutables sur du vrai matériel, sans fine-tuning, y compris sur des tâches jamais vues. Et open source par-dessus le marché, dans un secteur où tout le monde garde jalousement ses poids pour soi.

IA physiqueOpinion
1 source
Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements
46arXiv cs.RO 

Déploiement de pipelines VLA en atelier d'emballage industriel : étude de cas, flux de travail, échecs et enseignements

Des chercheurs associés à Siemens ont publié le 28 mai 2026 sur arXiv (2605.27461) une étude de déploiement industriel d'une politique VLA (Vision-Language-Action) dans l'usine Siemens GWE d'Erlangen, en Allemagne. La tâche ciblée est précisément définie : un bras robotique doit saisir un sachet d'accessoires transparent au sein d'un tas encombré, l'insérer dans la cavité restante d'un emballage carton, puis vérifier que le sachet et son contenu restent en dessous du plan de fermeture du carton. Le modèle de base utilisé est Pi0.5, la politique VLA de Physical Intelligence, affinée de manière itérative sur données terrain. L'équipe a accumulé 2535 épisodes d'entraînement, soit environ 10 heures de données collectées directement en conditions d'usine, via un pipeline cyclique comprenant collecte, curation, fine-tuning, évaluation et collecte de données de récupération ciblées. Ce qui rend cette publication notable, c'est son positionnement éditorial délibérément empirique : les auteurs ne communiquent pas sur un taux de succès global, mais documentent les modes de défaillances récurrents et les ajustements nécessaires à chaque cycle. C'est précisément ce type de retour d'expérience qui manque dans la littérature robotique, où les démonstrations sélectionnées occultent souvent le coût réel d'adaptation d'un modèle généraliste à une tâche industrielle spécifique. La gestion d'objets transparents, notoire pour tromper les systèmes de vision par profondeur, illustre ici les limites concrètes du sim-to-real et du transfert zero-shot. L'étude confirme que le fine-tuning dirigé par les échecs terrain, plutôt que la montée en données brutes, reste le levier dominant pour atteindre la fiabilité industrielle. Pi0.5 est le successeur de π0, lancé par Physical Intelligence (San Francisco) fin 2024, conçu comme politique généraliste pour la manipulation dextère. Son déploiement chez Siemens marque une étape significative dans la commercialisation B2B des VLA, un segment que se disputent actuellement Figure AI avec sa pile Helix, 1X Technologies avec NEO, et des initiatives internes comme GR00T N2 de NVIDIA ou les travaux de Boston Dynamics sur Atlas. Aucun acteur européen n'est directement impliqué dans ce déploiement, bien que Wandercraft et Enchanted Tools positionnent des produits complémentaires sur le segment français. La prochaine étape logique de ce type d'étude serait une généralisation multi-tâches ou multi-sites, mais les auteurs restent prudents : l'article conclut sur des leçons méthodologiques, non sur un déploiement à l'échelle.

UELe déploiement de Pi0.5 dans l'usine Siemens d'Erlangen fournit le premier retour d'expérience empirique documenté d'un modèle VLA généraliste en conditions industrielles réelles au sein d'un acteur EU majeur, directement exploitable par les intégrateurs et équipementiers robotiques européens.

FR/EU ecosystemeOpinion
1 source
SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données
47arXiv cs.RO 

SEVO : observation virtuelle enrichie sémantiquement pour la manipulation VLA robuste par éclairage actif et collecte de données

Des chercheurs publient sur arXiv (arXiv:2605.11114, mai 2025) une méthode baptisée SEVO (Semantic-Enhanced Virtual Observation) visant à résoudre l'un des problèmes les plus documentés des politiques VLA (Vision-Language-Action) et d'apprentissage par imitation : leur effondrement dès qu'elles quittent l'environnement d'entraînement. Sans modification de l'architecture du modèle, SEVO agit sur le flux caméra RGB brut via trois mécanismes combinés : des caméras fixes sur le corps du robot dont les champs de vision couvrent l'intégralité de l'espace de manipulation, un éclairage actif en spectre rouge qui normalise physiquement l'apparence des objets, et une segmentation YOLO en temps réel qui produit une représentation sémantique invariante au fond. Les tests portent sur des bouteilles d'eau transparentes -- objets délibérément difficiles car ils se confondent visuellement avec leur environnement -- dans une tâche de pick-and-place répétée sur deux plateformes mobiles. Avec SEVO, la politique ACT atteint 95 % de succès en environnement d'entraînement et 85 % en environnement inédit ; SmolVLA atteint 83 % et 75 % respectivement. Sans SEVO, ces mêmes politiques plafonnent à 75 %/70 % en entraînement et s'effondrent à 30-35 % hors contexte. Ces résultats remettent directement en cause le paradigme dominant qui consiste à compenser le manque de robustesse par une mise à l'échelle des modèles. Les praticiens de la communauté open source rapportaient déjà des taux de transfert quasi nuls avec les benchmarks ACT et SmolVLA standards, pourtant affichant des scores élevés en laboratoire. SEVO démontre que la conception de l'observation -- ce que le robot "voit" et comment -- combinée à une diversification systématique des données de téléopération (variations d'éclairage, de fond, d'objets distracteurs) constitue le levier de généralisation le plus efficace, bien devant le choix du modèle. Pour un intégrateur ou un COO industriel, l'implication est directe : un robot à bas coût bien "observé" et entraîné sur des données variées surpasse un modèle plus sophistiqué entraîné dans des conditions homogènes. Le contexte est celui de l'essor des toolchains communautaires autour des VLA, notamment les frameworks lekiwi et SO-101 sur lesquels ACT et SmolVLA sont régulièrement évalués. La "sim-to-real gap" et le "domain shift" sont des problèmes ouverts depuis des années dans la manipulation robotique ; des approches comme domain randomization ou data augmentation tentaient déjà d'y répondre par le calcul. SEVO prend le parti inverse : agir sur le hardware d'observation et le protocole de collecte plutôt que sur l'architecture ou la puissance de calcul. Les suites logiques de ces travaux incluent l'extension à des tâches multi-étapes, à des objets plus variés, et potentiellement à des bases mobiles commerciales -- un terrain sur lequel des acteurs comme Boston Dynamics (Spot), AgileX ou les startups européennes de manipulation à coût réduit sont directement concernés.

UESmolVLA, développé par HuggingFace (entreprise franco-américaine), est directement évalué dans cette étude, les équipes européennes travaillant sur la manipulation VLA disposent d'un levier hardware-protocole immédiatement applicable pour multiplier leurs taux de succès hors environnement d'entraînement, sans changer d'architecture ni investir dans des modèles plus lourds.

💬 J'attendais quelqu'un pour le montrer proprement : le domain shift, c'est pas un problème de modèle, c'est un problème d'observation. SEVO passe de 30 à 85 % de succès hors environnement d'entraînement en contrôlant l'éclairage, les angles de caméra et la segmentation temps réel, sans changer une ligne d'architecture. Un robot bas coût bien observé bat un modèle sophistiqué entraîné dans une bulle.

IA physiqueOpinion
1 source
QDTraj : exploration de primitives de trajectoires variées pour la manipulation robotique d'objets articulés
48arXiv cs.RO 

QDTraj : exploration de primitives de trajectoires variées pour la manipulation robotique d'objets articulés

Des chercheurs de l'ISIR (Institut des Systèmes Intelligents et de Robotique, Sorbonne Université/CNRS) publient sur arXiv en avril 2026 une méthode baptisée QDTraj, destinée à générer automatiquement des primitives de trajectoires diversifiées pour la manipulation d'objets articulés par des robots domestiques. L'approche repose sur des algorithmes Quality-Diversity (QD) couplés à une exploration par récompense sparse. Évaluée sur 30 articulations du dataset PartNetMobility, QDTraj produit en moyenne 704 trajectoires distinctes par tâche, contre un ratio au moins 5 fois inférieur pour les méthodes concurrentes testées sur des tâches d'activation de charnières (hinge) et de glissières (slider). La méthode a été validée d'abord en simulation, puis déployée en conditions réelles sur robot physique. Le code est rendu public sur le site de l'ISIR. La diversité des trajectoires n'est pas un détail académique : en environnement réel, un robot qui ne dispose que d'une seule séquence motrice pour ouvrir un tiroir échoue dès que cette trajectoire est bloquée par un obstacle ou une contrainte dynamique imprévue. QDTraj adresse directement ce verrou en dotant le robot d'un répertoire de solutions alternatives sélectionnables au runtime selon les contraintes du moment. La validation sim-to-real apporte un crédit concret à l'approche, au-delà de la démonstration en simulation. L'utilisation des algorithmes QD, issus de la robotique évolutionnaire (famille MAP-Elites), est un signe de maturité méthodologique : ces approches explorent des espaces de solutions larges sans converger prématurément vers un optimum local, contrairement aux méthodes par gradient classiques. L'ISIR est l'un des laboratoires de référence en robotique française, avec une longue tradition en planification de mouvement et manipulation dextre. Ce travail s'inscrit dans un contexte où les approches dominantes, imitation learning ou reinforcement learning standard, produisent généralement des politiques à trajectoire unique, fragiles hors distribution. Les modèles VLA (Vision-Language-Action), très suivis en 2025-2026 chez Physical Intelligence (pi0), Google DeepMind ou Boston Dynamics, abordent le problème différemment en conditionnant les actions sur le langage, sans garantir la diversité bas niveau que QDTraj cible explicitement. La méthode se positionne donc comme une couche de planification complémentaire, en amont des politiques haut niveau. Les extensions naturelles concerneraient les objets déformables et l'intégration dans des architectures de contrôle hiérarchique pour robots manipulateurs polyvalents.

UEL'ISIR (Sorbonne/CNRS) publie en open source une méthode de planification de trajectoires qui comble un verrou concret de la manipulation robotique, avec un bénéfice direct pour les équipes de R&D françaises et européennes travaillant sur les robots manipulateurs.

💬 Un robot qui n'a qu'une seule trajectoire pour ouvrir un tiroir, c'est un robot qui échoue dès qu'un obstacle se met en travers. QDTraj répond à ça en générant 700+ alternatives exploitables au runtime, avec des algorithmes QD qui explorent des espaces de solutions larges sans converger trop vite vers un optimum unique (contrairement au RL classique). Reste à voir comment ça s'articule avec des VLA au-dessus, mais comme brique de planification bas niveau, c'est du concret qui sort de l'ISIR.

FR/EU ecosystemePaper
1 source
Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)
49arXiv cs.RO 

Démasquer l'illusion du raisonnement incarné dans les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 22 avril 2026 un article sur arXiv (référence 2604.18000) introduisant BeTTER, un benchmark de diagnostic conçu pour tester le raisonnement incarné réel dans les modèles de type Vision-Language-Action (VLA). L'objectif : vérifier si les taux de succès élevés affichés par des modèles comme pi-0, OpenVLA ou RoboVLMs sur les benchmarks standards reflètent une véritable intelligence physique, ou un artefact d'évaluation. BeTTER applique des interventions causales ciblées, modifications de la disposition spatiale, extrapolation temporelle, tout en isolant cinématiquement les échecs de raisonnement de haut niveau des limites d'exécution motrice de bas niveau. Résultat : les VLA de pointe s'effondrent dans des scénarios dynamiques, exhibant des raccourcis lexico-cinématiques (le modèle associe des mots à des patterns moteurs sans vraiment "comprendre"), une inertie comportementale, et un effondrement de la représentation sémantique. Ces résultats remettent en cause l'un des postulats les plus optimistes du secteur : que les hauts scores sur benchmarks constituent une preuve de généralisation. L'analyse mécaniste des auteurs identifie deux goulots d'étranglement architecturaux structurels, la compression de capacité et le sous-échantillonnage myope, qui dégradent systématiquement la représentation sémantique fondamentale du modèle. En d'autres termes, les architectures VLA actuelles sont structurellement contraintes à sacrifier le raisonnement de haut niveau pour maintenir la fréquence de contrôle nécessaire à l'exécution motrice en temps réel. Les protocoles d'évaluation trop statiques masquent cette dégradation en permettant au modèle d'overfitter aux priors sensorimoteurs du dataset, ce qui est un signal d'alarme direct pour les intégrateurs industriels qui évaluent ces systèmes avant déploiement. La famille VLA a connu une accélération marquée depuis fin 2023, avec les travaux de Physical Intelligence (pi-0), Google DeepMind (RT-2, puis Helix en collaboration avec Figure AI), et des efforts académiques nombreux autour de modèles open-source comme OpenVLA. Le gap benchmark-réalité est un problème récurrent en robotique, le sim-to-real transfer en est la version la plus connue, mais BeTTER le documente cette fois au niveau du raisonnement cognitif plutôt que de la dynamique physique. Les auteurs valident leurs conclusions sur robot réel, ce qui exclut l'hypothèse d'un artefact de simulation. La prochaine étape logique pour le secteur est de repenser les architectures VLA pour résoudre la tension structurelle entre contrôle haute fréquence et raisonnement sémantique robuste, probablement via des approches hiérarchiques déjà explorées par des équipes comme Wandercraft côté locomotion, ou Enchanted Tools pour la manipulation expressive.

UEWandercraft et Enchanted Tools, acteurs français actifs sur la locomotion et la manipulation expressive, sont directement concernés par les goulots d'étranglement architecturaux identifiés par BeTTER, qui constitue un signal d'alarme pour tout intégrateur européen évaluant des systèmes VLA avant déploiement industriel.

RechercheOpinion
1 source
ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites
50arXiv cs.RO 

ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites

Des chercheurs ont publié ROBOGATE (arXiv:2603.22126), un framework open-source de validation pré-déploiement pour les politiques de manipulation robotique, conçu pour identifier les zones de défaillance avant mise en production industrielle. Le système repose sur un échantillonnage adaptatif en deux étapes dans un espace de paramètres à huit dimensions : une première phase par Latin Hypercube Sampling (LHS) couvre l'espace global, puis une seconde phase concentre l'effort sur la zone de transition critique entre 30 % et 70 % de taux de réussite, là où les échecs sont les plus révélateurs. Le tout est exécuté dans NVIDIA Isaac Sim avec le moteur physique Newton, sur quatre morphologies robotiques : Franka Panda (7-DOF), UR3e, UR5e et UR10e (tous 6-DOF). Au total, plus de 50 000 expériences ont été simulées, produisant un modèle de régression logistique avec une AUC de 0,780 et une équation analytique fermée de la frontière de défaillance. Le framework a également benchmarké huit politiques VLA, dont une version fine-tunée de NVIDIA GR00T N1.6 (3 milliards de paramètres), entraînée sur LIBERO-Spatial pendant 20 000 étapes. Le chiffre le plus frappant de l'étude est un écart de 97,65 points de pourcentage entre les environnements de simulation : le même checkpoint GR00T N1.6 atteint 97,65 % de réussite sur le benchmark LIBERO sous MuJoCo, mais tombe à 0 % sur les 68 scénarios industriels de ROBOGATE sous Isaac Sim. Ce résultat met en lumière un problème structurel du déploiement des VLA : les scores de benchmark en simulation ne prédisent pas le comportement dans un simulateur différent, a fortiori dans le monde réel. Pour les intégrateurs et les décideurs industriels, cela signifie qu'un modèle validé sur benchmark standard peut être totalement non opérationnel dans leur environnement cible. ROBOGATE propose une couche de validation intermédiaire, inspirée du paradigme que NVIDIA a formalisé pour le calcul quantique avec Ising, transposé ici à l'IA physique. Le gap sim-to-real reste l'un des verrous majeurs de la robotique manipulatrice apprise, et la plupart des acteurs du secteur, de Figure AI (Figure 03) à Physical Intelligence (Pi-0) en passant par Boston Dynamics ou les équipes internes de NVIDIA, travaillent à le réduire via des pipelines sim-to-real renforcés ou de la synthèse de données domain-randomisée. ROBOGATE ne prétend pas résoudre ce gap mais fournit un outil de diagnostic structuré : cartographier les frontières d'échec avant déploiement, ce qui est précisément ce qui manque dans les workflows industriels actuels. Le framework est publié en open-source, ce qui devrait faciliter son adoption par les équipes de validation, en particulier celles qui travaillent sur des cellules pick-and-place standardisées avec des bras industriels UR ou Franka. Les prochaines étapes naturelles seraient l'extension à des morphologies mobiles-manipulatrices et l'intégration dans des pipelines CI/CD robotiques, un domaine encore embryonnaire mais en progression rapide chez des acteurs comme Intrinsic (Alphabet) ou Covariant.

UELes équipes R&D européennes travaillant sur des cellules robotiques avec bras UR (Universal Robots, Danemark) ou Franka Panda peuvent adopter ce framework open-source pour structurer leur validation pré-déploiement et éviter des échecs coûteux en production.

IA physiqueActu
1 source