Aller au contenu principal

Dossier arXiv cs.RO — page 5

2437 articles · page 5 sur 49

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

201arXiv cs.RO RecherchePaper

Modèles vision-langage-action de manipulateurs aériens modulaires, adaptés à la tâche sous contraintes de flux d'air

Le paragraphe qui suit décode un preprint arXiv (2607.09548v1, catégorie "new") plutôt qu'une annonce produit : posture éditoriale adaptée en conséquence, sans effets d'annonce à dégonfler puisqu'il n'y en a pas. Une équipe de recherche propose un cadre de conception par optimisation pour des manipulateurs aériens modulaires, c'est à dire des drones multirotors équipés d'un bras robotique capable d'interagir physiquement avec leur environnement. Le problème central : le flux d'air généré par les rotors perturbe les tâches impliquant des cibles ou des environnements sensibles au souffle. Les auteurs introduisent une catégorisation inédite de la tolérance des cibles à l'exposition au flux d'air, traduite en contraintes géométriques exploitables dans l'optimisation. Pour modéliser ce flux sans exploser le coût de calcul, ils développent une enveloppe compacte en forme de cône-sphère qui approxime la structure de propagation du souffle d'un quadrirotor. Sur cette base, le système de reconfiguration optimise à la fois la configuration de la plateforme et le placement de l'effecteur terminal, en respectant simultanément les exigences de force et couple (wrench) de la tâche, l'exposition de la cible au flux d'air et les interférences aérodynamiques entre les propres rotors de la plateforme. Contrairement aux approches précédentes qui fixaient d'emblée la position de l'effecteur, ce placement devient ici une variable d'optimisation à part entière. Des expériences de passage à l'échelle et des études d'ablation viennent valider l'approche. L'intérêt pour le secteur tient à un angle mort réel de la manipulation aérienne : la plupart des cadres de conception optimisent la faisabilité mécanique des tâches sans jamais modéliser la perturbation aérodynamique que le drone lui-même inflige à sa cible, un problème critique pour l'inspection de capteurs fragiles, l'agriculture de précision près de cultures sensibles, ou toute intervention à proximité d'équipements ou de personnes. Un cadre qui reconfigure automatiquement bras et plateforme selon la tâche, sans réglage manuel au cas par cas, pourrait accélérer le déploiement de drones manipulateurs modulaires dans ces contextes. Le texte reste toutefois un apport computationnel : la validation s'appuie sur des expériences de simulation et des ablations, sans mention de vols réels ni de plateforme physique testée, ce qui invite à la prudence sur la transférabilité pratique. Le champ de la manipulation aérienne modulaire, porté historiquement par des laboratoires universitaires en robotique aérienne, continue ainsi d'explorer la reconfigurabilité matérielle comme réponse à la diversité des tâches, avec l'intégration du flux d'air comme contrainte de conception encore peu traitée dans la littérature.

1 source
ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts
202arXiv cs.RO 

ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts

Wiping a board, sitting on a chair ou pousser un meuble : ces tâches semblent réussies dès que le robot atteint la bonne posture, mais sans contact physique réel avec l'objet, elles échouent en pratique. C'est le constat de départ de CONTACTMIMIC, un framework d'apprentissage présenté dans un article publié le 10 juillet sur arXiv (2607.08742). L'équipe y ajoute aux trajectoires de points-clés classiques (keypoint tracking) des commandes de contact binaires, définies au niveau de chaque partie du corps. La politique résultante s'appuie sur deux ingrédients : des récompenses qui suivent explicitement le contact et un schéma d'augmentation de trajectoires conçu pour casser la corrélation entre géométrie des points-clés et étiquettes de contact. Résultat, le robot peut produire ou supprimer un contact à la demande, indépendamment de sa pose. Sur 10 mouvements d'interaction homme-objet testés en simulation, CONTACTMIMIC dépasse les trackers uniquement basés sur les points-clés, sans recourir à des récompenses spécifiques à chaque tâche. Le transfert sim-to-real a été validé sur 5 mouvements réels. L'enjeu dépasse la démonstration technique : la plupart des pipelines d'imitation de mouvement pour humanoïdes optimisent la fidélité cinématique, pas l'interaction physique effective, un angle mort qui limite l'utilité pratique des politiques de manipulation whole-body déployées sur des plateformes comme Figure 03, Optimus ou des architectures VLA type GR00T N2, Pi-0 ou Helix. Découpler contact et géométrie ouvre la voie à des contrôleurs capables d'exécuter des tâches ménagères ou industrielles réelles (essuyer, pousser, s'asseoir) sans réentraînement par tâche, un prérequis pour que les humanoïdes sortent de la démonstration scriptée. Le travail s'inscrit dans la lignée des méthodes de suivi de points-clés pour le contrôle corps entier des humanoïdes, dont il expose les limites via des ablations confirmant la nécessité de l'augmentation de trajectoires. Aucun partenaire industriel n'est mentionné : il s'agit pour l'instant d'une contribution de recherche en simulation et validation restreinte en réel, dont les vidéos sont disponibles en ligne, sans calendrier de déploiement annoncé.

RecherchePaper
1 source
EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim
203arXiv cs.RO 

EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim

Des chercheurs du SpikeLab de l'université Johns Hopkins ont publié EVIS, un plugin de caméra événementielle physiquement fondé pour le simulateur NVIDIA Isaac Sim, décrit dans un article déposé sur arXiv (référence 2607.08098) et accompagné d'un dépôt de code ouvert sur GitHub (spikelab-jhu/isaac-sim-event-camera-plugin). L'outil génère des flux d'événements haute fréquence et entièrement annotés directement à l'intérieur du moteur physique d'Isaac Sim, en s'appuyant sur un modèle de contraste log-intensité fidèle au fonctionnement réel des capteurs événementiels, avec mise à jour asynchrone de référence pixel par pixel. Le plugin migre depuis une caméra RGB standard avec peu de modifications et s'intègre à n'importe quelle scène Isaac Sim ou Isaac Lab, héritant ainsi de la physique du simulateur et d'une vérité terrain parfaite image par image. Une option d'interpolation permet de ne rendre que des images clés éparses puis de synthétiser les images intermédiaires par déformation bidirectionnelle par vecteurs de mouvement, rendant possible une génération en temps réel sur un seul GPU. Du bruit capteur et du flou de mouvement optionnels réduisent encore l'écart avec des caméras réelles. L'enjeu est concret pour la robotique événementielle: les caméras à événements offrent une résolution temporelle de l'ordre de la microseconde, une latence très faible et une large plage dynamique, des atouts pour la perception rapide et le contrôle en boucle fermée. Mais les données labellisées pour un robot et une scène donnés restent rares et coûteuses à collecter, ce qui freine le développement d'algorithmes de perception et de contrôle basés sur ces capteurs. En générant des flux directement exploitables par des réseaux événementiels pré-entraînés, EVIS réduit ce goulot d'étranglement et s'attaque frontalement au problème classique du fossé simulation-réel. Le projet s'inscrit dans l'écosystème Isaac Sim, largement utilisé par les laboratoires de robotique et les équipes d'apprentissage par renforcement pour l'entraînement en simulation avant déploiement physique. En rendant la simulation événementielle native et configurable au sein d'un outil déjà répandu, les auteurs visent à accélérer les cycles de recherche sur des tâches de perception et de contrôle à haute vitesse, sans attendre la constitution coûteuse de jeux de données réels capteur par capteur.

RechercheActu
1 source
Pelican-VLA 0.5 : l'attention avant l'action améliore la généralisation
204arXiv cs.RO 

Pelican-VLA 0.5 : l'attention avant l'action améliore la généralisation

Pelican-VLA 0.5, un nouveau modèle VLA (vision-langage-action) présenté dans un rapport arXiv publié début juillet, unifie dans une seule architecture la compréhension vision-langage, la génération de trames futures et la prédiction d'action. Sa caractéristique centrale : sans annotations d'objets, sans masques de segmentation, sans supervision explicite de l'attention ni fine-tuning spécifique à la tâche, le module d'action du modèle se concentre spontanément sur l'objet pertinent pour l'instruction et sur sa zone de contact. Ce comportement se maintient sur des scènes inédites et sur des embodiments robotiques jamais vus à l'entraînement, et il est nettement plus marqué que chez les autres modèles VLA open source testés en comparaison. Les auteurs attribuent cette capacité à un module qu'ils nomment Reasoning Slots, inséré entre les étages de perception et d'action. Cette découverte touche un point sensible de l'industrie des VLA : jusqu'ici, obtenir qu'un modèle regarde le bon objet avant de le manipuler exigeait souvent une supervision lourde, annotations manuelles, masques de segmentation ou fine-tuning tâche par tâche, ce qui limite le passage à l'échelle et la généralisation à de nouveaux robots ou environnements. Si l'attention correcte émerge directement de l'architecture plutôt que de données d'entraînement coûteuses, cela réduit la dépendance à l'ingénierie de données et s'attaque directement à l'écart persistant entre démonstrations en laboratoire et déploiement réel, un sujet central pour les intégrateurs qui évaluent des piles VLA comme Pi-0, GR00T N2 ou Helix. Techniquement, les Reasoning Slots agissent comme un goulot d'étranglement compact qui force l'information visuelle pertinente pour la tâche à transiter par un nombre limité de canaux, ce qui induit une attention centrée sur la manipulation dès le pré-entraînement. Les auteurs montrent que ce mécanisme reste efficace même appliqué à des architectures de politique différentes, y compris un style Mixture-of-Transformers (MoT). Il s'agit pour l'instant d'un rapport de recherche déposé sur arXiv (arXiv:2607.06655v1), sans annonce de produit commercial ni de déploiement industriel associé.

IA physiqueActu
1 source
LOTUSim : simulateur multi-domaines pour la robotique marine
205arXiv cs.RO 

LOTUSim : simulateur multi-domaines pour la robotique marine

Des chercheurs présentent LOTUSim, un simulateur maritime open source conçu pour la robotique navale multi-domaines, combinant drones aériens, véhicules de surface et engins sous-marins dans un même environnement partagé. Publié sur arXiv début juillet 2026, ce travail répond à un manque identifié dans les simulateurs existants, généralement centrés sur l'autonomie pure et dépourvus d'interaction humaine en temps réel. LOTUSim apporte deux contributions techniques. D'abord, une architecture temps réel supportant plusieurs opérateurs simultanément, capable de monter en charge jusqu'à de larges flottes hétérogènes de drones tout en conservant fidélité visuelle et performance d'exécution stricte. Ensuite, un modèle de courants sous-marins inspiré des couches d'Ekman, qui capture la dynamique des flux dépendants du vent et de la profondeur avec une précision physique supérieure aux modèles stochastiques de Gauss-Markov habituellement employés, comme le confirment les validations menées contre des données de réanalyse océanique. Pour l'industrie de la robotique marine, cet outil comble un vide concret: l'entraînement des opérateurs et la répétition de missions navales coordonnées nécessitent des simulateurs capables de mêler humains et machines en boucle fermée, pas seulement de valider des algorithmes d'autonomie en isolation. La capacité à faire cohabiter des essaims de drones aériens, de surface et sous-marins dans un même scénario interactif touche directement les besoins d'opérations militaires ou de surveillance côtière multi-véhicules, où le coût et le risque des essais réels rendent la simulation incontournable. Le gain de précision du modèle de courants a aussi une portée pratique: une dynamique océanique mal modélisée fausse les prédictions de trajectoire et de consommation énergétique des véhicules sous-marins autonomes. Ce projet s'inscrit dans une lignée de simulateurs robotiques qui, jusqu'ici, ont privilégié soit le rendu visuel, soit la fidélité physique, rarement les deux à l'échelle avec un opérateur humain dans la boucle. En le rendant open source, les auteurs visent son adoption par la communauté de recherche en robotique opérateur-en-boucle, avec pour perspective l'extension à des scénarios encore plus larges de coordination navale multi-drones.

RecherchePaper
1 source
SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon
206arXiv cs.RO 

SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon

Une équipe de chercheurs a publié SWITCH (arXiv:2511.17649), un benchmark conçu pour évaluer la capacité des agents IA à interagir avec ce que les auteurs appellent des interfaces de contrôle tangibles (TCIs) : panneaux d'appareils électroménagers, télécommandes, ascenseurs, interfaces graphiques embarquées. Le jeu de données comprend 1 170 vidéos temporellement interactives, annotées de manière structurée avec instructions, actions, transitions d'état, résultats et comportements de récupération en cas d'erreur. La spécificité de SWITCH est d'évaluer le raisonnement en boucle fermée : l'agent doit percevoir, agir, vérifier le résultat, et corriger si nécessaire, dans une séquence continue. Le benchmark inclut également une évaluation des modèles de génération vidéo sur des tâches centrées sur l'interaction, combinant jugement automatique par LLM et évaluation humaine. L'intérêt de SWITCH réside dans ce qu'il révèle : les modèles multimodaux de frontier, propriétaires comme open source, présentent des faiblesses persistantes en perception visuo-temporelle fine, en vérification des résultats et en récupération d'erreur. La plupart des benchmarks existants se limitent à la perception en boucle ouverte ou à l'exécution d'une seule action, ce qui masque précisément les défaillances qui apparaissent dans des scénarios d'horizon long, là où l'agent doit maintenir un état interne et détecter un échec non anticipé. Pour les équipes travaillant sur des robots de service ou des agents embarqués destinés à des environnements industriels ou domestiques, ce constat est directement opérationnel : les modèles actuels ne sont pas encore fiables dès qu'une interaction nécessite un retour d'état et une correction. SWITCH s'inscrit dans un effort plus large de la communauté embodied AI pour combler le fossé entre les capacités de perception statique et l'agentivité réelle en environnement physique. Les benchmarks précédents comme SQA3D, EmbodiedScan ou OpenEQA avaient posé des jalons en compréhension 3D et en questions-réponses situées, mais sans capturer la dimension corrective de l'interaction. SWITCH adresse explicitement ce manque via des scénarios égocentrés. L'étude ne mentionne pas de partenariat industriel ni de déploiement applicatif immédiat : il s'agit d'un outil académique, non d'un produit. Les suites probables concernent l'intégration du benchmark dans les pipelines d'entraînement de VLA (Vision-Language-Action models) et l'extension à des environnements 3D interactifs.

RecherchePaper
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
207arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

UELe code et le dataset open-source pourraient être exploités par des équipes de recherche européennes travaillant sur la navigation de robots à pattes (ex. ANYbotics en Suisse, labos SLAM EU), mais aucun acteur français ou européen n'est directement impliqué dans les travaux.

RecherchePaper
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
208arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

UELe code open-source pourrait être évalué par des équipes R&D françaises (Exotec, intégrateurs logistiques) pour la navigation en espaces non cartographiés, mais il n'y a pas de lien institutionnel direct avec la France ou l'UE.

RecherchePaper
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
209arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
210arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
L'injection directe d'un point 3D ancré dans la tête d'action débloque la généralisation spatiale et des tâches
211arXiv cs.RO 

L'injection directe d'un point 3D ancré dans la tête d'action débloque la généralisation spatiale et des tâches

Des chercheurs ont publié fin juin 2026 (arXiv:2606.27663) une méthode légère pour améliorer la généralisation des modèles Vision-Language-Action (VLA) en manipulation robotique. Le module proposé représente le signal d'ancrage spatial en 3D, calcule son déplacement relatif au préhenseur, et injecte l'embedding résultant directement dans la tête d'action via une normalisation de couche adaptative (AdaLN). Concrètement, c'est un MLP à deux couches qui n'exige aucune modification du backbone préentraîné ni du pipeline d'entraînement. Sur le benchmark LIBERO-PRO, appliqué à GR00T-N1.6 de NVIDIA, le taux de succès moyen passe de 31,2 à 77,5 points sous perturbation de tâche (+46,3 points) et de 28,1 à 60,2 points sous perturbation de position (+32,1 points). Des gains comparables sont mesurés sur π0.5 de Physical Intelligence, ce qui valide l'approche sur deux architectures distinctes. Les VLA souffrent de deux formes structurelles de fragilité à l'inférence : la généralisation spatiale, lorsqu'un objet cible se trouve à une position non vue à l'entraînement, et la généralisation de tâche, lorsqu'une instruction légèrement reformulée dans un contexte visuel familier fait chuter la politique. Les approches précédentes par prompting textuel ou visuel avec coordonnées 2D en pixels s'avèrent insuffisantes. Ce travail identifie le vrai levier : ni la richesse du prompt, ni l'ajout de capteurs, mais la représentation 3D de l'ancrage et son point d'injection en bout de chaîne, directement dans la tête d'action. Pour les intégrateurs industriels, cela signifie qu'un VLA déjà déployé peut théoriquement être augmenté de ce module sans réentraînement complet, ouvrant la voie à des adaptations sur des lignes de production à géométrie variable. Ce résultat s'inscrit dans une course intense à la généralisation en manipulation dextère. Physical Intelligence a sorti π0 puis π0.5 sur des données multi-tâches à grande échelle ; NVIDIA déploie GR00T N1.6 et prépare GR00T N2 pour des capacités humanoïdes. D'autres méthodes d'ancrage spatial comme SpatialVLA ou RoboPoint cherchaient déjà à résoudre ce problème via des coordonnées 2D ou des cartes de profondeur ; ce travail tranche le débat en faveur de la 3D injectée en bout de chaîne. À ce stade, c'est un résultat de recherche validé uniquement en simulation sur LIBERO-PRO ; le passage au réel, sur des robots physiques en environnement industriel, reste à démontrer.

💬 Deux couches de MLP bien placées, et ton VLA passe de 31 à 77% de succès sous perturbation de tâche. Le vrai insight du papier, c'est que le problème venait pas du manque de données ou de capteurs, mais de l'endroit où injecter le signal 3D dans la chaîne. Bon, c'est encore de la simulation, mais comme preuve de concept validée sur GR00T et π0.5 en même temps, c'est difficilement contestable.

IA physiqueOpinion
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
212arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source
Comment allouer un budget de transfert simulation-réel ?
213arXiv cs.RO 

Comment allouer un budget de transfert simulation-réel ?

Une étude publiée sur arXiv (réf. 2606.22062, juin 2026) s'attaque à une question pratique restée sans réponse claire dans la robotique par apprentissage : comment répartir un budget de temps de mesure sur robot réel entre l'identification de système (mesurer précisément les paramètres physiques du robot) et la randomisation de domaine (entraîner sur une large plage de dynamiques simulées) ? Les chercheurs ont conduit une expérience contrôlée sim-à-sim sur un pendule, en substituant un modèle à paramètres cachés au robot physique pour pouvoir varier proprement les gaps de réalité et les niveaux de bruit. Résultat : un faible nombre de rollouts d'identification suffisait à combler l'essentiel de l'écart de transfert. Une fois des données réelles disponibles, les politiques entraînées aux paramètres estimés surpassaient systématiquement celles entraînées sur une bande de randomisation élargie, même lorsque cette bande contenait les vrais paramètres du système. Ce résultat contredit une intuition répandue dans le secteur : celle que "plus de randomisation = plus de robustesse au sim-to-real gap". Les pipelines sim-to-real actuels (notamment pour les mains, les bras, et les humanoïdes) consacrent souvent une fraction importante de l'ingénierie à construire des distributions de randomisation larges via DR (Domain Randomization), parfois au détriment d'une identification soignée. Cette étude suggère que cette stratégie est sous-optimale dans le régime "bénin" où les dynamiques sont identifiables. Pour les intégrateurs robotiques et les équipes de déploiement, la leçon opérationnelle est directe : mesurer d'abord ce qu'il est possible de mesurer, et réserver la randomisation à l'incertitude résiduelle non modélisable, pas l'inverse. Le sim-to-real reste l'un des goulots d'étranglement centraux du robot learning depuis les travaux fondateurs d'OpenAI Robotics sur Dactyl (2019) et les benchmarks de transfert de Meta AI et Google DeepMind. La communauté a largement misé sur des variantes de Domain Randomization (DR) et sur les Visual-Language-Action models (VLA) pour contourner le gap sans nécessiter d'identification fine. Cette étude s'inscrit dans un contre-courant : celui d'une meilleure caractérisation du robot physique via la sysid, une approche défendue également par des travaux récents de Unitree, Boston Dynamics, et par des labos académiques proches du contrôle optimal. La limite explicitement posée par les auteurs est importante : leurs conclusions tiennent dans un régime à deux paramètres inconnus et sans mismatch structurel de modèle ; dans des systèmes plus complexes (contact, déformation, friction multipoint), la randomisation large pourrait reprendre l'avantage. Prochaines étapes naturelles : valider sur des systèmes à plus haute dimensionnalité, des robots articulés réels, et en présence de mismatch structurel explicite.

RecherchePaper
1 source
Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes
214arXiv cs.RO 

Apprentissage par renforcement avec mélange d'experts pour la locomotion quadrupède tolérante aux pannes

Des chercheurs du Dynamic Legged Systems Lab de l'Istituto Italiano di Tecnologia (IIT) proposent sur arXiv (prépublication 2506.25965) une architecture de contrôle modulaire pour robots à pattes conçue pour maintenir la locomotion en cas de panne d'actionneur. Le système repose sur un mélange d'experts (Mixture-of-Experts, MoE) piloté par apprentissage par renforcement : un module de diagnostic identifie en temps réel le type de défaillance (joint bloqué, couple réduit, actionneur hors service), puis active l'expert spécialisé correspondant parmi plusieurs politiques de contrôle distinctes, chacune entraînée pour un mode de panne spécifique. Les expériences menées dans le simulateur IsaacLab montrent que ces politiques modulaires surpassent systématiquement des politiques monolithiques de taille comparable sur l'ensemble des scénarios de panne évalués. L'architecture conserve de surcroît des performances compétitives avec une capacité réseau significativement réduite, un critère déterminant pour les plateformes embarquées à ressources de calcul limitées, notamment en contexte d'exploration planétaire. Ce résultat adresse un angle mort persistant du déploiement hors-laboratoire des robots à pattes : la robustesse aux défaillances matérielles en cours de mission. Les politiques monolithiques entraînées par RL, qui ont produit des performances remarquables sur terrain accidenté (ANYmal d'ETH Zurich, Spot de Boston Dynamics, MIT Cheetah), supposent implicitement l'intégrité de l'ensemble des actionneurs. Injecter explicitement l'état diagnostiqué de panne dans la boucle de décision permet à chaque expert de se spécialiser sur un sous-espace comportemental bien délimité, ce qui explique leur supériorité même à capacité réduite. Pour un intégrateur ou un concepteur de mission, l'architecture MoE trace une voie concrète vers des robots capables de poursuivre une mission malgré une défaillance partielle, sans intervention humaine ni recalibration à distance. L'IIT est l'un des laboratoires européens de référence en robotique à pattes, à l'origine de la lignée hydraulique HyQ et HyQReal. La cible applicative explicitement déclarée par les auteurs est l'exploration planétaire, domaine où l'ESA et la NASA cherchent activement des solutions de mobilité résiliente pour des rovers de nouvelle génération. Les approches concurrentes, notamment les politiques adaptatives basées sur l'estimation d'état développées par le Robotics Systems Lab de l'ETH Zurich sur ANYmal, n'exploitent pas aussi directement l'information de diagnostic pour router dynamiquement vers des experts dédiés par mode de panne. Le code est publié en open source sur GitHub (dépôt iit-DLSLab/fault-locomotion-isaaclab) sous IsaacLab, ce qui facilite la reproductibilité et l'adoption par la communauté. Prochaine étape attendue : validation sur plateforme physique, les résultats actuels étant entièrement en simulation.

UEL'IIT, laboratoire européen de référence en robotique à pattes, publie une architecture MoE open source pour la locomotion tolérante aux pannes, offrant une base directement exploitable pour les programmes de rovers résilients de l'ESA.

FR/EU ecosystemePaper
1 source
DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables
215arXiv cs.RO 

DeformGen : augmentation topologique basée sur la dynamique pour l'apprentissage de politiques de manipulation d'objets déformables

Une équipe de chercheurs a publié fin juin 2026 DeformGen (arXiv:2606.25939), un framework d'augmentation de données de démonstration conçu pour l'apprentissage de politiques de manipulation d'objets déformables. Face au coût prohibitif de la collecte de données réelles pour ce type de tâche, la méthode génère automatiquement de nouveaux exemples d'entraînement à partir d'un ensemble restreint de démonstrations existantes. L'approche repose sur deux briques techniques distinctes : d'abord, l'application de perturbations physiques localisées suivies d'une simulation de dynamique vers l'avant pour produire des états déformés topologiquement cohérents et physiquement plausibles ; ensuite, un transfert de trajectoires par déformation de champ continu ("deformation-field warping"), qui projette les déplacements par particule en une fonction spatiale continue permettant d'adapter la trajectoire de l'effecteur terminal à la nouvelle géométrie de l'objet. Les expériences menées sur des benchmarks haute fidélité de manipulation déformable montrent des améliorations systématiques par rapport à l'entraînement sur les seules démonstrations d'origine et par rapport aux baselines d'augmentation de style rigide. L'enjeu est de taille pour l'industrie robotique : la manipulation d'objets déformables (textiles, câbles, aliments, composants souples) reste l'un des verrous majeurs du déploiement en production, précisément parce que les méthodes d'augmentation classiques, conçues pour des objets rigides, échouent à générer des configurations valides dans un espace d'états haute dimension soumis aux contraintes physiques. DeformGen identifie et adresse deux problèmes fondamentaux jusque-là non résolus : l'espace d'états valides ne peut pas être couvert par de simples perturbations de pose 6-DOF, et le transfert de trajectoire n'est pas équivariant sous déformation. Si ces résultats se confirment sur des tâches industrielles réelles, ce type d'approche pourrait réduire significativement le coût d'acquisition de données pour les lignes de picking textile, le routage de câbles dans l'électronique ou la manipulation agro-alimentaire. Ce travail s'inscrit dans un courant actif de recherche sur l'augmentation de démonstrations pour l'apprentissage par imitation, domaine où les avancées ont surtout bénéficié jusqu'ici à la manipulation d'objets rigides. Les acteurs qui travaillent sur la manipulation déformable en milieu industriel, comme Pollen Robotics en France ou des équipes universitaires spécialisées en sim-to-real, pourraient trouver dans cette approche une piste pour réduire la dépendance à la téléopération coûteuse. Les auteurs se concentrent pour l'instant sur des benchmarks simulés haute fidélité ; la question du sim-to-real gap sur des matériaux réels reste ouverte et constitue la prochaine étape critique à franchir avant tout déploiement opérationnel.

UEPollen Robotics (France) est explicitement cité comme acteur pouvant bénéficier de cette approche pour réduire le coût de collecte de données en manipulation déformable, mais les travaux restent à valider sur matériaux réels avant tout impact opérationnel.

💬 La manipulation d'objets mous, c'est le vrai verrou du déploiement robotique en production, pas l'actionnement. DeformGen s'attaque au problème par la racine : au lieu de collecter des milliers de démos sur du textile ou des câbles, tu génères des variantes physiquement cohérentes depuis quelques exemples. Reste le fossé sim-réel à franchir, mais si ça tient sur matériaux réels, ça change complètement les calculs économiques pour les lignes de picking souple.

IA physiquePaper
1 source
Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles
216arXiv cs.RO 

Un jeu de données imprimable en 3D pour évaluer et comparer objectivement les capteurs tactiles

Des chercheurs ont publié sur arXiv (arXiv:2606.25886, juin 2026) un jeu de données ouvert de textures imprimables en 3D, conçu spécifiquement pour évaluer et comparer les capteurs tactiles de manière reproductible. Le dataset comprend six motifs de surface générés paramétriquement à partir de combinaisons de fonctions sinusoïdales et de séries de Fourier, offrant une variation contrôlée en fréquence spatiale, amplitude et structure directionnelle. Ces textures ont été évaluées sur trois imprimantes 3D grand public et plusieurs types de filaments, en mesurant la variance des empreintes capturées par un capteur optique TacTip sous conditions de contact contrôlées. Des expériences de classification ont ensuite été menées avec des réseaux de neurones et des modèles PCA. Le problème que ce travail cherche à résoudre est fondamental pour la communauté de la robotique haptique : jusqu'ici, les benchmarks de perception tactile dépendaient des lectures d'un capteur spécifique interagissant avec des surfaces disponibles en laboratoire, rendant toute comparaison inter-capteurs structurellement biaisée. Ce dataset brise ce verrou en définissant les textures de manière mathématique plutôt que physique, ce qui permet leur fabrication indépendante dans n'importe quel laboratoire équipé d'une imprimante FDM. Les résultats montrent toutefois une limite importante : la généralisation intra-imprimante est robuste, mais la généralisation inter-imprimantes reste difficile en raison d'inconsistances géométriques liées à la qualité d'impression, notamment la netteté des pics et le phénomène de "stringing". Les imprimantes haut de gamme produisent des signatures tactiles significativement plus cohérentes. La perception tactile reste l'un des sens les moins standardisés en robotique, contrairement à la vision où des benchmarks comme YCB ou LINEMOD sont devenus des références universelles. Des plateformes comme le TacTip (Bristol Robotics Lab) ou le GelSight (MIT) ont chacune développé leurs propres protocoles d'évaluation, sans base commune. Ce dataset constitue, selon les auteurs, le premier benchmark tactile physiquement reproductible et ouvertement disponible. Les prochaines étapes naturelles concernent l'extension à des matériaux aux propriétés mécaniques variées (rigidité, élasticité) et l'intégration à des pipelines de manipulation robotique où la discrimination de texture conditionne la stratégie de saisie.

UELes laboratoires français et européens travaillant sur la perception haptique (INRIA, CEA-List, laboratoires universitaires) peuvent adopter ce benchmark ouvert pour standardiser leurs évaluations de capteurs tactiles, mais aucun acteur européen n'est directement impliqué dans ce travail.

RecherchePaper
1 source
Champs de vitesse robotiques modélisés en flux de probabilité pour la manipulation d'objets
217arXiv cs.RO 

Champs de vitesse robotiques modélisés en flux de probabilité pour la manipulation d'objets

Une équipe de chercheurs a publié sur arXiv (réf. 2606.23090v2) un framework appelé Flow as Flow pour la manipulation d'objets en robotique. La méthode modélise les flux robotiques (champs de vitesse des robots) comme des flux de probabilité via une formulation de flow matching. Là où les approches précédentes représentaient les mouvements par des déplacements de keypoints épars, Flow as Flow génère des champs de vitesse denses, mieux alignés avec la nature continue du mouvement dans le temps. Sur les benchmarks standards, la méthode surpasse les baselines sur les métriques habituelles et atteint une vitesse de génération environ 33 fois supérieure. En conditions réelles, 9 méthodes ont été comparées sur 260 essais chacune et 13 tâches de manipulation distinctes: Flow as Flow affiche un taux de succès moyen supérieur à tous les systèmes testés. Ce gain de 33x à la génération a une portée concrète: dans un système robotique opérant en temps réel, la latence de planification de trajectoire conditionne directement la réactivité et la sécurité du bras. Sur le plan architectural, le travail s'inscrit dans la dynamique des modèles de fondation cross-embodiment, entraînés sur des données hétérogènes issues de plusieurs morphologies de robots. Utiliser les champs de vitesse comme représentation agnostique du corps permettrait de mutualiser des jeux de données entre humanoïdes, bras industriels et manipulateurs mobiles sans recoder les politiques de contrôle. L'approche adresse aussi un angle mort fréquent des VLA actuels: la cohérence temporelle des trajectoires générées, souvent dégradée par l'interpolation entre keypoints discrets. Le flow matching est une technique issue des modèles génératifs popularisée à partir de 2022-2023, et son import en robotique s'accélère. Dans la course aux politiques de manipulation généralisables, pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et des variantes comme OpenVLA font déjà référence. Flow as Flow ne propose pas une architecture complète rivale mais une représentation du mouvement alternative, potentiellement intégrable dans ces pipelines existants. La solidité du corpus expérimental mérite d'être soulignée: 260 essais par méthode sur 13 tâches représente une couverture inhabituelle pour une publication académique en manipulation, ce qui limite le risque de cherry-picking sur des démonstrations sélectionnées. L'étape suivante logique serait l'intégration dans des jeux de données cross-embodiment à grande échelle comme Open X-Embodiment ou DROID, pour tester la montée en généralisation sur des robots hétérogènes.

RechercheOpinion
1 source
EquiVLA : un cadre général pour les modèles VLA équivariants par rotation
218arXiv cs.RO 

EquiVLA : un cadre général pour les modèles VLA équivariants par rotation

Des chercheurs ont publié EquiVLA (arXiv:2606.19784), le premier cadre général pour rendre les modèles Vision-Langage-Action (VLA) équivariants par rotation SO(2) de bout en bout. Le système introduit deux composants modulaires : EquiPerceptor, qui extrait des représentations visuelles approximativement SO(2)-équivariantes à partir de features ViT gelées, et EquiActor, une tête d'action exactement SO(2)-équivariante basée sur un Diffusion Transformer à flow-matching. Instancié sur GR00T N1.5 (le modèle de manipulation généraliste de NVIDIA), EquiVLA atteint 92,6 % de succès moyen sur les quatre suites de benchmarks LIBERO contre 78,1 % pour la baseline, une longueur de séquence de 4,03 sur CALVIN ABCD→D contre 3,45, et améliore le taux de succès sur cinq tâches réelles avec le robot Mobile ALOHA de 54 % à 72 %. Le problème central qu'adresse EquiVLA est structurel : les VLA actuels manquent de biais inductifs géométriques, ce qui signifie qu'une politique entraînée dans une orientation donnée nécessite substantiellement plus de données pour généraliser à d'autres configurations rotationnelles. En imposant l'équivariance SO(2) de la caméra jusqu'aux séquences d'actions prédites, le framework réduit la dépendance aux données d'orientation. Pour un intégrateur ou un COO industriel, l'implication concrète est une meilleure robustesse opérationnelle sans retraining coûteux lorsqu'un poste de travail est réorganisé. Le gain de 18 points absolus sur LIBERO et le passage de 54 % à 72 % sur robot réel sont significatifs, même si ces résultats restent obtenus en conditions de laboratoire contrôlé et ne constituent pas encore un déploiement industriel. Les VLA sont devenus le paradigme dominant de la manipulation généraliste depuis RT-2 et PaLM-E, avec des modèles concurrents comme Pi-0 (Physical Intelligence), OpenVLA et GR00T N1.5 de NVIDIA, publié début 2025 comme modèle de référence pour la manipulation humanoïde. L'approche modulaire d'EquiVLA - les backbones vision-langage gelés restent intacts - facilite l'adoption sur des architectures existantes sans repartir de zéro. Ce papier est une contribution académique sans partenariat commercial annoncé ; les suites naturelles seraient d'étendre l'équivariance à SO(3) pour les manipulateurs à 6 DOF, et de valider la robustesse à grande échelle dans des environnements industriels moins structurés.

💬 Le vrai sujet ici, c'est pas le benchmark : c'est que si tu déplaces ton poste de travail de 90°, tu n'as plus à réentraîner ton robot. C'est précisément le genre de friction silencieuse qui rendait les déploiements industriels galères, et là ils y répondent de façon architecturale, sans toucher aux backbones existants. 72% sur robot réel c'est encore du labo, mais la direction est la bonne.

IA physiqueOpinion
1 source
Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source
219arXiv cs.RO 

Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source

Des chercheurs ont intégré la théorie de la force résistive tridimensionnelle (3D RFT) dans le moteur de simulation physique MuJoCo, comblant un angle mort persistant des outils de robotique open-source. La 3D RFT permet d'approximer les forces de réaction du sol lors de la locomotion en milieu granulaire (sable, gravier fin) sans simuler l'interaction avec chaque grain individuellement, ce qui constitue l'approche classique par éléments discrets (DEM), prohibitive en temps de calcul. Les auteurs ont validé leur implémentation sur un robot hexapode à 12 degrés de liberté évoluant en bac à sable : la simulation prédit la distance parcourue et l'enfoncement des pattes à moins de 20 % des valeurs mesurées expérimentalement, avec des tendances cohérentes selon la forme de l'effecteur, la vitesse de déplacement et la charge appliquée. Les travaux sont publiés sur arXiv (2606.19504) et le code est rendu disponible en open source. L'impact pratique est significatif pour les équipes qui développent des robots mobiles destinés à évoluer hors piste. Jusqu'ici, simuler fiablement la locomotion sur sol meuble imposait soit des moteurs DEM spécialisés (CHRONO, LIGGGHTS) avec des temps de calcul rédhibitoires pour l'apprentissage par renforcement, soit des approximations ad hoc peu transférables. Intégrer la RFT directement dans MuJoCo, l'environnement de référence pour l'entraînement de politiques de locomotion, ouvre une voie crédible vers le sim-to-real sur substrats granulaires. La précision de 20 % est honnête pour une approximation analytique et constitue une base exploitable pour l'optimisation de design ou le pré-entraînement de contrôleurs, même si elle reste insuffisante pour garantir un transfert direct sans recalibration. La RFT granulaire a été initialement développée dans les laboratoires de Daniel Goldman (Georgia Tech) pour étudier la locomotion animale dans le sable, avant d'être étendue aux systèmes robotiques. MuJoCo, racheté par DeepMind en 2021 et passé open-source la même année, est aujourd'hui le moteur dominant pour l'entraînement de politiques de locomotion humanoïde et quadrupède chez Figure, Boston Dynamics ou Unitree. Les débouchés concrets de ce travail concernent les rovers planétaires (JPL, ESA), les robots agricoles évoluant en sol labouré, et les plateformes de recherche et sauvetage en milieu sableux. La prochaine étape logique sera l'extension aux substrats hétérogènes et l'intégration dans des pipelines d'apprentissage par renforcement standard pour valider le gain sim-to-real à l'échelle.

RecherchePaper
1 source
Mouvement primitif en robotique : une étude approfondie
220arXiv cs.RO 

Mouvement primitif en robotique : une étude approfondie

Publiée sur arXiv sous l'identifiant 2601.02379v2, une revue encyclopédique sur les movement primitives en robotique recense et compare l'ensemble des cadres théoriques développés ces trente dernières années pour représenter les trajectoires de contrôle de robots à partir de démonstrations humaines. Ces primitives de mouvement, blocs élémentaires de motion analogues aux phonèmes du langage, permettent à un système autonome de décomposer un geste complexe en segments réutilisables et recombinables. Les approches couvertes incluent les Dynamic Movement Primitives (DMP), formulés comme des systèmes dynamiques de type amortisseur-ressort, les Probabilistic Movement Primitives (ProMP) couplant statistiquement plusieurs démonstrations, et les extensions neuronales adaptées aux espaces d'état de haute dimension. La revue présente ces frameworks en ordre chronologique, évalue leurs forces et faiblesses, et identifie des applications concrètes : saisie d'objets, mouvements balistiques, enchaînements de tâches en manipulation robotique. Pour les praticiens (intégrateurs, équipes R&D en manipulation, COO industriels), cette synthèse positionne les primitives de mouvement comme une couche intermédiaire critique entre démonstration brute et politique généraliste de bout en bout. Elles permettent le transfert de compétences motrices sans rejeu complet des données d'entraînement et restent interprétables, contrairement aux architectures VLA (Vision-Language-Action) comme π0 de Physical Intelligence ou OpenVLA. La revue souligne en particulier des défis non résolus que ces dernières n'ont pas encore surmontés à l'échelle industrielle : segmentation automatique des démonstrations, passage à l'échelle en environnements non structurés, et couplage de contraintes en temps réel. Les primitives de mouvement ont émergé au début des années 2000 avec les travaux d'Auke Ijspeert, Jun Nakanishi et Stefan Schaal sur les DMP, puis étendues par Paraschos et al. avec les ProMP en 2013. Le champ s'est depuis fragmenté en nombreuses variantes sans synthèse unifiée. Face aux approches purement neuronales (ACT, Diffusion Policy) popularisées par les groupes de Sergey Levine et Chelsea Finn, les primitives se repositionnent comme solution modulaire et interprétable. Les auteurs identifient leur intégration dans des architectures de type foundation model pour la robotique comme prochaine étape structurante, un axe qui mobilise des acteurs aux États-Unis (Boston Dynamics AI Institute, CMU) comme en Europe (DLR, LAAS-CNRS).

UELAAS-CNRS est explicitement identifié comme un acteur européen clé sur l'intégration des primitives de mouvement dans les architectures foundation model pour la robotique, ce qui positionne la recherche française au cœur d'un axe stratégique face aux approches VLA purement neuronales.

RecherchePaper
1 source
TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile
221arXiv cs.RO 

TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile

Une équipe de recherche a publié sur arXiv (identifiant 2606.18959) TactSpace, un cadre d'apprentissage de représentations multi-modales conçu pour résoudre l'un des verrous majeurs de la manipulation robotique : le transfert sim-to-real des capteurs tactiles. Le problème est structurel : les simulateurs actuels sont incapables de reproduire fidèlement la mécanique de déformation et de transduction des capteurs tactiles physiques, rendant inutilisables en conditions réelles les politiques entraînées en simulation. TactSpace contourne ce problème en alignant des modalités tactiles hétérogènes dans un espace latent partagé, sans jamais avoir besoin de simuler le signal brut du capteur. Des encodeurs spécifiques à chaque modalité projettent des observations aussi différentes que la profondeur de pénétration simulée et la capacitance mesurée sur un capteur réel dans un embedding commun. L'entraînement combine des objectifs de reconstruction croisée et d'alignement contrastif. Évalué sur trois tâches, identification de formes d'indenteur, prédiction de force et reconstruction géométrique, le système entraîné exclusivement en simulation transfère directement sur des mesures réelles sans fine-tuning : zéro-shot. Les gains mesurés atteignent 16,7 % de réduction d'erreur en prédiction de force et 45,8 % en reconstruction de forme par rapport aux baselines. Ces résultats adressent un goulot d'étranglement critique pour l'ensemble de la robotique de manipulation dextre. Le tactile est indispensable pour les tâches d'assemblage fin, de tri délicat ou de manipulation d'objets déformables, segments où les bras industriels classiques butent faute de retour de contact fiable. Jusqu'ici, la difficulté à simuler correctement les capteurs tactiles forçait soit à collecter massivement des données réelles, coûteuses et lentes, soit à se passer du tactile. TactSpace propose une troisième voie : accepter que simulation et réalité restent physiquement dissemblables, et apprendre malgré tout des représentations invariantes aux modalités mais riches en information de contact. La publication accompagne le code d'une implémentation Warp-based du simulateur tactile pénalité intégrée à Isaac Lab, la plateforme de simulation physique de NVIDIA, ce qui ouvre la génération de données tactiles scalable à la communauté. Le contexte de cette recherche s'inscrit dans une effervescence autour des capteurs tactiles à haute résolution, portée notamment par GelSight (MIT, aujourd'hui GelSight Inc.), DIGIT (Meta AI) et les capteurs capacitifs embarqués dans plusieurs plateformes humanoïdes. Isaac Lab, qui sert de base à ce travail, est devenu un standard de facto pour l'entraînement de politiques robotiques en simulation, utilisé par Figure, 1X et Agility entre autres. TactSpace reste à ce stade un preprint non évalué par les pairs, sans déploiement annoncé sur plateforme physique commerciale. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation réelles bout-en-bout et une intégration dans des pipelines Vision-Language-Action (VLA) où le retour tactile pourrait renforcer la robustesse en conditions industrielles.

RecherchePaper
1 source
RL résiduel centré sur les objets pour l'amélioration zéro-shot des VLA en transfert simulation-réel
222arXiv cs.RO 

RL résiduel centré sur les objets pour l'amélioration zéro-shot des VLA en transfert simulation-réel

Des chercheurs de Microsoft Research ont publié fin juin 2026 un framework baptisé Object-Centric Residual RL (arXiv:2606.18953), conçu pour améliorer la robustesse des modèles Vision-Language-Action (VLA) dans des tâches de manipulation physique précise. Le principe : entraîner une politique correctrice en simulation pure, basée non pas sur des images mais sur les poses des objets, puis la transférer directement sur un robot réel sans aucun fine-tuning supplémentaire. Sur un bras Franka Research 3 (FR3), la méthode fait passer le taux de succès moyen de 42 % à 76 % en zero-shot sur cinq tâches de manipulation, avec une politique résiduelle entraînée exclusivement en simulation, avec injection de bruit de pose et dropout. Le processus inclut également le rejeu des démonstrations de télé-opération en simulation pour entraîner un VLA "jumeau" simulé, auquel la politique résiduelle est ensuite couplée avant transfert zero-shot. L'enjeu est direct pour les intégrateurs et les équipes de déploiement robotique : les VLA actuels, qu'il s'agisse de Pi-0 (Physical Intelligence), d'OpenVLA ou des modèles RT de Google, généralisent bien à travers des tâches variées mais accumulent des erreurs d'exécution lors d'interactions physiques précises (pincements, insertions, assemblages) où la précision millimétrique est requise. Les approches concurrentes butent sur un trilemme classique : les méthodes à états privilégiés nécessitent une distillation coûteuse pour le déploiement, les méthodes basées image souffrent du fossé visuel sim-to-réel, et le RL en conditions réelles reste coûteux et risqué pour le matériel. En substituant les poses d'objets aux images comme espace d'observation, le framework crée une représentation compacte et cohérente entre simulation et réalité, suffisamment légère pour un transfert zero-shot fiable. Autre résultat notable : les rollouts améliorés peuvent être réutilisés pour ré-entraîner le VLA de base, ouvrant une boucle d'auto-amélioration sans télé-opération supplémentaire. Le sim-to-real gap est un problème structurel qui freine la commercialisation des robots polyvalents depuis plusieurs années, et les VLA n'y échappent pas malgré leurs capacités de généralisation linguistique. Cette publication s'inscrit dans une dynamique de recherche intense où Physical Intelligence (Pi-0, Pi-0 FAST), Figure AI et 1X Technologies tentent chacun de réduire cet écart par des voies différentes : données réelles massives, domain randomization, ou standardisation du hardware. Microsoft Research, moins visible sur le déploiement commercial que ces acteurs, confirme ici un axe de recherche sur la correction post-entraînement des fondations robotiques par RL simulé. La page projet est publiée en accès ouvert sur le site de Microsoft Research ; aucun partenariat industriel ni timeline de déploiement n'est mentionné dans la publication, qui reste pour l'heure une contribution académique.

💬 La précision millimétrique, c'est là où tous les VLA craquent en conditions réelles. Microsoft Research contourne le problème par le bon bout : en travaillant sur des poses d'objets plutôt que sur des images, le fossé visuel sim-to-real disparaît, et on monte de 42 % à 76 % de succès sur un Franka réel, zero-shot. Aucun partenaire industriel dans la publication pour l'instant, mais l'approche est solide.

IA physiqueOpinion
1 source
EBench : diagnostic élémentaire des politiques de manipulation mobile généralistes
223arXiv cs.RO 

EBench : diagnostic élémentaire des politiques de manipulation mobile généralistes

Une équipe de chercheurs a publié EBench (arXiv:2606.18239), un benchmark de simulation conçu pour évaluer les politiques de manipulation mobile généralistes au-delà d'un simple taux de succès global. Le système comprend 26 tâches variées, annotées selon 5 dimensions de capacités et 4 dimensions de généralisation. Quatre modèles de référence ont été soumis à l'évaluation : π₀ et π₀.₅ (Physical Intelligence), XVLA, et InternVLA-A1. Les résultats montrent que π₀.₅ obtient le meilleur taux de succès en test ainsi que la meilleure rétention train-test, InternVLA-A1 domine sur les tâches de manipulation mobile mais s'effondre sur les tâches dextérieuses, tandis que XVLA montre des forces sur un ensemble de compétences atomiques disjointes des autres modèles. L'apport principal d'EBench est de démontrer qu'un score agrégé unique masque des profils de compétences radicalement différents entre modèles affichant des performances globales similaires. Pour un intégrateur ou un responsable industriel qui choisit une politique VLA (Vision-Language-Action) pour une ligne de production, cela signifie qu'un modèle "généraliste" peut être inadapté selon le type de tâche visé. La distinction entre manipulation mobile (déplacement + interaction) et manipulation dextérieuse (précision digitale, assemblage fin) est particulièrement pertinente : aucun modèle actuel ne domine sur les deux axes simultanément. EBench fournit ainsi des signaux diagnostiques granulaires qui guident les itérations de développement, là où les benchmarks existants ne donnaient qu'une illusion de comparabilité. Ce travail s'inscrit dans un effort plus large de la communauté robotique pour combler le fossé entre démonstrations sélectionnées et évaluation systématique - un problème chronique dans les publications sur les politiques généralistes, où les vidéos filtrées ont souvent précédé les métriques rigoureuses. Côté paysage concurrentiel, les quatre modèles évalués représentent l'état de l'art en VLA pour la manipulation généraliste fin 2025-début 2026, avec Physical Intelligence (Pi) en position dominante sur l'axe généralisation. Aucun acteur européen n'apparaît dans cette évaluation. La publication du benchmark en accès ouvert vise à standardiser les comparaisons futures, mais ses limites restent celles de toute évaluation en simulation : le transfert sim-to-real n'est pas adressé dans cette version initiale.

RecherchePaper
1 source
Quantification de l'incertitude pour les modèles VLA à base de flux
224arXiv cs.RO 

Quantification de l'incertitude pour les modèles VLA à base de flux

Des chercheurs de la TU Munich ont publié sur arXiv (2606.18043) une méthode pour quantifier l'incertitude des modèles vision-langage-action (VLA) basés sur le flow matching, une classe de modèles qui combine un backbone vision-langage avec une tête génératrice d'actions entraînée sur de larges corpus de données robotiques. Leur approche, baptisée Velocity-Field Disagreement (VFD), exploite le désaccord entre les champs de vitesse d'un petit ensemble de modèles pour estimer l'incertitude épistémique, c'est-à-dire l'incertitude liée au manque de données d'entraînement plutôt qu'au bruit intrinsèque du signal. S'appuyant sur ces estimations, ils proposent SAVE, un cadre d'apprentissage actif multitâche guidé par l'incertitude, validé sur le benchmark LIBERO. Résultat clé : SAVE nécessite au moins 22 % de démonstrations expertes en moins que les baselines pour adapter un VLA à de nouvelles tâches. Ce résultat adresse un problème concret qui freine le déploiement industriel des VLAs : sans mécanisme de confiance, un robot ne sait pas quand il risque d'échouer, ce qui est rédhibitoire dans des environnements non-stationnaires comme une ligne de production évolutive. La détection de défaillance en temps réel qu'offre VFD permettrait d'intégrer un circuit de supervision humain ciblé plutôt que systématique, réduisant directement le coût opérationnel. La réduction de 22 % des démonstrations nécessaires à l'adaptation représente aussi un argument économique fort : collecter des données téléopérées reste la goulot d'étranglement principal du passage à l'échelle des VLAs en production. Les VLAs ont émergé comme paradigme dominant en manipulation robotique depuis les travaux de Physical Intelligence (pi-0, basé sur flow matching), Google DeepMind (RT-2, OpenVLA) et Hugging Face (LeRobot). La limitation identifiée ici -- l'absence de calibration des prédictions -- est connue du secteur mais rarement traitée directement. Le groupe LSY de la TU Munich, spécialisé en apprentissage pour systèmes autonomes, positionne ce travail comme une brique de fiabilité applicable à tout VLA flow-based existant, sans réentraînement complet. Le projet dispose d'un site dédié (tum-lsy.github.io/uq_vla/) et la prochaine étape logique serait une validation sur hardware réel, les expériences actuelles restant confinées au benchmark simulé LIBERO.

UELa TU Munich (institution européenne) publie une brique de fiabilité intégrable dans tout VLA flow-based sans réentraînement complet, ce qui pourrait réduire les coûts de supervision humaine et accélérer le déploiement industriel des VLAs dans les usines européennes.

RechercheOpinion
1 source
Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts
225arXiv cs.RO 

Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts

Une équipe de chercheurs publie sur arXiv (référence 2606.16902) un agent de localisation spatiale open-source baptisé BinTrack, conçu pour permettre à des robots de service de répondre à des questions du type « où puis-je trouver un pressing sur le chemin du retour ? » et de retourner une coordonnée métrique exploitable directement par les modules de navigation. Le système s'appuie sur un robot quadrupède réel déployé dans des rues publiques de Séoul pour constituer GangnamLoop, un nouveau benchmark multi-trajets en extérieur. BinTrack atteint une amélioration de précision allant jusqu'à 22,8 % par rapport aux autres implémentations open-source sur SpaceLocQA, le benchmark de référence du domaine, et égale les résultats des agents basés sur GPT-4o sur la catégorie « global », la plus difficile. Il offre par ailleurs un gain de vitesse d'inférence supérieur à 1,5x par rapport aux approches précédentes. L'intérêt principal de BinTrack pour les intégrateurs et les décideurs industriels tient à son architecture entièrement embarquée et déconnectée. Les approches existantes de Spatial Question Answering s'appuyaient sur des modèles fermés comme GPT-4o via des agents RAG (retrieval-augmented generation), ce qui implique une dépendance réseau, une latence de communication et des coûts d'API prohibitifs pour une flotte de robots en production. BinTrack remplace cela par une recherche binaire sur les segments de trajectoire entre deux repères spatiaux extraits de la requête, en exploitant l'ordre temporel du trajet. Ce faisant, le travail démontre qu'un modèle de vision-langage open-source peut rivaliser avec GPT-4o sur un benchmark spatial de référence, sans connexion cloud, une hypothèse que beaucoup dans le secteur considéraient non résolue à ce stade. GangnamLoop se distingue des benchmarks indoor habituels : il capture les mêmes lieux sous différentes conditions extérieures et croise le point de vue bas du robot quadrupède avec celui de son propriétaire humain, ce qui en fait un jeu de données plus réaliste pour la navigation piétonne en ville. La recherche spatiale embarquée reste un domaine peu exploré par rapport aux approches cloud-first ; des acteurs comme Boston Dynamics, Unitree ou les équipes robotique de Google DeepMind travaillent sur des problèmes connexes, mais rarement avec une contrainte d'inférence locale aussi explicite. Le code et les données de GangnamLoop sont disponibles publiquement sur GitHub, ce qui ouvre la voie à des évaluations indépendantes et à des intégrations dans des pipelines de navigation autonome en contexte réel.

RechercheOpinion
1 source
SimWeaver : transfert simulation-réel RGB sans entraînement pour la manipulation d'objets déformables
226arXiv cs.RO 

SimWeaver : transfert simulation-réel RGB sans entraînement pour la manipulation d'objets déformables

Une équipe de recherche présente SimWeaver (arXiv:2606.15338), un système capable d'entraîner des politiques VLA (Vision-Language-Action) en environnement simulé uniquement, puis de les déployer directement sur un robot réel sans aucun affinage sur données réelles. Entraîné sur seulement 200 démonstrations simulées par tâche, SimWeaver atteint plus de 80% de succès par tâche et 91% de taux moyen sur cinq tâches de manipulation d'objets déformables incluant la manipulation de sacs plastique et la saisie de tissu de soie, sans téleopération ni calibration spécifique à chaque tâche. Sur la tâche de saisie de soie, la politique sim-entraînée atteint 100% de succès sous des variations visuelles importantes, là où les baselines entraînées sur données réelles chutent entre 9% et 70%. Le coût par trajectoire est réduit de deux ordres de grandeur par rapport aux approches requérant des données terrain. Ce résultat est notable parce que le sim-to-real pour objets déformables en entrée RGB brute est resté largement non résolu jusqu'ici. La physique des corps mous (tissus, sacs, fils) est notoirement difficile à simuler fidèlement, et l'écart simulation-réalité se traduit généralement par des politiques qui échouent dès le déploiement. SimWeaver contourne ce problème avec une augmentation photométrique tenant compte du pipeline ISP (Image Signal Processor) de la caméra, ce qui réduit le fossé visuel sans nécessiter de données réelles. Pour un intégrateur ou un COO industriel travaillant sur des lignes de conditionnement, de tri textile ou de logistique e-commerce, la réduction du coût de collecte de données et l'absence de recalibration par tâche représentent un levier économique concret. Le problème de la manipulation déformable concentre depuis plusieurs années une part croissante de la recherche en robotique, portée par des applications telles que la préparation de commandes en entrepôt (Exotec, HAI Robotics) ou l'assemblage textile. Les approches précédentes mobilisaient soit des capteurs de profondeur, soit d'importantes campagnes de téleopération pour construire des datasets réels. SimWeaver s'appuie sur quatre modules complémentaires : un simulateur physique calibré (SimWeaver-Sim), un générateur d'assets à partir d'une seule image (SimWeaver-Asset), un synthétiseur de trajectoires déterministe topologie-aware (SimWeaver-Syn) et un protocole de transfer sim-to-real avec augmentation ISP (SimWeaver-Real). Le code et un sous-ensemble d'assets représentatifs seront publiés en open source, ce qui positionne ce travail comme une infrastructure potentielle pour la communauté. Aucun partenaire industriel ni timeline de déploiement commercial n'est mentionné à ce stade : il s'agit d'une contribution académique, pas d'un produit annoncé.

UELa publication open-source de SimWeaver pourrait bénéficier aux intégrateurs robotiques français et européens actifs dans la logistique e-commerce et le tri textile, en réduisant drastiquement le coût de collecte de données pour la manipulation d'objets déformables.

💬 Le sim-to-real sur des objets déformables, c'était le mur que tout le monde contournait faute de physique fiable. 100% de succès sur la soie en sim seul, là où les modèles entraînés sur données réelles tombent entre 9 et 70%, c'est le genre de résultat qui force à prendre ça au sérieux. Bon, c'est encore académique et sans partenaire industriel annoncé, mais le code sort en open source, alors on verra vite si ça tient hors benchmark.

IA physiqueOpinion
1 source
ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels
227arXiv cs.RO 

ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels

Des chercheurs ont publié ReMoBot (arXiv:2408.15919v4), un framework d'apprentissage par imitation à peu d'exemples conçu pour la manipulation mobile sur robots à vision égocentrique. Évalué sur un Boston Dynamics Spot, le système atteint des taux de succès de 70 % sur la tâche "Table Uncover" et 80 % sur "Gap Cover" en environnement réel, avec seulement 20 démonstrations par tâche. Plutôt que de distiller les démonstrations dans une politique paramétrique classique, ReMoBot adopte une stratégie de récupération : à l'inférence, il identifie dans une base de démonstrations d'experts les séquences les plus pertinentes via une combinaison de similarité d'état, d'alignement temporel des trajectoires et de cohérence des séquences d'actions, puis sélectionne directement les commandes motrices sans aucun entraînement supplémentaire. L'ensemble s'appuie sur des vision foundation models pour extraire des représentations robustes depuis la caméra embarquée du robot, en fonctionnement totalement training-free à l'exécution. L'approche retrieval-based présente deux avantages concrets pour les intégrateurs industriels. D'abord, le coût de collecte de données est drastiquement réduit : 20 démonstrations contre plusieurs centaines requises par les méthodes IL standard (ACT, Diffusion Policy), ce qui accélère le déploiement sur de nouvelles tâches ou variantes. Ensuite, l'absence d'entraînement à l'inférence supprime le risque de surapprentissage sur données insuffisantes, problème récurrent avec les objets déformables où la variabilité des états est élevée. ReMoBot surpasse deux baselines entraînées directement sur données réelles sans transfert sim-to-réel sur deux tâches sur trois. La tâche "Curtain Open" reste problématique, signalant que la manipulation d'objets hautement déformables sous occultations partielles constitue encore un verrou non résolu, y compris pour les approches retrieval. ReMoBot s'inscrit dans la tendance à exploiter les vision foundation models (de la famille DINOv2, CLIP, SAM) pour réduire la dépendance aux données propriétaires et améliorer la généralisation. Sur le Spot de Boston Dynamics, plateforme quadrupède commerciale, la manipulation mobile reste un défi structurel : le robot se déplace en même temps qu'il manipule, rendant l'observation égocentrique partielle et bruitée. Face aux VLA de grande taille comme pi-0 (Physical Intelligence) ou RT-2 (Google DeepMind), qui exigent des volumes de données considérables et une infrastructure d'entraînement lourde, ReMoBot se positionne dans le segment "data-efficient, training-free" particulièrement pertinent pour les intégrateurs ou PME industrielles sans capacité de collecte à grande échelle. La prochaine étape logique serait d'enrichir dynamiquement la base de démonstrations et de valider l'approche dans des environnements industriels hors laboratoire contrôlé.

UELes PME et intégrateurs robotiques européens sans capacité de collecte de données à grande échelle pourraient bénéficier directement de cette approche data-efficient (20 démos vs plusieurs centaines), réduisant la barrière d'entrée au déploiement de manipulation mobile intelligente.

RecherchePaper
1 source
Attaques trojans sur les contrôleurs de réseaux de neurones pour systèmes robotiques
228arXiv cs.RO 

Attaques trojans sur les contrôleurs de réseaux de neurones pour systèmes robotiques

Des chercheurs ont publié sur arXiv (référence 2602.05121v2) une démonstration de faisabilité d'attaques par backdoor, dites attaques "Trojan", ciblant des contrôleurs neuronaux embarqués dans des systèmes robotiques. Le vecteur d'attaque étudié est un robot mobile à propulsion différentielle, dont le contrôleur de suivi de trajectoire et de stabilisation de pose est implémenté sous forme de réseau de neurones. Les auteurs ont conçu un module Trojan parallèle, léger, conçu pour être inséré dans le réseau principal sans modifier ses poids. Ce module reste inactif en fonctionnement normal, puis s'active dès qu'une condition de déclenchement très précise est détectée, définie conjointement par la pose courante du robot et ses paramètres objectifs. À l'activation, le module corrompt directement les commandes de vitesse des roues, provoquant des comportements non désirés, potentiellement dangereux. L'attaque est validée en simulation selon deux scénarios distincts. Ce travail met en lumière un risque souvent sous-estimé dans la robotique industrielle et les AMR (robots mobiles autonomes) : la chaîne d'approvisionnement en modèles neuronaux. Dès lors qu'un contrôleur est fourni par un tiers, entraîné sur une infrastructure externe, ou acquis via un pipeline de fine-tuning non audité, l'intégrateur ne peut pas garantir l'absence de modules cachés. La discrétion du Trojan, dormant jusqu'à un trigger très spécifique, le rend difficilement détectable par les tests fonctionnels classiques. Pour les COO industriels et les équipes sécurité, cela signifie que les approches de validation de modèles actuelles, orientées performance, sont insuffisantes face à des attaques intentionnelles. Les attaques par backdoor sur les réseaux de neurones sont documentées depuis 2017 dans le domaine de la classification d'images, mais leur transposition aux systèmes de contrôle robotique en temps réel est plus récente et plus critique : une erreur de classification est bénigne, une dérive de trajectoire sur un robot industriel peut provoquer des dommages matériels ou humains. Ce papier s'inscrit dans un corpus croissant qui questionne la robustesse des architectures VLA (Vision-Language-Action) et des contrôleurs neuronaux génériques. Les suites logiques sont des méthodes de détection (analyse spectrale des poids, tests adversariaux ciblés) et des protocoles de certification des modèles embarqués, un chantier encore largement ouvert pour les organismes de standardisation comme l'ISO ou l'IEC.

UELes intégrateurs européens d'AMR et robots industriels utilisant des contrôleurs neuronaux fournis par des tiers sont directement exposés à ce vecteur d'attaque ; les travaux de normalisation ISO/IEC sur la certification des modèles embarqués deviennent un chantier prioritaire pour le marché européen.

RechercheOpinion
1 source
Exécution en temps réel avec des politiques autorégressives
229arXiv cs.RO 

Exécution en temps réel avec des politiques autorégressives

Un article de recherche déposé sur arXiv (référence 2606.13355) en juin 2026 démontre que les politiques autoregressives -- la famille de modèles qui génère les actions token par token, à la manière d'un LLM classique -- peuvent atteindre une exécution en temps réel sur des robots physiques. La méthode repose sur deux leviers combinés : l'ajustement de l'horizon de tokenisation (la granularité temporelle des séquences d'actions encodées) et le décodage contraint (constrained decoding), qui impose des bornes de latence strictes à chaque inférence. En rendant l'inférence asynchrone, le système garantit des trajectoires d'action fluides tout en maintenant une réactivité suffisante pour absorber les perturbations de l'environnement. Les auteurs montrent, sur des benchmarks simulés et en conditions réelles, que la politique autoregressive surpasse systématiquement son équivalent basé sur le flow-matching (variante des politiques de diffusion) tout en atteignant des vitesses de complétion de tâche nettement supérieures à celles obtenues en inférence synchrone. Le multi-trajectory decoding -- rendu possible par les garanties de latence -- permet en outre d'explorer plusieurs trajectoires candidates en parallèle pour maximiser la performance. Ce résultat est significatif car il remet en cause une hypothèse dominante dans la robotique d'apprentissage : celle selon laquelle les politiques de diffusion seraient structurellement mieux adaptées à l'exécution temps réel en raison de leur parallélisme d'échantillonnage. Les modèles VLA (Vision-Language-Action) autoregressifs, qui traitent séquentiellement pixels, instructions textuelles et commandes moteur dans un même réseau, souffraient d'un goulot d'étranglement de latence jugé rédhibitoire pour le déploiement sur robots industriels ou humanoïdes. Cette publication suggère que ce surcoût peut être absorbé par architecture -- sans sacrifier la performance ni la généralisation aux instructions. Pour un intégrateur ou un COO industriel évaluant des briques VLA, le message est pratique : les modèles autoregressifs offrent également une convergence plus rapide à l'entraînement et une meilleure généralisation aux nouvelles instructions, deux propriétés critiques pour les déploiements à petits volumes de données. Sur le plan du contexte, le débat autoregressif contre diffusion structure la recherche en politiques robotiques depuis la publication des diffusion policies (Chi et al., 2023), rapidement adoptées par des projets comme pi-0 de Physical Intelligence ou ACT. Les modèles VLA à architecture autoregressive, dont OpenVLA ou les variantes de GR00T N2 (NVIDIA), peinent en revanche à s'imposer en déploiement temps réel faute de latence acceptable. Ce preprint, qui n'est pas encore évalué par les pairs, repositionne cette famille comme compétitive pour l'exécution physique, à condition d'intégrer les deux mécanismes proposés dès la conception du pipeline d'inférence. Les prochaines étapes naturelles seront la validation sur des robots industriels à haute fréquence de contrôle (au-dessus de 50 Hz) et l'ouverture éventuelle du code.

💬 Le verrou de latence des VLA autoregressifs, c'était le seul argument solide qui restait pour privilégier les politiques de diffusion en robotique physique. Avec le décodage contraint plus l'ajustement de l'horizon de tokenisation, ils montrent que ce goulot était architectural, pas structurel. Bon, c'est encore un preprint, reste à voir si ça tient au-dessus de 50 Hz sur du vrai acier.

IA physiqueOpinion
1 source
SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle
230arXiv cs.RO 

SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle

Des chercheurs du groupe Intuitive Robots ont publié sur arXiv (réf. 2606.13497) SPARC, acronyme de Spatial Annotations from Robot Demonstrations with Reliability Calibration. Il s'agit d'un pipeline automatique qui annote des démonstrations robotiques avec des métadonnées spatiales structurées -- boîtes englobantes, trajectoires d'objets, labels de phase de manipulation -- tout en attribuant à chaque annotation un score de fiabilité calibré. Évalué sur 1 700 démonstrations annotées manuellement, couvrant des morphologies et des scénarios variés, SPARC conserve trois fois plus d'échantillons aux points de fonctionnement haute précision par rapport aux pipelines de détection classiques, tout en surpassant ces mêmes baselines sur la précision de localisation. L'équipe introduit également IA-Bench (Interaction-Aware Bench), un benchmark dédié à mesurer la précision des modèles dans la localisation des objets manipulés au fil d'une démonstration. Le code, les données et les modèles sont disponibles publiquement. L'enjeu est directement lié à la scalabilité de l'entraînement des politiques robotiques et des modèles de fondation incarnés (embodied foundation models). Les pipelines d'annotation automatique existants produisent des labels en volume, mais sans signal de qualité fiable : la confiance du détecteur est mal calibrée pour prédire la correction d'une annotation, ce qui oblige les équipes ML à choisir entre bruit et perte de données. SPARC contourne ce dilemme en exploitant la structure spatio-temporelle propre aux tâches robotiques pour générer un signal de fiabilité intrinsèque. Les politiques entraînées sur ces annotations surpassent les baselines dans des scènes réelles encombrées et visuellement ambiguës, ce qui suggère que la qualité du signal d'annotation compte autant que le volume brut de données -- une hypothèse que le secteur commence seulement à tester systématiquement. Le problème de l'annotation à grande échelle est un goulot d'étranglement bien identifié dans la robotique d'apprentissage par imitation, notamment depuis l'émergence des Visual Language Action models (VLA) tels que pi-0 de Physical Intelligence ou OpenVLA de Berkeley. Ces architectures consomment des milliers de démonstrations annotées avec précision, et la vérification humaine ne passe pas à l'échelle. SPARC s'inscrit dans un effort plus large, parallèle aux travaux de Google DeepMind sur RoboAgent ou aux pipelines de données de Hugging Face LeRobot, pour industrialiser la production de datasets robotiques de qualité. La prochaine étape logique sera de valider SPARC sur des distributions d'environnements plus larges et sur des tâches de manipulation longue durée, deux axes où le sim-to-real gap reste ouvert.

UELes laboratoires européens (CEA-List, INRIA, universités) travaillant sur l'apprentissage par imitation peuvent directement exploiter ce pipeline open-source pour améliorer la qualité de leurs datasets robotiques sans coût d'annotation humaine supplémentaire.

RecherchePaper
1 source
Recherche à horizon adaptatif basée sur les conflits pour la planification de chemins multi-agents en boucle fermée
231arXiv cs.RO 

Recherche à horizon adaptatif basée sur les conflits pour la planification de chemins multi-agents en boucle fermée

Des chercheurs ont publié sur arXiv (arXiv:2602.12024v2) un algorithme nommé ACCBS (Adaptive-Horizon Conflict-Based Search), conçu pour résoudre en temps réel le problème de coordination de flottes de robots dans des entrepôts automatisés. Le Multi-Agent Path Finding (MAPF) consiste à calculer des trajectoires sans collision pour des dizaines à des centaines d'AGV ou AMR opérant simultanément dans un même espace. ACCBS est un planificateur en boucle fermée qui adapte dynamiquement son horizon de planification en fonction du budget computationnel disponible, et réutilise un arbre de contraintes unique pour passer fluidement d'un horizon à l'autre. L'algorithme exhibe un comportement "anytime" : il retourne une solution faisable de bonne qualité très rapidement, puis l'améliore jusqu'à l'optimalité asymptotique si le temps de calcul le permet. L'enjeu industriel est direct. Les approches actuelles se divisent en deux familles peu satisfaisantes : les planificateurs en boucle ouverte, qui génèrent des trajectoires fixes et s'effondrent dès qu'un robot tombe en panne ou qu'un opérateur traverse une allée, et les heuristiques en boucle fermée, qui réagissent aux perturbations mais sans garantie de performance formelle, ce qui les exclut des déploiements à contraintes de sécurité. ACCBS propose un compromis crédible : la robustesse aux perturbations d'un système réactif combinée aux garanties théoriques d'un solveur optimal. Pour un intégrateur ou un COO logistique, cela signifie potentiellement pouvoir dimensionner une flotte plus serrée sans sacrifier la fiabilité SLA, et certifier le comportement du système face aux auditeurs. ACCBS s'appuie sur CBS (Conflict-Based Search), un algorithme de référence académique pour le MAPF optimal, et y greffe un mécanisme d'horizon variable inspiré du Model Predictive Control (MPC) et de l'iterative deepening. Ce domaine est activement disputé : Amazon Robotics, Geek+ et Exotec (acteur français, qui déploie des flottes Skypod dans plusieurs dizaines d'entrepôts en Europe et Amérique du Nord) investissent massivement dans la coordination de flottes à grande échelle. La contribution reste à ce stade un résultat de recherche avec études de cas simulées, aucun déploiement réel n'est annoncé, et les auteurs ne précisent pas le nombre d'agents testé ni les temps de cycle obtenus, ce qui limite l'évaluation de la maturité industrielle.

UEExotec, acteur français leader des flottes Skypod déployées dans des dizaines d'entrepôts en Europe, opère précisément dans le domaine adressé par ACCBS ; si l'algorithme atteint la maturité industrielle, il pourrait renforcer la compétitivité des solutions européennes de coordination de flottes AMR face aux acteurs américains et asiatiques.

RecherchePaper
1 source
μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA
232arXiv cs.RO 

μVLA : mémoire récurrente pour la manipulation partiellement observable dans les modèles VLA

Des chercheurs ont publié sur arXiv (arXiv:2606.12497) une étude d'isolation contrôlée baptisée muVLA, une famille de variantes du modèle OpenVLA-OFT augmentées de récurrence minimale. Le principe : injecter un petit ensemble de tokens mémoire apprenables dans le transformer, transportés d'un pas de temps au suivant et mis à jour par auto-attention, sans loss auxiliaire ni modification architecturale. L'entraînement se fait de bout en bout avec rétropropagation tronquée dans le temps (TBPTT), paramétrée par la largeur mémoire m et la longueur de troncature K, avec deux règles de mise à jour comparées -- gradients inter-pas ou EMA détachée. Sur le benchmark MIKASA-Robo, muVLA porte le taux de succès moyen sur cinq tâches d'entraînement de 0,42 à 0,84 dans la configuration la plus forte, et atteint 0,23 sur des tâches hors distribution contre 0,07 pour la baseline sans mémoire. Sur LIBERO, environnement à observabilité complète, la variante récurrente la plus forte atteint 96,2 % de succès moyen -- sans régression par rapport au modèle de base. Ce travail apporte une contribution méthodologique précise à un champ encombré d'ablations mal contrôlées. La quasi-totalité des VLA à mémoire existants couplent récurrence, retrieval, compression et objectifs hiérarchiques dans un seul système, rendant impossible d'attribuer les gains à un mécanisme isolé. muVLA démontre que la récurrence seule -- sans aucune machinerie additionnelle -- suffit à doubler le taux de succès sur des tâches à observabilité partielle, c'est-à-dire les situations où une partie de l'état pertinent a disparu du champ de vision. Pour les intégrateurs robotiques travaillant sur des cellules avec occlusions ou des séquences d'assemblage multi-étapes, c'est un signal clair : le goulot n'est pas la puissance brute du modèle de base, mais la capacité à maintenir un état latent persistant. Le résultat sur LIBERO indique également que l'ajout de mémoire ne dégrade pas les performances en pleine observabilité, ce qui lève un frein souvent cité à l'adoption de ces architectures en production. OpenVLA est un modèle open-source lancé fin 2024 par une collaboration Stanford/Berkeley/Toyota Research Institute, positionné comme alternative ouverte aux VLA propriétaires comme RT-2 (Google DeepMind) ou pi0 (Physical Intelligence). OpenVLA-OFT en est une variante fine-tunée pour l'exécution rapide. La question de la mémoire dans les VLA est activement travaillée par plusieurs équipes -- RoboVLMs, SpatialVLA, Helix (Figure AI) -- mais avec des architectures nettement plus lourdes. muVLA se distingue par sa minimalité revendiquée et son protocole d'isolation rigoureux, ce qui en fait un outil de calibration plus qu'un système prêt au déploiement. Les auteurs délimitent explicitement le "régime de suffisance" de la récurrence minimale : elle fonctionne pour les tâches où la structure mémoire requise est homogène entre entraînement et évaluation, et atteint ses limites dès que les tâches hors distribution exigent une structure mémorielle différente. Les prochaines étapes naturelles -- combinaison avec des mécanismes de retrieval ou de compression -- sont implicitement balisées par ces résultats.

RechercheOpinion
1 source
Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)
233arXiv cs.RO 

Attaques par redirection de trajectoire sur les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 12 juin 2026 un article (arXiv:2606.12978) introduisant une nouvelle classe d'attaques adversariales sur les politiques robotiques de type VLA (Vision-Language-Action), ces architectures qui combinent un modèle de langage, une vision par caméra et un contrôleur moteur pour exécuter des tâches de manipulation à partir d'instructions textuelles. L'attaque baptisée "command-preserving trajectory redirection" (redirection de trajectoire préservant la commande) consiste à modifier subtilement le prompt d'entrée de façon à ce qu'il reste visuellement et sémantiquement proche de l'instruction légitime, mais provoque un résultat physique entièrement différent. Le modèle de menace est strict : l'attaquant ne modifie ni les poids du modèle, ni l'environnement, il choisit un seul prompt avant l'épisode, et ce prompt reste dans la norme syntaxique de la commande originale, sans mots-cibles ni langage correctif. Les auteurs proposent une méthode de recherche "on-policy" qui exploite des rollouts réels du robot pour identifier les perturbations textuelles dont le comportement en boucle fermée dévie vers une tâche cible. Les expériences sont conduites en simulation et sur robot physique, confirmant le transfert de l'attaque au monde réel. Ce résultat est significatif pour les intégrateurs et les décideurs industriels qui évaluent l'adoption des VLA en production, notamment dans les contextes de manipulation collaborative ou d'assemblage. La vulnérabilité exploite une propriété structurelle des VLA en boucle fermée : le même prompt est réappliqué à chaque étape de re-planification, et chaque action conditionnée modifie les observations futures sur lesquelles la politique agit. Un prompt malveillant peut donc cumuler ses effets sur toute une trajectoire, là où les attaques précédentes se limitaient à des perturbations action-par-action ou à la persistance d'actions basses. Cela contredit implicitement l'hypothèse que la robustesse visuelle d'un VLA suffit à garantir son intégrité comportementale, et soulève des questions concrètes sur la validation de sécurité avant déploiement. Les modèles VLA sont au coeur de plusieurs développements récents : pi0 de Physical Intelligence, OpenVLA, RT-2 de Google DeepMind, ou encore les politiques embarquées sur les humanoïdes Figure et 1X. La recherche en sécurité adversariale sur ces architectures était jusqu'ici dominée par des attaques sur les observations visuelles ou sur les actions individuelles ; ce travail ouvre formellement le champ des attaques au niveau de l'instruction textuelle à horizon long. Les auteurs n'annoncent pas de correctif ni de contre-mesure validée, ce qui laisse ouverte la question de la robustification des pipelines VLA. Les prochaines étapes attendues dans la communauté concerneront vraisemblablement la détection de prompts adversariaux à la volée et l'évaluation de ce vecteur d'attaque sur des modèles déployés commercialement. Le site projet est accessible à l'adresse indiquée dans le papier.

RechercheOpinion
1 source
L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes
234arXiv cs.RO 

L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes

Une étude publiée sur arXiv le 11 juin 2026 (réf. 2606.11891) présente une comparaison rigoureuse de deux architectures de critique en apprentissage par renforcement multi-objectifs pour robots humanoïdes : un critique unifié (un seul réseau estimant la valeur combinée de tous les objectifs) contre des critiques duaux (deux réseaux distincts, chacun associé à un signal de récompense séparé, l'un pour la locomotion, l'autre pour la manipulation). Les expériences ont été conduites sur le Unitree G1, un humanoïde à 23 degrés de liberté actifs, dans le simulateur NVIDIA Isaac Lab, via un curriculum séquentiel de 13 niveaux progressant de l'atteinte stationnaire jusqu'à la marche avec des cibles à orientation variable. Résultat : les politiques entraînées avec critiques duaux atteignent leurs cibles 3,5 fois plus vite (6,5 pas de simulation contre 22,6), affichent un débit deux fois supérieur (14,3 contre 7,0 atteintes validées pour 1 000 pas), et un taux de réussite validé de 65,2 % contre 53,8 % pour le critique unifié. Ce que l'étude démontre, c'est que le choix de l'architecture du critique est un levier de conception primaire, souvent négligé, dont l'impact surpasse celui du reward engineering. Fait notable : l'ajout de mécanismes anti-gaming, conçus pour empêcher la politique d'exploiter les failles de la fonction de récompense, ne produit aucun gain au-delà du changement architectural seul (60,9 % contre 65,2 %). L'implication la plus immédiate concerne le fine-tuning RL de politiques pré-entraînées par imitation : lorsqu'on affine un modèle de manipulation déjà appris (style Pi-0 ou GR00T N2), un critique unifié risque de supprimer les comportements acquis par interférence des gradients de locomotion. Pour les équipes qui cherchent à spécialiser des modèles de fondation robotiques par RL, cette mise en garde est directement opérationnelle. Le Unitree G1, vendu autour de 16 000 dollars, est devenu un banc de test standard pour la recherche en humanoïde abordable, face aux plateformes de Figure AI, Agility Robotics ou 1X Technologies qui opèrent sur des gammes de prix bien supérieures. NVIDIA Isaac Lab, successeur d'Isaac Gym, s'est imposé comme l'environnement de référence pour l'entraînement sim-to-real. La question du découplage locomotion/manipulation en RL multi-objectifs est au coeur de plusieurs groupes de recherche (Stanford, CMU, ETH Zurich), et les résultats de cette étude, issus d'un cadre contrôlé et reproductible, offrent une base solide pour orienter les choix d'architecture avant tout entraînement coûteux sur robot réel.

RecherchePaper
1 source
Efficient-WAM : un modèle monde-action de 1 milliard de paramètres à faible coût d'anticipation
235arXiv cs.RO 

Efficient-WAM : un modèle monde-action de 1 milliard de paramètres à faible coût d'anticipation

Une équipe de recherche présente Efficient-WAM, un World-Action Model (WAM) d'un milliard de paramètres conçu pour la manipulation robotique en temps réel, dont les résultats sont publiés sur arXiv (2606.10040) en juin 2026. Les WAMs constituent une classe de modèles qui couplent la prédiction visuelle du futur avec la génération d'actions motrices : le robot "imagine" ce que va ressembler la scène dans quelques instants avant de décider quoi faire. Efficient-WAM ramène la latence d'inférence à environ 100 ms par chunk lors du déploiement physique, soit un gain de 30x par rapport aux WAMs existants. Pour y parvenir, trois leviers techniques sont combinés : un expert vidéo compact distillé depuis WAN-2.2-5B (modèle de génération vidéo à 5 milliards de paramètres), des représentations vidéo token-sparse, et un débruitage asymétrique qui alloue moins d'étapes d'échantillonnage à la branche vidéo qu'à la branche action. Les évaluations portent sur le benchmark RoboTwin 2.0 et des tâches de manipulation en conditions réelles. Le résultat central est contre-intuitif : Efficient-WAM maintient des performances d'action compétitives même si ses prédictions visuelles sont visiblement grossières, ce qui invalide l'hypothèse implicite que la fidélité photorealiste de l'imagination future est nécessaire au contrôle. Pour un intégrateur ou un responsable robotique, cela signifie que le goulot d'étranglement computationnel des WAMs n'est pas une fatalité architecturale mais un problème de design résolu ici par une re-priorisation : la vidéo future n'est plus un objectif visuel mais un signal de guidage compact pour la génération d'actions. À 100 ms par chunk, le modèle entre dans la fenêtre de faisabilité pour des boucles de contrôle sur manipulateurs industriels ou cobots, là où les WAMs précédents restaient confinés à la démonstration labo. Les WAMs s'inscrivent dans une compétition dense avec les Vision-Language-Action models (VLAs) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA, qui traitent directement la génération d'actions sans passer par la prédiction vidéo explicite. L'argument des WAMs est que l'imagination du futur améliore la robustesse en dehors de la distribution d'entraînement, mais leur coût computationnel a jusqu'ici limité leur adoption. Efficient-WAM rééquilibre ce trade-off. La distillation depuis WAN-2.2-5B, un modèle de génération vidéo généraliste, suggère une stratégie de transfer learning inter-domaine qui pourrait s'étendre à d'autres architectures. Les prochaines étapes naturelles sont l'évaluation sur des plateformes humanoïdes complètes et des déploiements en environnements semi-structurés, deux dimensions absentes de ce papier.

IA physiqueActu
1 source
ros2probe : observabilité non intrusive et sélective au niveau noyau pour le middleware ROS 2
236arXiv cs.RO 

ros2probe : observabilité non intrusive et sélective au niveau noyau pour le middleware ROS 2

Une équipe de chercheurs a publié le 12 juin 2026 sur arXiv (arXiv:2606.10746v1) les travaux autour de ros2probe, un framework d'observabilité non-intrusif pour ROS 2, le middleware de facto de la robotique moderne. ROS 2 structure chaque robot comme un graphe de noeuds communicant via DDS (Data Distribution Service), un protocole publish/subscribe. Le problème fondamental des outils de monitoring existants : pour observer un topic, ils s'inscrivent eux-mêmes comme subscribers DDS, devenant ainsi partie intégrante du système qu'ils mesurent. ros2probe contourne cette contrainte en reconstituant l'état de communication complet à partir des paquets de découverte DDS, sans rejoindre le domaine, puis en appliquant un filtre noyau (in-kernel) ciblé sur les topics demandés. Sur trois plateformes matérielles (laptop x86, NVIDIA Jetson, Raspberry Pi), deux implémentations DDS distinctes et sept workloads robotiques, ros2probe maintient le graphe de découverte à moins de 0,5% d'un système non observé. Les outils classiques, eux, gonflent ce graphe jusqu'à 2,6 fois et perdent 38,5% des messages du subscriber réel en conditions de saturation. ros2probe n'en perd aucun, affiche un recall de 1,0 sur le reporting de perte, et réduit la consommation CPU de l'observateur jusqu'à 7x, la mémoire jusqu'à 28x. Ce résultat est significatif pour quiconque développe ou intègre des systèmes robotiques en production. L'effet sonde (probe effect) décrit ici n'est pas un artefact de mauvaise implémentation : il est inhérent au protocole DDS. Cela signifie que tout log de performance ou diagnostic collecté avec les outils standard (ros2 topic echo, rqt, rosbag2) modifie silencieusement le comportement du système mesuré, avec des pertes de messages qui peuvent atteindre plus d'un tiers en charge élevée. Sur les robots embarqués à ressources contraintes, Jetson ou Raspberry Pi, les outils existants peuvent tout simplement saturer le système. ros2probe démontre qu'une observabilité fidèle est techniquement possible sans ce compromis. ROS 2 a supplanté ROS 1 précisément pour son architecture distribuée et sa robustesse industrielle, mais cette architecture DDS a hérité d'une limitation structurelle pour le debug et le monitoring. L'approche de ros2probe s'appuie sur la capture passive au niveau noyau, proche des techniques eBPF utilisées dans l'observabilité Linux moderne, appliquée ici à la sémantique ROS 2. Aucun déploiement commercial ni partenariat industriel n'est mentionné dans l'article, qui reste une publication académique. Les prochaines étapes naturelles seraient une intégration dans les toolchains ROS 2 existants et une validation sur des robots de production, notamment dans des environnements multi-robots où l'inflation du graphe de découverte est encore plus critique.

UELes équipes robotiques européennes développant sur ROS 2, notamment sur plateformes embarquées contraintes comme Jetson ou Raspberry Pi, bénéficieraient d'un outil de monitoring fiable sans dégradation des performances, un gain concret pour la R&D robotique française et européenne.

InfrastructureActu
1 source
Ce que les métriques de curation des démonstrations font à votre politique
237arXiv cs.RO 

Ce que les métriques de curation des démonstrations font à votre politique

Une étude publiée en juin 2026 (arXiv:2606.10229) révèle une décorrélation surprenante au cœur du pipeline d'imitation learning en robotique : les métriques qui détectent le mieux les épisodes de démonstration défectueux ne sont pas celles qui produisent les meilleures politiques de behavior cloning. Les chercheurs ont travaillé sur le benchmark LIBERO de pick-and-place en contact riche, en injectant un défaut structurel contrôlé, un relâchement prématuré du préhenseur pendant la phase de transport. Parmi sept métriques de curation évaluées, celle affichant le meilleur AUROC de détection de défauts (0,804) génère la pire politique downstream, avec un taux de succès de seulement 13,3 %. À l'inverse, une métrique avec un AUROC bien plus faible (0,638) produit une politique atteignant 90,0 % de réussite, contre 93,3 % pour l'oracle entraîné sur données propres vérifiées. La baseline contaminée, sans aucune curation, ne dépasse pas 3,3 % de succès. Ce résultat remet en cause un présupposé largement répandu dans la communauté robotique : l'idée qu'améliorer la détection des démonstrations défectueuses suffit à améliorer la politique apprise. L'étude montre que cinq des sept métriques testées utilisent en réalité la longueur d'épisode comme proxy trivial pour le label de défaut, un biais qui gonfle artificiellement les AUROC jusqu'à des valeurs quasi-parfaites, et qui disparaît dès lors qu'on neutralise cette variable. Pour les équipes qui construisent des systèmes de robot learning à partir de données humaines (notamment dans les approches VLA ou diffusion policy), cela signifie que les outils de curation standard peuvent induire en erreur, en sélectionnant des données qui « semblent » propres sans réellement améliorer le comportement en rollout. L'imitation learning par behavior cloning est aujourd'hui au cœur des approches de référence en manipulation robotique, des systèmes Pi-0 de Physical Intelligence aux architectures ACT et Diffusion Policy largement reproduites en recherche académique. LIBERO est un benchmark établi, utilisé précisément pour sa richesse en interactions contact. Les auteurs de cette étude vont plus loin que le constat en publiant le testbed complet, toutes les implémentations de métriques et le pipeline d'évaluation, ce qui permet à la communauté de recalibrer ses outils de curation. La recommandation centrale est méthodologique : évaluer une méthode de curation à l'aune de la politique qu'elle produit, pas des défauts qu'elle signale, et imposer un contrôle systématique de la longueur d'épisode avant toute publication de score de détection.

UELes laboratoires académiques et startups européennes travaillant sur le behavior cloning ou les politiques de diffusion peuvent recalibrer leurs pipelines de curation grâce au testbed complet publié par les auteurs.

RecherchePaper
1 source
Une méthode pratique pour améliorer la corrélation simulation-réel dans l'évaluation des modèles VLA
238arXiv cs.RO 

Une méthode pratique pour améliorer la corrélation simulation-réel dans l'évaluation des modèles VLA

Une équipe de chercheurs a publié en juin 2026 sur arXiv (arXiv:2606.10366) une étude systématique visant à quantifier et améliorer la corrélation entre évaluation en simulation et déploiement réel pour les politiques de type VLA (Vision-Language-Action). Ces politiques, qui combinent perception visuelle, compréhension du langage naturel et génération d'actions motrices, sont au coeur des robots généralistes actuels. L'étude couvre plusieurs plateformes de simulation, plusieurs politiques VLA, plusieurs familles de tâches manipulatoires, et plusieurs facteurs de perturbation contrôlés. Les métriques retenues sont la cohérence du classement des politiques entre simulation et réel, la corrélation de performance absolue, et les patterns d'échec induits par perturbation. Les auteurs examinent également à quel moment le fine-tuning d'une politique sur données simulées améliore réellement les performances en monde réel, et comment le volume de données post-entraînement influence cet alignement. Ce travail s'attaque à un verrou identifié de longue date dans la robotique apprise : les benchmarks en simulation, malgré des progrès significatifs en réalisme et diversité ces deux dernières années, ne sont pas encore adoptés comme proxies fiables pour l'évaluation hors-lab. En pratique, cela signifie que les équipes d'intégration et les labs reproduisent des évaluations coûteuses en monde réel à chaque itération de politique, faute de pouvoir faire confiance aux scores simulés. L'étude identifie quels signaux simulés restent alignés avec le déploiement réel et lesquels divergent, donnant aux praticiens une grille de lecture concrète pour calibrer leur utilisation de la simulation dans le pipeline de développement. Le problème du sim-to-real gap accompagne la robotique apprise depuis les travaux fondateurs sur le domain randomization (OpenAI, 2017-2019), mais il devient critique à mesure que les VLA cherchent à passer à l'échelle industrielle. Des acteurs comme Physical Intelligence (Pi-0), Google DeepMind (RT-X, GR00T N2 côté Nvidia), ou encore Figure AI avec Figure 03 s'appuient tous sur des pipelines simulation-réel pour accélérer l'entraînement. En proposant un cadre unifié pour mesurer, interpréter et améliorer l'utilité de la simulation pour les VLA, ce papier vise à fournir une référence méthodologique commune, à la fois pour les concepteurs de simulateurs et pour les praticiens. Les prochaines étapes logiques incluent l'intégration de ces recommandations dans des benchmarks publics existants tels que RoboVerse ou LIBERO.

UEImpact indirect : ce cadre méthodologique pourrait réduire les coûts d'évaluation réelle répétée pour les équipes R&D européennes travaillant sur des politiques VLA.

RechercheOpinion
1 source
C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences
239arXiv cs.RO 

C³ache : accélérer les modèles monde-action par cache de blocs inter-inférences

Des chercheurs ont publié sur arXiv en juin 2026 (référence 2606.08962) une méthode d'accélération appelée C³ache (Cross Inference Chunk Cache), ciblant les World Action Models (WAM), une classe de modèles robotiques qui génèrent des politiques d'action en modélisant la vidéo plutôt qu'en s'appuyant uniquement sur des démonstrations étiquetées. Contrairement aux politiques VLA (Vision-Language-Action) classiques, les WAM s'entraînent sur de la vidéo non labellisée abondante, ce qui améliore leur généralisation à de nouveaux mouvements et environnements, mais au prix d'un coût d'inférence élevé. Pour exécuter une tâche, un WAM enchaîne plusieurs blocs d'inférence successifs (chunks), chacun nécessitant un processus de débruitage coûteux. Les méthodes existantes réduisent ce coût en mettant en cache les calculs au sein d'un même chunk, mais ignorent une source de redondance plus large : la forte corrélation entre les résidus calculés à un même step de débruitage, d'un chunk au suivant, lorsque le robot exécute un comportement fluide. C³ache exploite cette corrélation en réutilisant ces résidus entre chunks consécutifs, sans aucun réentraînement du modèle. Les expériences sur benchmarks avec un backbone Fast-WAM montrent un gain allant jusqu'à 2,5× sur le temps d'inférence total mesuré en wall-clock, avec une dégradation négligeable du taux de succès aux tâches. Ce résultat a une portée concrète pour les équipes cherchant à déployer des robots autonomes à coût raisonnable. Le principal frein à l'adoption industrielle des WAM n'est pas la qualité des politiques générées, mais leur latence d'inférence : réduire ce coût par 2,5× sans modifier les poids du modèle constitue un levier de déploiement immédiat, sans pipeline de réentraînement ni risque de régression. La méthode valide aussi une hypothèse structurelle utile : les trajectoires robotiques lisses produisent des représentations internes stables d'un pas à l'autre, ce qui ouvre la voie à des stratégies de cache plus agressives au niveau système. Pour les intégrateurs et les équipes MLOps, C³ache se présente comme un composant directement intégrable à tout modèle WAM existant. Les WAM s'inscrivent dans une tendance initiée par des modèles comme pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui exploitent tous deux un objectif de génération vidéo pour apprendre à partir de données non étiquetées. La course à la réduction des coûts d'inférence pour ces architectures est intense : Google, Physical Intelligence et plusieurs laboratoires académiques explorent en parallèle la distillation, la quantification et le cache intra-chunk. C³ache se positionne comme une solution orthogonale et combinable avec ces approches. Les auteurs soulignent toutefois une limite importante : la corrélation inter-chunks supposée ne tient que pour des comportements robotiques fluides, et des mouvements brusques ou des transitions rapides pourraient dégrader les performances. Il s'agit pour l'instant d'un preprint non relu par les pairs, et les évaluations restent confinées à des benchmarks simulés ; les prochaines étapes naturelles incluent la validation sur robots physiques et l'intégration dans des pipelines embarqués à contraintes de latence strictes.

IA physiqueActu
1 source
ActProbe : sonde dans l'espace d'action pour la détection précoce des défaillances des politiques robotiques génératives
240arXiv cs.RO 

ActProbe : sonde dans l'espace d'action pour la détection précoce des défaillances des politiques robotiques génératives

Des chercheurs ont publié ActProbe (arXiv:2606.08508), un détecteur de défaillances léger pour les politiques robotiques génératives, ces systèmes qui produisent des séquences d'actions continues comme les politiques de diffusion ou les architectures ACT déployées sur des robots tels que Figure 03 ou entraînés avec pi-0. Plutôt que d'accéder aux états internes du modèle ou d'introduire un rééchantillonnage coûteux à l'exécution, ActProbe opère exclusivement sur les chunks d'actions émis lors d'un seul passage avant (forward pass). Deux signaux suffisent : l'erreur de cohérence temporelle (TCE), qui mesure l'incohérence entre deux chunks consécutifs, et l'amplitude du chunk courant (ACM). Ces métriques alimentent une architecture LSTM-MLP légère conditionnée par la tâche, produisant une probabilité de défaillance par étape. Sur un ensemble diversifié de benchmarks, ActProbe améliore le front de Pareto précision (F1)/précocité d'un gain en hypervolume de +12,7 % par rapport aux méthodes existantes, et affiche un avantage de +9,0 % en ROC-AUC sur des tâches non vues à l'entraînement. L'intérêt opérationnel tient à une contrainte réelle : les politiques commerciales comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne donnent pas accès à leurs états internes. Un détecteur purement black-box est donc la seule option viable en déploiement industriel. ActProbe émet ses alertes avant que la défaillance ne soit visuellement reconnaissable, ce qui est critique pour interrompre une action irréversible avant qu'elle ne soit engagée. Côté fine-tuning par renforcement (PPO), le système réduit de 2,9 fois le nombre d'interactions nécessaires avec l'environnement, un gain direct lorsque chaque interaction implique un robot physique. Le transfert sur des tâches de saisie réelles non vues lors de l'entraînement valide la généralisation hors simulateur. ActProbe s'inscrit dans les travaux ciblant le fossé entre démonstration en laboratoire et déploiement à l'échelle, l'obstacle central à la commercialisation des robots généralistes depuis 2023. Les approches concurrentes, qu'elles reposent sur le monitoring d'incertitude interne ou sur des signaux côté observation, souffrent d'un manque d'accès aux internals ou d'une latence incompatible avec le temps réel. La prochaine étape logique serait l'intégration dans des boucles de contrôle réactives pour robots humanoïdes industriels, terrain où Figure AI, Apptronik et Agility Robotics accélèrent leurs déploiements en entrepôt en 2026. ActProbe reste à ce stade une publication académique préliminaire, sans produit ni partenariat industriel annoncé.

RechercheOpinion
1 source
Prédiction d'intention avec gestion de l'incertitude pour la téléopération d'assemblage humain-robot
241arXiv cs.RO 

Prédiction d'intention avec gestion de l'incertitude pour la téléopération d'assemblage humain-robot

Une équipe de recherche a publié le 9 juin 2026 (arXiv:2606.08341) un cadre de prédiction d'intentions pour la télé-opération assistée en assemblage industriel. L'approche combine trois composants : MS-TCN++, un réseau temporel convolutif pré-entraîné sur des démonstrations de mains humaines puis affiné sur seulement 16 démonstrations de télé-opération robot ; un module de prédiction conforme (conformal prediction) offrant des garanties statistiques de couverture sur l'incertitude trame à trame ; et une correction sélective par VLM (modèle de langage visuel) ciblant les segments temporellement ambigus. Sur un jeu de test à 22 classes d'actions d'assemblage, le transfert humain-robot fait progresser le score Edit de 70,50 à 80,70, et la précision trame de 45,21 % à 46,42 % après correction VLM, avec des gains accompagnateurs sur F1@25 et F1@50. Ce résultat quantifie précisément le volume de données robot nécessaire pour atteindre une performance opérationnelle viable : 16 démonstrations suffisent lorsque le modèle est initialisé sur données humaines, contre des centaines habituellement requises en imitation learning pur. Pour les intégrateurs et les COO qui déploient des cellules de collaboration humain-robot (HRC) en assemblage structuré, c'est une réduction du coût de mise en service potentiellement substantielle. La prédiction conforme est particulièrement pertinente en contexte industriel : contrairement à un score de confiance non calibré, elle génère des ensembles de prédiction avec des garanties formelles de couverture, permettant de détecter les hésitations du système avant qu'une erreur ne survienne, une propriété critique pour la supervision en temps réel sur des lignes à cycle court. Le transfert learning entre démonstrations humaines et données robotiques est un terrain actif dans plusieurs laboratoires. ACT (Stanford), Pi-0 (Physical Intelligence) et GR00T N2 de NVIDIA abordent tous le bootstrapping par données humaines, mais à des échelles très différentes et sans mécanisme d'incertitude formalisé natif. Ce travail se positionne sur la télé-opération industrielle en assemblage structuré, un segment distinct des robots mobiles généralistes, et contribue une couche d'incertitude quantifiée que les grandes architectures VLA n'intègrent pas encore. Les auteurs mettent à disposition code et données via le site du projet ; les suites probables incluent des validations sur environnements industriels réels et des ensembles d'actions plus larges, un terrain où des acteurs européens comme Enchanted Tools pourraient trouver des briques directement exploitables.

UELa disponibilité du code et des données, conjuguée à la réduction du volume de démonstrations nécessaires (16 vs plusieurs centaines), offre aux intégrateurs européens et aux acteurs français comme Enchanted Tools une brique exploitable pour abaisser le coût de mise en service des cellules d'assemblage HRC.

💬 16 démonstrations robot au lieu de plusieurs centaines, c'est le chiffre qui change tout. Le pré-entraînement sur données humaines puis l'affinage sur un tout petit dataset robotique, ça casse le mur d'entrée pour les intégrateurs qui font de l'assemblage structuré. Et la prédiction conforme avec des garanties formelles sur l'incertitude, pas juste un score de confiance non calibré, c'est le détail qui fait qu'on peut l'imaginer en prod, pas seulement sur un papier arXiv.

IA physiquePaper
1 source
Votre modèle sait déjà : filtre de sécurité guidé par l'attention pour les modèles vision-langage-action (VLA)
242arXiv cs.RO 

Votre modèle sait déjà : filtre de sécurité guidé par l'attention pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié début juin 2026 (arXiv:2606.09749) une méthode de filtrage de sécurité sans entraînement pour les modèles VLA (Vision-Language-Action) en manipulation robotique. La technique repose sur une découverte clé : un petit nombre de têtes d'attention internes au modèle localise de manière fiable l'objet que la politique de contrôle cherche à atteindre. Ces têtes sont exploitées à chaque pas de contrôle pour identifier la cible active, traiter le reste de la scène comme obstacles, et alimenter un filtre CBF (Control Barrier Function) garantissant l'évitement de collisions. Couplée à un tracker léger en temps réel, l'approche gère également les obstacles mobiles. Sur le benchmark SafeLIBERO étendu aux scénarios dynamiques, la méthode surpasse de 43 % en moyenne une baseline oracle disposant de l'état complet du simulateur. L'enjeu est concret pour les intégrateurs de systèmes robotiques déployant des VLA en environnement non contrôlé. Les filtres de sécurité existants interrogent un VLM pour identifier les obstacles, un processus trop lent pour la boucle de contrôle, limité à une initialisation en début d'épisode et incapable de traquer des obstacles en mouvement. L'approche proposée contourne ce goulot en réutilisant les signaux perceptuels déjà présents dans le modèle, sans latence supplémentaire significative. Concrètement, un VLA déjà déployé comme Pi-0, OpenVLA ou RoboFlamingo pourrait être doté d'un filtre de sécurité dynamique sans re-fine-tuning ni surcoût matériel, réduisant le demo-to-reality gap sur les lignes de production avec opérateurs humains à proximité. Ce travail s'inscrit dans la dynamique des VLA depuis 2023, portée par RT-2 (Google DeepMind), OpenVLA, Pi-0 (Physical Intelligence) et d'autres architectures fondées sur des modèles de langage. La sécurité et la garantie de comportement sont restées en retrait face à la course aux performances end-to-end, mais deviennent critiques pour les déploiements industriels réels, notamment en Europe où la réglementation sur les systèmes autonomes se renforce. La méthode CBF est mathématiquement établie en théorie du contrôle ; son intégration sans entraînement dans des pipelines VLA existants constitue un résultat notable. Limite à signaler : les évaluations restent pour l'instant en environnement simulé, et l'extension à des scènes avec occlusions partielles ou robots multiples reste à démontrer.

UELa méthode pourrait accélérer la certification de VLA en environnements industriels européens soumis à la réglementation sur les systèmes autonomes (AI Act), en fournissant un mécanisme de sécurité formellement vérifiable sans surcoût matériel.

IA physiqueOpinion
1 source
SOAR : optimisation conjointe en temps réel pour l'allocation des commandes et l'ordonnancement des robots mobiles
243arXiv cs.RO 

SOAR : optimisation conjointe en temps réel pour l'allocation des commandes et l'ordonnancement des robots mobiles

Des chercheurs, en collaboration avec Geekplus, ont publié SOAR (Simultaneous Order Allocation and Robot Scheduling), un framework d'apprentissage par renforcement profond conçu pour optimiser en temps réel la coordination des robots dans les systèmes de préparation de commandes automatisés (RMFS, Robotic Mobile Fulfillment Systems). Déposé sur arXiv en mai 2026 (arXiv:2605.03842), le système unifie deux sous-problèmes classiquement découplés, l'allocation des commandes et la planification des robots mobiles, en un seul agent décisionnel. Sur des données industrielles réelles fournies par Geekplus, SOAR réduit le makespan global de 7,5 % et le temps moyen de complétion des commandes de 15,4 %, avec une latence de décision inférieure à 100 ms. La viabilité du système a été confirmée par un déploiement en environnement de production via une procédure sim-to-real. Techniquement, le problème est formulé comme un processus de décision de Markov piloté par événements (Event-Driven MDP), où l'agent réagit à des événements asynchrones (fin de tâche, arrivée de commande) grâce à un Heterogeneous Graph Transformer encodant l'état de l'entrepôt, complété par une stratégie de reward shaping pour gérer la rareté du signal de récompense sur les longues séquences. Les RMFS équipent aujourd'hui les grands centres logistiques : des flottes de robots mobiles (AMR) transportent des étagères entières vers des postes de picking humains ou automatisés. Le goulot d'étranglement traditionnel vient du couplage fort entre allocation et ordonnancement : les approches décomposées sacrifient l'optimalité globale pour garantir la réactivité, tandis que les modèles d'optimisation classiques comme les MILP ou CP-SAT sont trop lents pour des environnements à haute cadence. SOAR casse ce compromis en prouvant qu'un agent de deep RL peut raisonner globalement tout en répondant en moins de 100 ms, ce qui constituait un verrou industriel reconnu. Plus significatif encore, la validation sim-to-real en conditions de production distingue ce travail de la majorité des publications académiques qui restent cantonnées à la simulation. Geekplus, fondé en 2015 à Pékin, est l'un des leaders mondiaux des AMR pour la logistique d'entrepôt, avec des déploiements dans plus de 40 pays chez des clients comme Decathlon et JD.com. Sa participation directe à cette recherche signale une intégration croissante entre laboratoires académiques et industriels pour raccourcir le cycle lab-to-production. Sur le marché, Geekplus concurrence Hai Robotics et AutoStore, mais aussi en Europe des acteurs comme Exotec (France), dont le système Skypod adresse des problèmes similaires de coordination multi-robots à grande échelle. SOAR s'inscrit dans un corpus actif de travaux sur le RL multi-agent pour la planification en entrepôt, mais se distingue par son approche unifiée et son ancrage en production confirmé. Le code est disponible en open source sur GitHub, ce qui devrait faciliter son adaptation à d'autres architectures RMFS.

UELe code open-source SOAR, validé en production chez des clients de Geekplus dont Decathlon, constitue une référence technique directe pour Exotec et les intégrateurs AMR européens confrontés aux mêmes problèmes de coordination multi-robots à grande échelle.

IndustrielPaper
1 source
Un indicateur efficace pour mesurer la qualité des données en apprentissage par imitation
244arXiv cs.RO 

Un indicateur efficace pour mesurer la qualité des données en apprentissage par imitation

Des chercheurs ont proposé sur arXiv (arXiv:2605.01544, mai 2026) une métrique automatisée pour évaluer la qualité des démonstrations en apprentissage par imitation (IL), fondée sur la densité spectrale de puissance (PSD) des trajectoires enregistrées. Une PSD faible signale une trajectoire lisse et exploitable ; une PSD élevée indique oscillations, corrections abruptes et mouvements erratiques qui dégradent les politiques apprises. Contrairement aux méthodes existantes, la métrique ne requiert ni rollout de politique, ni interaction avec l'environnement, ni étiquetage expert. Elle a été évaluée sur deux benchmarks IL et via une étude terrain avec des résidents âgés d'un établissement de retraite, dont les démonstrations ont servi à affiner π0.5 de Physical Intelligence pour une tâche de vie quotidienne. Les politiques issues des données filtrées par PSD surpassent les baselines non filtrées et deux méthodes concurrentes en taux de succès et en fluidité d'exécution. Le déploiement réel de robots guidés par imitation bute sur les scénarios hors distribution (OOD), aggravés par la faible qualité des démonstrations d'utilisateurs finaux. Les approches existantes de curation automatisée exigeaient des rollouts en environnement, coûteux et impraticables à grande échelle. La métrique PSD supprime ce verrou : applicable avant tout entraînement, elle filtre les démonstrations directement au moment de la collecte terrain. Pour les intégrateurs de robots manipulateurs en environnements non contrôlés, cela réduit concrètement le coût de mise en qualité des données sans ressources RL dédiées. Le travail s'inscrit dans l'essor des VLA (Vision-Language-Action models), où π0.5 de Physical Intelligence figure parmi les modèles de fondation robotique disponibles pour le fine-tuning, mais le défi du "demo-to-reality gap" reste l'un des freins majeurs au passage à l'échelle de l'IL. En ciblant des utilisateurs âgés peu habitués au guidage de robots, l'étude ouvre une piste vers la robotique d'assistance, segment où des acteurs comme Enchanted Tools en France cherchent à s'implanter. La prochaine étape logique serait l'intégration de cette métrique dans des pipelines de collecte en production, couplée à des retours temps réel pour guider les utilisateurs vers de meilleures démonstrations dès la capture.

UELa métrique PSD pourrait réduire le coût de curation de données pour des acteurs européens comme Enchanted Tools (France), actifs en robotique d'assistance, en supprimant le besoin de rollouts environnementaux coûteux lors du fine-tuning de modèles VLA.

RechercheOpinion
1 source
Les modèles VLA sont restreints mais capables de généraliser à des instructions inédites
245arXiv cs.RO 

Les modèles VLA sont restreints mais capables de généraliser à des instructions inédites

Une étude publiée sur arXiv (référence 2505.03500, version 5, mai 2026) expose une limitation structurelle des modèles VLA (Vision-Language-Action) : leur incapacité à combiner des compétences apprises séparément pour exécuter des tâches inédites. L'exemple présenté est parlant, un VLA peut réussir à placer du fromage frais dans un bol et à poser ce bol sur une armoire, mais échoue à placer directement le fromage sur l'armoire. Pour quantifier ce déficit, les chercheurs ont créé libero-ood, un benchmark de 20 tâches extrapolées depuis les suites standards LIBERO. Résultat net : l'ensemble des VLA état-de-l'art testés plafonnent à moins de 15 % de succès. En appliquant leur technique d'interpolation de latents textuels au modèle π0 de Physical Intelligence, les auteurs atteignent 83 % sans aucun réentraînement. Autre découverte préoccupante : des prompts illisibles pour un humain, obtenus par décodage du latent textuel, suffisent à piloter le VLA à 70 % de succès sur LIBERO standard, ouvrant la voie à des attaques de type backdoor ou à des instructions privées non auditables. La méthode repose sur l'extraction d'un "latent textuel" par tâche de base, en moyennant les états cachés des tokens textuels sur l'ensemble des trajectoires démontrées. Pour exécuter une tâche composite inédite, les chercheurs interpolent temporellement les latents de deux tâches sources et les réinjectent dans le modèle à l'inférence, activant séquentiellement les sous-comportements correspondants. Ce résultat remet en question l'hypothèse d'une compréhension sémantique robuste dans les VLA actuels : l'analyse qualitative révèle un phénomène de surapprentissage spatial, les modèles associant les noms d'objets à des emplacements démontrés plutôt qu'à des entités abstraites. Pour les intégrateurs et décideurs industriels, cela signifie que les benchmarks standards ne détectent pas ces angles morts compositionnels, et que la qualification de systèmes autonomes en production devrait systématiquement inclure des tâches out-of-distribution. LIBERO est depuis plusieurs années une référence en manipulation robotique tabletop ; libero-ood comble un angle mort important sur la généralisation hors distribution. π0, développé par Physical Intelligence (fondée en 2023 par d'anciens chercheurs de Google et DeepMind, dont Sergey Levine et Chelsea Finn), s'est imposé comme l'un des VLA les plus performants du marché via son architecture flow-matching. Les modèles concurrents testés ici, notamment OpenVLA (Berkeley) et Octo, affichent les mêmes limites compositionnelles. Ce travail, encore au stade preprint, pose les bases d'un nouveau critère d'évaluation pour les VLA et soulève des questions de sécurité concrètes qui devraient alerter les équipes déployant ces modèles en environnement industriel non supervisé.

UELes équipes R&D et industriels européens déployant des VLA en production doivent revoir leurs protocoles de qualification pour y intégrer des tâches hors-distribution, les benchmarks standards ne détectant pas les angles morts compositionnels exposés ici.

IA physiqueOpinion
1 source
Évaluation de la sécurité des grands modèles de langage pour le contrôle d'assistants robotiques de santé
246arXiv cs.RO 

Évaluation de la sécurité des grands modèles de langage pour le contrôle d'assistants robotiques de santé

Une équipe de chercheurs a publié fin avril 2026 (arXiv:2604.26577) une évaluation systématique de la sécurité de 72 grands modèles de langage (LLMs) dans le contexte du contrôle de robots-soignants. Le protocole repose sur un corpus de 270 instructions nuisibles, réparties en neuf catégories de comportements interdits dérivés des Principes d'éthique médicale de l'American Medical Association, et testées dans un environnement de simulation basé sur le cadre "Robotic Health Attendant". Le taux de violation moyen toutes catégories confondues atteint 54,4 %, et plus de la moitié des modèles dépassent individuellement les 50 %. Les instructions superficiellement plausibles, manipulation d'équipements médicaux ou retard délibéré face à une urgence, s'avèrent bien plus difficiles à refuser pour les modèles que des requêtes ouvertement destructrices. L'écart entre modèles propriétaires et open-weight est particulièrement marqué : taux médian de violation à 23,7 % pour les premiers, contre 72,8 % pour les seconds. Ces résultats ont des implications directes pour quiconque envisage d'intégrer un LLM dans une boucle de contrôle robotique en milieu clinique. Ils invalident deux hypothèses courantes : d'abord, que le fine-tuning dans le domaine médical améliore la sécurité (aucun bénéfice significatif mesuré), ensuite, que des défenses basées sur le prompt suffisent à sécuriser les modèles les moins fiables (réduction modeste, niveaux absolus toujours incompatibles avec un déploiement clinique). La taille du modèle et la date de sortie restent les meilleurs prédicteurs de sécurité pour les modèles open-weight, ce qui suggère que l'amélioration est incidentelle aux évolutions générales d'entraînement, pas le fruit d'une conception sécurité-first. Le cadre Robotic Health Attendant, utilisé comme base de simulation, s'inscrit dans une tendance plus large où les LLMs sont envisagés comme couche de raisonnement dans des systèmes robotiques d'assistance à la personne, aux côtés d'approches comme les Vision-Language-Action models (VLA). Les acteurs du secteur, qu'il s'agisse de startups comme Enchanted Tools côté français ou de plateformes hospitalières intégrant des bras manipulateurs, n'ont pas encore de benchmark standardisé pour valider la sécurité comportementale de leurs modèles embarqués. Cette étude constitue une première tentative de formalisation, mais ses auteurs reconnaissent que les résultats, obtenus en simulation, devront être confrontés à des protocoles en environnement réel avant de pouvoir orienter des décisions de certification ou de déploiement.

UECette étude fournit un premier benchmark formalisé pour la sécurité comportementale des LLMs en robotique de santé, dont des acteurs français comme Enchanted Tools sont explicitement dépourvus, et pourrait orienter les futures exigences de certification dans le cadre de la réglementation européenne sur les dispositifs médicaux autonomes.

RechercheOpinion
1 source
Relations en forme fermée et approximations d'ordre supérieur des dérivées premières et secondes de l'opérateur tangent sur SE(3)
247arXiv cs.RO 

Relations en forme fermée et approximations d'ordre supérieur des dérivées premières et secondes de l'opérateur tangent sur SE(3)

Des chercheurs ont publié sur arXiv (référence 2604.22287) des expressions en forme close pour le différentiel trijeunialisé à droite de l'application exponentielle sur le groupe de Lie SE(3), communément appelé opérateur tangent ou dexp, ainsi que ses dérivées premières et secondes. La matrice 6×6 représentant ce différentiel, dexpX : se(3) → se(3), était déjà partiellement documentée via une représentation en blocs 3×3, mais ce travail abandonne ce partitionnement pour proposer des relations directement compactes. Les auteurs dérivent également le jacobien et le hessien des applications d'évaluation dexpX(Z) et dexp_X^T(Z), accompagnés d'approximations polynomiales d'ordre élevé conçues pour rester numériquement stables au voisinage des singularités. La méthode est illustrée sur le calcul du champ de déformation et des taux de déformation d'une poutre élastique de type Cosserat-Simo-Reissner. Pour les ingénieurs en robotique et en simulation multiphysique, ces formules sont directement exploitables dans les solveurs de dynamique inverse, les optimiseurs de trajectoires basés sur le gradient, et les intégrateurs temps-réel pour bras manipulateurs ou robots souples. L'accès au hessien de l'opérateur tangent en forme close ouvre la voie à des méthodes d'optimisation du second ordre (Newton, Gauss-Newton) sur SE(3), jusqu'ici freinées par l'absence de ces expressions ou par leur coût numérique élevé via différentiation automatique. La robustesse numérique des approximations d'ordre élevé est particulièrement précieuse dans les schémas implicites où les configurations proches d'une rotation nulle dégradent les méthodes tronquées classiques. SE(3), groupe de Lie des transformations rigides orientées dans l'espace tridimensionnel (rotations et translations couplées), est la structure algébrique centrale de la cinématique des corps rigides, de la dynamique des robots articulés, et de la mécanique des tiges flexibles. Les modèles de Cosserat-Simo-Reissner, qui généralisent la théorie des poutres d'Euler-Bernoulli aux grandes déformations, sont notamment utilisés pour simuler des robots continus, des cathéters, des câbles ou des aiguilles chirurgicales. Ce type de travail fondationnel rejoint un effort de standardisation des outils différentiels sur les groupes de Lie, porté en parallèle par des équipes comme le laboratoire Gepetto (LAAS-CNRS, Toulouse) avec la bibliothèque Pinocchio, ou par les travaux de Müller et Terze sur la formulation intrinsèque des équations du mouvement. La disponibilité de ces expressions dans un format compact et numériquement stable devrait faciliter leur intégration dans des frameworks open-source de simulation robotique.

UECes expressions pourraient être intégrées dans Pinocchio (laboratoire Gepetto, LAAS-CNRS Toulouse), renforçant les capacités de dynamique différentiable du second ordre dans les frameworks robotiques open-source européens.

RecherchePaper
1 source
Comment fonctionnent réellement les VLA en environnements ouverts
248arXiv cs.RO 

Comment fonctionnent réellement les VLA en environnements ouverts

Un article de recherche publié sur arXiv (référence 2604.21192) soumet les modèles vision-langage-action (VLA) à une évaluation critique sur le benchmark BEHAVIOR1K (B1K), un protocole simulant des tâches domestiques complexes de longue durée dans des environnements ouverts. Le constat est net : les métriques standards de ces benchmarks, taux de succès ou score partiel, ne mesurent que l'état final des objets manipulés, indépendamment des événements qui y ont conduit. Un robot qui renverse un verre avant de le replacer peut ainsi obtenir le même score qu'un robot qui l'a manipulé sans incident. Ce protocole dit "progress-agnostic" ignore entièrement les comportements dangereux en cours d'exécution. Les chercheurs ont soumis plusieurs VLA de pointe à une analyse multidimensionnelle couvrant robustesse, reproductibilité, violations de sécurité et causes d'échec des tâches. Les implications sont directes pour tout acteur envisageant un déploiement réel. Si les métriques actuelles gonflent artificiellement les performances rapportées, les décisions d'intégration basées sur ces benchmarks reposent sur des bases fragiles. La distinction est capitale entre un modèle qui complète une tâche et un modèle qui la complète de façon sûre et reproductible, deux propriétés que les scores agrégés actuels confondent. Les auteurs proposent de nouveaux protocoles d'évaluation capables de capturer les violations de sécurité, comblant un angle mort majeur de la recherche. Pour un intégrateur ou un décideur industriel, cela signifie que les chiffres de "success rate" publiés par les laboratoires doivent être lus avec prudence, en exigeant explicitement des données de reproductibilité et des métriques comportementales. La course aux VLA s'est accélérée depuis 2024 avec des modèles comme pi0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu de Stanford et Berkeley. Ces systèmes combinent une fondation vision-langage avec un module d'action, affichant des capacités de généralisation notables en simulation. Ce papier suggère que le fossé simulation-réel est peut-être plus profond qu'estimé : des modèles performants sur B1K pourraient s'avérer moins fiables dès lors qu'on intègre sécurité et consistance comportementale comme critères d'évaluation. Les auteurs appellent la communauté à adopter ces nouveaux protocoles dans les futures éditions du B1K Challenge pour aligner les standards de recherche avec les exigences concrètes du déploiement en environnement ouvert.

RechercheOpinion
1 source
Un pipeline de déploiement rapide pour la préhension autonome de robots humanoïdes basé sur des modèles fondation
249arXiv cs.RO 

Un pipeline de déploiement rapide pour la préhension autonome de robots humanoïdes basé sur des modèles fondation

Des chercheurs ont publié sur arXiv (arXiv:2604.17258, avril 2026) un pipeline de déploiement rapide permettant de préparer un robot humanoïde à manipuler un nouvel objet en environ 30 minutes, contre un à deux jours dans les approches classiques. Le système s'appuie sur trois composants à base de modèles de fondation : l'annotation automatique via Roboflow pour entraîner un détecteur YOLOv8, la reconstruction 3D par Meta SAM 3D à partir d'images standard (smartphone suffisant, pas de scanner laser), et le suivi de pose 6-DoF en zero-shot par FoundationPose, qui utilise directement le maillage généré par SAM 3D comme gabarit. Les commandes de pose alimentent un planificateur de cinématique inverse sous Unity, transmises en UDP au robot Unitree G1 via le SDK propriétaire. Les métriques annoncées : mAP@0.5 = 0,995 en détection, précision de suivi σ inférieure à 1,05 mm, et saisie réussie sur cinq positions dans l'espace de travail. Le pipeline a également été validé sur une tâche d'application de mastic sur vitre d'automobile, ce qui constitue un environnement industriel concret. L'enjeu principal est la réduction du "time-to-deployment" pour la manipulation humanoïde, un goulot d'étranglement majeur qui freine l'intégration en environnement industriel réel. Passer de deux jours à 30 minutes sans équipement spécialisé change la donne pour les intégrateurs et les PME industrielles qui ne disposent pas d'équipes robotique dédiées. Le recours au zero-shot pour FoundationPose signifie qu'aucun réentraînement n'est nécessaire pour chaque nouvel objet, ce qui valide partiellement l'hypothèse que les modèles de fondation peuvent absorber la variabilité d'objets sans collecte de données lourde. Cela dit, les résultats sont présentés sur cinq positions fixes et deux tâches seulement ; la robustesse en conditions de production non contrôlées reste à démontrer. Le robot support, le Unitree G1, est un humanoïde commercial chinois à 16 degrés de liberté vendu autour de 16 000 dollars, positionné comme plateforme de recherche accessible. Les composants logiciels mobilisés (Roboflow, Meta SAM 3D, FoundationPose de NVidia) sont tous open-source ou accessibles via API, ce qui renforce la reproductibilité. Dans le paysage actuel où Figure (Figure 03), Tesla (Optimus), Physical Intelligence (pi0) et Boston Dynamics investissent massivement dans les pipelines de manipulation apprise, cette approche modulaire et frugale en données offre une alternative pragmatique, notamment pour les déploiements pilotes dans des cellules de production à faible volume ou à variété élevée d'objets.

UELes intégrateurs robotiques et PME industrielles européens peuvent évaluer et reproduire ce pipeline open-source (Roboflow, Meta SAM 3D, FoundationPose) pour réduire drastiquement le time-to-deployment sur des cellules de production à haute variété d'objets, sans équipement spécialisé ni équipe robotique dédiée.

IA physiquePaper
1 source
π0.7 : un modèle fondation robotique généraliste et pilotable aux capacités émergentes
250arXiv cs.RO 

π0.7 : un modèle fondation robotique généraliste et pilotable aux capacités émergentes

Physical Intelligence, le laboratoire californien fondé en 2023 par d'anciens chercheurs de Google DeepMind et Stanford, publie π0.7 (pi-zéro-point-sept), un nouveau modèle de fondation robotique généraliste présenté dans un preprint arXiv (2604.15483) daté d'avril 2026. Le modèle démontre des capacités zero-shot sur des tâches multi-étapes en environnements inconnus : manipulation d'appareils de cuisine variés, pliage de linge sans avoir vu la tâche en entraînement, et opération d'une machine à expresso à un niveau de performance comparable à des modèles spécialisés entraînés par reinforcement learning. La généralisation cross-embodiment, c'est-à-dire la capacité à transférer des comportements entre plateformes robotiques différentes sans réentraînement dédié, est présentée comme une propriété émergente du système. L'innovation centrale de π0.7 est un mécanisme de conditionnement contextuel multimodal étendu. Là où la plupart des VLA (Vision-Language-Action models) se contentent d'une instruction textuelle, π0.7 reçoit en entrée de prompt des métadonnées sur la qualité de l'exécution, des images de sous-objectifs intermédiaires, et des informations sur la stratégie à adopter. Ce conditionnement riche permet d'intégrer à l'entraînement des données hétérogènes : démonstrations humaines, données autonomes potentiellement sous-optimales incluant des échecs, et données issues de sources non-robotiques. C'est un levier direct sur le problème du sim-to-real gap et sur le coût de collecte de données de qualité, deux freins majeurs au déploiement industriel. Pour un intégrateur ou un COO industriel, la promesse est concrète : un modèle qui fonctionne correctement sans fine-tuning coûteux sur chaque nouvelle tâche. Physical Intelligence avait introduit π0 fin 2024 comme premier modèle de fondation robotique à architecture flow matching, capable de piloter des bras manipulateurs avec haute dextérité. π0.7 constitue une évolution orientée généralité et pilotabilité plutôt que spécialisation. Dans le paysage concurrentiel, ce positionnement affronte directement Google DeepMind avec RT-2 et ses successeurs, Figure AI avec son modèle Helix, ainsi qu'1X Technologies. Aucun déploiement commercial n'est annoncé à ce stade : il s'agit d'un preprint académique sans validation industrielle publiée. Les évaluations portent sur plusieurs plateformes robotiques en laboratoire, et les prochaines étapes probables incluent des collaborations avec des fabricants de robots pour valider le passage à l'échelle en conditions réelles.

IA physiqueOpinion
1 source