Aller au contenu principal

Dossier arXiv cs.RO — page 33

2842 articles · page 33 sur 57

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement
1601arXiv cs.RO RecherchePaper

ManipArena : évaluation exhaustive en conditions réelles de la manipulation robotique généraliste orientée raisonnement

Le laboratoire à l'origine de ce papier arXiv (identifiant 2603.28545, version 2, soumission de type remplacement) présente ManipArena, un cadre d'évaluation standardisé pour la manipulation robotique en conditions réelles. Le benchmark couvre 20 tâches distinctes, s'appuie sur 10 812 trajectoires expertes et 13,5 millions d'images, pour un total d'environ 188 heures de fonctionnement robotique cumulées sur des scénarios de manipulation de table et de manipulation mobile. Le protocole combine variation de tâches définie par schéma, essais stratifiés en distribution, en décalage visuel et hors distribution sémantique, notation par crédit partiel au niveau des sous-tâches, annotations linguistiques à trois niveaux de granularité, signaux moteurs bas niveau, et environnements simulés jumeaux reconstruits à partir de scènes physiques réelles. Les chercheurs ont utilisé ce dispositif pour évaluer sept configurations de manipulation de table, couvrant à la fois des modèles vision-langage-action (VLA) et des modèles dits world-action. L'enjeu dépasse la simple création d'un nouveau jeu de tests. Les benchmarks en simulateur, bien que reproductibles et faciles à mettre à l'échelle, ne capturent pas fidèlement l'écart entre simulation et réel, ce dernier étant causé par le bruit de perception, la dynamique de contact, la latence et les erreurs de calibration. À l'inverse, les évaluations sur robots physiques existantes sont dispersées entre plateformes, scènes et règles de notation différentes, ce qui rend toute comparaison rigoureuse quasi impossible. Résultat clé de l'étude: les performances mesurées sur robot réel ne dépendent pas seulement de l'architecture du modèle, mais aussi de sa provenance, du régime de fine-tuning, de l'échantillonnage des données d'entraînement et de la granularité des annotations. Pour les intégrateurs et décideurs industriels, ce constat invite à relativiser fortement les annonces de performance basées uniquement sur des démonstrations vidéo ou des scores en simulation. Ce travail s'inscrit dans la course actuelle autour des modèles généralistes de contrôle robotique (VLA et world-action), un domaine où les affirmations de généralisation restent difficiles à vérifier faute de méthodologie commune. En proposant un référentiel reproductible avec attribution fine des échecs, ManipArena vise à devenir un outil diagnostique de référence pour mesurer les véritables limites de capacité de ces modèles, plutôt qu'un simple classement de plus.

1 source
Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée
1602arXiv cs.RO 

Distiller les dynamiques collaboratives dans un espace latent pour une coordination implicite en manipulation multi-agents décentralisée

Un article mis à jour sur arXiv (version 2, référence 2606.22982) présente CLS-DP, un cadre décentralisé pour la manipulation multi-bras par des agents robotiques. Le système répond à un problème concret : les approches centralisées de coordination multi-agents passent mal à l'échelle quand le nombre de bras augmente, car elles exigent une vue globale partagée et des échanges d'état constants. CLS-DP suit le paradigme CTDE (entraînement centralisé, exécution décentralisée) : pendant l'entraînement, il distille dans un espace latent les dynamiques privilégiées de coordination multi-agents ; au déploiement, chaque bras infère ce "latent collaboratif" à partir de sa seule observation RGB locale et d'une instruction de tâche partagée, puis conditionne dessus son processus de débruitage par diffusion, sans communication inter-agents ni état global explicite. Sur six tâches du benchmark RoboFactory impliquant de deux à quatre agents, CLS-DP atteint un taux de réussite moyen de 38%, contre 20% pour la meilleure référence centralisée testée et seulement 9% pour une version décentralisée privée du latent collaboratif. Ce résultat contredit une hypothèse répandue en robotique multi-bras : qu'une coordination fine nécessite forcément une communication explicite ou une vue centralisée de la scène. En montrant qu'un latent appris peut encoder implicitement les dynamiques collaboratives à partir d'une simple image locale, CLS-DP ouvre la voie à des cellules multi-robots qui passent à l'échelle sans coût de communication croissant, un enjeu direct pour les intégrateurs qui déploient des postes de manipulation coopérative en usine. Les cartes d'attribution des auteurs montrent que chaque agent, conditionné sur ce latent, porte une attention élevée non seulement sur ses propres articulations et sa pince, mais aussi sur celles de ses coéquipiers pendant toute l'exécution, preuve que l'information de coordination circule réellement dans la représentation apprise. Pour qui évalue des architectures VLA (vision-language-action) en environnement multi-agent, le travail suggère qu'on peut réduire le coût de calcul par agent tout en égalant, voire en dépassant, des références centralisées plus lourdes. Ce travail s'inscrit dans la lignée des politiques de manipulation par diffusion, devenues une alternative courante au clonage comportemental classique, et s'appuie sur RoboFactory comme benchmark commun pour l'évaluation multi-agents. Le choix du paradigme CTDE rapproche aussi cette recherche des méthodes d'apprentissage par renforcement multi-agents, où entraînement centralisé et exécution décentralisée sont devenus un standard pour équilibrer performance et scalabilité. L'article ne mentionne aucun déploiement industriel ni partenariat avec un fabricant de bras robotiques : il s'agit pour l'instant d'un résultat validé en simulation, sans calendrier annoncé de transfert vers du matériel réel. L'étape logique suivante serait une validation sim-to-réel sur des cellules physiques à deux ou trois bras, véritable épreuve pour une méthode qui promet de faire tenir la coordination fine dans une seule caméra RGB par agent.

RecherchePaper
1 source
Bridge-WA : prédire où et comment le monde change pour l'action robotique
1603arXiv cs.RO 

Bridge-WA : prédire où et comment le monde change pour l'action robotique

Une équipe de chercheurs présente Bridge-WA, un nouveau framework "world-action" léger destiné aux modèles de manipulation robotique vision-langage-action (VLA), décrit dans un article publié sur arXiv (2607.02195v1) début juillet. Plutôt que de s'appuyer sur de lourds modèles génératifs du monde ou des séquences denses d'images futures pour anticiper les changements de scène, coûteux en calcul et souvent focalisés sur des détails visuels peu utiles au contrôle, Bridge-WA distille un "teacher" figé de prédiction des changements futurs en trois représentations compactes : des tokens de résultat visé, des cartes de changement pour identifier les zones d'intervention, et des cartes de flux de mouvement pour la direction locale des transitions. Un module appelé WorldBridge conditionne ensuite le transformer d'action sur ces trois priors via des mémoires d'attention multi-sources et des biais spatio-temporels, tandis que le modèle enseignant est retiré au moment de l'inférence. Les auteurs évaluent leur approche sur les benchmarks VLABench, RoboTwin2.0 et LIBERO-Plus, ainsi que sur des tests en robot réel, avec des gains en taux de réussite, en progression de tâche et en robustesse, particulièrement marqués face à des variations visuelles hors distribution. L'intérêt pour l'industrie robotique tient à la promesse d'un compromis efficacité-robustesse : obtenir les bénéfices d'un raisonnement sur l'évolution future de la scène sans payer le coût de génération d'images denses au déploiement, un frein connu pour l'intégration temps réel des modèles VLA. En filtrant les facteurs de nuisance comme le fond, l'éclairage ou les distracteurs pour se concentrer sur où et comment la scène va changer, l'approche s'attaque directement à l'écart généralisation/robustesse qui limite souvent le passage de la démonstration en labo au déploiement industriel. Le travail s'inscrit dans la lignée des modèles VLA à grande échelle qui cherchent à coupler perception, langage et action, un axe de recherche actif depuis l'essor de modèles génériques de manipulation. Comme il s'agit ici de résultats de recherche publiés par les auteurs eux-mêmes sur leurs propres benchmarks, sans déploiement industriel ni validation tierce à ce stade, la prudence reste de mise sur la portée réelle des gains annoncés. Le code et des visualisations sont mis à disposition sur le site du projet, ouvrant la voie à une reproduction indépendante des résultats.

IA physiqueActu
1 source
Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP
1604arXiv cs.RO 

Modélisation de représentations volumétriques pour l'apprentissage de politiques de manipulation : VolumeDP

Une équipe de recherche présente VolumeDP, une nouvelle architecture pour l'apprentissage par imitation en robotique manipulatrice, décrite dans une version révisée d'un article arXiv (2603.17720v2). Le problème visé est concret : la plupart des méthodes actuelles font correspondre directement des observations d'images 2D à des sorties d'action 3D, un décalage géométrique qui nuit au raisonnement spatial et fragilise la robustesse des politiques apprises. VolumeDP corrige ce défaut en raisonnant explicitement en trois dimensions : les features issues des images sont d'abord projetées dans une représentation volumétrique via un mécanisme d'attention croisée, puis un module apprenable sélectionne les voxels pertinents pour la tâche et les convertit en un ensemble compact de tokens spatiaux, ce qui réduit fortement le calcul sans perdre la géométrie utile à l'action. Un décodeur multi-tokens exploite ensuite l'ensemble de ces tokens pour prédire les actions, évitant l'agrégation destructrice qui réduit plusieurs indices spatiaux à un seul descripteur. Résultat chiffré : 88,8% de taux de réussite moyen sur le benchmark de simulation LIBERO, soit 14,8 points de mieux que la meilleure méthode concurrente, avec des gains également marqués sur ManiSkill et LIBERO-Plus. Des essais en conditions réelles confirment la généralisation à de nouvelles dispositions spatiales, de nouveaux points de vue caméra et de nouveaux environnements. Pour les équipes qui développent des politiques de manipulation robotique, ce travail illustre une limite structurelle des architectures VLA qui traitent la 3D comme un simple sous-produit d'un flux d'images : sans représentation spatiale explicite, la robustesse aux changements de caméra ou de décor s'effondre, un problème récurrent dès qu'on sort du laboratoire. VolumeDP montre qu'ajouter un raisonnement volumétrique explicite, plutôt que de compter uniquement sur l'échelle des données ou du modèle, améliore sensiblement la généralisation, ce qui nuance l'idée reçue selon laquelle scaler les VLA suffirait à résoudre le problème spatial. Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation ayant précédemment tenté d'intégrer une composante 3D, comme les approches de type Diffusion Policy en 3D, mais en visant une représentation volumétrique plus efficiente en calcul. Il s'agit à ce stade d'une contribution académique, publiée sur arXiv avec code et vidéos disponibles sur une page projet dédiée, et non d'un produit ou d'un système déployé commercialement. Les benchmarks utilisés (LIBERO, ManiSkill) restent des environnements de recherche standard, ce qui laissera aux prochaines étapes le soin de confirmer la tenue de ces résultats sur des tâches industrielles plus complexes.

RecherchePaper
1 source
Domain Arithmetic : adaptation VLA en un essai face aux changements environnementaux
1605arXiv cs.RO 

Domain Arithmetic : adaptation VLA en un essai face aux changements environnementaux

Des chercheurs du SNU MPR Lab (Seoul National University) publient sur arXiv (arXiv:2607.00666v1) une méthode baptisée DART, pour Domain ARiThmetic, qui permet d'adapter un modèle Vision-Language-Action (VLA) à un nouvel environnement à partir d'une seule démonstration, contre plusieurs dizaines habituellement nécessaires. Le problème visé est concret : un modèle VLA entraîné sur un bras Panda avec une caméra à un angle donné échoue souvent dès que la caméra bouge ou que le robot change, par exemple pour un UR5e. DART traite ce décalage comme un problème d'arithmétique de vecteurs de poids, en isolant l'information spécifique au nouveau domaine et en l'ajoutant au modèle d'origine, grâce à un alignement de sous-espaces entre composantes singulières qui filtre le bruit. Les auteurs rapportent de meilleures performances que les méthodes d'adaptation VLA existantes, en simulation comme sur des essais réels, avec du code publié sur GitHub (snumprlab/dart). Pour les intégrateurs et les équipes robotique, l'enjeu dépasse l'exercice académique : le coût de collecte de démonstrations reste l'un des principaux freins au déploiement des politiques VLA hors laboratoire, chaque cellule de production ayant sa propre configuration de caméra, son propre bras et ses propres contraintes. Réduire ce besoin à une seule démonstration attaquerait directement le goulot d'étranglement qui empêche les modèles comme Pi-0, GR00T N2 ou Helix de passer de la démo contrôlée au déploiement multi-site sans réentraînement coûteux à chaque nouvelle installation. DART s'inscrit dans la lignée des travaux sur l'arithmétique de tâches appliquée initialement aux grands modèles de langage, transposée ici aux modèles de fondation robotiques. Le champ de l'adaptation VLA reste actif et concurrentiel, porté par Physical Intelligence, Nvidia ou Figure sur leurs propres architectures. À ce stade, DART demeure une contribution académique validée par ses seuls auteurs, sans acteur français ou européen impliqué ; sa généralisation à d'autres paires de robots et à des VLA tiers reste à démontrer avant toute adoption industrielle.

RechercheActu
1 source
Robustesse de la manipulation robotique : fondations et perspectives
1606arXiv cs.RO 

Robustesse de la manipulation robotique : fondations et perspectives

Résumé pour l'article "Robustness of Robotic Manipulation: Foundations and Frontiers" : Une équipe de chercheurs publie sur arXiv une étude systématique consacrée à la robustesse de la manipulation robotique, un chantier resté jusqu'ici fragmenté entre sous-domaines qui n'utilisaient pas les mêmes définitions. Les auteurs proposent d'abord une définition formelle : la robustesse mesure la capacité d'un système de manipulation à atteindre son objectif malgré l'incertitude et la variation des conditions. Ils en dérivent ensuite deux formulations générales, l'une probabiliste, l'autre issue de la théorie du contrôle, avant de cartographier les mécanismes concrets qui produisent de la robustesse à chaque étage de la pile robotique : perception, planification, contrôle, apprentissage de politiques (policy learning) et conception matérielle. Chaque mécanisme est illustré par des travaux de référence, des fondations historiques aux publications récentes. Le papier revient aussi sur les métriques et protocoles d'évaluation existants, souvent hétérogènes, et se conclut par une liste de problèmes ouverts vers une robustesse comparable à celle des humains. L'enjeu dépasse l'exercice académique. Depuis deux ans, une génération de modèles VLA (vision-language-action) comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure ou Optimus de Tesla revendique des capacités de manipulation généralistes, mais les annonces s'appuient sur des démonstrations et des métriques propres à chaque acteur, difficiles à comparer entre elles. Pour les intégrateurs et décideurs B2B qui doivent choisir une solution pour de la logistique ou de l'assemblage, disposer d'un cadre commun pour distinguer un modèle réellement robuste d'une démonstration soigneusement sélectionnée devient central, surtout face à l'écart bien documenté entre performance en vidéo et performance en déploiement réel. Cette synthèse s'inscrit dans une lignée qui remonte au contrôle robuste classique des années 1980-1990, avant que l'apprentissage par renforcement puis les politiques end-to-end n'ouvrent de nouvelles pistes dans les années 2010-2020, jusqu'au boom actuel des modèles fondation pour la robotique portés par des laboratoires comme Physical Intelligence, Nvidia, Google DeepMind ou Figure. En posant un vocabulaire et des critères communs, les auteurs cherchent moins à trancher un débat qu'à donner aux chercheurs et industriels un langage partagé pour comparer leurs approches, une étape jugée nécessaire avant toute standardisation sectorielle des tests de robustesse.

RecherchePaper
1 source
TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM
1607arXiv cs.RO 

TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM

Une équipe de chercheurs publie TacEvo (arXiv:2606.30109), un framework de découverte autonome d'architectures neuronales pour la perception tactile robotique. Les capteurs tactiles visuels comme le ViTacTip convertissent les déformations de surface en images pour inférer des forces de contact et des textures fines inaccessibles à la vision conventionnelle, mais les architectures réseau efficaces restent hautement spécifiques au capteur et à la physique du contact, imposant une itération manuelle intensive par des experts. TacEvo utilise un LLM pour générer des mutations et croisements au niveau du code, couplé à une boucle MAP-Elites (algorithme de qualité-diversité) qui maintient une population d'architectures élites diversifiées tout en privilégiant les prompts ayant produit les meilleures améliorations. Deux descripteurs comportementaux guident l'exploration : Architectural Diversity et Efficiency Ratio. Sur le ViTacTip, en régression de force et classification de réseaux de rainures, TacEvo atteint un taux de génération d'architectures entraînables de 96,0 % et 94,5 %, et améliore la fitness de validation de 56,1 % et 96,1 % sur 20 générations. Dans une évaluation haute-fidélité à 20 seeds, le framework atteint la parité avec la baseline expert en prédiction de force et la surpasse en classification fine de textures. Le résultat le plus significatif est la fiabilité de la génération autonome à plus de 94 %, prérequis non trivial pour industrialiser l'approche. Pour les équipes R&D travaillant sur des capteurs tactiles propriétaires comme Digit, GelSight ou XELA, la promesse est d'automatiser la phase d'exploration architecturale sans définir à l'avance un espace de recherche restreint, là où les NAS classiques comme DARTS ou ENAS restent contraints par leurs primitives prédéfinies. TacEvo s'inscrit dans un courant de NAS guidé par LLM initié notamment par FunSearch (DeepMind) et EvoPrompting, qui cherche à remplacer les espaces de recherche hand-crafted par une exploration ouverte au niveau du code. Le capteur ViTacTip utilisé comme banc d'essai est développé à l'Université de Bristol, acteur académique européen central sur la tactilité robotique. L'article est un preprint non encore soumis à peer-review, et les résultats restent à confirmer sur des capteurs et tâches variés ; les prochaines étapes naturelles seraient un benchmark multi-capteurs et une intégration dans des pipelines de manipulation dextre.

UELes équipes R&D européennes spécialisées en capteurs tactiles pourraient bénéficier du framework TacEvo pour automatiser l'exploration architecturale, le capteur de référence ViTacTip étant développé à l'Université de Bristol (UK).

RecherchePaper
1 source
AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets
1608arXiv cs.RO 

AeroPlace-Flow : placement d'objets guidé par le langage pour manipulateurs aériens via prévision visuelle et flux d'objets

Des chercheurs ont publié sur arXiv (arXiv:2603.07744) AeroPlace-Flow, un framework de placement d'objets par langage naturel pour manipulateurs aériens, des drones équipés de bras robotiques. Le système prend en entrée des observations RGB-D de l'objet saisi et de la scène cible, ainsi qu'une instruction en langue naturelle, pour produire une trajectoire de placement exécutable sans coordonnées prédéfinies. Concrètement, AeroPlace-Flow génère d'abord une image objectif synthétique ("goal image") via un modèle d'édition d'images qui visualise la configuration finale souhaitée, puis ancre cette image dans l'espace métrique 3D par alignement de profondeur et raisonnement centré sur l'objet. Il en déduit un "object flow", un champ de déplacement 3D tenant compte des collisions, qui guide le manipulateur vers une pose de pose cohérente avec l'instruction et les contraintes de contact. Les expériences menées en simulation et en conditions réelles affichent un taux de succès moyen de 75% sur plateforme matérielle, sur des scénarios de placement variés. L'intérêt principal de cette approche réside dans son caractère "training-free" : contrairement aux pipelines classiques de manipulation aérienne qui nécessitent soit des coordonnées cibles codées en dur, soit un entraînement spécifique à chaque tâche, AeroPlace-Flow ne requiert aucune donnée d'apprentissage dédiée au placement. Pour un intégrateur ou un OEM développant des drones industriels à capacité de manipulation, cela réduit considérablement le coût de mise en service sur de nouveaux environnements. La combinaison de la prévoyance visuelle (foresight) et du raisonnement géométrique explicite représente également une alternative aux architectures VLA (Vision-Language-Action) entièrement end-to-end, dont le transfert sim-to-real reste problématique à grande échelle. La manipulation aérienne reste un domaine de recherche émergent, largement dominé par les travaux sur la saisie (grasping) et le contrôle en vol, le placement précis d'objets étant jusqu'ici peu étudié dans ce contexte. Des acteurs comme Aeroarms, LAAS-CNRS ou des équipes de ETH Zurich travaillent sur des architectures concurrentes, généralement contraintes à des poses cibles explicites. AeroPlace-Flow se positionne comme une couche de raisonnement sémantique au-dessus des pipelines de contrôle existants, compatibles avec un suivi de trajectoire standard. Il s'agit à ce stade d'un résultat de recherche avec validation expérimentale, sans déploiement industriel annoncé ni partenaire commercial identifié.

UEDes équipes européennes actives sur la manipulation aérienne, notamment LAAS-CNRS en France, pourraient s'appuyer sur cette approche sans entraînement pour accélérer leurs propres travaux sur le placement sémantique d'objets par drone.

IA physiquePaper
1 source
CSAR : architecture système conteneurisée pour la robotique
1609arXiv cs.RO 

CSAR : architecture système conteneurisée pour la robotique

Des chercheurs ont publié en juin 2026 CSAR (Containerized System Architecture for Robotics), un cadre architectural décrit dans un preprint arXiv (identifiant 2606.30293). L'architecture s'appuie sur la conteneurisation système via LXC/LXD, la communication inter-processus ROS 2/DDS, et une infrastructure edge organisée en trois couches : Infrastructure Core, Platform and Multi-User Orchestration, et Compute and Acceleration. Ces couches visent à créer des environnements d'exécution persistants et "hardware-affines", découplés des charges expérimentales volatiles. CSAR a été déployé et évalué dans un laboratoire de robotique académique à travers deux cas d'usage représentatifs : du SLAM 3D déporté sur serveur edge et de la cartographie sémantique accélérée par GPU. Les templates de déploiement, fichiers de configuration et documentation sont publiés en open source sur GitHub (goyoambrosio/CSAR). L'intégration logicielle en robotique distribuée souffre depuis des années de frictions récurrentes : isolation des dépendances défaillante, incompatibilités entre environnements embarqués et cloud, partage inefficace des GPU dans les équipes multi-utilisateurs. CSAR apporte une réponse structurée en séparant explicitement les couches d'infrastructure stables des workloads expérimentaux. Selon les auteurs, les résultats observés incluent une meilleure utilisation des ressources partagées, une intégration logicielle simplifiée et un prototypage plus sûr. Pour un intégrateur ou un responsable R&D, l'enjeu est concret : réduire le phénomène "works on my machine" et raccourcir le cycle test-déploiement sur des architectures edge hétérogènes, un problème chronique dans les labo multi-robots ou multi-chercheurs. L'adoption de Docker et Kubernetes en robotique s'est faite de manière ad hoc, sans tenir compte des contraintes spécifiques du secteur : latence temps-réel, accès direct au matériel (GPU, capteurs), et partage de ressources entre utilisateurs concurrents. CSAR s'inscrit dans un courant de travaux "devops for robotics" qui inclut AWS RoboMaker, les environnements CI Gazebo, ou encore des projets académiques sur la robotics cloud infrastructure. Il faut noter que CSAR reste pour l'instant une contribution de recherche avec un déploiement en labo académique, sans adoption industrielle annoncée. Les suites naturelles seraient une validation à plus grande échelle, sur des architectures multi-sites, ou une intégration dans des pipelines de déploiement de flottes robotiques réelles.

InfrastructureOpinion
1 source
PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching
1610arXiv cs.RO 

PAMAE : mélange d'experts d'action sensible aux phases pour des politiques VLA fiables par flow matching

Des chercheurs ont publié le 27 juin 2026 sur arXiv (2606.27144) un module baptisé PAMAE (Phase-Aware Mixture-of-Experts Action Experts), conçu pour améliorer la fiabilité des politiques d'action dans les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique multi-étapes. Le principe est simple : remplacer l'expert d'action unique partagé des architectures VLA à flow-matching par un mélange sparse d'experts spécialisés, sans toucher au backbone VLA pré-entraîné. Un routeur "phase-aware" oriente dynamiquement la génération d'actions vers l'expert approprié selon la phase d'exécution en cours, grâce à une tête de prédiction de phase légère et un objectif d'alignement de routage. L'entraînement se déroule en deux temps : d'abord un échauffement standard sous la loss de flow-matching, puis une optimisation du routage phase-cohérent sous supervision auxiliaire. Sur des benchmarks de simulation de manipulation multi-étapes, PAMAE affiche jusqu'à 9,2 % de gain en taux de succès par rapport à des baselines VLA solides. Ce résultat est notable parce qu'il s'attaque à un goulot d'étranglement concret des VLA à flow-matching : la tendance à lisser les comportements de contrôle à travers toutes les phases d'exécution avec un seul expert, ce qui nuit aux transitions critiques (saisie, repositionnement, insertion). L'approche "plug-and-play" est stratégiquement importante pour les intégrateurs -- elle évite le coût d'un réentraînement complet du backbone et reste compatible avec des fondations VLA existantes comme Pi-0 ou OpenVLA. Le gain de 9,2 % en simulation est mesuré sur des tâches multi-étapes, là où les architectures à expert unique échouent le plus souvent, ce qui rend la comparaison pertinente. Cela dit, la validation reste exclusivement en simulation, et le transfert sim-to-real n'est pas encore démontré : le "reality gap" demeure le vrai test pour ce type d'amélioration. Les VLA à flow-matching sont apparus comme une alternative aux politiques de diffusion classiques (Diffusion Policy, ACT) en combinant ancrage multimodal fort et généralisation, notamment via des modèles comme Pi-0 de Physical Intelligence ou les travaux de OpenVLA. L'idée des Mixture-of-Experts (MoE) pour les politiques de robot n'est pas nouvelle -- elle est empruntée au monde des LLMs (Mixtral, Switch Transformer) -- mais son application phase-conditioned dans un pipeline VLA end-to-end constitue une contribution originale. Côté concurrents, des approches comme HiRT, RoboVLMs ou les travaux de DeepMind sur RT-2 et ses successeurs explorent des trajectoires similaires pour améliorer la robustesse sur les tâches longues. La prochaine étape naturelle pour PAMAE serait une évaluation sur robot réel (plateforme Franka, UR5 ou bras humanoïde) et une comparaison directe avec des politiques récentes comme Pi-0.5 ou GR00T N2 de NVIDIA, dont les résultats terrain commencent à circuler.

RechercheOpinion
1 source
RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes
1611arXiv cs.RO 

RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes

Des chercheurs ont déposé en juin 2026 sur arXiv (référence 2606.27036) RelAfford6D, un framework sans entraînement pour la manipulation robotique d'objets articulés. Le système s'appuie sur un graphe d'affordances 6D relationnel : à partir d'une consigne en langage naturel, il déduit une topologie sémantique reliant la partie principale d'interaction d'un objet à son ancre physique. Ces noeuds topologiques sont ensuite convertis en poses métriques précises dans l'espace SE(3), soit six degrés de liberté complets en position et orientation, via des modèles de vision fondamentaux pré-entraînés. L'exécution est formulée comme un problème de satisfaction de contraintes cinématiques : le robot génère des trajectoires continues en suivant des variétés physiques strictement définies, qu'il s'agisse d'orbites rotoïdes (rotation) ou prismatiques (translation). Un mécanisme de suivi en boucle fermée assure la replanification en temps réel face aux perturbations. L'approche tranche avec la majorité des politiques data-driven actuelles, comme les VLA basés sur l'imitation ou les méthodes à affordances latentes, qui extraient des points de contact isolés sans contraintes cinématiques explicites. En formulant la manipulation comme satisfaction de contraintes, RelAfford6D obtient des taux de succès zero-shot supérieurs aux baselines data-driven testées, avec une généralisation inter-catégories documentée sur des objets articulés variés (tiroirs, portes, manettes) aussi bien en simulation que dans des environnements physiques réels. Pour les intégrateurs industriels, l'absence d'entraînement spécifique à la tâche est significative : le framework peut s'adapter à de nouveaux mécanismes sans collecter de données de démonstration supplémentaires. La manipulation d'objets articulés en open-world reste l'un des verrous majeurs de la robotique de service et industrielle. Les approches récentes à base de VLA ont progressé sur la flexibilité sémantique mais peinent à garantir la précision géométrique requise pour des mécanismes contraints comme des vannes, portes ou tiroirs industriels. RelAfford6D s'inscrit dans une tendance émergente combinant fondations visuelles pré-entraînées et raisonnement géométrique analytique, sans fine-tuning coûteux. Parmi les travaux concurrents figurent CabiNet, les méthodes à affordance implicite comme GNFactor ou F3RM, et les approches VLA récentes telles que Pi-0. Ce preprint constitue une démonstration académique validée sur banc réel, sans partenariat industriel ni timeline de déploiement annoncé à ce stade.

RecherchePaper
1 source
RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique
1612arXiv cs.RO 

RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique

Des chercheurs ont publié sur arXiv (identifiant 2510.09036, seconde version) RoDyn, un modèle de monde 2.5D destiné à la manipulation robotique. L'architecture repose sur un espace latent géométriquement conscient plutôt que sur des flux vidéo 2D bruts. Son composant central, le Robot-Dynamic Tokenizer, couple les représentations visuelles sémantiques avec des informations spatiales et centrées sur l'agent via un mécanisme de cross-attention dominé par le canal RGB, complété d'un guidage par masque dynamique. Une architecture autorégressi guidée par ces masques oriente ensuite le modèle vers les zones d'interaction active entre le robot et les objets manipulés. Sur des jeux de données à grande échelle, RoDyn atteint l'état de l'art en fidélité de génération et affiche, point le plus saillant, une amélioration de 42% du taux de réussite en imitation learning dans le monde réel par rapport aux baselines purement 2D. Ce gain de 42% doit être lu avec soin: il est mesuré contre des modèles 2D, non contre d'autres approches 2.5D ou 3D, ce qui circonscrit la portée de la comparaison. Il illustre néanmoins un problème structurel bien documenté: les modèles vidéo 2D, aussi convaincants visuellement, ne capturent pas la géométrie ni la cinématique indispensables aux interactions physiques précises. En introduisant une représentation intermédiaire 2.5D, soit une profondeur estimée sans reconstruction 3D complète et coûteuse, RoDyn tente de combler ce fossé à moindre coût computationnel. Pour les équipes R&D en manipulation industrielle, l'intérêt concret réside dans l'accélération du reinforcement learning model-based (MBRL), qui réduit potentiellement le nombre d'interactions physiques requises à l'entraînement, et dans une meilleure généralisation aux objets non vus en simulation. Le champ des modèles de monde pour la robotique s'est densifié depuis 2023, porté par Dreamer (DeepMind), UniSim, et plus récemment les architectures VLA comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). RoDyn occupe une niche spécifique: la simulation neuronale pour la manipulation de précision, avec un compromis géométrique explicite entre vidéo pure et reconstruction 3D complète. Cette publication reste à ce stade purement académique, sans annonce de déploiement commercial ni partenariat industriel mentionné. Les suites naturelles concerneront des tâches de manipulation plus exigeantes (assemblage fin, dépose contrainte) et une éventuelle intégration dans des pipelines VLA existants. Aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
ARTOO-DARTU : étude de la collaboration humain-robot en réalité augmentée avec atténuation des occlusions pour les tâches d'entrepôt
1613arXiv cs.RO 

ARTOO-DARTU : étude de la collaboration humain-robot en réalité augmentée avec atténuation des occlusions pour les tâches d'entrepôt

Des chercheurs ont publié sur arXiv (arXiv:2606.25202) un système de réalité augmentée baptisé ARTOO-DARTU, conçu pour améliorer la collaboration humain-robot (HRC) en entrepôt logistique. Le principe : superposer en temps réel des informations sur l'état et les intentions du robot directement dans le champ de vision de l'opérateur via un casque AR, tout en évitant que ces couches graphiques n'occultent des éléments critiques du monde réel. L'équipe a développé pour cela un pipeline ODM (Obstruction Detection and Mitigation) qui repositionne dynamiquement les éléments AR lorsque le robot mobile se déplace. L'évaluation a mobilisé 34 participants sur un scénario gamifié appelé Pocket MonstARs, abstraction contrôlée d'une tâche de picking en entrepôt où des monstres virtuels servent de proxies pour les cibles de prélèvement, tandis que des boîtes étiquetées préservent les contraintes d'identification du monde réel. Résultats : avec l'ODM actif, les participants ont affiché une efficacité globale supérieure de 46 % sur la tâche HRC, et se sont révélés 61 % plus rapides sur les sous-tâches nécessitant une visibilité directe du terrain. Ces chiffres méritent d'être mis en perspective : le gain de 46 % n'est observé que lorsque le pipeline ODM est enclenché, ce qui indique que l'AR sans gestion des obstructions peut dégrader les performances plutôt que les améliorer. Pour les intégrateurs logistiques et les équipes de déploiement d'AMR (autonomous mobile robots), le message est structurant : la valeur des analytics AR situationnels est conditionnelle à la qualité de leur intégration perceptuelle, pas seulement à la richesse des données affichées. Cela valide l'hypothèse que le sim-to-real gap en HRC n'est pas uniquement mécanique, mais aussi cognitif : l'interface compte autant que le robot. Le domaine de l'AR appliquée à la robotique industrielle reste fragmenté. Des travaux antérieurs ont exploré les overlays statiques ou les interfaces sur tablette, mais peu traitent le cas dynamique des robots mobiles où la position de l'annotation change en continu. ARTOO-DARTU s'inscrit dans un effort plus large pour rendre les floors robotisés auditable et sûrs sans mobiliser des opérateurs hautement qualifiés. Côté concurrentiel, des acteurs comme RealWear (casques AR industriels), PTC Vuforia ou encore des startups françaises comme Immersion se positionnent sur des segments adjacents. L'étude reste cependant dans un cadre académique contrôlé et gamifié : aucun déploiement réel en entrepôt n'est annoncé à ce stade, et la robustesse de l'ODM face à des environnements industriels bruités (éclairage variable, occlusions dynamiques multiples) reste à démontrer.

UELa startup française Immersion opère sur un segment adjacent à l'AR industrielle, mais l'étude reste un préprint académique sans déploiement annoncé en France ou en Europe.

RecherchePaper
1 source
ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles
1614arXiv cs.RO 

ReaDy-Go : simulation dynamique réel-vers-sim par Gaussian Splatting 3D pour la navigation visuelle avec obstacles mobiles

Des chercheurs présentent dans un preprint arXiv (référence 2602.11575, troisième version) un pipeline baptisé ReaDy-Go qui vise à combler l'écart simulation-réalité pour la navigation visuelle robotique en environnements dynamiques. Le principe : reconstruire une scène réelle cible (domicile, restaurant, usine) sous forme de nuage de gaussiennes 3D (Gaussian Splatting, ou GS), puis y insérer des avatars humains animables, eux aussi représentés en GS photoreáliste, dont les mouvements sont synthétisés à partir de trajectoires 2D. Un planificateur expert dédié aux représentations GS dynamiques, couplé à un planificateur humain, génère ensuite automatiquement des milliers de scénarios de navigation depuis des points de vue arbitraires. Les politiques de navigation entraînées sur ces datasets sont ensuite déployées sur robot physique. Les auteurs rapportent des gains de performance en simulation et en conditions réelles face à des obstacles mobiles, ainsi qu'un transfert zero-shot dans un environnement inédit, ce qui suggère une capacité de généralisation au-delà des scènes d'entraînement. L'enjeu industriel est significatif pour les intégrateurs de robots de service et les concepteurs de systèmes AMR (autonomous mobile robots) en environnements non contrôlés. Le verrou principal que ReaDy-Go cherche à lever est double : les méthodes classiques souffrent d'un sim-to-real gap important parce que les scènes d'entraînement sont génériques, et les obstacles dynamiques y sont soit absents, soit représentés par des mannequins non photoréalistes issus de simulateurs comme Isaac Sim ou Gazebo. En ancrant la simulation dans une reconstruction GS de l'environnement cible réel et en peuplant cette scène d'avatars humains photoréalistes et cinématiquement plausibles, l'approche réduit la distance de distribution entre entraînement et déploiement. Il s'agit d'une contribution méthodologique, pas d'un produit commercialisé ; les résultats restent à ce stade des démonstrations académiques, et les métriques annoncées (temps de cycle, taux de succès) gagneraient à être contextualisées par des conditions de test plus variées. Le Gaussian Splatting a émergé comme technique de reconstruction 3D rapide et photoréaliste depuis les travaux de Kerbl et al. en 2023, et plusieurs groupes l'ont depuis exploré pour la simulation robotique, notamment pour la manipulation (voir les travaux de RoboGSim ou GaussianWorld). ReaDy-Go se distingue en ciblant la navigation en présence de piétons, un cas d'usage critique pour les robots de livraison indoor et les plateformes de service en espace public. Sur ce segment, les concurrents directs incluent les pipelines basés sur NeRF (plus lents à l'entraînement), les simulateurs procéduraux type NVIDIA Omniverse, et des approches comme UniSim ou HabitatSim. Aucun acteur européen n'est cité dans le preprint, mais des équipes comme Enchanted Tools (robotique de service, France) ou les labos de navigation de l'INRIA pourraient trouver dans ReaDy-Go une brique de simulation réutilisable. La page projet est accessible et le code pourrait être publié ; les prochaines étapes naturelles seraient des tests à plus grande échelle avec diversité de populations et d'environnements, et une intégration dans des stacks de navigation open-source comme Nav2.

UECette méthode de simulation photoréaliste à base de Gaussian Splatting pourrait être réutilisée par des équipes européennes de navigation robotique (INRIA, Enchanted Tools) pour réduire le sim-to-real gap sans dépendre de simulateurs propriétaires comme Isaac Sim ou NVIDIA Omniverse.

RecherchePaper
1 source
Reflective VLA : les conséquences d'actions en contexte améliorent la généralisation des modèles VLA
1615arXiv cs.RO 

Reflective VLA : les conséquences d'actions en contexte améliorent la généralisation des modèles VLA

Des chercheurs ont publié le 25 juin 2026 sur arXiv (réf. 2606.25215) une architecture baptisée Reflective VLA, conçue pour améliorer la généralisation des modèles de type vision-language-action (VLA) en dehors de leurs environnements d'entraînement. Contrairement aux politiques dites "réactives" qui prédisent l'action suivante à partir de la seule observation courante, Reflective VLA conditionne chaque décision sur un contexte de triplets observation-action-conséquence: le modèle enregistre non seulement ce que le robot a vu et exécuté, mais aussi comment la scène a changé après chaque action. Architecturalement, toutes les modalités perceptives passent par le modèle de langage visuel (VLM) sous attention partagée, tandis qu'un masque de causalité par blocs permet l'entraînement parallèle sur plusieurs frames sans fuite d'information et supporte une inférence temps réel avec cache KV. Sur les benchmarks standards LIBERO et SimplerEnv-Bridge, le modèle maintient les performances en distribution. Sous distribution shift, sur LIBERO-Plus et la variante plus difficile LIBERO-Plus-Hard, il améliore le taux de succès moyen respectivement de 5,4 et 4,2 points de pourcentage face à une baseline réactive appariée. Ces gains, modestes en valeur absolue mais obtenus dans des conditions de transfert réel, adressent un verrou central de la robotique embarquée: les facteurs spécifiques à chaque déploiement (calibration robot, biais d'actuation, géométrie caméra-robot) sont difficiles à inférer d'une observation unique. En exposant la cartographie actions-effets propre à chaque environnement, l'approche réduit l'overfitting aux conditions d'entraînement sans modifier la structure générale du modèle. Chose importante, les ablations montrent que c'est le signal de conséquence, et non la simple augmentation du contexte historique, qui est responsable du gain de généralisation, résultat qui contredit l'hypothèse selon laquelle "plus de contexte suffit". Les VLA réactifs, popularisés par des travaux comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 (Physical Intelligence), souffrent depuis leurs débuts de ce gap sim-to-real et de dégradation hors distribution. Reflective VLA s'inscrit dans une tendance émergente qui cherche à doter les politiques robotiques d'une forme de boucle de feedback interne, proche du concept de "réflexion" en LLM. Les concurrents directs incluent des approches à mémoire épisodique ou à correction en ligne (comme RoboDreamer ou ACT avec buffer de contexte). L'article reste une contribution académique sans annonce de déploiement industriel ni partenaire commercial déclaré; les prochaines étapes naturelles seraient une validation sur matériel réel à grande échelle et l'intégration dans des pipelines de fine-tuning continu sur robots déployés.

RechercheOpinion
1 source
Cadre de détection et reconnaissance des interactions humain-humain pour robots mobiles de service
1616arXiv cs.RO 

Cadre de détection et reconnaissance des interactions humain-humain pour robots mobiles de service

Des chercheurs ont publié sur arXiv (référence 2602.22346) un framework de perception sociale destiné aux robots de service mobiles autonomes, comme les robots tondeuses ou les robots nettoyeurs opérant dans des espaces fréquentés par des humains. Le système repose sur une architecture en deux étapes : une première phase identifie les paires d'individus susceptibles d'interagir en s'appuyant uniquement sur des indices géométriques et de mouvement (positions relatives, trajectoires, orientations corporelles), puis une seconde phase classe le type d'interaction à l'aide d'un réseau relationnel (relation network). L'approche a été évaluée sur le dataset JRDB, benchmark de référence pour la perception sociale en robotique, ainsi que sur le Collective Activity Dataset (CAD) et, en évaluation zero-shot, sur un jeu de données collecté directement par une tondeuse autonome en conditions réelles. L'enjeu est concret pour les intégrateurs de robots de service : détecter qu'un groupe de personnes interagit entre elles, qu'il s'agisse d'une discussion, d'un attroupement ou d'une interaction dynamique, permet au robot de planifier une trajectoire socialement acceptable sans interrompre ni gêner ces échanges. Les approches existantes reposent souvent sur des modèles de reconnaissance d'activité de groupe qui mobilisent des réseaux d'analyse visuelle coûteux en calcul, inadaptés aux plateformes embarquées à ressources limitées. Ce framework démontre que des indices géométriques simples suffisent à obtenir des performances compétitives tout en réduisant significativement la taille du modèle et le coût computationnel. Ce résultat remet en question l'hypothèse largement répandue selon laquelle l'analyse visuelle par apparence serait indispensable pour ce type de tâche de perception sociale. Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), où des frameworks comme SARL, CrowdNav ou ORCA constituent les références historiques. Le dataset JRDB, produit par Stanford, reste le principal benchmark pour ce type de tâche en environnement robotique réel. Le code est publié en open source, ce qui facilitera son intégration dans des pipelines ROS existants. La limite notable est que l'évaluation porte sur des interactions coarse-grained, c'est-à-dire des catégories comportementales larges plutôt que des gestes fins, ce qui suffit pour la navigation mais exclut les applications nécessitant une compréhension sociale plus granulaire. La prochaine étape naturelle serait une validation à plus grande échelle sur des plateformes réelles déployées en environnements semi-publics, comme des aéroports, des centres commerciaux ou des entrepôts à occupation mixte.

RecherchePaper
1 source
SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile
1617arXiv cs.RO 

SWAP : modèle du monde symétrique équivariant pour le parkour robotique agile

Des chercheurs ont publié sur arXiv le 19 juin 2026 un preprint décrivant SWAP (Symmetric World-model for Agile Parkour), un cadre d'apprentissage par renforcement pour la locomotion agile de robots quadrupèdes. L'approche couple un modèle du monde latent, qui permet des prédictions proactives sur le terrain à venir, avec un principe d'équivariance par symétrie gauche-droite intégré simultanément dans le modèle du monde et dans les réseaux acteur-critique. En tests réels, le robot associé au framework franchit un fossé de 2,13 mètres d'un saut et escalade une plateforme de 1,63 mètre. Les auteurs présentent ces résultats comme des records pour le parkour quadrupède, affirmation non encore validée de façon indépendante. Le système démontre également une généralisation robuste à des environnements extérieurs et à des terrains miroirs non vus lors de l'entraînement, sans ré-entraînement (zero-shot transfer). L'enjeu central est l'efficacité d'apprentissage. Les modèles du monde purement pilotés par les données encodent les interactions symétriques gauche-droite comme des patterns indépendants, gonflant inutilement la complexité d'apprentissage et empêchant la capture des régularités géométriques du terrain. En intégrant l'équivariance comme prior structurel, SWAP réduit cette redondance et rend l'espace latent plus compact pour la politique en aval. Pour les équipes de recherche appliquée, le résultat le plus notable reste le transfert zero-shot vers des terrains inédits : si confirmé sur d'autres plateformes matérielles, cela réduirait le besoin de données de fine-tuning spécifiques à chaque déploiement, un verrou important dans le sim-to-real actuel pour la locomotion agile. Le parkour quadrupède est devenu un benchmark de facto depuis les travaux d'ETH Zurich sur ANYmal et le papier Parkour Learning de 2023, suivis par Carnegie Mellon University, qui ont progressivement montré que des politiques entraînées en simulation pouvaient généraliser à des obstacles physiques complexes. L'usage de modèles du monde latents pour la locomotion reste une piste plus récente par rapport aux pipelines classiques de RL bout-en-bout, et SWAP se positionne à l'intersection de ces deux axes. Le preprint ne mentionne ni le nom précis du robot utilisé ni l'institution d'origine des auteurs, deux détails qui limiteront la reproductibilité jusqu'à la publication complète en conférence. Aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source
Allocation de tâches et planification du mouvement en environnements dynamiques encombrés via CBBA et graphes d'ensembles convexes
1618arXiv cs.RO 

Allocation de tâches et planification du mouvement en environnements dynamiques encombrés via CBBA et graphes d'ensembles convexes

Une équipe de chercheurs a publié sur arXiv (référence 2506.18516) un système de planification combinant deux algorithmes complémentaires pour coordonner des agents mobiles dans des environnements encombrés et dynamiques : le CBBA (Consensus-Based Bundle Algorithm) pour l'allocation distribuée des tâches, et les GCS (Graphs of Convex Sets) pour l'optimisation des trajectoires. L'approche repose sur un espace de configuration en 4D (3D spatial plus axe temporel), ce qui permet de modéliser simultanément la géométrie de l'environnement et le timing des rendez-vous mobiles. Les agents doivent non seulement se répartir les tâches, mais également estimer précisément quand et où ils pourront les atteindre, compte tenu des obstacles et des autres agents. Les résultats sont démontrés exclusivement en simulation, avec des scénarios incluant des tâches statiques et des objectifs de rendez-vous dynamiques. L'apport technique principal réside dans le couplage explicite entre allocation et planification, deux sous-problèmes généralement traités séparément dans la littérature sur les systèmes multi-robots. En pratique, la plupart des architectures industrielles de type AMR (Autonomous Mobile Robot) utilisent un planificateur de chemin découplé du système de dispatch, ce qui introduit des erreurs d'estimation temporelle et des conflits de ressources. En intégrant les GCS dans la boucle CBBA, le système produit des enchères basées sur des trajectoires réellement faisables plutôt que sur des heuristiques de distance euclidienne. Pour un intégrateur ou un décideur B2B, cela signifie potentiellement moins de recalculs coûteux en exécution et une meilleure fiabilité des estimations de temps de cycle dans des entrepôts ou ateliers denses. Il faut néanmoins noter que les GCS, bien que performants en optimisation convexe, restent computationnellement lourds à grande échelle, et que l'article ne fournit pas de données de timing comparatives. Les GCS ont été popularisés principalement par les travaux de Tobia Marcucci et Russ Tedrake au MIT via la librairie Drake, avec des applications initiales en manipulation et locomotion. Le CBBA est issu des travaux du MIT Lincoln Laboratory (Choi et al., 2009) et reste une référence en coordination décentralisée pour drones et robots terrestres. Cette combinaison s'inscrit dans un effort plus large pour combler le fossé entre planification géométrique et coordination multi-agent, un problème actif dans des labos comme Stanford ASL, CMU Robotics Institute, ou côté français l'INRIA et le LAAS-CNRS. Les prochaines étapes naturelles seraient une validation sur matériel réel, une évaluation de la scalabilité au-delà d'une dizaine d'agents, et une comparaison quantitative avec des approches basées sur MILP ou MAPF (Multi-Agent Path Finding).

UEL'INRIA et le LAAS-CNRS sont explicitement cités comme acteurs actifs sur cette problématique, positionnant la recherche française en bonne place pour contribuer ou collaborer autour de cette méthodologie de planification multi-agents.

RecherchePaper
1 source
GCNGrasp-VP : planification de vue guidée par les affordances pour une préhension efficace orientée tâche
1619arXiv cs.RO 

GCNGrasp-VP : planification de vue guidée par les affordances pour une préhension efficace orientée tâche

Une équipe de recherche publie ce mois-ci sur arXiv (référence 2606.19091) GCNGrasp-VP, un framework destiné à améliorer la saisie orientée tâche en robotique de manipulation, en particulier lorsque l'objet cible est partiellement masqué. Le système repose sur deux composants : GCNGrasp-v2, un modèle de préhension qui évalue simultanément la qualité d'une prise et prédit un champ d'affordance en temps constant, et Affordance-VP, un planificateur de points de vue qui utilise ce champ d'affordance comme métrique de gain d'information pour repositionner la caméra du robot vers les zones fonctionnellement pertinentes. Les auteurs rapportent une validation en environnement réel sur des scénarios mono-objet, avec une latence de calcul annoncée à l'échelle de la milliseconde et une correction de point de vue obtenue en un seul déplacement caméra. Le code et les modèles sont rendus publics sur GitHub. L'intérêt technique de cette approche réside dans la dissociation entre perception active et reconstruction de scène. Les méthodes existantes de view planning s'appuient généralement sur une reconstruction 3D complète avant de décider où observer, ce qui introduit une latence incompatible avec les contraintes de cycle industriel. GCNGrasp-VP contourne ce goulot en substituant la carte d'affordance à l'incertitude géométrique comme critère d'exploration, ce qui réduit le nombre d'ajustements nécessaires à un seul dans les tests publiés. Pour les intégrateurs travaillant sur des cellules de picking ou d'assemblage, c'est un angle pertinent : gérer les occlusions partielles sans recourir à un système de vision multi-caméras fixe ou à une reconstruction volumétrique coûteuse. Ce travail s'inscrit dans une tendance plus large vers les modèles de préhension sémantiquement informés, où la notion d'affordance, popularisée par des travaux comme GCNGrasp original et les approches VLA (Vision-Language-Action) de type pi-zero ou GR00T, commence à descendre au niveau de la planification perceptuelle. La contribution reste pour l'instant un preprint non peer-reviewed, validé sur des scénarios mono-objet en laboratoire. Les benchmarks sur des configurations multi-objets avec occlusions sévères, ou dans un contexte industriel réel, n'ont pas encore été publiés. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné.

💬 Ce qui est malin ici, c'est de remplacer la reconstruction 3D complète par une carte d'affordance pour guider la caméra. Un robot qui cherche à voir ce qu'il veut saisir plutôt que de tout reconstruire avant d'agir, c'est un vrai changement de logique dans la perception active, et ça ramène les ajustements caméra à un seul dans les tests. Bon, c'est un preprint sur scénarios mono-objet, donc on garde la tête froide.

IA physiquePaper
1 source
C-ARC : le clustering adaptatif continu pour capteurs LiDAR non répétitifs
1620arXiv cs.RO 

C-ARC : le clustering adaptatif continu pour capteurs LiDAR non répétitifs

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.18948) C-ARC, un framework open source de clustering de nuages de points conçu pour les LiDAR non répétitifs à prismes de Risley, tels que le Livox Mid-360 et le Livox Avia. Ces capteurs génèrent des trajectoires en courbes de Rhodonée avec des distributions de points non uniformes et sans cycle de rotation défini, rendant inopérant le clustering classique par scan lines développé pour les LiDAR mécaniques répétitifs. C-ARC, implémenté en C++17 single-threaded, produit une sortie de clustering en temps réel à 20 Hz sur matériel grand public, via un graphe dual persistant sur fenêtre glissante. Un mécanisme adaptatif de résolution de grille, calibré à l'initialisation par boucle de contrôle exponentielle, équilibre le compromis sparsité-collision sans connaissance préalable du patron de scan. Pour les équipes SLAM et de tracking multi-objet en robotique mobile, ce framework comble un manque concret : les LiDAR non répétitifs restaient hors scope des stacks de perception temps réel faute d'algorithme adapté. Le découplage insertion haute fréquence / récupération de clusters à la demande est critique pour limiter la latence dans les pipelines de cartographie et de suivi d'objets. Le mécanisme adaptatif améliore par ailleurs la qualité de clustering des méthodes à grille existantes sur données non répétitives, ce qui ouvre une voie d'intégration sans refonte complète du stack de perception. Les auteurs identifient explicitement une limitation : l'occupancy de cellule non bornée pose problème sur les capteurs à pattern de scan fortement concentré, cas du Livox Avia. Livox, filiale de DJI, domine le segment des LiDAR non répétitifs avec ses capteurs Mid-360 (couverture hémisphérique) et Avia, face aux solutions mécaniques traditionnelles de Velodyne, Ouster et Hesai. Leur attractivité tarifaire a favorisé leur adoption dans les AMR et robots de livraison, mais sans algorithme de clustering natif adapté à leurs spécificités optiques. C-ARC s'insère au niveau du preprocessing bas niveau, en amont des modules de détection et de SLAM. Les approches alternatives par deep learning offrent davantage de robustesse aux distributions irrégulières, mais restent généralement moins adaptées aux contraintes embarquées temps réel. Les auteurs indiquent une prochaine évaluation sur des datasets plus diversifiés et évoquent une extension multi-capteurs.

UELes équipes européennes de robotique mobile équipées de capteurs Livox (AMR, robots de livraison) peuvent intégrer ce framework open source pour combler un manque algorithmique dans leurs pipelines de perception temps réel.

RecherchePaper
1 source
Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité
1621arXiv cs.RO 

Commande prédictive par modèle basée sur MuJoCo via dérivées d'espaces affines : robustesse et efficacité

Des chercheurs ont publié sur arXiv (2512.21109v2) une méthode d'optimisation du contrôle prédictif par modèle (MPC) dans MuJoCo, le simulateur physique open source de DeepMind, largement utilisé en robotique. Le coeur de la contribution est l'intégration de WASP (Web of Affine Spaces), une approche de calcul de dérivées, comme remplacement direct de la différentiation finie (FD) dans la bibliothèque MJPC (MuJoCo MPC). Les expériences montrent un gain de vitesse allant jusqu'à 2x par rapport au backend FD lorsque WASP est couplé à des planificateurs basés sur les dérivées, notamment iLQG (iterative Linear-Quadratic-Gaussian). Les tests couvrent plusieurs morphologies de robots avec des systèmes à grand nombre de degrés de liberté (DOF), contexte dans lequel FD devient particulièrement coûteux. L'implémentation est publiée en open source et s'intègre sans modification d'architecture dans MJPC existant. L'enjeu est technique mais concret : la différentiation finie est historiquement le goulot d'étranglement du MPC en temps réel sur des systèmes complexes, car elle nécessite de nombreuses évaluations du simulateur pour estimer les gradients. WASP contourne ce problème en réutilisant les informations de calculs de dérivées précédents, ce qui est particulièrement adapté aux mises à jour itératives et incrémentales du MPC. En pratique, cela signifie qu'un contrôleur MPC peut fonctionner à des fréquences plus élevées ou sur des robots avec davantage de degrés de liberté sans augmenter le budget computationnel, un facteur déterminant pour le déploiement sur matériel réel. Les auteurs rapportent également que WASP surpasse les planificateurs stochastiques par échantillonnage de MJPC sur les tâches d'évaluation, en fiabilité et en efficacité, ce qui renforce l'argument en faveur des méthodes basées sur les gradients lorsque ceux-ci sont calculables de façon robuste. MJPC est l'implémentation de référence du MPC sur MuJoCo, et MuJoCo lui-même est devenu le simulateur standard dans la recherche en locomotion et manipulation depuis son acquisition par DeepMind en 2021 et son passage en open source. La différentiation finie y était utilisée faute de meilleures alternatives efficaces pour des simulateurs de contact. WASP a été introduit récemment comme méthode générique de calcul de dérivées approximées en séquence, et ce papier constitue sa première intégration documentée dans un framework MPC robotique établi. Les concurrents directs sur le terrain du MPC différentiable incluent des approches comme Dojo ou MJX (version JAX de MuJoCo permettant la différentiation automatique), mais WASP se positionne comme solution sans réécriture du simulateur sous-jacent. Les prochaines étapes probables sont l'évaluation sur du matériel réel et l'extension à des scènes de contact plus complexes, qui restent le cas limite critique pour tout simulateur physique.

RecherchePaper
1 source
Voir malgré l'occlusion : correction cinématique déterministe du bras pour la téléopération robotique
1622arXiv cs.RO 

Voir malgré l'occlusion : correction cinématique déterministe du bras pour la téléopération robotique

Des chercheurs ont publié sur arXiv (référence 2606.19240) une méthode baptisée AKC (Arm Kinematic Correction) pour corriger les erreurs de profondeur lors de la télé-opération de robots via une unique caméra RGB-D sans marqueurs. Le problème ciblé est l'auto-occlusion : quand un bras humain masque partiellement ses propres articulations, les estimations de profondeur se dégradent et le suivi de mouvement devient peu fiable. La méthode repose sur une contrainte géométrique simple, les longueurs de bras sont constantes, et applique le théorème de Pythagore pour reconstruire de manière déterministe la profondeur des articulations cachées à partir de la position du poignet et des longueurs d'avant-bras prédéfinies, sans modèle probabiliste ni ajustement de paramètres. La validation a été conduite contre un système Vicon sur des séquences statiques et dynamiques, mesurées par RMSE et corrélation de Pearson, avec une démonstration de télé-opération par mappage de mouvement en simulation et sur robot physique réel. L'intérêt opérationnel tient d'abord au coût d'entrée : une seule caméra RGB-D grand public remplace un rig Vicon à plusieurs milliers d'euros avec calibration lourde. Le caractère déterministe de l'AKC est un argument concret pour les intégrateurs : pas de phase d'entraînement, pas de poids à régler, pas de risque de mauvaise généralisation. Les résultats montrent que la méthode maintient la cohérence anatomique du squelette sous occultation sévère prolongée, même couplée à des filtres temporels peu robustes, ce qui correspond précisément aux conditions réelles de déploiement. Pour les équipes développant du learning from demonstration ou des interfaces homme-robot légères, c'est un signal que les pipelines bas coût commencent à atteindre un seuil de fiabilité exploitable en production. La télé-opération markerless est un terrain actif depuis que les robots humanoïdes et les bras manipulateurs apprenant par imitation ont pris de l'ampleur. Les approches concurrentes incluent les systèmes multi-caméras, les gants haptiques et les méthodes probabilistes comme les filtres particulaires, plus expressives mais coûteuses à calibrer. L'AKC se positionne comme une couche de correction légère, applicable par-dessus n'importe quel pipeline de pose estimation existant. Il s'agit d'un preprint académique sans partenariat industriel annoncé ; les suites naturelles seraient une intégration dans des frameworks comme ALOHA ou UMI, qui reposent précisément sur ce type de capture de mouvement à bas coût.

RecherchePaper
1 source
Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision
1623arXiv cs.RO 

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision

Des chercheurs ont publié le 23 juin 2026 une étude comparative systématique (arXiv:2606.18594) évaluant quatre types d'espaces d'action en apprentissage par renforcement (RL) pour la manipulation robotique visuelle : l'incrément de pose, la vitesse de pose, l'incrément de position articulaire, et la vitesse articulaire. Les politiques ont été entraînées en simulation puis déployées sur robot réel via transfert sim-to-réel, sur deux tâches benchmark : la saisie d'objet et la poussée d'objet. Résultat principal : l'espace d'action en vitesse articulaire (joint velocity) surpasse les trois autres alternatives, aussi bien en fluidité de mouvement qu'en performance finale sur les deux tâches testées. Ce résultat a une portée pratique directe pour les ingénieurs qui conçoivent des systèmes de manipulation autonome. Le choix de l'espace d'action est une décision d'architecture souvent sous-documentée dans la littérature RL appliquée, et les praticiens se retrouvent fréquemment à tâtonner empiriquement. En démontrant que la vitesse articulaire favorise à la fois la sécurité (mouvements plus lisses, moins de à-coups) et la performance sur des tâches visuelles, l'étude fournit une recommandation actionnable. Elle confirme aussi que le gap sim-to-réel dépend non seulement de la politique apprise, mais de la représentation même des actions, un levier souvent négligé dans les pipelines de transfert. Pour les intégrateurs travaillant avec des bras industriels ou des cobots, cette granularité de contrôle peut directement influer sur la durée de vie mécanique et la robustesse opérationnelle. L'étude s'inscrit dans un courant de recherche croissant sur la robustesse du transfert sim-to-réel pour la manipulation visuelle, aux côtés de travaux sur les politiques visuomotrices à base de transformeurs (VLA) comme pi-0 de Physical Intelligence ou les approches diffusion-policy popularisées par Columbia et Toyota Research Institute. Contrairement à ces méthodes qui s'intéressent à l'architecture du modèle, ce papier intervient en amont, au niveau du signal de commande lui-même. Les auteurs annoncent des recommandations pratiques pour le choix d'espace d'action selon le contexte (simulation seule ou déploiement réel), ce qui en fait une référence méthodologique utile pour les équipes démarrant un projet RL sur hardware.

RecherchePaper
1 source
ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique
1624arXiv cs.RO 

ThinkingVLA : raisonnement vision-langage entrelacé pour la manipulation robotique

Une équipe de chercheurs a publié sur arXiv (réf. 2606.17937, juin 2026) ThinkingVLA, un modèle VLA (Vision-Language-Action) conçu pour la manipulation robotique sur des séquences longues. L'architecture, de type Mixture-of-Transformers, intercale raisonnement textuel et visuel dans un unique processus génératif. Un Chain-of-Thought "forward" identifie le sous-objectif suivant et prédit l'état visuel cible correspondant ; un CoT "inverse" prend ensuite cette image générée comme entrée et infère les commandes motrices nécessaires pour l'atteindre. L'action finale est générée conditionnée sur ce contexte de raisonnement complet. Sur des benchmarks en simulation et en conditions réelles, ThinkingVLA surpasse les baselines de l'état de l'art, avec les gains les plus marqués sur les tâches à horizon temporel long. La grande majorité des modèles VLA actuels, notamment Pi-0 de Physical Intelligence ou OpenVLA, projettent directement observations vers actions sans raisonnement explicite, ce qui les pénalise sur les séquences longues nécessitant planification spatiale et décomposition en sous-étapes. ThinkingVLA adresse ce "reasoning gap" en forçant le modèle à anticiper visuellement l'état du monde avant de dériver les commandes. Cette boucle d'inverse dynamics grounding visuel est, si elle se confirme à l'échelle sur des objets et environnements variés, une piste sérieuse pour réduire le fossé persistant entre démonstrations en laboratoire et robustesse opérationnelle hors domaine. Les modèles VLA ont connu une accélération nette depuis 2024 avec RT-2 de Google DeepMind, Pi-0 de Physical Intelligence (lancé fin 2024), GR00T N2 de NVIDIA et Helix de Figure AI. L'ajout de CoT textuel dans les VLA est une tendance consolidée, mais ThinkingVLA se distingue par un CoT visuel explicite, soit la génération d'une image intermédiaire comme étape de raisonnement, ce qui implique une architecture bimodale plus coûteuse à l'inférence. Le travail est soumis en pre-print sans revue par les pairs à ce stade, sans partenariat industriel annoncé. Les prochains défis identifiés par le domaine concernent la généralisation hors distribution et la réduction du coût d'inférence pour un déploiement embarqué en temps réel.

RechercheOpinion
1 source
Planification de mouvement de bras robotique par intégrale de chemin prédictive en une étape via les champs de distance dans l'espace de configuration
1625arXiv cs.RO 

Planification de mouvement de bras robotique par intégrale de chemin prédictive en une étape via les champs de distance dans l'espace de configuration

Une équipe de chercheurs propose, dans une prépublication arXiv (2509.00836, troisième révision), un cadre de planification de trajectoire baptisé CDF-MPPI, qui fusionne deux familles d'approches jusqu'ici séparées : les champs de distance en espace de configuration (Configuration Space Distance Fields, CDFs) et la commande par intégrale de chemin à modèle prédictif (Model Predictive Path Integral, MPPI). Appliqué à un bras Franka Emika à 7 degrés de liberté (DOF), le système atteint des fréquences de commande supérieures à 750 Hz tout en maintenant des taux de succès proches de 100 % en environnement 2D et des taux élevés sur des scènes de simulation avec obstacles complexes. L'innovation centrale est la réduction de l'horizon de planification MPPI à un seul pas de temps, rendue possible par l'utilisation des gradients CDF pour exprimer l'ensemble de la fonction de coût directement dans l'espace articulaire du robot. L'impact pratique de ce résultat touche un verrou bien connu des intégrateurs de cellules robotisées : les méthodes d'optimisation classiques basées sur les champs de distance signée (Signed Distance Fields, SDFs) tombent dans des minima locaux dès que les gradients SDF s'annulent, notamment dans les espaces à haute dimensionnalité ou autour d'obstacles convexes. De leur côté, les approches MPPI échantillonnent massivement des trajectoires candidates, ce qui les rend coûteuses en calcul et difficiles à calibrer (unités physiques hétérogènes dans la fonction de coût). En unifiant le coût en espace articulaire via les gradients CDF et en réduisant l'horizon à un pas, CDF-MPPI supprime à la fois le problème de minima locaux et le surcoût d'échantillonnage, permettant une planification temps-réel à 750 Hz, seuil compatible avec des boucles de contrôle industrielles exigeantes. C'est une démonstration que les CDFs, introduits récemment dans la littérature, offrent un signal de gradient suffisamment robuste pour remplacer les SDFs workspace dans des pipelines de commande réactifs. Les CDFs ont émergé comme alternative aux SDFs workspace précisément parce qu'ils modélisent les distances directement dans l'espace de configuration du robot, là où la planification a lieu, évitant la projection coûteuse entre espace cartésien et espace articulaire. L'MPPI, popularisé notamment par les travaux de Williams et al. (Georgia Tech) et adopté dans plusieurs pipelines de navigation mobile, était jusqu'ici rarement appliqué à la manipulation à haute fréquence en raison de son coût d'échantillonnage. Le bras Franka Emika (désormais sous l'écosystème Agile Robots après le rachat de Franka Robotics en 2023) est le benchmark de facto de la communauté manipulation. Les concurrents directs de CDF-MPPI incluent les planificateurs à base de TrajOpt (optimisation SDF), les variantes iCEM et STORM côté MPPI, ainsi que les approches par champs de potentiels neuronaux. Les auteurs valident uniquement en simulation pour l'instant ; la prochaine étape attendue est le transfert sim-to-real sur hardware réel, avec les défis habituels de calibration des modèles de contact et de latence réseau.

UELes laboratoires européens utilisant le bras Franka Emika (désormais sous l'écosystème Agile Robots) pourraient bénéficier de cette méthode de planification temps-réel, mais l'impact reste indirect faute de validation hardware publiée et de code disponible.

RecherchePaper
1 source
MotionVLA : un modèle vision-langage-action pour les robots humanoïdes
1626arXiv cs.RO 

MotionVLA : un modèle vision-langage-action pour les robots humanoïdes

Une équipe de l'AIGeeksGroup a publié le 18 juin 2026 sur arXiv (2606.15142) MotionVLA, un modèle de type Vision-Language-Action conçu pour générer du mouvement humanoïde réaliste à partir d'images de scène et d'instructions textuelles. Le coeur de la contribution repose sur DSFT (Dual-Stream Frequency Tokenizer), un tokeniseur qui décompose le signal de mouvement en deux flux distincts : un flux Base capturant la sémantique de pose basse fréquence, et un flux Phys encodant la dynamique physique haute fréquence. Cette séparation s'appuie sur une analyse en transformée en cosinus discrète (DCT) du corpus HumanML3D, qui révèle un déséquilibre concret : cinq coefficients DCT suffisent à couvrir 93 % de l'énergie des positions articulaires, mais seulement 37 % de l'énergie des vélocités. Les deux flux sont compressés indépendamment par troncature DCT et encodage BPE, puis réinjectés dans un transformeur autorégressif basé sur Qwen3.5 2B. Sur les benchmarks HumanML3D et MBench, MotionVLA réduit l'écart de diversité avec les données réelles de plus de 50 % et améliore la cohérence mouvement-condition de 3,8 %. Ce résultat pointe une limite structurelle des approches à codebook unique, qui dominent actuellement la génération de mouvement humanoïde : en forçant des signaux hétérogènes dans un espace de quantification commun, ces méthodes sous-représentent systématiquement les composantes dynamiques hautes fréquences au profit de la géométrie de pose. Pour les équipes travaillant sur le contrôle de robots humanoïdes ou la synthèse d'animation procédurale, cela signifie que la qualité du mouvement généré peut sembler plausible en posture statique mais manquer de naturel en transition. L'architecture duale de MotionVLA, malgré un backbone léger de 2 milliards de paramètres, obtient des gains mesurables sans augmenter significativement le coût de calcul. MotionVLA s'inscrit dans un mouvement de recherche plus large qui adapte les VLA, initialement développés pour le contrôle robotique visuomoteur, à la génération de comportement humanoïde. Le modèle s'appuie sur Qwen3.5, la famille de modèles open-weight d'Alibaba, et le code source est disponible sur GitHub (AIGeeksGroup/MotionVLA). À ce stade, il s'agit exclusivement d'un résultat de recherche académique évalué sur des benchmarks synthétiques standard, sans déploiement industriel ni partenariat hardware annoncé. Les acteurs comme Figure AI, 1X, Agility Robotics ou Fourier Intelligence, qui investissent dans la génération de mouvement pour leurs humanoïdes, suivent de près ce type de travaux, même si le chemin du benchmark de laboratoire vers un déploiement sim-to-real reste non démontré ici.

IA physiqueOpinion
1 source
LaWAM : des modèles du monde latents pour des politiques robotiques efficaces et dynamiques
1627arXiv cs.RO 

LaWAM : des modèles du monde latents pour des politiques robotiques efficaces et dynamiques

Des chercheurs ont publié en juin 2026 sur arXiv (réf. 2606.15768) LaWAM, un Latent World Action Model destiné au contrôle robotique. Le système atteint 98,6 % de taux de succès sur le benchmark LIBERO, 91,22 % sur RoboTwin, et maintient des résultats compétitifs sur des tâches de manipulation en environnement réel. Sa latence d'inférence est de 187 ms par chunk d'actions, soit jusqu'à 24 fois inférieure à celle des World Action Models (WAM) opérant dans l'espace pixel. L'architecture résout un compromis structurel dans les VLA (Vision-Language-Action models) actuels : ces systèmes exploitent le préentraînement vision-langage à grande échelle pour le contrôle sémantique, mais restent aveugles à la dynamique physique de la scène. Les WAM corrigent ce défaut en conditionnant la politique sur une prédiction du futur, mais leur génération vidéo pixel par pixel les rend prohibitifs pour le temps réel. LaWAM substitue à cette vidéo des sous-objectifs visuels latents compacts, calculés dans l'espace de représentation d'un modèle de fondation vision préentraîné. Son composant central, le Latent World Model (LaWM), réutilise un décodeur forward pour prédire les caractéristiques d'observation future, éliminant la redondance au niveau pixel. Le résultat est une planification dynamique compatible avec les contraintes de latence du contrôle robotique industriel. Ce travail prend place dans la convergence entre grands modèles et robotique, après que pi-0 (Physical Intelligence) et GR00T de NVIDIA ont validé l'approche VLA mais buté sur le demo-to-reality gap et la latence d'inférence. LaWAM propose une voie d'intégration plus réaliste : 187 ms par inférence autorise des boucles de contrôle à environ 5 Hz, suffisantes pour de nombreuses tâches de manipulation structurée. Le préprint ne mentionne ni partenariat industriel ni timeline de déploiement ; il s'agit à ce stade d'une contribution académique sans produit shipé ni pilote annoncé. La prochaine étape naturelle sera de valider la robustesse hors distribution sur des environnements plus variés que LIBERO et RoboTwin, qui restent des benchmarks relativement contrôlés.

RechercheActu
1 source
PATCH : suivi des innovations de patchs latents conditionné par les séquences d'actions pour la manipulation robotique
1628arXiv cs.RO 

PATCH : suivi des innovations de patchs latents conditionné par les séquences d'actions pour la manipulation robotique

Des chercheurs présentent PATCH (Action-Chunk-Conditioned Latent Patch Innovation Monitor), un moniteur d'exécution temps réel publié sur arXiv (2606.16690) conçu pour rendre les politiques de manipulation robotique plus robustes lors du déploiement en environnements ouverts. Le système s'appuie sur le "chunk" d'actions courant, séquence de commandes prédites d'un coup par la politique apprise, pour définir un corridor d'exécution projeté dans l'espace latent. À l'intérieur de ce corridor, PATCH prédit l'évolution attendue des patches visuels latents et accumule les résidus persistants que le mouvement propre du robot n'explique pas. Ces résidus constituent un signal d'intervention localisé : le composant PATCH-Router peut suspendre l'exécution, sélectionner une source de récupération disponible, puis reprendre la politique originale une fois l'innovation locale dissipée. Des expériences sur données réelles de déploiement montrent des déclenchements plus stables et plus contextuellement pertinents que les moniteurs concurrents évalués. L'enjeu est précis : les politiques de manipulation à base d'apprentissage (politiques de diffusion, modèles VLA) produisent des résultats convaincants en laboratoire mais restent fragiles dès qu'un objet bouge inopinément, qu'une occlusion transitoire survient ou qu'une perturbation apparaît près de la trajectoire prévue. Les moniteurs existants s'appuient sur des anomalies d'observation globales, l'incertitude de la politique ou des différences frame-à-frame, des mécanismes qui peinent à distinguer un risque d'exécution réel d'une variation visuelle bénigne (reflet, passage d'une personne en fond). PATCH déplace l'analyse au niveau local et conditionné sur l'intention du robot, ce qui réduit les faux positifs et permet une reprise automatique plutôt qu'un arrêt définitif. Pour un intégrateur industriel, cela change la logique de supervision : au lieu d'une e-stop humaine systématique, on dispose d'un mécanisme de récupération autonome gradué. L'article s'inscrit dans une vague de travaux qui cherchent à combler le "deployment gap" des VLA et des politiques de diffusion, notamment après que des systèmes comme Pi-0 (Physical Intelligence) ou RDT ont démontré des performances impressionnantes en conditions contrôlées. PATCH ne cherche pas à remplacer la politique de base mais à la surveiller et à la relancer de façon ciblée, une approche modulaire compatible avec n'importe quelle politique pré-entraînée. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné ; il s'agit pour l'instant d'une contribution de recherche accompagnée d'une page projet publique, sans déploiement à l'échelle annoncé.

RechercheOpinion
1 source
Le gant haptique N2D : un gant multi-doigts pour le retour de force directionnel 2D en manipulation multi-contact
1629arXiv cs.RO 

Le gant haptique N2D : un gant multi-doigts pour le retour de force directionnel 2D en manipulation multi-contact

Des chercheurs du laboratoire ARC de l'Université de Californie à San Diego (UCSD) ont présenté le N2D Haptic Glove, un gant haptique multi-doigts dont le preprint a été déposé sur arXiv (2606.14083) en juin 2026. Le dispositif exploite des transmissions à cabestan (capstan-drive) pour restituer, en temps réel, des forces de contact bidirectionnelles dans le plan sagittal de chaque doigt, couvrant à la fois la flexion et l'extension. Dans une étude contrôlée de télé-opération d'un bras et d'une main robotiques, le gant a été comparé à deux conditions de référence: retour visuel seul et retour haptique mono-axial. Le retour planaire réduit significativement l'erreur de force de contact lors de manipulations précises, améliore la répétabilité inter-essais, et hausse les scores d'expérience utilisateur sur des tâches de sondage axial. Le hardware et le software seront publiés en open-source sur le dépôt de l'ARC Lab. Ce résultat adresse directement un angle mort persistant de la télé-opération haptique: sans information sur la direction de la force appliquée, un opérateur compense par la vision seule, ce qui génère des sur-pressions systématiques, une forte variabilité et une perte de précision dans les gestes fins. Pour les équipes qui collectent des données de démonstration robotique (learning from demonstrations, LfD) pour entraîner des politiques de manipulation dextre, la fidélité du retour d'effort est critique: un gant qui ne transmet que l'intensité introduit un biais dans les trajectoires capturées. La capacité du N2D à réduire l'erreur de force en télé-opération suggère que les données produites avec ce type de gant seraient plus représentatives des stratégies de contact humain réel, ce qui est directement pertinent pour les équipes humanoides actuelles. Le N2D s'inscrit dans un segment où plusieurs acteurs ont tenté de concilier précision et praticité. HaptX commercialise un gant pneumatique à retour de force multi-doigts, mais avec un encombrement et un poids importants; SenseGlove (Pays-Bas) propose un exosquelette à câbles ciblant la formation industrielle; Dexmo de Dexta Robotics offre un retour de force par doigt sans composante directionnelle planaire. Le N2D se distingue par la transparence mécanique réputée des transmissions à cabestan et par son approche open-source, rare dans ce domaine. Les auteurs ciblent trois débouchés: télé-opération contact-riche, simulation en réalité virtuelle et collecte de démonstrations pour l'apprentissage robotique. Le preprint ne mentionne ni partenaire industriel ni calendrier de commercialisation; l'étude reste un prototype de laboratoire validé en conditions contrôlées.

UELa publication open-source du N2D constitue une pression concurrentielle indirecte pour SenseGlove (Pays-Bas), acteur européen du gant haptique à câbles ciblant la formation industrielle.

RecherchePaper
1 source
Apprentissage de la sécurité robotique à partir de rares retours humains par prédiction conforme
1630arXiv cs.RO 

Apprentissage de la sécurité robotique à partir de rares retours humains par prédiction conforme

Des chercheurs ont publié sur arXiv (référence 2501.04823v2) une méthode permettant d'apprendre les préférences de sécurité d'un opérateur humain à partir de retours binaires très limités, puis de les traduire en garanties statistiques formelles pour un robot autonome. Le principe : un humain visionne des trajectoires effectuées par le robot et signale simplement les comportements jugés dangereux. L'algorithme applique ensuite la prédiction conforme (conformal prediction) sur ces annotations pour délimiter, dans l'espace d'état du robot (ou dans un espace latent appris), une zone suspecte dont il est garanti qu'elle contiendra au moins une fraction spécifiée des futures erreurs de la politique. Un système d'alerte se déclenche dès que le robot pénètre cette zone. La méthode a été validée expérimentalement sur des quadrirotor en vol libre : 30 vols répartis sur 6 tâches de navigation, avec pour objectif de franchir un portique désigné en suivant une politique visuomotrice. Le classifieur par plus proches voisins, combiné à la prédiction conforme, détecte de manière fiable quand la politique va rater le franchissement, sans nécessiter de jeu de données de calibration séparé. L'intérêt industriel de cette approche réside dans deux points souvent négligés dans les déploiements robotiques actuels : la subjectivité de la sécurité et la fragilité des politiques entraînées sur données "sûres". Un robot formé sur des trajectoires correctes peut produire des comportements dangereux hors distribution, et les contraintes définies manuellement ratent systématiquement les cas limites. Ici, la garantie de taux de manqués (miss rate) est mathématiquement contrôlée par l'utilisateur, ce qui est exploitable dans un cahier des charges de déploiement. La méthode est également "sample-efficient" : elle évite la pratique courante en prédiction conforme de geler une partie des données de calibration, ce qui compte lorsque les retours humains sont coûteux à collecter. Pour un intégrateur déployant des robots mobiles ou des drones d'inspection, c'est un outil de qualification potentiellement plus réaliste que les approches par fonctions de barrière de contrôle (CBF) ou vérification formelle, qui supposent des modèles analytiques précis. La prédiction conforme gagne depuis 2022 une traction notable en robotique apprise, notamment pour quantifier l'incertitude dans les politiques de type Vision-Language-Action (VLA) et les planificateurs model predictive control (MPC) -- c'est précisément ce dernier que les auteurs améliorent ici. Les approches concurrentes incluent les CBFs (moins flexibles avec des politiques neuronales), le safe reinforcement learning avec contraintes Lagrangiennes, et les méthodes de détection d'anomalies par reconstruction. L'article ne mentionne pas de partenaire industriel ni de timeline de transfert ; il s'agit d'un preprint académique, code et vidéos publiés, sans peer review finalisé à ce stade. Les suites naturelles seraient une validation sur des robots manipulateurs ou des AMR en environnement d'entrepôt, et l'extension à des retours humains plus granulaires que le binaire safe/unsafe.

RecherchePaper
1 source
Pilotage du comportement multi-robots par édition affine des activations en boucle fermée
1631arXiv cs.RO 

Pilotage du comportement multi-robots par édition affine des activations en boucle fermée

Une équipe de chercheurs a publié le 11 juin 2026 (arXiv:2606.11489) une méthode baptisée CLAE (Closed-Loop Affine Activation Editing), permettant de piloter le comportement d'une flotte de robots sans modifier les poids du modèle de base. Plutôt que de recourir au fine-tuning ou au réentraînement complet de la politique, CLAE intervient à l'inférence en éditant directement les activations intermédiaires du réseau neuronal. Concrètement, la méthode entraîne d'abord un auto-encodeur sparse sur les activations d'une politique gelée, identifie les features latentes pertinentes pour le comportement visé via sondage post-hoc, puis apprend une politique de pilotage légère par renforcement qui applique des transformations affines sur ces latents en temps réel. Les validations portent sur une flotte de quadrotors en simulation et en tests physiques, naviguant vers des positions objectif tout en évitant des obstacles. CLAE y démontre trois capacités distinctes : contrôle du profil de vitesse individuel de chaque appareil, maintien d'une formation configurable entre plusieurs robots, et émergence d'un comportement entièrement nouveau consistant à minimiser l'exposition aux caméras de surveillance présentes dans l'environnement. Ce que cette approche prouve, c'est qu'il est possible de découpler l'adaptation comportementale du cycle de réentraînement, un point structurant pour les intégrateurs industriels et les équipes de déploiement en production. Le risque d'oubli catastrophique, bien documenté lors du fine-tuning de politiques obtenues après des milliers d'heures de simulation, est écarté puisque les poids de base restent intacts. La couche de pilotage est légère et s'adapte en boucle fermée à l'état courant du robot et au contexte multi-agents, ce qui la distingue des approches d'activation patching offline utilisées dans les LLMs. La diversité des comportements obtenus sur une même architecture gelée, de la gestion de formation à l'esquive de surveillance, suggère une généralité de la méthode au-delà des tâches de navigation. Les résultats restent cependant limités aux quadrotors pour l'instant, et la transférabilité à des robots manipulateurs ou humanoïdes n'est pas encore démontrée. CLAE s'inscrit dans un courant de recherche actif autour du steering de réseaux de neurones via sparse autoencoders, popularisé par les travaux d'Anthropic sur l'interpretabilité des LLMs et les techniques d'activation patching dans les transformers. Appliqué à la robotique incarnée, ce paradigme impose une contrainte supplémentaire : la boucle fermée exige des corrections adaptées en temps réel à la dynamique du système, contrairement à l'édition statique en NLP. Parmi les approches concurrentes figurent les méthodes de parameter-efficient fine-tuning (LoRA, adaptateurs), le meta-learning de type MAML et les residual policies. La prochaine étape naturelle serait une validation sur des architectures VLA (Vision-Language-Action), où le coût prohibitif de réentraînement rend encore plus pertinente une solution d'édition à l'inférence, notamment pour les déploiements industriels à grande échelle.

RecherchePaper
1 source
Politiques hiérarchiques à partir de signaux verbaux et égocentrés pour l'interaction naturelle homme-robot
1632arXiv cs.RO 

Politiques hiérarchiques à partir de signaux verbaux et égocentrés pour l'interaction naturelle homme-robot

Des chercheurs ont présenté EDITH (Egocentric Data for Intent from The Human), un cadre de contrôle robotique qui intègre les signaux non-verbaux humains, notamment le regard et la vue égo-centrique, comme entrées directes d'une politique de robot, en complément des instructions verbales. Le système repose sur des lunettes intelligentes portées par l'opérateur, qui diffusent en temps réel un flux vidéo à la première personne, le point de regard (gaze tracking) et la parole transcrite automatiquement en texte. Une architecture hiérarchique à deux niveaux traite ces signaux : un module haut niveau infère l'intention et génère une séquence de sous-tâches, chacune représentée par une instruction textuelle fine associée à une image-clé (keyframe) ancrant l'objet cible dans la scène ; un module bas niveau exécute ensuite ces sous-tâches sur le robot physique. Les expériences sur des tâches interactives montrent qu'EDITH réagit à des signaux non-verbaux exprimés très brièvement et réduit significativement l'effort de communication par rapport à une interface purement textuelle. L'enjeu industriel est direct : les politiques robotiques actuelles reposent exclusivement sur des commandes linguistiques explicites, forçant l'opérateur à verbaliser chaque intention, une friction significative dans les environnements collaboratifs et sur les lignes d'assemblage. En capturant le geste et le regard comme canaux implicites, EDITH rapproche l'interaction humain-robot des modes naturels de collaboration entre humains et ouvre une voie vers des manipulateurs plus accessibles à des opérateurs non formés. La représentation en keyframe ancre l'intention dans la scène réelle plutôt que dans un espace de tokens abstrait, adressant partiellement le gap entre instructions ambiguës et exécution physique précise, une limitation bien documentée des approches VLA (Vision-Language-Action) à entrée textuelle seule. EDITH s'inscrit dans un mouvement plus large de politiques multimodales pour la manipulation robotique, aux côtés de travaux comme Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA, qui combinent vision et langage mais conservent le texte comme unique interface d'intention. L'originalité d'EDITH réside dans l'exploitation du gaze tracking comme signal de sélection d'objet implicite, une approche étudiée en recherche mais rarement intégrée dans une politique bout-en-bout déployée sur robot réel. Le travail, publié en preprint sur arXiv (2606.10276), inclut le code source et des vidéos de démonstration sur robot physique, mais ne mentionne aucun partenaire industriel ni timeline de déploiement commercial. Les prochaines étapes naturelles concerneront la robustesse du gaze tracking en environnement industriel bruité et la validation sur des tâches d'assemblage plus complexes.

RechercheOpinion
1 source
HandCept : un cadre de fusion visuo-inertielle pour la proprioception précise des mains dextériques
1633arXiv cs.RO 

HandCept : un cadre de fusion visuo-inertielle pour la proprioception précise des mains dextériques

Une équipe de chercheurs a publié sur arXiv en mai 2025 (référence 2505.08213) HandCept, un framework de proprioception visuo-inertielle pour mains dextres robotiques. Le système combine une caméra RGB-D montée au poignet et des IMU à 9 axes (accéléromètre, gyroscope, magnétomètre) pour estimer les angles articulaires en temps réel, via un filtre de Kalman étendu (EKF) sans latence ajoutée. Les erreurs d'estimation se situent entre 2° et 4° sur les angles articulaires, sans dérive observable sur la durée, surpassant selon les auteurs les approches purement visuelles ou purement inertielles. L'approche repose sur un apprentissage zero-shot, sans données réelles annotées, rendu possible par un pipeline de rendu photoréaliste haute fidélité sous Blender, publié en open-source sur GitHub. La proprioception, c'est-à-dire la capacité d'une main robotique à connaître précisément la position de ses propres doigts, reste l'un des verrous techniques de la manipulation dextre généraliste. Les encodeurs magnétiques et capteurs de force embarqués dans des mains multi-DOF imposent des contraintes de volume, de câblage et de calibration souvent incompatibles avec un déploiement à l'échelle. HandCept contourne ces limites en s'appuyant sur des capteurs déjà présents dans de nombreuses plateformes humanoïdes ou cobots, et la fusion EKF temps réel réduit le fossé sim-to-real, point critique pour accélérer le déploiement de politiques d'imitation learning ou de VLA (Vision-Language-Action) apprises en simulation. La précision annoncée de 2 à 4° reste toutefois à contextualiser: les résultats sont issus de conditions de laboratoire contrôlées et le papier n'a pas encore été évalué par les pairs. La course à la manipulation dextre s'est intensifiée en 2024-2025 avec des mains à haute densité d'actionneurs chez Figure (Figure 03), Sanctuary AI, Physical Intelligence (pi0), ou encore LEAP Hand côté recherche ouverte. La précision proprioceptive conditionne directement les performances de ces architectures. HandCept reste à ce stade un résultat de laboratoire: les auteurs n'annoncent ni partenaire industriel, ni timeline de commercialisation, ni intégration sur une plateforme humanoïde spécifique. Le pipeline Blender open-sourcé constitue néanmoins une contribution tangible pour la communauté, en facilitant la génération de données synthétiques pour d'autres équipes travaillant sur des architectures similaires sans accès à un système de capture de mouvement coûteux.

RecherchePaper
1 source
MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)
1634arXiv cs.RO 

MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.09827, juin 2026) MemoryVLA++, un framework de modélisation temporelle pour modèles VLA (Vision-Language-Action). L'architecture combine trois composants : une mémoire de travail construite à partir des tokens perceptifs et cognitifs générés par un VLM pré-entraîné sur l'observation courante ; une banque mémoire Perceptual-Cognitive qui indexe contexte sémantique et détails bas niveau des interactions passées via un mécanisme de consolidation sans redondance ; et un modèle du monde simulant des états futurs dans un espace latent de débruitage. Ces latents imaginés, guidés par la mémoire, alimentent un expert d'action à diffusion qui produit des séquences d'actions temporellement cohérentes. Évalué sur cinq benchmarks de simulation (Libero, SimplerEnv, Mikasa-Robo, Calvin, Libero-Plus) et trois catégories de tâches réelles sur trois robots distincts, le système affiche des gains de +9 % sur les tâches générales, +26 % sur les tâches mémoire-dépendantes, et +28 % sur les tâches d'anticipation. Ces résultats adressent une faiblesse structurelle des VLAs actuels (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA), tous limités à l'observation instantanée et incapables de maintenir un contexte opérationnel sur plusieurs étapes. Pour des tâches longue-portée (reprendre une manipulation interrompue, enchaîner des gestes interdépendants), cette limitation est rédhibitoire en environnement industriel réel. Le gain de +26 % sur les tâches mémoire-dépendantes, mesuré hors simulation, est le point le plus solide de la publication : il suggère que l'architecture surmonte partiellement le sim-to-real gap qui affaiblit beaucoup de travaux académiques récents. Pour un intégrateur ou un COO industriel, c'est la différence entre un robot qui réinitialise sa compréhension à chaque step et un qui maintient un contexte cohérent sur l'ensemble de la séquence de manipulation. MemoryVLA++ s'inscrit dans une vague de travaux cherchant à injecter du raisonnement temporel dans les fondations robotiques, face aux architectures VLA portées par Physical Intelligence, NVIDIA et Google DeepMind. L'inspiration est explicitement cognitive : mémoire de travail (buffer court terme), système hippocampique (mémoire épisodique des interactions passées) et simulation mentale d'états futurs, trois mécanismes documentés en neurosciences. L'article reste un preprint non relu par les pairs, et les vidéos de démonstration sur la page projet méritent une lecture critique avant toute conclusion définitive. Les suites naturelles seraient une validation sur bras industriels à 6-7 DOF en environnement non contrôlé et une comparaison rigoureuse avec des approches à mémoire externe de type RAG robotique. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
Modélisation par réseau de Petri et ordonnancement sans interblocage pour systèmes AGV hétérogènes attachables
1635arXiv cs.RO 

Modélisation par réseau de Petri et ordonnancement sans interblocage pour systèmes AGV hétérogènes attachables

Une équipe de chercheurs a publié sur arXiv (identifiant 2508.00724) un cadre de planification sans interblocage pour des systèmes de véhicules autoguidés (AGV) hétérogènes et attachables, où des unités "porteuses" (carriers) et des "navettes" (shuttles) peuvent s'accoupler physiquement pour accomplir des tâches coopératives avant de se séparer à la demande. Ce mode d'opération introduit une difficulté computationnelle sévère : la synchronisation imposée par les couplages physiques rend la flotte fortement interdépendante et vulnérable aux interblocages (deadlocks), situations où aucun véhicule ne peut progresser parce que chacun attend qu'un autre se déplace. Pour y répondre, les auteurs proposent un modèle en réseau de Petri intégré dans un algorithme de recherche adaptative à grand voisinage (ALNS), capable de transformer des permutations statiques de tâches en processus collaboratifs dynamiques et de prévenir proactivement les interblocages par analyse structurelle. L'intérêt industriel de ce travail tient à la combinaison de deux verrous : la planification de flottes hétérogènes (où les AGV ne sont pas interchangeables) et la gestion des deadlocks sans exploration exhaustive de l'espace d'états. Les expériences sur instances réelles et synthétiques montrent que l'ALNS proposé surpasse à la fois la politique opérationnelle actuellement déployée sur site, les solveurs exacts, et les métaheuristiques de référence, avec un gain significatif en efficacité computationnelle. Une analyse de sensibilité fournit par ailleurs des recommandations concrètes pour le dimensionnement optimal de la flotte, ce qui rend le cadre potentiellement actionnable pour des décideurs logistiques ou des intégrateurs industriels. Ce travail s'inscrit dans un courant de recherche actif sur la coordination de flottes AMR et AGV hétérogènes, domaine où des acteurs comme Exotec en France (systèmes Skypod) ou Geek+ et Quicktron en Asie proposent des flottes spécialisées mais généralement homogènes. La thèse centrale du papier reste à confronter à des déploiements industriels à grande échelle : les instances "réelles" mentionnées dans le résumé ne sont pas quantifiées en termes de nombre d'AGV ou de volume de tâches traités, ce qui limite la portée immédiate des conclusions. Les extensions naturelles incluent l'intégration de contraintes de recharge, la gestion de topologies dynamiques, et la validation sur des benchmarks standardisés du secteur AMR.

UELe cadre proposé pourrait à terme informer la conception de flottes AGV hétérogènes chez des acteurs européens de la logistique robotisée comme Exotec, dont les systèmes Skypod actuels restent homogènes.

IndustrielPaper
1 source
Revisiter la perception des parties articulées en manipulation robotique
1636arXiv cs.RO 

Revisiter la perception des parties articulées en manipulation robotique

Des chercheurs ont déposé en juin 2026 (arXiv:2606.08103) une nouvelle approche pour la perception des parties articulées d'objets du quotidien, portes, boîtes et poignées, baptisée GPS (Geometric Primary Structure). Ce cadre représente la géométrie des parties mobiles sous une forme abstraite et générique, collectée via un dispositif de réalité virtuelle portable : l'annotation d'une séquence d'objets prend moins d'une minute, contre plusieurs dizaines de minutes pour les pipelines de labellisation manuelle classiques. Appliqué sur 234 objets répartis en six classes de parties, le système a constitué un corpus de 41 000 frames. Le modèle GPS entraîné accepte en entrée une unique image RGB-D et, sans aucun fine-tuning spécifique au domaine, atteint un taux de réussite de 73 % sur 270 états initiaux couvrant 9 objets en manipulation robotique réelle, à partir d'une politique heuristique basée sur la prédiction GPS. Ce résultat illustre un point clé pour les intégrateurs et les équipes R&D industrielles : la qualité de la représentation perceptive conditionne directement la robustesse de la politique de manipulation. Les deux approches dominantes présentent des compromis défavorables. Les méthodes basées sur la pose nécessitent une annotation intensive et ne passent pas à l'échelle, tandis que les méthodes affordance-based, qui extraient le mouvement futur par point tracking, souffrent de données bruitées ou incomplètes. GPS tente d'occuper le terrain intermédiaire. Un taux de 73 % sans fine-tuning in-domain est une indication sérieuse de généralisation réelle, même si la validation sur 9 objets seulement invite à la prudence avant de conclure que le fossé entre démonstration et déploiement industriel est comblé. Le problème de la manipulation d'objets articulés constitue un verrou reconnu depuis les travaux fondateurs sur WHERE2ACT et les datasets de type OPD (OpenDoors-Dataset). GPS s'inscrit dans un mouvement plus large visant à remplacer les bases de connaissances statiques par des systèmes de perception apprenants et annotables à faible coût. Les auteurs rendent publics le code, les données et l'outil VR (enlighten0707.github.io/gps), ce qui favorise la reproductibilité et l'adoption en recherche. Les extensions naturelles incluent l'intégration avec des politiques de type VLA (Vision-Language-Action), la généralisation à des parties déformables, et la validation sur des objets industriels hors distribution.

RecherchePaper
1 source
Objectifs définis par ensembles, pas par états : des buts de robots interrogeables via le réétiquetage rétrospectif par ensemble d'objectifs
1637arXiv cs.RO 

Objectifs définis par ensembles, pas par états : des buts de robots interrogeables via le réétiquetage rétrospectif par ensemble d'objectifs

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (référence 2606.09476) une méthode baptisée Goal-Set Hindsight Relabeling (GS-HER), qui reformule le problème du ré-étiquetage a posteriori en apprentissage robot hors-ligne. Là où la technique standard HER (Hindsight Experience Replay) convertit chaque état final atteint en objectif singleton exact, GS-HER opère au niveau des prédicats : une requête binaire spécifie quelles variables de l'état définissent le succès, transformant le critère d'objectif en paramètre configurable à l'inférence plutôt qu'en constante d'entraînement. Le système a été évalué sur les benchmarks OGBench avec cinq algorithmes d'apprentissage offline orientés objectifs (GCRL), et améliore les performances sur l'ensemble des configurations testées lorsque les objectifs en pleine dimension sont pénalisés par des variables parasites -- les "nuisance dimensions" -- qui n'ont aucun impact sur le succès réel de la tâche. L'intérêt de GS-HER pour un intégrateur ou un déploiement industriel tient dans sa modularité : un unique checkpoint entraîné peut répondre à plusieurs définitions d'objectifs sans nécessiter de ré-entraînement. Concrètement, une même politique apprise peut être interrogée différemment selon le contexte opérationnel, en modifiant uniquement la requête à l'inférence. La méthode adresse aussi une limite bien connue du GCRL offline : dans les tâches réelles, la définition exacte d'un état-but final est souvent impossible à spécifier sans introduire de contraintes artificielles. GS-HER relaxe cette sur-contrainte en ne demandant au robot de vérifier que les dimensions effectivement pertinentes au succès, ce qui rapproche la formulation théorique de la réalité opérationnelle. HER a été introduit par Andrychowicz et al. (OpenAI) en 2017 et est devenu l'une des pierres angulaires du GCRL, notamment pour la manipulation robotique. Des variantes ont depuis émergé pour gérer les trajectoires sous-optimales et les objectifs bruités, mais peu s'attaquaient à la sur-contrainte dimensionnelle. GS-HER se positionne comme une couche de généralisation compatible avec les algorithmes GCRL existants, ce qui limite la friction d'adoption. La limite principale à ce stade : les résultats sont exclusivement issus de simulations (OGBench), sans validation sur hardware réel -- l'écart sim-to-real reste donc à démontrer. Aucun acteur européen n'est impliqué dans la publication selon les informations disponibles.

RecherchePaper
1 source
Politiques de récupération sensibles aux différences pour l'apprentissage par imitation
1638arXiv cs.RO 

Politiques de récupération sensibles aux différences pour l'apprentissage par imitation

Une équipe du Weird Lab de l'Université de Washington publie sur arXiv (arXiv:2606.09758, juin 2026) une méthode appelée DARP (Difference-Aware Retrieval Policies for Imitation Learning), une approche semi-paramétrique d'apprentissage par imitation. Le principe central : plutôt que d'apprendre un mapping global état-action via un réseau de neurones pur (behavior cloning standard), DARP entraîne un modèle à prédire des actions en s'appuyant sur les k plus proches voisins (k-NN) extraits des démonstrations expertes, leurs actions associées, et les vecteurs de distance relative entre les états voisins et l'état requête courant. En reformulant le problème d'imitation en termes de structure de voisinage local plutôt que de mappings directs, la méthode revendique des gains de performance de 15 à 46 % sur behavior cloning standard, mesurés sur des benchmarks de contrôle continu et de manipulation robotique, y compris avec des représentations visuelles haute dimension. L'amplitude de cette fourchette suggère des variations importantes selon les tâches et les domaines évalués. L'intérêt concret de DARP réside dans sa capacité à atténuer le problème de "compounding errors" : lors du déploiement, un agent entraîné par behavior cloning accumule des erreurs en rencontrant des états hors distribution, dégradant rapidement les performances. En réutilisant les données d'entraînement au moment de l'inférence, DARP introduit une forme de mémoire épisodique sans nécessiter de collecte de données supplémentaires, de feedback expert en ligne, ni de connaissance spécifique à la tâche. C'est là la distinction clé vis-à-vis de méthodes comme DAgger (Ross et Bagnell, 2011), qui résolvent la distribution shift mais exigent des requêtes à l'expert pendant l'entraînement, une contrainte souvent rédhibitoire en robotique industrielle réelle. Le behavior cloning reste une méthode de référence pour son absence de contraintes opérationnelles, mais sa fragilité face à la distribution shift en limite la portée pour des déploiements à grande échelle. DARP s'inscrit dans un courant de méthodes semi-paramétriques qui connaît un regain d'intérêt avec la montée des politiques génératives : l'idée de conserver explicitement une mémoire des démonstrations plutôt que de tout comprimer dans des poids de réseau est cohérente avec les architectures hybrides actuelles, comme les VLA Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les résultats sur représentations visuelles haute dimension ouvrent la voie à des applications sur des manipulateurs avec vision RGB, domaine où les approches purement paramétriques montrent encore des limites significatives. Le code et les démonstrations sont disponibles publiquement via le site des auteurs.

RecherchePaper
1 source
ReCoVLA : un système de récompense guidé par VLM pour la récupération d'échecs dans les politiques VLA
1639arXiv cs.RO 

ReCoVLA : un système de récompense guidé par VLM pour la récupération d'échecs dans les politiques VLA

ReCoVLA (Reward Compilation for VLA recovery) est un framework de récupération d'erreurs présenté dans un preprint arXiv publié le 9 juin 2026, conçu pour pallier la fragilité des politiques VLA (Vision-Language-Action) face aux états hors-nominal. Le principe : maintenir une politique VLA pré-entraînée gelée (frozen), déléguer à un modèle vision-langage externe (VLM) l'inférence du mode de défaillance et du stade de récupération, puis compiler une récompense structurée pour entraîner une politique résiduelle corrective en simulation. Cette politique résiduelle est ensuite déployée en zéro-shot sur robot réel sans réentraînement. Sur des tâches de manipulation couvrant des horizons courts, longs et des contacts riches, ReCoVLA fait passer le taux de succès moyen de 36,7 % (baseline π0.5 fine-tuné) à 66,7 % en simulation, et atteint 61,7 % en déploiement physique zéro-shot sim-to-réel. L'apport conceptuel central est de ne pas utiliser le VLM pour générer des actions ou des récompenses directement, mais comme un sélecteur sémantique de récompenses : il prédit un descripteur de récupération et un masque de récompense parmi des composants prédéfinis liés à la tâche. Cette séparation entre compréhension sémantique de haut niveau et contrôle correctif de bas niveau adresse un angle mort bien documenté des architectures VLA actuelles : elles offrent de bons priors pour la manipulation conditionnée au langage, mais s'effondrent dès qu'elles rencontrent un état non prévu à l'entraînement. Le framework se veut agnostique à la politique VLA sous-jacente, ce qui le rendrait compatible avec différents modèles de base. Le travail s'inscrit dans une compétition intense autour des politiques génératives pour la manipulation robotique. Des modèles comme π0 et π0.5 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA ont démontré la faisabilité des VLA à grande échelle, mais la robustesse aux défaillances reste un problème ouvert. ReCoVLA propose une réponse modulaire qui n'exige pas de réentraîner la politique de base, ce qui réduit théoriquement les coûts d'adaptation. Il convient toutefois de noter que ce preprint ne fait pas état d'un déploiement industriel : les expériences physiques restent en contexte laboratoire, avec un périmètre de tâches limité. Les prochaines étapes naturelles concernent la généralisation à d'autres architectures VLA et l'évaluation sur des chaînes causales plus longues.

RechercheOpinion
1 source
Q-VGM : un guidage par gradient de valeur pour les politiques VLA à flux normalisants
1640arXiv cs.RO 

Q-VGM : un guidage par gradient de valeur pour les politiques VLA à flux normalisants

Une équipe de chercheurs propose Q-VGM (Q-Guided Value-Gradient Matching), une méthode d'apprentissage par renforcement hors-politique conçue pour affiner les politiques VLA (Vision-Language-Action) reposant sur le flow-matching. Partant de pi0.5, le modèle VLA de Physical Intelligence, comme initialisation few-shot, la méthode améliore les taux de réussite sur trois environnements : sur le benchmark LIBERO, le taux de succès passe de 75,0 % à 92,5 % ; sur RoboTwin 2.0, de 76,4 % à 87,2 % ; sur deux tâches de manipulation réelles en environnement tabletop, de 40,0 % à 67,5 %. Ces gains sont obtenus sans supervision experte supplémentaire, à partir de données d'expérience auto-générées par le robot (rollouts). L'étude est disponible en preprint sur arXiv (2606.08015) et n'a pas encore été soumise à évaluation par les pairs à la date de publication. Le verrou que Q-VGM résout est l'un des obstacles les plus tenaces du fine-tuning RL pour les VLA de type flow-matching : propager les gradients d'une fonction de valeur (Q-function) à travers le processus de débruitage itératif est numériquement instable à grande échelle, tandis que les méthodes de policy-gradient exigent des vraisemblances d'actions indisponibles sous débruitage itératif. Q-VGM contourne ces deux contraintes via VGG-Flow, un cadre théorique qui convertit le gradient de valeur en un champ de guidage appliqué pendant le débruitage, sans rétropropagation end-to-end ni calcul de vraisemblance explicite. Pour un intégrateur ou une équipe robotique, le paradigme est directement opérationnel : quelques démonstrations pour amorcer la politique (few-shot SFT), puis amélioration continue à partir de l'expérience propre du système. La progression de 40 % à 67,5 % sur robot réel est encourageante, bien que les conditions expérimentales restent circonscrites à deux tâches tabletop contrôlées. Physical Intelligence a lancé pi0 fin 2024, puis pi0.5, des architectures VLA fondées sur le flow-matching devenues un point de référence pour la manipulation généraliste. Q-VGM s'inscrit dans un courant de recherche actif visant à greffer l'apprentissage par renforcement sur ces fondations pré-entraînées, en concurrence avec des approches comme OpenVLA-OFT ou les adaptations RLVR appliquées aux VLA. LIBERO et RoboTwin 2.0 sont des benchmarks standards de manipulation simulée, ce qui rend les comparaisons reproductibles mais soulève la question classique du transfert en conditions réelles non supervisées. La prochaine étape pour ce type de méthode sera de démontrer la robustesse sur des plateformes robotiques variées et dans des environnements moins contrôlés.

RechercheOpinion
1 source
Planification et commande de mouvement sûres par polytopes imbriqués et fonctions de barrière de contrôle
1641arXiv cs.RO 

Planification et commande de mouvement sûres par polytopes imbriqués et fonctions de barrière de contrôle

Des chercheurs présentent dans un preprint arXiv (2606.09719) une méthode de planification de mouvement locale pour robots mobiles autonomes évoluant dans des espaces confinés. L'approche repose sur la représentation polytopique du footprint du robot : modéliser sa géométrie réelle par un polygone convexe plutôt que de la simplifier à un point ou un cercle. La condition de sécurité, le robot doit rester à l'intérieur d'une région libre convexe continuellement mise à jour, est formulée comme un ensemble de contraintes de type Control Barrier Function (CBF) intégrées dans un contrôleur prédictif à modèle (MPC). Les expériences sur matériel embarqué, avec un robot non-holonome équipé de LiDAR et de grilles d'occupation, valident le système à 10 Hz en temps réel, avec évitement réactif d'obstacles dynamiques. L'analyse comparative affiche une réduction du temps de calcul pouvant atteindre 91x face à une formulation classique basée sur la détection d'obstacles, lorsque la densité de l'environnement augmente. L'intérêt pour les intégrateurs de systèmes AMR tient à deux propriétés distinctes. Le nombre de contraintes de sécurité dépend uniquement de la complexité géométrique locale et de la forme du robot, pas du nombre d'obstacles, ce qui garantit une tenue en temps réel dans des environnements denses. Par ailleurs, l'absence de nécessité de détecter ou segmenter les obstacles individuellement simplifie le pipeline de perception. La validation sur hardware, et pas seulement en simulation, place ce travail au-delà d'un résultat purement théorique, même si la montée en charge vers des environnements industriels à grande échelle reste à démontrer. La fréquence de 10 Hz sur ordinateur embarqué est un indicateur crédible de déployabilité réelle. Les approches classiques de navigation sûre pour robots à empreinte non-triviale recourent soit à des simplifications conservatives, soit à des formulations obstacle-par-obstacle dont le coût de calcul croît avec la densité de la scène, un problème bien documenté dans les entrepôts opérés par des acteurs comme Exotec ou dans la navigation maritime autonome. Les CBF appliqués à la planification en espace libre s'inscrivent dans une tendance croissante aux côtés de méthodes comme MPPI ou les planificateurs basés sur des tubes de sécurité. Ce preprint n'a pas encore été soumis à révision par les pairs, mais la démonstration embarquée sur robot réel constitue un signal d'applicabilité sérieux pour les équipes R&D robotique cherchant à naviguer dans des couloirs étroits sans surestimer les marges de sécurité.

UELes équipes R&D d'intégrateurs AMR européens (dont Exotec en France) pourraient bénéficier de cette méthode pour améliorer la navigation en environnements confinés sans surcoût computationnel, mais le travail reste un preprint non encore validé par les pairs.

RecherchePaper
1 source
Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes
1642arXiv cs.RO 

Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes

Une équipe de recherche publie sur arXiv (arXiv:2606.05687v1) une méthode hybride MPC-RL pour le contrôle moteur des robots humanoïdes, baptisée MPC-RL. Le principe : intégrer un contrôleur prédictif par modèle (MPC) directement dans la boucle d'entraînement par renforcement (RL), en utilisant les trajectoires générées par le MPC comme signal de récompense basé sur la dynamique centroïdale du robot. La contribution technique centrale est un solveur GPU appelé pi-n-MPC, parallélisé à la fois sur l'horizon temporel et sur les instances de simulation, sans nécessiter de précompilation ni de construction explicite du problème à chaque pas. Les auteurs reportent des validations sur hardware réel, sans préciser les plateformes matérielles ni les cycles de tests. Le code est disponible en open source sur GitHub. L'enjeu industriel derrière ce travail est réel : le RL massif en simulation parallèle (Isaac Gym, Mujoco MJX) est devenu le standard pour entraîner des compétences de locomotion et de manipulation humanoïde, mais y injecter un MPC est historiquement coûteux en temps de construction et en mémoire GPU. Pi-n-MPC contourne ces deux goulots d'étranglement en opérant directement sur des dynamiques variables dans le temps, sans accumuler de mémoire excessive. Si les gains revendiqués se confirment à l'échelle, cela ouvre la voie à des politiques hybrides MPC/RL entraînables sur des clusters GPU standard, sans infrastructure spécialisée. Attention toutefois : le papier s'appuie sur des études comparatives internes et des validations hardware dont les conditions exactes (charges, cycles, environnements) ne sont pas détaillées dans le résumé disponible, ce qui limite l'évaluation externe des performances annoncées. La combinaison MPC-RL n'est pas nouvelle dans la recherche en locomotion : des travaux comme ceux de DeepMind sur le contrôle de quadrupèdes ou les approches whole-body de CMU et ETH Zurich ont exploré des directions similaires. La spécificité ici réside dans l'accent mis sur la scalabilité GPU et l'absence de précompilation, deux verrous pratiques qui freinent l'adoption dans les pipelines d'entraînement industriels. Les acteurs qui déploient activement des humanoïdes en environnement réel, comme Figure AI, Apptronik ou Agility Robotics, travaillent tous à réduire le sim-to-real gap sur la manipulation dextre : une infrastructure d'entraînement MPC-RL plus légère pourrait accélérer leurs cycles d'itération. La prochaine étape naturelle serait une validation sur des plateformes nommées et des tâches de manipulation avec contraintes de contact.

RecherchePaper
1 source
DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils
1643arXiv cs.RO 

DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils

Des chercheurs ont publié DexFuture (arXiv:2606.05699), une architecture hiérarchique pour la manipulation bimanuelle dextre avec des outils. Le système se décompose en deux niveaux : un prédicteur de cibles visuomotrices futures (Future-State Visuomotor Target Predictor) en haute couche, et une politique d'exécution bas niveau conditionnée sur ces cibles (Target-Conditioned Structured Dexterous Policy). Le prédicteur exploite un flux RGB égocentrique, des données proprioceptives et un historique géométrique pour générer une trajectoire multi-étape via un transformeur conditionné sur l'horizon temporel ; le module d'exécution suit ensuite ces cibles articulation par articulation (per-link) à 60 Hz. Sur le benchmark OakInk2 de tâches bimanuelles avec outils, DexFuture atteint 90 % des performances d'un oracle disposant d'états privilégiés (informations inaccessibles en déploiement réel), contre seulement 7 % pour une politique sans référence future, et s'exécute environ 250 fois plus vite que les approches de planification CEM de type DexWM. Ce résultat est notable car il s'attaque à l'un des verrous fondamentaux de la robotique dextre : comment générer une référence future dynamiquement cohérente sans s'appuyer sur des états privilégiés issus de démonstrations humaines, et sans planification contrefactuelle lente sur des séquences d'actions à haute dimension. L'écart de performance entre la politique sans référence (7 %) et DexFuture (90 %) illustre à quel point le conditionnement sur un horizon temporel est déterminant pour la manipulation fine à deux mains. Pour les intégrateurs et décideurs B2B, l'exécution à 60 Hz est compatible avec du contrôle temps-réel sur hardware standard, là où les approches CEM nécessitaient des cycles bien trop longs pour un déploiement industriel. La séparation explicite entre prédiction sémantique lente (long horizon) et exécution haute fréquence (bas niveau) est une architecture qui se répand dans la robotique de précision, et DexFuture en fournit une validation quantitative significative sur benchmark public. Le benchmark OakInk2 est une référence académique établie pour évaluer la manipulation d'outils à deux mains avec des mains anthropomorphes, couvrant des tâches réalistes de préhension, transfert et utilisation d'outils courants. Le champ des politiques visuomotrices pour mains dextres est en pleine effervescence : DexWM (world models pour la dextérité), Pi-0 de Physical Intelligence, et les approches VLA (Vision-Language-Action) de Google DeepMind et Figure AI poussent la généralisation vers des niveaux inédits. DexFuture se distingue en ciblant la cohérence dynamique de la trajectoire future sans supervision privilégiée, une contrainte plus réaliste que les méthodes supposant un accès complet à l'état du système. L'article n'annonce ni déploiement physique ni timeline commerciale : il s'agit d'un résultat de recherche fondamentale validé en simulation et sur données de démonstration. Les étapes naturelles seraient le passage à des mains physiques (sim-to-real), l'extension à des outils non vus à l'entraînement, et l'intégration dans des pipelines VLA pour des tâches de longue durée.

RecherchePaper
1 source
VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique
1644arXiv cs.RO 

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique

Des chercheurs ont publié sur arXiv (identifiant 2606.05395) un framework nommé VASO, pour "Verification-guided Self-evolution of LLM-generated robot skill contracts", qui vise à rendre les compétences robotiques générées par des grands modèles de langage à la fois réutilisables et formellement vérifiables. L'idée centrale : chaque compétence n'est plus un simple script exécutable mais un contrat sémantique à double interface, une interface formelle qui aligne états du robot, observations et commandes de contrôle avec des propositions logiques pour le model checking, et une interface orientée planificateur qui guide la génération de comportements exécutables. Lorsqu'un plan généré échoue à la vérification, VASO traduit la trace de contre-exemple en un gradient textuel qui met à jour le contrat de compétence réutilisable, sans toucher aux poids du modèle de fondation. Sur des plateformes Clearpath Jackal et PX4 (quadrocoptère), le framework atteint 97,2 % de conformité aux spécifications temporelles formelles en moins de 100 échantillons d'optimisation, surpassant les baselines de feedback d'exécution, d'optimisation de prompt et de fine-tuning. Le problème adressé est précis et rarement traité : les boucles d'évolution de compétences existantes, retour d'exécution, tests unitaires, récompenses d'environnement, auto-critique LLM, ne fournissent que des preuves au niveau de la trace. Elles montrent qu'une compétence a fonctionné sur des exécutions échantillonnées, pas qu'elle satisfait des contrats de sécurité temporelle dans des conditions non testées. Pour un intégrateur ou un COO industriel, c'est la différence entre une démo convaincante en lab et un déploiement certifiable en production. Le fait que VASO maintienne les poids du modèle gelés est également notable sur le plan économique : pas de fine-tuning, pas de GPU dédié à la mise à jour du modèle. Ce travail s'inscrit dans la tendance des "physical AI agents" où les LLM orchestrent des comportements robotiques à long horizon depuis des instructions en langage naturel. Les compétences réutilisables sont devenues les unités de base de ces architectures, mais leur fiabilité formelle reste un angle mort notable. Des approches concurrentes comme les VLA (Vision-Language-Action models) ou les frameworks d'optimisation de prompts comme OPRO ne ferment pas cette boucle vérification-évolution. VASO affirme être le premier à le faire explicitement. Il s'agit néanmoins d'un preprint sans validation industrielle publiée, et les résultats obtenus sur deux plateformes relativement simples devront être confirmés sur des environnements plus complexes et des chaînes de compétences plus longues avant d'envisager un déploiement en conditions réelles.

RecherchePaper
1 source
Flow matching guidé par le potentiel pour l'amélioration des politiques VLA
1645arXiv cs.RO 

Flow matching guidé par le potentiel pour l'amélioration des politiques VLA

Des chercheurs ont publié le 5 juin 2026 sur arXiv (2606.04968) une méthode baptisée ForesightFlow, conçue pour améliorer les politiques de type vision-langage-action (VLA) sans recourir à un critique externe. Le problème de départ est concret : lorsqu'un robot déploie une politique VLA entraînée par imitation, il génère inévitablement des trajectoires de qualité variable, succès complets, récupérations partielles, erreurs rattrapables, échecs francs. L'imitation comportementale classique reproduit les erreurs, le filtrage par seuil de qualité écarte des sous-trajectoires pourtant exploitables, et le renforcement offline ajoute un critique séparé coûteux. ForesightFlow contourne ces trois écueils en augmentant chaque chunk d'actions généré d'une trajectoire de potentiel de succès apprise conjointement. Le même réseau de flow matching propose et note les actions candidates, permettant une inférence de type best-of-K sans module additionnel. Sur cinq tâches de simulation BEHAVIOR-1K et cinq tâches réelles bimanipulation, la méthode dépasse les baselines d'imitation, égale le meilleur baseline avec critique séparé en simulation, améliore le taux de succès en conditions réelles et réduit le coût d'entraînement de 38 %. L'apport industriel le plus direct est cette réduction de 38 % des ressources de calcul à performance comparable, un argument budgétaire non négligeable pour les labos qui entraînent des modèles VLA de grande taille. Plus fondamentalement, ForesightFlow montre qu'il est possible de valoriser les données de déploiement imparfaites sans jeter les mauvais épisodes ni payer le coût d'un critic offline. La clé technique est un "decoupled advantage-weighted flow matching" : les poids d'avantage exponentié s'appliquent uniquement aux vitesses d'action, tandis que les vitesses de potentiel sont entraînées uniformément, évitant ce que les auteurs appellent la "value hallucination". Un estimateur de frontière en un seul pas forward (stop-gradient) rend le calcul des avantages suffisamment léger pour être intégré dans la boucle d'entraînement. Ce travail s'inscrit dans une vague de recherche dense autour des VLA pour la manipulation robotique, où Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA ont établi les références récentes en termes d'architectures génératives. Le recours au flow matching, alternative à la diffusion, plus rapide à l'inférence, pour la politique robotique est une tendance émergente depuis 2024. ForesightFlow est à ce stade une contribution académique, pas un produit ou un déploiement annoncé ; aucun partenariat industriel ni timeline commerciale n'est mentionné. Les prochaines étapes naturelles seraient la validation sur des benchmarks plus larges type LIBERO ou RLBench, et l'intégration dans des pipelines VLA à plus grande échelle comme ceux entraînés sur Open-X Embodiment.

RechercheOpinion
1 source
WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée
1646arXiv cs.RO 

WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée

Des chercheurs ont publié WAM-Nav (Latent World-Action Model for Navigation), un système de navigation visuelle incarnée qui couple la génération d'actions et la prévision visuelle dans un seul modèle, déposé sur arXiv en juin 2026 (réf. 2606.04907). L'architecture repose sur un Diffusion Transformer partagé qui effectue une diffusion jointe asymétrique : il génère simultanément des actions à long horizon et une anticipation visuelle à court horizon, sans recourir aux rollouts autorégressifs multi-étapes qui alourdissent la latence d'inférence. Un mécanisme de conditionnement contextuel à double flux intègre l'historique d'ego-motion à l'échelle de l'épisode et les observations visuelles séquentielles, favorisant des trajectoires lisses et cohérentes. Un module d'alignement d'objectif unifié permet à WAM-Nav de gérer trois modes dans une seule politique : Image-Goal, Point-Goal et exploration libre (No-Goal). Sur les benchmarks ClutterScenes et InternScenes, le système améliore les taux de réussite de 15,7 % en Image-Goal et de 3,3 % en Point-Goal. En déploiement réel, WAM-Nav atteint 85 % de taux de succès moyen sur des environnements intérieurs et extérieurs variés, sans fine-tuning, soit un transfert sim-to-real zéro-shot. Ce résultat intéresse directement les intégrateurs de robotique mobile pour deux raisons concrètes. D'abord, la résolution simultanée de l'action et de l'imagination visuelle dans un seul réseau réduit l'accumulation d'erreurs typique des architectures modulaires, où le prédicteur de scène et le module de politique sont entraînés séparément et se propagent mutuellement leurs erreurs. Ensuite, un taux de 85 % en zéro-shot sur des environnements variés représente un indicateur sérieux, même si les conditions de test (densité d'obstacles, vitesses, types de sols) ne sont pas détaillées dans le résumé et méritent d'être examinées dans le papier complet. Pour un COO ou un décideur B2B, cette architecture suggère des robots de navigation capables de s'adapter à de nouveaux scénarios sans collecte de données coûteuse sur site. Le sim-to-real gap reste l'un des blocages majeurs de la robotique mobile autonome depuis des années : les politiques entraînées en simulation échouent souvent au contact du monde réel en raison des différences de rendu, de dynamique et de bruit des capteurs. WAM-Nav s'inscrit dans une vague de travaux qui combinent modèles de diffusion pour la génération d'actions et représentations latentes du monde, dans la lignée des World Models de type RSSM ou des VLA comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. Sur le plan concurrentiel, des approches comme NoMaD, ViNT ou les stacks Nav2/ROS 2 restent des références opérationnelles sur AMR commerciaux, et WAM-Nav devra être comparé à ces systèmes dans des conditions contrôlées identiques pour confirmer sa supériorité pratique. L'étape suivante naturelle serait une validation sur des plateformes matérielles réelles en conditions industrielles, dont aucun partenariat ni timeline n'est annoncé à ce stade.

RecherchePaper
1 source
MineXplore : un benchmark d'exploration open-source par apprentissage par renforcement pour environnements souterrains sans GNSS
1647arXiv cs.RO 

MineXplore : un benchmark d'exploration open-source par apprentissage par renforcement pour environnements souterrains sans GNSS

Des chercheurs ont publié MineXplore, un benchmark open-source basé sur MuJoCo pour entraîner des agents d'exploration autonome dans des mines souterraines en environnement GNSS-dénié. L'environnement reconstitue un réseau de tunnels de 104 423 m² à partir du relevé d'une mine de cuivre chilienne (dataset Leung et al., 2017), via un pipeline en six étapes (contour-to-MJCF) générant des sections de galeries octogonales, une géométrie de parois irrégulières issue de données LiDAR, trois zones de friction au sol distinctes, une inclinaison globale de 5 degrés et un éclairage ponctuel périodique. La fidélité géométrique est validée à un IoU de 0,9538 par rapport à la carte de relevé source, et la similarité de texture de surface atteint 79,4 % sur six dimensions structurelles. Un agent PPO entraîné via RLlib sur cinq graines aléatoires indépendantes atteint une couverture roulante maximale de 88,89 %, trois des cinq runs franchissant le seuil cible de 90 %. L'apport principal est de combler un vide concret dans l'écosystème open-source : aucun benchmark compatible avec les pipelines d'apprentissage accélérés par GPU n'existait pour des environnements miniers souterrains à géométrie réaliste. Les mines constituent des cas extrêmes pour la navigation autonome, sans GNSS, éclairage dégradé, topologie en boucle non convexe, qui mettent en défaut les approches développées en terrain ouvert. La reproductibilité des résultats sur cinq seeds indépendantes valide la stabilité du benchmark pour des comparaisons inter-méthodes rigoureuses, un critère essentiel pour les publications futures. Pour les équipes développant des robots d'inspection ou de cartographie minière, MineXplore réduit le sim-to-real gap dans des environnements où les tests terrain sont coûteux, longs à organiser et potentiellement dangereux. Le benchmark s'ancre dans des données de terrain réelles plutôt qu'une géométrie synthétique, ce qui lui confère une crédibilité sectorielle plus solide que les environnements procéduraux courants. La communauté avait déjà travaillé le problème souterrain via le challenge DARPA SubT (2019-2021), qui a produit des résultats notables avec des plateformes comme Boston Dynamics Spot ou ANYbotics ANYmal, mais favorisait les architectures modulaires classiques. MineXplore occupe un espace complémentaire, centré explicitement sur l'apprentissage par renforcement et les politiques end-to-end. Les extensions naturelles concernent les scénarios multi-agents, les capteurs additionnels (RGB, thermique) et des topologies de mines plus variées. Le code est disponible publiquement sur arXiv, ce qui devrait accélérer les contributions de la communauté autour de la robotique en milieu confiné.

RecherchePaper
1 source
Génération de mouvements extrêmes par contrôle hybride en espace nul pour le suivi de trajectoire en ligne droite
1648arXiv cs.RO 

Génération de mouvements extrêmes par contrôle hybride en espace nul pour le suivi de trajectoire en ligne droite

Des chercheurs présentent dans un preprint arXiv (2606.03390) une méthode baptisée "extreme motion generation" qui vise à maximiser la longueur du chemin cartésien parcouru par un manipulateur à base fixe sur une trajectoire rectiligne prédéfinie. L'objectif concret : pousser un bras robotique jusqu'aux limites de son espace de travail sans déclencher les butées articulaires, ce qui est critique pour des applications continues comme le revêtement de surface ou le soudage. Le système a été évalué sur 10 000 tâches de suivi de chemin en ligne droite avec un Franka FR3 à 7 degrés de liberté. Résultat : une augmentation de 27 % de la longueur moyenne de trajectoire par rapport à une baseline entièrement basée sur un contrôleur modèle, avec des gains bien supérieurs sur les cas extrêmes. L'intérêt technique réside dans l'architecture hybride proposée. Un contrôleur par apprentissage par renforcement (RL) gère les décisions à long horizon, là où il excelle, tandis qu'un contrôleur modèle classique prend la relève lorsque le manipulateur s'approche des limites articulaires, une zone où la politique RL se dégrade en raison d'une couverture de données insuffisante. La bascule entre les deux modes se fait selon une distance normalisée aux limites articulaires. L'initialisation des configurations articulaires est résolue par un modèle de diffusion conditionnel, qui exploite un prior de mouvement appris pour choisir des configurations de départ favorables. Ce découplage explicite entre prise de décision à long terme (RL) et stabilisation locale (contrôle modèle) est une réponse directe au problème dit du "safety boundary avoidance" dans les trajectoires longues, un problème qui reste mal résolu par les approches purement data-driven. Ce travail s'inscrit dans un corpus croissant autour des contrôleurs hybrides RL+modèle pour la manipulation industrielle, à côté d'approches comme celles de Lux et al. ou des travaux sur le null-space control dans les bras redondants. Il ne s'agit pas ici d'un robot humanoïde ni d'une VLA généraliste, mais d'une contribution ciblée sur les manipulateurs fixes à tâche contrainte, directement pertinente pour les intégrateurs en soudage robotisé ou en peinture automatisée. Le Franka FR3 est un bras de recherche standard à 7 degrés de liberté, ce qui rend les résultats reproductibles mais limite leur généralisation directe à d'autres cinématiques. Les vidéos et le site projet sont accessibles publiquement ; aucun déploiement industriel ni partenariat commercial n'est mentionné dans ce preprint.

UEMéthode directement exploitable sur le Franka FR3 (bras allemand, Franka Robotics GmbH), ce qui la rend pertinente pour les intégrateurs européens en soudage robotisé et revêtement automatisé.

IndustrielPaper
1 source
EaDex : un cadre de manipulation dextérique multi-plateforme à partir de démonstrations à faible coût
1649arXiv cs.RO 

EaDex : un cadre de manipulation dextérique multi-plateforme à partir de démonstrations à faible coût

EaDex, un framework de manipulation dextère multi-corps présenté dans un preprint arXiv (2606.03268, juin 2026), propose d'entraîner des mains robotiques articulées à partir de démonstrations humaines capturées avec une simple caméra RGB-D grand public. Le pipeline repose sur le modèle paramétrique MANO pour reconstruire la géométrie 3D de la main, suivi d'une étape de normalisation et de retargeting cinématique vers différentes morphologies robotiques. Le système a été évalué sur trois mains dextères distinctes et trois catégories de tâches d'ouverture d'objets articulés, couvrant neuf configurations cross-embodiment. Par rapport à une baseline sans mécanisme d'annealing de démonstrations, EaDex affiche une amélioration relative de 55,3 %. Le verrou adressé est structurel pour le secteur: le reinforcement learning pur en manipulation dextère exige une exploration interactive à grande échelle, coûteuse en temps machine et difficile à transférer, tandis que l'imitation learning classique dépend de démonstrations à haute fidélité collectées via des gants haptiques ou des systèmes de motion capture onéreux. EaDex cherche à abaisser ce seuil avec du matériel accessible. Son mécanisme central, l'"annealing dynamique de démonstrations basé sur les récompenses de contact", est notable: il guide l'exploration initiale en s'appuyant sur les trajectoires humaines, puis réduit progressivement cette dépendance à mesure que l'agent accumule des contacts réussis, évitant le sur-ajustement aux trajectoires de référence. Que le même pipeline fonctionne sur trois architectures de main aux cinématiques différentes est le point le plus pertinent pour un intégrateur: cela suggère une généralisation morphologique réelle, pas un résultat ajusté manuellement par configuration. L'approche s'inscrit dans un effort plus large de la communauté pour rendre la collecte de données de manipulation bon marché et scalable, face à des méthodes concurrentes comme DAPG ou DexMimicGen qui requièrent des infrastructures plus lourdes. Le papier n'annonce pas de déploiement industriel ni de partenariat commercial: c'est un résultat de recherche en phase preprint, sans validation sur des objets non-vus ni en conditions réelles non-contrôlées. Les suites naturelles incluront des tests sur des tâches plus complexes (bimanuel, objets déformables) et une comparaison systématique avec des pipelines VLA récents sur des benchmarks standardisés.

IA physiquePaper
1 source
SpaceTools : raisonnement spatial augmenté par des outils via apprentissage par renforcement interactif double
1650arXiv cs.RO 

SpaceTools : raisonnement spatial augmenté par des outils via apprentissage par renforcement interactif double

Une équipe de chercheurs a publié, début juin 2026 sur arXiv, les travaux sur SpaceTools, un modèle de vision-langage (VLM) entraîné à coordonner plusieurs outils de perception spatiale via un nouveau cadre d'apprentissage par renforcement baptisé DIRL (Double Interactive Reinforcement Learning). Le système s'appuie sur des outils standards de perception robotique comme les estimateurs de profondeur, les modèles de segmentation et les estimateurs de pose, que le VLM apprend à orchestrer de manière autonome sans pipeline fixe. La validation expérimentale porte sur trois benchmarks de compréhension spatiale, RoboSpatial-Home, BLINK et BOP-ASK, où SpaceTools atteint l'état de l'art, avec des gains de +12 points de pourcentage sur RoboSpatial par rapport à un fine-tuning supervisé standard (SFT) et +16 points par rapport à un RL mono-outil de référence. Les tests en manipulation réelle ont été conduits sur un bras robotique à 7 degrés de liberté (7-DOF). L'enjeu central adressé par ces travaux est le fossé entre la compréhension visuelle qualitative des VLMs actuels et la précision métrique exigée par les applications embarquées. Les VLMs savent décrire une scène, mais peinent à répondre à des questions du type "à quelle distance exacte se trouve cet objet" ou "quel est l'angle de rotation optimal pour saisir cette pièce", ce qui bloque leur intégration dans des systèmes de manipulation industrielle. DIRL résout ce problème en deux phases : une phase d'enseignement qui combine des démonstrations issues d'un spécialiste mono-outil et des traces générées par un modèle frontier utilisant tous les outils disponibles, suivie d'une phase d'exploration où le modèle affine lui-même la coordination multi-outils par RL interactif. Ce résultat contredit l'hypothèse selon laquelle le multi-tool reasoning via RL serait inaccessible en raison de l'explosion combinatoire de l'espace de recherche. Ces travaux s'inscrivent dans la dynamique plus large d'intégration des VLMs dans la robotique embodied, un axe de recherche en forte croissance depuis les travaux SayCan (Google, 2022) et RT-2 (DeepMind, 2023). Sur le front concurrent, des approches comme ToolkenGPT ou des pipelines handcrafted restent prisonniers de séquences d'outils prédéfinies, tandis que SpaceTools apprend à choisir dynamiquement ses outils. Il s'agit pour l'instant d'un preprint de recherche, sans déploiement industriel annoncé, et les vidéos de manipulation sur le bras 7-DOF restent des démonstrations lab-controlled dont la généralisation en conditions réelles reste à confirmer. Le code et les détails sont accessibles via la page projet spacetools.github.io.

RechercheOpinion
1 source