Aller au contenu principal

Recherche — page 8

2076 articles · page 8 sur 42

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels
351arXiv cs.RO RecherchePaper

Reconnaissance gestuelle tactile par capteurs articulaires intégrés pour robots industriels

Des chercheurs ont publié sur arXiv (2508.12435) une étude démontrant qu'un robot industriel peut reconnaître des gestes tactiles humains en exploitant uniquement ses capteurs articulaires intégrés, sans aucun capteur externe. Implémentée sur un bras Franka Emika Research (7 DOF), l'approche s'appuie sur des architectures CNN évaluées sur un dataset collecté spécifiquement pour l'expérience. Deux méthodes ont atteint plus de 95 % de précision en détection de contact et classification de gestes : STFT2DCNN, qui applique une transformée de Fourier à court terme pour générer des spectrogrammes 2D, et STT3DCNN, qui exploite des représentations temps-fréquence tridimensionnelles. La variable déterminante n'est pas le choix d'architecture CNN mais la représentation des données : passer des séries temporelles brutes aux spectrogrammes fait bondir les performances de façon significative. L'implication industrielle est directe. Équiper un robot d'une peau tactile ou de caméras supplémentaires pour détecter l'intention humaine coûte cher, complexifie l'intégration et fragilise la maintenance. Prouver que les couples et positions articulaires déjà remontés par le contrôleur suffisent à atteindre 95 % de précision ouvre une voie de déploiement à coût quasi nul pour la collaboration homme-robot dans les cellules existantes. Les modèles spectraux montrent également une meilleure généralisation à de nouvelles configurations articulaires, ce qui est un signal positif pour des applications où le robot change fréquemment de posture de travail. Cela dit, les performances sont mesurées en laboratoire sur un seul modèle de robot et un dataset maison dont la taille et la diversité ne sont pas précisées dans l'abstract, ce qui invite à la prudence avant de conclure à une généralisation industrielle immédiate. La reconnaissance tactile sans peau robotique est un chantier actif depuis plusieurs années, notamment dans les labos qui travaillent sur la conformance mécanique (robots cobots comme le Franka, UR, ou le Kinova). Des approches concurrentes s'appuient sur des capteurs de force-couple au poignet (ATI, Robotiq FT300), des peaux à électrodes capacitives, ou la vision RGB-D pour inférer l'intention de contact, chacune avec un surcoût matériel substantiel. Ce travail positionne les signaux proprioceptifs comme une alternative viable et souligne que le verrou n'est pas hardware mais algorithmique. Les prochaines étapes probables : validation sur d'autres plateformes (UR10, KUKA iiwa), extension à des gestes plus complexes, et tests en conditions industrielles réelles avec bruit vibratoire ambiant.

UELa validation s'appuie sur un bras Franka Emika (plateforme allemande dominante dans les labos et cellules cobots européens) : si confirmée sur d'autres plateformes, cette approche offrirait aux intégrateurs EU une voie de déploiement HRI à coût quasi nul sans capteurs supplémentaires.

1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
352arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

UELes plateformes AMR européennes comme Exotec, qui déploient ou évaluent des systèmes VLA embarqués, devront réévaluer leurs hypothèses d'optimisation d'inférence (quantization, pruning) à la lumière des paradoxes documentés par TISED avant tout déploiement à grande échelle.

RechercheOpinion
1 source
CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle
353arXiv cs.RO 

CORE Planner : navigation robotique en environnements inconnus par apprentissage par renforcement à mémoire contextuelle

Une équipe de chercheurs a publié sur arXiv (réf. 2606.29222) un planificateur de navigation autonome baptisé CORE (Contextual-memory Oriented Reinforcement-learning), conçu pour guider un robot dans des environnements inconnus sans carte préalable. L'architecture combine un graphe de visibilité sparse pour la représentation structurée de l'espace, un réseau Transformer pour la compréhension globale de l'environnement, et un mécanisme de mémoire contextuelle pour éviter les optima locaux dans les grandes scènes. Testé face au planificateur traditionnel FAR Planner et à plusieurs baselines d'apprentissage par renforcement, CORE réduit la distance de déplacement de 13 % par rapport à FAR Planner et jusqu'à 48 % face aux meilleures méthodes d'apprentissage, avec des gains qui s'accentuent dans les environnements complexes. Fait notable : le modèle réalise un transfert sim-to-real en zéro-shot, sans fine-tuning sur données réelles, après entraînement exclusif sur des environnements simulés basés sur l'image. Le code est disponible en accès libre sur GitHub. Ce résultat s'attaque à un verrou persistant de la navigation mobile : la dégradation des performances lors du passage du simulateur au monde réel. La plupart des méthodes d'apprentissage par renforcement nécessitent soit une domain randomization poussée, soit un fine-tuning coûteux sur données terrain. Ici, le zéro-shot sim-to-real est démontré en environnement physique sans intervention humaine, résultat significatif si les conditions expérimentales sont généralisables. Pour les intégrateurs et équipes R&D, l'enjeu concret est double : réduction de la distance parcourue (efficacité énergétique, temps de cycle) et capacité à opérer dans des espaces non cartographiés, scénario courant en logistique, BTP ou exploration. La navigation en environnements inconnus s'appuie historiquement sur le SLAM, avec des contributions majeures d'ETH Zurich, Carnegie Mellon ou l'INRIA côté européen. FAR Planner (CMU), utilisé ici comme référence de comparaison, reste une baseline solide mais à règles fixes. Sur le plan industriel, Boston Dynamics, ANYbotics ou Exotec intègrent des planificateurs propriétaires dans leurs flottes de robots mobiles. CORE se positionne comme une alternative légère, entraînable sur image seule, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La robustesse face aux obstacles dynamiques, non testée dans cette version, constituera l'étape critique pour une éventuelle industrialisation.

UELe code open-source pourrait être évalué par des équipes R&D françaises (Exotec, intégrateurs logistiques) pour la navigation en espaces non cartographiés, mais il n'y a pas de lien institutionnel direct avec la France ou l'UE.

RecherchePaper
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
354arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

UELe code et le dataset open-source pourraient être exploités par des équipes de recherche européennes travaillant sur la navigation de robots à pattes (ex. ANYbotics en Suisse, labos SLAM EU), mais aucun acteur français ou européen n'est directement impliqué dans les travaux.

RecherchePaper
1 source
Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique
355arXiv cs.RO 

Eval-Actions : évaluation fine de la qualité d'exécution en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.18723v2) Eval-Actions, une méthodologie d'évaluation diagnostique et un benchmark en conditions réelles pour mesurer la qualité d'exécution des politiques de manipulation robotique de type Vision-Action (VA) et Vision-Language-Action (VLA). Le corpus rassemble plus de 13 000 épisodes téléopérés et générés par des politiques apprises, couvrant 150 tâches et environ 52 heures d'enregistrements avec vidéos RGB-D, trajectoires d'état robot et labels succès/échec. Trois niveaux d'annotation structurent le benchmark : un Expert Grading (EG) basé sur des critères explicites, des labels Rank-Guided (RG) alignant indicateurs cinématiques et classements experts, et des annotations Chain-of-Thought (CoT) qui explicitent les différences d'exécution observables entre épisodes. Les auteurs fournissent également AutoEval, un évaluateur multimodal de référence : AutoEval-S atteint une corrélation de rang Spearman (SRCC) de 0,81 sous EG et 0,84 sous RG, avec une précision de détection du succès de 90,6 % et 91,0 % respectivement ; AutoEval-P obtient 0,70 SRCC sous CoT. L'apport principal est de combler un angle mort persistant dans le domaine : les benchmarks robotiques mesurent quasi exclusivement le taux de succès binaire, une métrique grossière qui masque des différences profondes entre exécutions réussies. Deux politiques peuvent accomplir la même tâche de préhension avec des trajectoires radicalement différentes en termes de fluidité, de sécurité des mouvements ou d'efficacité. Pour les intégrateurs industriels et les équipes de déploiement, ce niveau de granularité est critique : il conditionne la robustesse en production, la détection précoce des dégradations de performance, et la comparaison fiable de politiques concurrentes hors ligne, sans enregistrement supplémentaire sur robot physique. Les modèles VLA ont connu une accélération marquée depuis 2024, notamment avec Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) côté architectures de politiques, mais leur évaluation rigoureuse restait un point faible reconnu du domaine, freinant reproductibilité et décisions d'achat. Eval-Actions s'inscrit dans un effort de standardisation aux côtés de RoboMimic, LIBERO et Open X-Embodiment, sans cibler un concurrent direct. Les suites logiques incluent l'extension aux manipulateurs bi-bras, la validation sur systèmes humanoïdes complets et l'intégration potentielle comme critère officiel dans des challenges robotiques standardisés.

RechercheOpinion
1 source
SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon
356arXiv cs.RO 

SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon

Une équipe de chercheurs a publié SWITCH (arXiv:2511.17649), un benchmark conçu pour évaluer la capacité des agents IA à interagir avec ce que les auteurs appellent des interfaces de contrôle tangibles (TCIs) : panneaux d'appareils électroménagers, télécommandes, ascenseurs, interfaces graphiques embarquées. Le jeu de données comprend 1 170 vidéos temporellement interactives, annotées de manière structurée avec instructions, actions, transitions d'état, résultats et comportements de récupération en cas d'erreur. La spécificité de SWITCH est d'évaluer le raisonnement en boucle fermée : l'agent doit percevoir, agir, vérifier le résultat, et corriger si nécessaire, dans une séquence continue. Le benchmark inclut également une évaluation des modèles de génération vidéo sur des tâches centrées sur l'interaction, combinant jugement automatique par LLM et évaluation humaine. L'intérêt de SWITCH réside dans ce qu'il révèle : les modèles multimodaux de frontier, propriétaires comme open source, présentent des faiblesses persistantes en perception visuo-temporelle fine, en vérification des résultats et en récupération d'erreur. La plupart des benchmarks existants se limitent à la perception en boucle ouverte ou à l'exécution d'une seule action, ce qui masque précisément les défaillances qui apparaissent dans des scénarios d'horizon long, là où l'agent doit maintenir un état interne et détecter un échec non anticipé. Pour les équipes travaillant sur des robots de service ou des agents embarqués destinés à des environnements industriels ou domestiques, ce constat est directement opérationnel : les modèles actuels ne sont pas encore fiables dès qu'une interaction nécessite un retour d'état et une correction. SWITCH s'inscrit dans un effort plus large de la communauté embodied AI pour combler le fossé entre les capacités de perception statique et l'agentivité réelle en environnement physique. Les benchmarks précédents comme SQA3D, EmbodiedScan ou OpenEQA avaient posé des jalons en compréhension 3D et en questions-réponses situées, mais sans capturer la dimension corrective de l'interaction. SWITCH adresse explicitement ce manque via des scénarios égocentrés. L'étude ne mentionne pas de partenariat industriel ni de déploiement applicatif immédiat : il s'agit d'un outil académique, non d'un produit. Les suites probables concernent l'intégration du benchmark dans les pipelines d'entraînement de VLA (Vision-Language-Action models) et l'extension à des environnements 3D interactifs.

RecherchePaper
1 source
Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel
357arXiv cs.RO 

Modèles physiques pour le transfert simulation-réel au tennis de table robotique de niveau professionnel

Des chercheurs ont soumis sur arXiv (arXiv:2606.28805, juin 2026) un ensemble de modèles physiques haute-fidélité destinés à améliorer le sim-to-real transfer en robotique, appliqués au tennis de table de niveau professionnel. À des vitesses et effets compétitifs, une balle de ping-pong suit des trajectoires complexes et contre-intuitives que le robot doit anticiper en une fraction de seconde. Les modèles proposés couvrent trois domaines : la dynamique aérodynamique du vol de balle, avec les coefficients de traînée et de force de Magnus modélisés en fonction du nombre de Reynolds et du rapport de rotation ; le contact balle-table, intégrant les effets de déformation (buckling) de la balle sur le coefficient de restitution ainsi que des termes résiduels ; et le contact balle-raquette, via un réseau de neurones résiduel combiné à des coefficients de restitution normale et tangentielle et un amortissement torsionnel. Ces modèles ont servi à entraîner des politiques par apprentissage par renforcement (RL), aboutissant à ce que les auteurs décrivent comme le premier agent robotique capable d'affronter des joueurs professionnels en conditions réelles. L'intérêt technique dépasse le cadre sportif. La nature adversariale du tennis de table impose une contrainte rarement aussi explicite ailleurs : toute zone où la simulation diverge de la réalité devient exploitable par l'adversaire, forçant une précision de modélisation sans concession. Les travaux antérieurs en robotique ping-pong se cantonnaient à des plages étroites de vitesses et d'effets, insuffisantes pour reproduire les comportements balistiques du jeu professionnel. Que ce pipeline simulation-vers-réalité soit suffisamment fidèle pour approcher ce niveau valide l'approche pour des tâches de manipulation rapide en milieu industriel, où les essais réels restent coûteux ou dangereux, et renforce l'hypothèse que le sim-to-real gap est soluble par la précision physique plutôt que par l'accumulation de données réelles. Ce travail s'inscrit dans la continuité directe des recherches publiées par Google DeepMind en 2024, qui avaient démontré qu'un robot pouvait battre des joueurs amateurs confirmés en conditions réelles. Ce nouveau papier documente les fondations physiques qui rendent possible le saut qualitatif vers le niveau professionnel. Plusieurs équipes concurrentes utilisent le ping-pong comme benchmark de robotique agile, mais peu ont publié des modèles de contact aussi détaillés pour les phases raquette-balle et balle-table. La revendication de compétitivité face à des professionnels reste à confirmer par des évaluations indépendantes, le papier étant une prépublication non encore évaluée par les pairs. Les suites logiques incluent la généralisation de ces modèles de contact résiduels à d'autres objets déformables et leur transposition à des tâches industrielles de manipulation précise à haute cadence.

RecherchePaper
1 source
Human2Any : transfert humain-robot via planification compositionnelle avec contraintes
358arXiv cs.RO 

Human2Any : transfert humain-robot via planification compositionnelle avec contraintes

Une équipe de chercheurs a publié en juin 2026 Human2Any, un framework d'apprentissage conçu pour transférer des démonstrations humaines vers des robots sans nécessiter de données d'entraînement collectées directement sur le robot cible. Le principe central repose sur l'extraction de priors d'interaction centrés sur les objets à partir de vidéos de mains humaines, en représentant la manipulation non pas par les mouvements du bras, mais par la relation cinématique entre objets, ce qui change dans la scène, indépendamment de qui ou quoi produit ce changement. Ces priors sont ensuite composés avec un module de raisonnement de faisabilité côté robot et un planificateur de mouvement, permettant l'adaptation à différentes morphologies robotiques, géométries de scène et configurations de tâches. Les expériences réelles ont été menées sur deux plateformes distinctes : un bras Franka Emika en configuration tabletop, et un robot humanoïde mobile RBY-1, tous deux opérant sur des tâches de manipulation sans avoir reçu d'exemples robot dans le contexte cible. Ce résultat est significatif parce qu'il attaque directement le goulot d'étranglement le plus coûteux du pipeline robotique actuel : la collecte de données de démonstration sur le robot réel. Les approches VLA (Vision-Language-Action) dominantes, comme celles de Physical Intelligence (pi0) ou de Google DeepMind, s'appuient sur des téléopérations massives ou des simulations intensives pour construire des datasets robot-specific. Human2Any propose une voie alternative : lever l'hypothèse que les priors doivent être ancrés dans l'embodiment. La capacité démontrée à transférer vers un humanoïde mobile comme le RBY-1, dont la cinématique et les degrés de liberté diffèrent radicalement d'un bras fixe, suggère une généralisation inter-embodiment qui, si elle se confirme à plus grande échelle, réduirait les barrières à l'entrée pour les intégrateurs sans accès à des flottes de robots pour la collecte. Sur le plan académique, Human2Any s'inscrit dans un courant de recherche en plein essor autour du retargeting humain-robot, aux côtés de travaux comme UMI (Universal Manipulation Interface) de Stanford ou OKAMI et HumanPlus de Berkeley, qui exploitent tous la vidéo humaine comme signal de supervision bon marché. La distinction revendiquée ici est l'abstraction complète de l'embodiment via la représentation objet-objet, plutôt qu'un retargeting cinématique direct. Le projet est disponible sur human2any.github.io. La prochaine étape logique sera de mesurer si ces priors tiennent face à une plus grande diversité d'objets, de saisies, et de configurations de scène non vues à l'entraînement.

UEL'utilisation du bras Franka Emika (fabricant allemand) comme plateforme de validation confère une pertinence marginale pour les intégrateurs européens, mais l'impact concret reste limité à la veille académique pour les équipes R&D robotique en France et en UE.

RecherchePaper
1 source
SIR : représentations d'images structurées pour un apprentissage robotique explicable
359arXiv cs.RO 

SIR : représentations d'images structurées pour un apprentissage robotique explicable

Des chercheurs du laboratoire Intuitive Robots publient SIR (Structured Image Representations, arXiv:2606.30101), une méthode visant à corriger l'un des angles morts persistants des politiques robotiques basées sur l'apprentissage profond : leur opacité. Le pipeline repose sur les Scene Graphs (graphes de scènes) comme couche intermédiaire entre la perception et l'action. À partir d'une image d'entrée, le système construit d'abord un graphe complet dont les noeuds sont initialisés avec des features visuelles extraites. Un second module apprend ensuite, de bout en bout, à réduire (sparsifier) ce graphe pour n'en conserver que le sous-graphe pertinent à la tâche courante, avant de le transmettre au générateur d'actions. Évalué sur RoboCasa, un benchmark de manipulation en environnement domestique simulé, SIR atteint un taux de succès moyen de 19,5 % contre 14,81 % pour les baselines à embeddings visuels directs, soit un gain relatif d'environ 30 %. L'intérêt ne se limite pas à ce delta de performance, en soi modeste en valeur absolue. Ce qui distingue SIR, c'est que le sous-graphe creux appris constitue une représentation lisible et auditable : il devient possible d'inspecter sur quels objets et quelles relations le modèle fonde ses décisions pour une tâche donnée. Lorsque ce sous-graphe s'écarte des attentes humaines, qu'il intègre des noeuds distracteurs sans rapport avec la tâche ou qu'il omet des objets pourtant centraux, les auteurs montrent que cela révèle systématiquement des biais dans le dataset d'entraînement, notamment des corrélations spurieuses et des biais positionnels. Pour des intégrateurs industriels ou des équipes soumises à des exigences de validation et de certification, cette capacité d'audit intrinsèque est un argument autrement plus fort qu'une amélioration marginale du taux de réussite. Ce travail s'inscrit dans un débat de fond au sein de la communauté robotique : les représentations visuelles latentes des architectures de type VLA (Vision-Language-Action) ou des politiques par diffusion sont puissantes mais pratiquement impossibles à déboguer. Les approches concurrentes pour l'explicabilité passent généralement par des méthodes post-hoc, cartes de saillance ou visualisation d'attention dans les Transformers, qui n'interviennent pas dans la boucle d'inférence. SIR propose à l'inverse une explicabilité structurelle native. Le code est disponible sur GitHub (intuitive-robots/SIR\_Model) et les auteurs évaluent pour l'instant uniquement en simulation ; la généralisation à des robots physiques dans des environnements non contrôlés reste la prochaine étape critique pour valider le sim-to-real transfer de cette approche.

RecherchePaper
1 source
Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique
360arXiv cs.RO 

Erreur quadratique sur intervalle critique : vers une validation hors ligne fiable des politiques de manipulation robotique

Une équipe de chercheurs publie sur arXiv (réf. 2606.29898) une métrique d'évaluation hors ligne baptisée Critical Interval MSE (CI-MSE), conçue pour combler un angle mort majeur dans le développement des politiques de manipulation robotique. Le problème de départ est bien connu : l'évaluation en conditions réelles reste la seule mesure fiable de la performance d'un modèle, mais elle est coûteuse, difficile à reproduire et trop lente pour comparer itérativement des variantes proches. Le proxy historique, la perte de validation MSE sur des démonstrations d'experts, présente une corrélation trop faible avec les performances en déploiement réel pour être utile en pratique. CI-MSE propose une approche différente : restreindre le calcul d'erreur aux segments temporels jugés critiques pour la tâche, et l'associer à des procédures d'alignement d'actions qui reproduisent mieux le comportement au moment du rollout. Les auteurs mesurent une corrélation de rang de Spearman de -0,87 entre leur métrique et les performances réelles, contre -0,61 pour la MSE brute, sur un large panel de checkpoints de politiques, validés en simulation et en environnement physique. L'enjeu industriel est direct : le goulot d'étranglement de l'itération sur les politiques robotiques n'est pas le calcul, c'est le temps de test physique. Si une métrique hors ligne prédit fiablement laquelle de deux variantes d'un modèle est meilleure, les équipes peuvent filtrer les mauvais candidats avant même de mobiliser un robot. Pour les intégrateurs et les labs qui travaillent sur des politiques de type VLA (Vision-Language-Action), ce gain de cycle de R&D peut se traduire en semaines économisées par itération. Le résultat de -0,87 est notable, mais à nuancer : les auteurs délimitent eux-mêmes des conditions limites d'utilisation, notamment en cas de shifts de distribution à l'évaluation. CI-MSE s'inscrit dans un effort plus large de la communauté pour résoudre le "sim-to-real gap" par des proxies d'évaluation plus fidèles, sans nécessiter de rollouts physiques systématiques. Les travaux sur les métriques comportementales (action chunking, diffusion policies) ont mis en évidence que la MSE brute ne capturait pas les moments décisifs d'une tâche de manipulation. Ce papier formalise cette intuition avec une analyse de sensibilité qui montre la robustesse de CI-MSE sur un large spectre d'hyperparamètres. Le code et les détails sont accessibles sur le site du projet (ci-mse.github.io). Prochaine étape attendue : validation à plus grande échelle sur des benchmarks multi-tâches et des architectures de politiques hétérogènes.

RechercheOpinion
1 source
Génération de concepts spatiaux de haut niveau intégrant l'incertitude dans des graphes de scènes 3D factorisés par GNN
361arXiv cs.RO 

Génération de concepts spatiaux de haut niveau intégrant l'incertitude dans des graphes de scènes 3D factorisés par GNN

Des chercheurs ont publié fin 2024 (arXiv:2409.11972, version 4) une méthode d'apprentissage automatique permettant à un robot de découvrir de manière autonome des concepts spatiaux de haut niveau, pièces, murs, couloirs, à partir de simples observations géométriques primitives telles que des surfaces planes verticales. L'approche s'appuie sur un réseau de neurones de graphe (GNN) qui infère ces concepts en ligne, puis les injecte comme facteurs optimisables dans un backend de SLAM (Simultaneous Localization and Mapping) reposant sur des Factorized 3D Scene Graphs. Ces graphes de scène 3D organisent la représentation de l'environnement de façon hiérarchique et métrico-sémantique, de l'obstacle ponctuel jusqu'à la pièce entière. Les gains mesurés sont significatifs : en environnements simulés à agencements complexes, la détection de pièces progresse de 20,7 % et l'estimation de trajectoire de 19,2 %. Sur des chantiers de construction réels, la détection de pièces s'améliore de 5,3 % et la précision du recalage cartographique de 3,8 %. L'intérêt de ce travail réside dans la suppression d'un goulot d'étranglement persistant dans la robotique d'intérieur : jusqu'ici, la génération de concepts spatiaux et la spécification des covariances associées reposaient sur des heuristiques conçues à la main, concept par concept. Cette dépendance limitait la généralisation à de nouveaux types d'environnements et rendait coûteuse l'extension à de nouvelles classes sémantiques. En automatisant à la fois la génération des facteurs et la calibration de leur incertitude, la méthode rend le pipeline SLAM plus robuste et potentiellement déployable sans expertise de réglage fin, ce qui intéresse directement les intégrateurs de robots mobiles autonomes (AMR) opérant dans des bâtiments industriels ou des chantiers évolutifs. Les 3D Scene Graphs, popularisés notamment par les travaux du MIT et de l'université Carnegie Mellon sur Hydra et ses successeurs, constituent depuis plusieurs années un cadre de référence pour la cartographie sémantique hiérarchique. La variante "factorisée" utilisée ici, qui encode les concepts comme contraintes d'optimisation dans le graphe de poses, est une direction active de la communauté graph-SLAM. Les concurrents directs incluent les approches basées sur des segmentations panoptiques 2D projetées en 3D (SegMap, Kimera) ainsi que les méthodes neuronales implicites de type NeRF-SLAM. La prochaine étape naturelle sera d'étendre la méthode à des concepts au-delà des pièces, zones fonctionnelles, étages, bâtiments, et de la valider à plus grande échelle sur des flottes robotiques opérant en continu.

RecherchePaper
1 source
Odométrie proprioceptive à ancrage de contact pour robots à pattes et roues-pattes
362arXiv cs.RO 

Odométrie proprioceptive à ancrage de contact pour robots à pattes et roues-pattes

Des chercheurs présentent dans un preprint arXiv (2602.17393, v3) un estimateur d'état proprioceptif pour robots à pattes qui n'utilise ni caméra, ni LiDAR, uniquement IMU et encodeurs moteurs. Le système calcule la pose et la vitesse du corps avec une formulation unifiée couvrant quadrupèdes et robots roue-patte (wheel-legged), validée sur quatre plateformes quadrupèdes distinctes. Le principe central est l'ancrage cinématique par contact : l'estimation des forces d'appui via le couple articulaire sélectionne les pieds en stance, dont les empreintes au sol fournissent des contraintes intermittentes dans le repère monde qui limitent la dérive cumulative de l'IMU. Un algorithme de clustering de hauteur avec décroissance temporelle corrige la dérive en élévation lors de longues traversées en recalant les nouvelles empreintes sur les plans d'appui précédemment observés. Pour les plateformes roue-patte, le contact enregistré est propagé par déplacement de roulement effectif avec compensation du mouvement de jambe et correction de direction sur pente. Cette approche répond à un verrou concret de la robotique mobile : les robots à pattes déployés en environnements visuellement dégradés (poussière, fumée, obscurité, souterrains) ne peuvent pas se fier à la vision ou au LiDAR. Les méthodes purement inertielles accumulent une dérive de cap et de position incompatible avec une navigation autonome prolongée. En ancrant l'estimation sur des contacts validés par couple, la méthode s'affranchit partiellement de la qualité des encodeurs de vitesse, sujets à quantification. Un filtre de Kalman cubature (UKF) par cinématique inverse est proposé en module optionnel pour améliorer les observations de vitesse pied sans alourdir l'architecture principale. La cohérence géométrique multi-contacts est injectée comme prior souple de cap plutôt que comme reset brutal de l'attitude, préservant la continuité de l'état estimé. L'odométrie proprioceptive pour robots à pattes est un terrain actif depuis les travaux Contact-Aided Invariant EKF (Hartley, University of Michigan) et les plateformes ANYmal développées à l'ETH Zurich. Les grandes solutions commerciales actuelles comme Boston Dynamics Spot ou Unitree B2 combinent odométrie visuelle et inertielle en production, ce qui signale l'intérêt industriel pour des alternatives sans capteurs exogènes dans des conditions adverses. La méthode est présentée comme extensible aux bipèdes, morphologie centrale dans la course aux humanoïdes industriels. À sa troisième révision sur arXiv, le papier cible probablement une conférence de robotique de premier rang (IROS, ICRA), sans calendrier de soumission annoncé.

RecherchePaper
1 source
Transformateur tactile hétérogène
363arXiv cs.RO 

Transformateur tactile hétérogène

Des chercheurs ont déposé le 30 juin 2026 sur arXiv (référence 2606.29948) le Heterogeneous Tactile Transformer (HTT), un framework visant à résoudre un verrou fondamental du toucher artificiel : l'hétérogénéité des capteurs tactiles. Un modèle entraîné sur un capteur visuotactile de type GelSight ne peut aujourd'hui pas être réutilisé sur un capteur matriciel résistif sans réentraînement complet, ce qui empêche toute mutualisation des données à grande échelle. HTT propose une architecture composée d'encodeurs spécifiques à chaque capteur couplés à un tronc transformer partagé, pré-entraîné par reconstruction masquée par modalité et alignement cross-modal entre paires de capteurs. Ce pré-entraînement s'appuie sur un nouveau dataset baptisé Heterogeneous Paired Tactile (HPT), compilant 1,6 million de frames synchronisées issues de quatre capteurs : deux visuels (vision-based) et deux matriciels (array-based). Les expériences montrent que HTT produit des représentations transférables à de nouvelles tâches et à des capteurs jamais vus à l'entraînement. Ce verrou est réel et coûteux pour les équipes robotique. Contrairement à la vision, où des modèles pré-entraînés comme ViT ou CLIP se transfèrent facilement d'une caméra à une autre, le tactile est resté un silo par capteur, forçant chaque projet à recollecte ses propres données de contact. Si HTT généralise correctement, cela ouvre la voie à des datasets tactiles fédérés, analogue à ce qu'Open X-Embodiment a réalisé pour la manipulation visuo-motrice, et potentiellement à des politiques contact-rich entraînées sur des données hétérogènes issues de plusieurs fournisseurs. Pour un intégrateur ou un COO industriel, l'enjeu est concret : pouvoir changer de capteur tactile sans tout réentraîner représente un gain de temps et de coût significatif sur les lignes d'assemblage précis. Ce travail succède à des approches comme T3 (Transferable Tactile Transformers, 2024) et UniTouch, qui avaient amorcé la représentation cross-capteur mais restaient limitées à une ou deux modalités. Sur le marché, GelSight et ses dérivés (DIGIT, GelSight Mini) dominent la recherche académique, tandis qu'Xela Robotics et Contactile misent davantage sur les grilles résistives ou piézoélectriques. L'article est présenté comme preprint et n'a pas encore été soumis à revue par les pairs ; le code, les poids de modèle et le dataset HPT seront publiés à la parution définitive, ce qui permettra une évaluation indépendante des performances revendiquées. L'étape suivante naturelle sera l'intégration de HTT dans des pipelines VLA (Vision-Language-Action) pour doter les mains humanoïdes d'un retour haptique fiable et généralisable à l'échelle.

RecherchePaper
1 source
IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte
364arXiv cs.RO 

IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte

Des chercheurs du laboratoire EMPRISE de l'université Cornell ont publié E²-CARE (arXiv:2606.28592), un cadre de contrôle pour robots d'assistance physique capables de s'adapter à la fois aux environnements variables et aux différentes morphologies robotiques sans reprogrammation. L'architecture représente l'espace de soins dans un graphe de scène 3D dynamique unifié qui modélise explicitement l'environnement, le robot et l'humain assisté. Ce graphe sert à synthétiser des contraintes spécifiques à chaque tâche, injectées en temps réel pour piloter l'exécution de gabarits d'interaction (interaction templates) prédéfinis. Le système a été évalué sur quatre activités de la vie quotidienne (ADL) dans des centaines d'environnements domestiques simulés, puis validé par des études utilisateurs portant sur deux tâches de soin avec deux robots distincts dans des environnements réels. La démonstration centrale d'E²-CARE est que les mêmes primitives de mouvement peuvent être réutilisées en zero-shot sur des robots de morphologies différentes et dans des environnements non vus à l'entraînement, sans dégradation de sécurité. C'est une réponse directe à l'un des verrous majeurs du secteur : le couplage fort entre un système de soin et son environnement ou son hardware d'origine. La contrainte de sécurité autour des humains, souvent absente des démonstrateurs existants, est ici modélisée comme une couche de contraintes d'exécution. Pour un intégrateur ou un acheteur B2B dans l'aide à la personne, c'est un argument de fond : un pipeline logiciel unique potentiellement déployable sur plusieurs plateformes matérielles, ce qui réduit substantiellement le coût d'intégration multi-hardware. EMPRISE (Enabling Manipulation and Physical Robot Interaction with Sensing and Embodiment) travaille depuis plusieurs années sur les robots d'assistance physique en contexte de vie quotidienne. Ce domaine reste très fragmenté : Diligent Robotics (Moxi, logistique hospitalière), 1X Technologies, et les plateformes académiques comme PR2 ou HSR de Toyota traitent chacun des sous-espaces étroits. E²-CARE n'est pas un produit commercial annoncé : il s'agit d'une contribution académique, sans prototype industriel ni timeline de commercialisation. Les étapes suivantes logiques impliquent des évaluations sur un plus grand nombre de morphologies physiques réelles et des scénarios d'interaction plus complexes, notamment avec des utilisateurs à mobilité fortement réduite ou en situation de dépendance avancée.

RecherchePaper
1 source
Planification séquentielle par points d'ancrage pour la robotique
365arXiv cs.RO 

Planification séquentielle par points d'ancrage pour la robotique

Des chercheurs de la Case Western Reserve University ont publié SPARK (Sequential Planning via Anchored Robotic Keypoints), un système neurosymbolique de manipulation robotique sans entraînement supplémentaire. Sur LIBERO-PRO, benchmark évaluant la robustesse face aux changements de position et de tâche, SPARK atteint 43,7 % sur six configurations, soit plus du double de CaP-Agent0 (18,2 %) et des baselines Vision-Language-Action. L'architecture repose sur deux appels Gemini : le premier génère un arbre de comportement (behavior tree) typé composé de primitives précodées intégrant le contrôle bas niveau (mouvement, préhension, géométrie de profondeur) ; le second propose trois formulations textuelles alternatives par objet, que SAM3 évalue pour retenir la détection la plus confiante. Un mécanisme de récupération relance toute primitive échouée sur des objets re-détectés, sans nouvel appel LLM. Le système a été validé sur trois familles de robots (UR10e, Franka FR3, Franka bimanuels) pour neuf tâches à vingt essais chacune, avec une moyenne de 68 %. Le résultat central est architectural : SPARK identifie la perception comme le principal point de rupture des pipelines de manipulation, non la planification. Les formulations alternatives par objet apportent +27,7 points sur les tâches spatiales et +10,0 sur la suite objet ; la boucle de récupération ajoute +5,0 points globalement. Là où CaP-Agent0 re-interroge un LLM en repartant de zéro à chaque échec, SPARK ne replanifie que la détection, réduisant significativement le coût computationnel. Point stratégique : chaque essai produit automatiquement une trajectoire vérifiée et étiquetée, permettant à un planificateur training-free de générer les données dont les VLAs ont besoin sans téleopération humaine. SPARK s'inscrit dans le débat entre architectures VLA end-to-end (pi-0 de Physical Intelligence, RT-2 de Google DeepMind, OpenVLA de Berkeley) et approches hybrides symboliques. Les VLAs misent sur la généralisation apprise de données massives mais restent fragiles aux distributions non vues à l'entraînement, précisément ce que LIBERO-PRO mesure. SPARK démontre qu'une conception neurosymbolique rigoureuse peut surpasser des modèles foundation sur des configurations difficiles. La validation reste limitée à neuf tâches sur trois plateformes, sans timeline de déploiement industriel annoncée. La modularité du système -- détecteur, planificateur et contrôleur remplaçables indépendamment -- ouvre la voie à des intégrations sur de nouvelles plateformes sans réentraînement.

RecherchePaper
1 source
OGM-CBF : contrôle sûr de robot mobile avec carte d'occupation et mémoire des obstacles hors de vue
366arXiv cs.RO 

OGM-CBF : contrôle sûr de robot mobile avec carte d'occupation et mémoire des obstacles hors de vue

Une équipe de chercheurs publie sur arXiv (identifiant 2405.10703, quatrième révision) une méthode baptisée OGM-CBF qui couple les fonctions de barrière de contrôle (CBF) à une carte d'occupation en grille (occupancy grid map) construite dynamiquement pendant l'opération du robot. Le problème adressé est précis : les approches CBF existantes ne considèrent que les obstacles présents dans le champ de vision instantané (FoV) du robot. Dès qu'un objet quitte ce champ, occultation, portée capteur dépassée, angle mort, la garantie de sécurité formelle disparaît. OGM-CBF mémorise les obstacles préalablement observés, de forme arbitraire, et les intègre dans le calcul de la barrière même après leur sortie du FoV. Pour résoudre la dégénérescence du gradient de la Signed Distance Function (SDF) en face-à-face avec un obstacle (ce qui annule l'autorité de braquage), les auteurs introduisent une pyramide d'images sur la SDF, produisant un CBF multi-niveaux. La méthode est validée dans le simulateur CARLA, puis déployée sur matériel réel : un robot d'entrepôt compact et un chargeur à roues articulé de grande taille, à direction de châssis. L'enjeu pratique est direct pour les intégrateurs AMR et opérateurs d'engins autonomes : en environnement industriel, un palettier, une machine ou un opérateur en mouvement peuvent masquer momentanément un obstacle critique. Sans mémoire d'environnement, le robot agit comme s'il évoluait dans un espace vide dès la sortie du FoV. OGM-CBF apporte une garantie formelle continue sans exiger de carte préchargée ni de reconstruction 3D explicite, ce qui limite le coût computationnel embarqué. La validation sur un chargeur articulé, véhicule lourd à cinématique non-holonome, typique des chantiers et ports, est particulièrement significative : elle démontre que les garanties CBF tiennent au-delà des plateformes holonomes de laboratoire, ouvrant une voie vers l'automatisation sécurisée en BTP, logistique portuaire et extraction minière. Les CBF constituent un axe de recherche actif depuis une décennie, en concurrence avec les champs de potentiel artificiel et les planificateurs à base de sampling pour la navigation sûre. OGM-CBF se distingue des approches GP-CBF (modélisation probabiliste de l'incertitude) et des CBF couplés à du SLAM complet, en exploitant directement la grille d'occupation sans étape de reconstruction explicite. La publication en est à sa quatrième révision, signe d'un travail itéré par la communauté. Aucun partenaire industriel ni horizon de commercialisation n'est mentionné : il s'agit d'une contribution de recherche fondamentale avec preuves de concept réelles, pas d'une annonce produit.

UEMéthode applicable aux secteurs logistique portuaire, BTP et extraction présents en Europe, mais aucun acteur ou financement européen n'est impliqué dans ces travaux de recherche fondamentale.

RecherchePaper
1 source
STEAM : modélisation de l'avantage par ensemble temporel auto-supervisé pour l'apprentissage robotique réel
367arXiv cs.RO 

STEAM : modélisation de l'avantage par ensemble temporel auto-supervisé pour l'apprentissage robotique réel

Des chercheurs ont publié le 30 juin 2026 sur arXiv (référence 2606.29834) une méthode baptisée STEAM, pour Self-Supervised Temporal Ensemble Advantage Modeling, visant à améliorer l'apprentissage de politiques robotiques à partir de données hétérogènes. Le problème traité est concret : les jeux de données d'entraînement mélangent inévitablement des démonstrations de qualité avec des séquences de blocage, des corrections maladroites ou des comportements sous-optimaux. STEAM attribue à chaque paire de frames un score d'avantage sans nécessiter d'annotation humaine. Le système entraîne un ensemble de prédicteurs décalés temporellement sur des trajectoires expertes, chaque prédicteur estimant le décalage temporel normalisé entre deux frames pour produire un scalaire d'avantage. Le score final retenu est le minimum de l'ensemble, ce qui confère une posture conservative face aux données ambiguës. Combiné à CFGRL (Classifier-Free Guidance Reinforcement Learning), STEAM a été évalué sur quatre tâches physiques réelles : pliage bimanuel de serviettes, passage de chips en caisse, réassort de canettes de cola, et pick-and-place à un bras. Les gains de taux de succès observés sont respectivement de 59 %, 54,3 %, 23 % et 16,2 % par rapport aux baselines. L'intérêt pour les intégrateurs et les équipes de recherche appliquée est double. D'abord, STEAM est entièrement label-free : il n'exige pas d'annotation manuelle des frames "bonnes" ou "mauvaises", ce qui réduit drastiquement le coût de curation des datasets. Ensuite, les gains mesurés sur des tâches réelles de manipulation, notamment sur le pliage de tissu qui reste un benchmark difficile en robotique souple, suggèrent que la méthode tient face au reality gap, une hypothèse longtemps débattue dans le domaine sim-to-real. La discrimination automatique entre progression utile et stall ou régression est un verrou central pour l'apprentissage à partir de données d'opérateurs humains en environnement industriel, où la qualité des démonstrations est rarement homogène. STEAM s'inscrit dans une vague de méthodes cherchant à rendre le Reinforcement Learning from Demonstrations (RLfD) moins dépendant de données propres et annotées. Des approches voisines comme GAIL, IRL ou les méthodes basées sur des modèles de récompense appris se heurtent toutes à la question de la supervision implicite de la qualité. STEAM tente d'y répondre via une hypothèse simple : la proximité temporelle dans une trajectoire experte est un proxy fiable de la progression. Les auteurs ne mentionnent pas d'affiliations industrielles explicites ni de déploiement prévu à date, et les résultats restent à confirmer sur des environnements plus bruités ou des horizons temporels plus longs. Les prochaines étapes naturelles porteront sur la généralisation à des politiques de type VLA (Vision-Language-Action) et à des configurations multi-robots.

RecherchePaper
1 source
AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone
368arXiv cs.RO 

AsyncMDE : estimation de profondeur monoculaire en temps réel via mémoire spatiale asynchrone

Des chercheurs ont publié sur arXiv (arXiv:2603.10438v2) AsyncMDE, un système de perception de profondeur monoculaire asynchrone conçu pour permettre un déploiement temps-réel sur plateformes embarquées. L'architecture dissocie deux chemins d'exécution : un modèle fondation "slow path" de 97,5 millions de paramètres, figé, qui génère périodiquement des représentations spatiales de haute qualité en arrière-plan ; et un "fast path" léger de seulement 3,83 millions de paramètres entraînables, qui tourne en parallèle en réutilisant ces features via une fusion complémentaire avec l'observation courante et une mise à jour autorégressive de la mémoire. Sur GPU RTX 4090, le fast path atteint 237 FPS. Sur Jetson AGX Orin optimisé TensorRT, la cible embarquée réaliste pour la robotique mobile, il tourne à 161 FPS tout en récupérant 77 % de l'écart de précision par rapport au modèle fondation complet. L'enjeu industriel est direct : l'estimation de profondeur monoculaire à base de modèles fondation constitue une alternative crédible aux capteurs actifs (LiDAR, ToF), mais leur coût computationnel les rendait jusqu'ici incompatibles avec les contraintes temps-réel des robots mobiles et des AMR. AsyncMDE répond à ce verrou en amortissant le coût du modèle lourd sur plusieurs frames consécutives, en exploitant la redondance spatiale naturelle des déplacements continus d'un robot. La dégradation de précision est bornée et prédictible sur trois benchmarks couvrant des scènes statiques, dynamiques et des mouvements extrêmes synthétiques, ce qui est plus rassurant que des métriques moyennes masquant les cas limites. La profondeur monoculaire est un champ de recherche en forte accélération depuis que les architectures Vision Transformer et les modèles fondation (DPT, Depth Anything, UniDepth) ont montré des généralisations zero-shot solides, mais le goulot computationnel restait le principal obstacle à l'embarquement. AsyncMDE s'inscrit dans une tendance plus large d'inférence asynchrone et de caching de features, similaire aux approches utilisées en détection vidéo temps-réel. Les concurrents directs incluent les méthodes de distillation de modèles fondation (par exemple MobileDepth, FastDepth) et les pipelines LiDAR-caméra fusion légère. La prochaine étape naturelle sera de valider ces chiffres sur des robots réels en navigation autonome, où la latence bout-en-bout, et non le seul débit du réseau, détermine l'utilisabilité.

RecherchePaper
1 source
ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration
369arXiv cs.RO 

ConCent : apprentissage centré sur le contact réel-vers-sim-vers-réel depuis une seule démonstration

Déposé sur arXiv fin juin 2026 (arXiv:2606.30268), ConCent (Contact-Centric Real-to-Sim-to-Real) est un framework d'apprentissage par renforcement conçu pour résoudre le transfert sim-to-real dans les tâches de manipulation robotique riche en contacts. L'approche part d'une seule démonstration réelle : à partir de celle-ci, elle extrait automatiquement la séquence d'événements de contact (quand, où et comment les contacts surviennent), puis optimise en simulation la géométrie des objets, approximés comme des groupes de primitives géométriques, pour que la dynamique locale reproduise fidèlement les transitions d'état observées. Cette séquence de contact devient un signal de récompense structuré qui guide la politique RL vers des régimes de contact physiquement plausibles, l'empêchant d'exploiter des artefacts irréalistes du simulateur. Aucune conception manuelle de fonction de récompense par tâche n'est nécessaire. Le noeud du problème que ConCent attaque est le reality gap sur les tâches à fort couplage mécanique (vissage, assemblage précis, manipulation d'objets déformables), où une légère différence de dynamique de contact suffit à invalider une politique entière. Contrairement aux approches par domain randomization ou aux pipelines nécessitant de larges corpus de données réelles, ConCent impose une contrainte structurelle : la politique ne peut progresser qu'en respectant les séquences de contact validées dans le monde réel. Les résultats présentés montrent une meilleure stabilité et robustesse du transfert face à des baselines RL non contraintes. L'absence de reward engineering par tâche représente un gain opérationnel concret pour les équipes souhaitant déployer de nouvelles tâches sans reconfiguration coûteuse. Le problème du sim-to-real pour la manipulation remonte aux travaux fondateurs sur la domain randomization (OpenAI Dactyl, 2019) et aux pipelines de learning from demonstration. Des approches récentes comme la simulation différentiable (DiffTaichi) ou les VLA de type pi0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'attaquent au même reality gap, mais avec des architectures et des volumes de données très différents. ConCent se distingue en ancrant la dynamique simulée sur une démonstration réelle unique, sans calibration manuelle du simulateur. Il s'agit à ce stade d'un preprint académique sans déploiement industriel annoncé, les résultats étant validés en conditions de laboratoire. La suite logique serait une évaluation sur des cycles d'assemblage industriels réels et une comparaison directe avec des architectures VLA pour quantifier l'avantage de l'approche contact-centric à l'échelle.

RecherchePaper
1 source
FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde
370arXiv cs.RO 

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde

Des chercheurs du LECAR Lab (Learning, Computing and Autonomous Robots) ont publié le 30 juin 2026 sur arXiv (référence 2506.28476) un préprint décrivant FADA, un cadre d'adaptation en quelques exemples pour le contrôle de robots humanoïdes. L'architecture, baptisée Planner-IDM (Planner–Inverse Dynamics Model), fonctionne en trois étapes : entraînement d'une politique oracle avec accès à des informations privilégiées (état complet du simulateur), distillation de ce comportement dans un modèle étudiant déployable via DAgger, puis fine-tuning ciblé du seul module IDM à partir d'environ deux minutes de données collectées dans l'environnement réel. La supervision ne requiert ni démonstrations expertes ni signal de récompense : uniquement les paires (actions, observations) enregistrées lors de ces brefs rollouts. Les expériences montrent que FADA surpasse les baselines d'adaptation in-context et d'adaptation end-to-end sur des tâches whole-body à haute précision exécutées sur robot physique. L'enjeu pratique est réel : le "dynamics mismatch", écart entre les dynamiques simulées et celles du domaine cible dues aux variations de terrain, de charge utile ou de réponse actionneur, reste l'un des principaux freins au déploiement industriel des humanoïdes. Les approches actuelles forcent un compromis inconfortable entre la randomisation de domaine (zero-shot, mais sous-spécialisée) et le recalibrage complet du modèle ou le ré-entraînement de politique (précis, mais coûteux en données et en temps). Deux minutes de rollouts pour aligner un IDM représentent un point d'équilibre opérationnellement crédible pour des intégrateurs qui ne peuvent pas interrompre une ligne de production plusieurs heures. Cela dit, les vidéos hardware présentées sur le site du projet sont sélectionnées par les auteurs ; aucune évaluation statistique robuste sur variété de terrains ou charges n'est encore disponible dans ce préprint non relu par les pairs. Le sim-to-real gap est un problème structurel que l'ensemble de l'écosystème humanoïde, Figure (02/03), Tesla Optimus, Boston Dynamics Atlas, Physical Intelligence (pi-zero), tente de résoudre, principalement par randomisation massive en simulation ou par apprentissage en contexte (in-context RL). FADA s'inscrit dans une troisième voie, plus proche des travaux sur l'adaptation rapide de politiques (MAML, RMA) mais appliquée à l'architecture Planner-IDM. Le LECAR Lab, affilié à l'Université de Californie San Diego, capitalise ici sur des travaux antérieurs en locomotion et manipulation whole-body. Prochaine étape attendue : validation sur une plus large variété de dynamiques et de morphologies robotiques, ainsi qu'une soumission à conférence (ICRA ou CoRL) pour passer le filtre de la revue par les pairs.

RecherchePaper
1 source
Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage
371arXiv cs.RO 

Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage

Des chercheurs ont publié sur arXiv (référence 2606.22471) une approche systématique pour générer automatiquement, via apprentissage par renforcement (RL), des données d'entraînement synthétiques destinées à la manipulation bimane et dextre conditionnée par le langage. Le pipeline proposé combine trois briques : une conception de récompenses généralisables (non spécifiques à une tâche), une randomisation de domaine pour combler l'écart simulation-réel (sim-to-real gap), et des annotations de tâches exprimées en langage naturel. Les expériences portent sur trois tâches de manipulation représentatives ; les auteurs concluent à une amélioration significative de la généralisation par rapport aux baselines, sans toutefois publier de métriques quantitatives précises dans le résumé disponible. Le principal verrou qu'adresse ce travail est le manque de données massives et de qualité pour entraîner des politiques généralistes sur des manipulateurs bimanes à haute dextérité. La télé-opération humaine, standard actuel pour collecter des démonstrations (méthode utilisée par des projets comme ACT, Diffusion Policy, ou les datasets de Aloha), souffre de limitations structurelles : faible diversité de tâches, inadéquation morphologique entre la main humaine et l'effecteur robot, et absence des actions robot dans les vidéos brutes. Le RL surmonte ces obstacles mais exige traditionnellement des fonctions de récompense artisanales, tâche par tâche. En proposant une conception de récompenses généralisables, les auteurs visent à rendre le pipeline scalable sans surcoût d'ingénierie par tâche, ce qui est le vrai défi industriel pour quiconque cherche à déployer des politiques multi-tâches sur des lignes d'assemblage ou de conditionnement. Ce travail s'inscrit dans une tendance de fond : face à la rareté des données robotiques réelles, la synthèse en simulation devient une voie centrale, portée par des frameworks comme Isaac Lab (NVIDIA), MuJoCo Playground, ou Genesis. Il dialogue directement avec des approches comme RoboGen, RoboCasa ou GROOT, qui cherchent également à automatiser la génération de tâches et de données. Les politiques VLA (Vision-Language-Action) telles que pi0 de Physical Intelligence ou OpenVLA nécessitent des corpus variés que la télé-opération seule ne peut pas alimenter à l'échelle requise. Les prochaines étapes naturelles seront la validation sur hardware réel et la comparaison quantitative avec des datasets de référence comme RoboSet ou Open X-Embodiment.

RecherchePaper
1 source
Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs
372arXiv cs.RO 

Détection multi-classe d'humains et d'objets sur des bras robotiques par capteurs proprioceptifs

Une équipe de recherche a publié sur arXiv (référence 2508.02425) une étude portant sur la détection multi-classe de contacts en collaboration physique humain-robot (pHRC), testée sur le manipulateur Franka Emika Panda, l'un des cobots de référence pour la recherche académique. L'objectif : identifier en temps réel si le robot entre en contact avec un humain, un objet mou ou un objet dur, en utilisant uniquement la perception proprioceptive (couples articulaires, positions, vitesses) sans aucun capteur visuel externe. Un dataset dédié a été constitué sur ce bras à 7 degrés de liberté, puis trois architectures de réseaux de neurones ont été entraînées et comparées : LSTM, GRU et Transformers. Le meilleur modèle atteint 91,11 % de précision en test temps réel, avec une approche de prétraitement par fenêtre glissante identifiée comme optimale pour cette analyse de séries temporelles. Ce résultat marque une progression significative par rapport aux classifieurs binaires (humain/non-humain ou mou/dur) qui constituaient jusqu'ici l'état de l'art dans ce domaine. Passer à trois classes augmente la granularité de l'analyse de contact, ce qui est directement utile pour des applications industrielles : un robot qui distingue un opérateur d'un outil ou d'une pièce peut adapter sa réponse (arrêt d'urgence, réduction de vitesse, reconfiguration de trajectoire) de façon bien plus fine. L'approche purement proprioceptive est également un avantage pratique majeur : elle ne nécessite ni caméra supplémentaire ni calibration visuelle, ce qui simplifie l'intégration sur des cellules robotisées existantes. La précision de 91 % en conditions temps réel reste toutefois à valider sur des scénarios industriels variés au-delà du protocole de collecte de données décrit. Le Franka Emika Panda, désormais commercialisé sous la marque Franka Robotics après le rachat par Agile Robots, est une plateforme quasi-standard pour la recherche en pHRC grâce à son contrôle en couple natif. Ce travail s'inscrit dans un axe de recherche actif qui cherche à rivaliser avec les approches par vision (détection de contact par caméra RGB-D ou tactile) en misant sur la richesse des signaux internes du robot. Les concurrents directs incluent des travaux utilisant des peaux tactiles (BioTac, iCub) ou des réseaux de neurones appliqués aux données de force/couple de robots Universal Robots ou Kuka. La prochaine étape naturelle serait l'extension à des environnements moins contrôlés et à des robots à payload plus élevé pour valider le transfert sim-to-real de ces modèles.

UEFranka Robotics, entreprise européenne éditrice du Panda (plateforme quasi-standard des labos EU), est l'hôte direct de ces travaux, ce qui facilite un transfert technologique vers les intégrateurs et chercheurs européens en sécurité cobot sans capteurs additionnels.

RecherchePaper
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
373arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
TACO : un cadre de test et vérification pour l'optimisation robuste de graphe de poses
374arXiv cs.RO 

TACO : un cadre de test et vérification pour l'optimisation robuste de graphe de poses

Des chercheurs ont publié TACO (Test And Check Optimization), un framework open-source dédié à la robustification de l'optimisation de graphes de poses (PGO), pierre angulaire des systèmes SLAM (Simultaneous Localization and Mapping). Présenté dans un preprint arXiv (2606.29851), le système adresse un problème concret : les mesures aberrantes (outliers) issues d'associations incorrectes de reconnaissance de lieux, phénomène classique en environnements répétitifs (couloirs, entrepôts). TACO repose sur deux composants complémentaires. Le premier, IPC (Incremental Probabilistic Consensus), évalue en ligne la cohérence de chaque fermeture de boucle entrant dans le graphe. Le second, Switchable Outlier Sanitization, s'appuie sur les Switchable Constraints existantes pour purger périodiquement les mesures incohérentes qu'IPC aurait à tort intégrées. Sur des benchmarks 2D et 3D, TACO atteint un taux de succès supérieur à 90 % en 2D et 83 % en 3D, même avec un taux d'outliers pouvant atteindre 50 %, avec des temps de convergence moyens de 45 ms en 2D et 100 ms en 3D. Ces performances positionnent TACO comme une alternative crédible aux méthodes offline état de l'art, tout en restant déployable en temps réel, ce qui est rare dans ce segment. Pour les intégrateurs de robots mobiles (AMR, AGV) et les équipes SLAM embarqué, c'est un signal important : un pipeline PGO robuste aux outliers avec une latence inférieure à 100 ms ouvre la voie à des localisations fiables dans des environnements industriels mal contraints, sans nécessiter de post-traitement offline coûteux. Le fait que la robustesse soit atteinte sans modélisation explicite inlier/outlier simplifie aussi le tuning en production. Le PGO robuste est un champ actif depuis plus d'une décennie, avec des approches comme DCS (Dynamic Covariance Scaling), les Switchable Constraints de Sünderhauf, ou encore les méthodes basées M-estimateurs. TACO s'inscrit dans cette lignée en combinant une évaluation incrémentale probabiliste à une sanitisation rétrospective, là où la plupart des méthodes temps réel font l'un ou l'autre. Les concurrents directs incluent ROBIN, Graduated Non-Convexity (GNC) et ORB-SLAM3 pour le SLAM visuel 3D. Le code est publié en open source, ce qui facilitera l'intégration dans des stacks ROS existants et permettra à la communauté de valider les performances sur des jeux de données propriétaires.

UEFramework open-source intégrable dans les stacks ROS des intégrateurs AMR/AGV européens, sans impact institutionnel direct sur la France/UE.

RecherchePaper
1 source
WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement
375arXiv cs.RO 

WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement

Des chercheurs ont publié sur arXiv (référence 2602.13977v2) un framework nommé WoVR, conçu pour entraîner via du reinforcement learning (RL) des politiques de type Vision-Language-Action (VLA) sans recourir à des milliers d'heures d'interaction physique réelle. Le principe : substituer le robot réel par un modèle du monde appris, c'est-à-dire un modèle vidéo conditionné par les actions qui prédit le comportement de l'environnement. WoVR articule trois mécanismes distincts : un modèle vidéo action-conditionné à stabilité contrôlée, une stratégie baptisée Keyframe-Initialized Rollouts qui réinitialise les trajectoires imaginées à partir d'images-clés pour limiter l'accumulation d'erreurs sur l'horizon, et une co-évolution conjointe du modèle du monde et de la politique pour maintenir leur cohérence dans le temps. Les expériences rapportées montrent des gains sur le benchmark LIBERO et des améliorations mesurées sur plusieurs plateformes robotiques physiques. Ce travail s'attaque à un verrou central du post-entraînement des VLA : le RL promet d'aller au-delà de l'imitation learning, mais ses besoins en données d'interaction rendent son application directe sur robot physique quasi prohibitive. La contribution de WoVR est de montrer qu'un modèle du monde imparfait peut néanmoins servir de simulateur RL fiable, à condition de contrôler explicitement ses hallucinations plutôt que de les ignorer. C'est un signal positif pour la thèse que le sim-to-real, appliqué non au niveau du rendu physique mais au niveau de la prédiction vidéo apprise, peut débloquer l'optimisation de politiques à grande échelle. La nuance importante : les résultats sont publiés sous forme de papier de recherche, les démonstrations sont disponibles sur wovr-corl.github.io, mais aucun déploiement industriel n'est revendiqué. WoVR s'inscrit dans une vague de recherche qui cherche à reproduire pour la robotique ce que le RL a accompli pour les grands modèles de langage. Les VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA ont montré des capacités impressionnantes en imitation, mais leur amélioration par RL reste un problème ouvert. D'autres approches concurrentes misent sur des simulateurs physiques classiques (Isaac Lab, MuJoCo) ou sur du RL directement en conditions réelles, avec des cycles de collecte longs et coûteux. WoVR propose une troisième voie via les world models vidéo, dans la lignée des travaux de type DIAMOND ou DreamerV3 appliqués à la robotique. La soumission cible CORL, conférence de référence du domaine, ce qui suggère une prochaine validation par les pairs et potentiellement une intégration dans les pipelines d'entraînement open-source des équipes académiques et industrielles dès 2026.

RechercheOpinion
1 source
Puis-je vous aider ? La proactivité dans la collaboration humain-robot en groupe
376arXiv cs.RO 

Puis-je vous aider ? La proactivité dans la collaboration humain-robot en groupe

Des chercheurs ont publié sur arXiv (référence 2606.28469) une étude expérimentale portant sur le rôle de l'initiative robotique dans la collaboration humain-robot à plusieurs participants. Le protocole place des binômes humains en situation de résolution collaborative de puzzles, à l'intérieur d'un escape room instrumenté, en présence d'un robot humanoïde opérant selon deux modalités distinctes : un modèle réactif, où le robot ne répond que lorsqu'il est directement interpellé, et un modèle proactif, où il écoute en continu, contribue de façon autonome et relance l'interaction de sa propre initiative. Les résultats sont mesurés selon trois axes : performance de résolution de puzzles, fréquence des interactions, et évaluations subjectives via les échelles standardisées Godspeed et RoSAS. Le modèle proactif génère mécaniquement plus d'échanges, mais c'est le modèle réactif qui affiche le taux de complétion le plus élevé : 92,86 % contre 71,42 %. Ce résultat contre-intuitif est central pour quiconque déploie des robots collaboratifs dans un contexte industriel ou de service. L'intuition commune voudrait qu'un robot qui anticipe et prend des initiatives améliore la performance collective ; l'étude montre que ce n'est pas systématiquement le cas, et que la proactivité peut fragmenter l'attention, perturber la prise de tour de parole et dégrader la coordination du groupe. Plus significatif encore : l'effet de la modalité d'interaction dépend fortement du profil de l'utilisateur. Les participants ayant une expérience préalable des LLM résolvent les premiers puzzles plus vite en mode réactif ; ceux ayant déjà travaillé avec des robots, ou se déclarant introvertis, modifient leur évaluation des deux modèles de façon distincte. Pour un intégrateur ou un COO, cela signifie qu'il n'existe pas de configuration universellement optimale : le bon niveau d'initiative robotique dépend du profil des opérateurs et de la structure cognitive de la tâche. L'étude s'inscrit dans un corpus croissant de recherches en interaction humain-robot multi-parties (HRI), un champ qui prend de l'importance à mesure que les robots collaboratifs quittent les cellules isolées pour des environnements partagés et non structurés. L'escape room comme banc d'essai contrôlé pour l'HRI est une approche émergente qui permet de tester des dynamiques de groupe réalistes sans infrastructure industrielle lourde. Sur le plan concurrentiel, les questions d'initiative robotique concernent directement les plateformes de cobots sociaux (Boston Dynamics Spot, Furhat Robotics, mais aussi des acteurs européens comme Enchanted Tools avec Miroka) et les systèmes de guidage adaptatif dans la logistique. L'étude ne donne pas de suite opérationnelle immédiate, mais ses données suggèrent qu'une personalisation du niveau de proactivité selon le profil utilisateur, plutôt qu'un réglage global unique, constitue la piste de conception la plus prometteuse.

UELes résultats sur la proactivité robotique concernent directement des acteurs européens comme Enchanted Tools (Miroka) et les intégrateurs de cobots déployant des robots en environnements partagés non structurés.

RecherchePaper
1 source
CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique
377arXiv cs.RO 

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 CORE (Common Outcome Regularities from Action-Free Visual Demonstrations), un cadre d'apprentissage de politique robotique conçu pour exploiter des vidéos humaines sans annotations de mouvements, afin d'entraîner des robots manipulateurs. La méthode s'appuie sur une observation clé : bien que les trajectoires menant à une même tâche varient, leurs états terminaux partagent des configurations d'objets stables, des relations spatiales et des contraintes de contact reproductibles. CORE entraîne d'abord un encodeur d'état terminal par apprentissage contrastif et objectifs temporels auxiliaires, agrège ensuite les embeddings terminaux réussis en prototypes visuels de but (visual goal prototypes), puis injecte ces prototypes comme conditions globales dans la politique de contrôle du robot. Les gains de taux de succès mesurés sur les benchmarks de référence sont de +3,9 points de pourcentage sur Meta-World, +11,1 pp sur RoboTwin 2.0, et jusqu'à +17,0 pp en manipulation réelle. L'enjeu est direct pour les intégrateurs : collecter des démonstrations robotiques est coûteux en équipement, en opérateurs et en temps de setup, tandis que des millions d'heures de vidéos humaines d'assemblage, de logistique ou de cuisine existent déjà. L'écart morphologique entre la main humaine et un préhenseur robotique a jusqu'ici rendu ces vidéos inutilisables pour l'apprentissage par imitation direct. CORE contourne le problème en ne cherchant pas à transférer les actions elles-mêmes, mais uniquement les régularités des états finaux. Le gain de +17 pp en conditions réelles est particulièrement notable car il indique une réduction du fossé sim-to-real sans contrainte sur la morphologie du robot. En surpassant les variantes conditionnées par texte (architecture VLA classique), CORE suggère que les prototypes visuels de but apportent des contraintes géométriques et physiques plus exploitables que les instructions en langage naturel, une nuance importante pour la calibration de politiques multi-tâches. L'apprentissage par imitation depuis des vidéos humaines est un axe de recherche actif, porté notamment par Google DeepMind avec RT-2, Physical Intelligence avec pi-0, et Meta FAIR. Des méthodes comme R3M ou VIP apprennent des représentations visuelles transférables depuis des vidéos humaines, mais CORE cible spécifiquement les états terminaux plutôt que les représentations d'observation générales, ce qui constitue sa distinction architecturale principale. Les benchmarks retenus, Meta-World et RoboTwin 2.0, sont reconnus sans être universellement adoptés, ce qui limite les comparaisons directes avec les résultats concurrents. Aucun partenariat industriel ni déploiement commercial n'est mentionné : il s'agit d'un preprint arXiv, dont les suites dépendront de réplications indépendantes et d'extensions vers des tâches plus complexes, notamment la manipulation en chaîne longue ou en environnements non structurés.

RechercheOpinion
1 source
ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes
378arXiv cs.RO 

ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes

Des chercheurs ont publié le 30 juin 2026 sur arXiv (identifiant 2606.30362) les travaux ReactiveBFM, un framework de planification-contrôle en boucle fermée temps réel pour humanoïdes, validé sur le robot Unitree G1. L'approche atteint un taux de succès de 93,1 % lors de benchmarks sim-to-sim soumis à des perturbations sévères, surpassant de 28,6 points les baselines en boucle ouverte classiques. Le système permet notamment la poursuite de cibles mobiles en zero-shot, c'est-à-dire sans avoir été entraîné explicitement sur cette tâche, en mobilisant une coordination corps entier fluide et une replanification à la volée. Le verrou technique adressé est le problème dit d'exposition bias : quand un modèle génératif de planification de mouvement est naïvement chaîné avec un contrôleur d'exécution, les écarts de suivi s'accumulent jusqu'à provoquer des effondrements comportementaux. ReactiveBFM répond à cela via un curriculum d'échantillonnage par préfixe planifié (scheduled prefix sampling), qui force le planificateur à apprendre des comportements de récupération d'erreur à partir d'états physiques imparfaits plutôt que de trajectoires de référence idéales. Un second mécanisme d'asynchronisme découple la replanification autorégressive, lente, du tracking haute fréquence, tandis qu'un chunking de trajectoire assure la cohérence spatio-temporelle sans jitter physique. Pour les intégrateurs industriels et les équipes de recherche en contrôle humanoïde, cela valide une piste concrète pour rendre les Behavior Foundation Models (BFMs) exploitables hors conditions laboratoire. Les BFMs sont une classe émergente de modèles pré-entraînés qui fournissent des priors de contrôle pour humanoïdes, analogues aux LLMs pour le texte. Jusqu'ici, leur limitation majeure était l'exécution figée de mouvements pré-définis, sans adaptation à l'environnement. Le Unitree G1, humanoïde chinois à 16 000 dollars commercialisé depuis 2024, s'est imposé comme banc de test standard dans la recherche académique. Les concurrents directs sur le plan scientifique incluent les travaux autour de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les architectures VLA embarquées chez Figure et Agility Robotics. Ce papier reste à ce stade un preprint non évalué par les pairs : les résultats sim-to-sim sont prometteurs mais aucun déploiement industriel ni transfert sim-to-real robuste n'est encore démontré.

UELes techniques ReactiveBFM (curriculum de préfixe planifié, réplanification asynchrone, chunking de trajectoire) sont directement exploitables par les équipes R&D européennes travaillant sur les Behavior Foundation Models pour humanoïdes, mais aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM
379arXiv cs.RO 

TacEvo : découverte d'architectures auto-évolutives pour la perception tactile robotique via une recherche qualité-diversité pilotée par LLM

Une équipe de chercheurs publie TacEvo (arXiv:2606.30109), un framework de découverte autonome d'architectures neuronales pour la perception tactile robotique. Les capteurs tactiles visuels comme le ViTacTip convertissent les déformations de surface en images pour inférer des forces de contact et des textures fines inaccessibles à la vision conventionnelle, mais les architectures réseau efficaces restent hautement spécifiques au capteur et à la physique du contact, imposant une itération manuelle intensive par des experts. TacEvo utilise un LLM pour générer des mutations et croisements au niveau du code, couplé à une boucle MAP-Elites (algorithme de qualité-diversité) qui maintient une population d'architectures élites diversifiées tout en privilégiant les prompts ayant produit les meilleures améliorations. Deux descripteurs comportementaux guident l'exploration : Architectural Diversity et Efficiency Ratio. Sur le ViTacTip, en régression de force et classification de réseaux de rainures, TacEvo atteint un taux de génération d'architectures entraînables de 96,0 % et 94,5 %, et améliore la fitness de validation de 56,1 % et 96,1 % sur 20 générations. Dans une évaluation haute-fidélité à 20 seeds, le framework atteint la parité avec la baseline expert en prédiction de force et la surpasse en classification fine de textures. Le résultat le plus significatif est la fiabilité de la génération autonome à plus de 94 %, prérequis non trivial pour industrialiser l'approche. Pour les équipes R&D travaillant sur des capteurs tactiles propriétaires comme Digit, GelSight ou XELA, la promesse est d'automatiser la phase d'exploration architecturale sans définir à l'avance un espace de recherche restreint, là où les NAS classiques comme DARTS ou ENAS restent contraints par leurs primitives prédéfinies. TacEvo s'inscrit dans un courant de NAS guidé par LLM initié notamment par FunSearch (DeepMind) et EvoPrompting, qui cherche à remplacer les espaces de recherche hand-crafted par une exploration ouverte au niveau du code. Le capteur ViTacTip utilisé comme banc d'essai est développé à l'Université de Bristol, acteur académique européen central sur la tactilité robotique. L'article est un preprint non encore soumis à peer-review, et les résultats restent à confirmer sur des capteurs et tâches variés ; les prochaines étapes naturelles seraient un benchmark multi-capteurs et une intégration dans des pipelines de manipulation dextre.

UELes équipes R&D européennes spécialisées en capteurs tactiles pourraient bénéficier du framework TacEvo pour automatiser l'exploration architecturale, le capteur de référence ViTacTip étant développé à l'Université de Bristol (UK).

RecherchePaper
1 source
ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme
380arXiv cs.RO 

ViPSim : collaboration entre espaces visuels et paramétriques pour des modèles du monde incarnés cohérents sur le long terme

Des chercheurs ont publié le 30 juin 2026 un article de préprint (arXiv:2606.28804) présentant ViPSim, un framework de simulation destiné à entraîner et évaluer des systèmes Vision-Langage-Action (VLA) sans risque pour le matériel réel. Le problème central qu'adresse ViPSim est le "representation gap" : les modèles de monde incarné (Embodied World Models, EWMs) doivent traduire des actions en basse dimension (positions articulaires, vitesses) en vidéos haute résolution cohérentes sur de longues séquences. Sans correctif, cette asymétrie produit une dérive de trajectoire cumulée et des interactions robot-objet incohérentes dès qu'on dépasse quelques pas de simulation. Pour y remédier, ViPSim combine deux espaces complémentaires : un Visual Space qui fournit des ancrages géométriques explicites (projections pixel-alignées de la pose de l'effecteur, perspectives caméra, géométrie de scène assistée par la profondeur, masques morphologiques du robot) et un Parameter Space qui injecte les séquences d'action brutes et les matrices caméra pour guider précisément le mouvement. Les expériences rapportées montrent que l'approche est backbone-agnostic, c'est-à-dire indépendante de l'architecture de génération vidéo sous-jacente. L'enjeu industriel est direct : le principal frein à l'utilisation des EWMs comme bancs de test pour les VLA est précisément leur manque de fidélité géométrique sur des horizons longs, ce qui rend leurs évaluations peu fiables pour des tâches de manipulation complexe. ViPSim prétend résoudre ce verrou, et les résultats préliminaires indiquent une capacité émergente sur des objets déformables, notamment le pliage de tissu, un cas d'usage notoire pour mettre en échec les simulateurs rigides classiques. Le framework conserverait également des performances robustes dans des scénarios hors-distribution et en cross-embodiment, c'est-à-dire appliqué à des morphologies robotiques non vues à l'entraînement. Pour un intégrateur ou un équipementier cherchant à réduire les coûts de collecte de données réelles, un simulateur de ce type permettrait d'accélérer le cycle de validation des politiques VLA avant déploiement terrain. Il convient toutefois de nuancer : il s'agit d'un preprint académique sans validation industrielle publiée, et les vidéos de démonstration sélectionnées ne constituent pas une preuve de performance en production. Le contexte est celui d'une course effrénée à la simulation haute-fidélité pour robots incarnés, portée par la montée en puissance des architectures VLA comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Ces modèles nécessitent des volumes massifs de données de démonstration, et la génération synthétique en est le principal levier de scalabilité. Des frameworks concurrents comme UniSim, IRASim ou Genesis s'attaquent au même problème avec des approches différentes, certains privilégiant la physique explicite, d'autres la génération neuronale pure. ViPSim se positionne sur la cohérence géométrique longue durée plutôt que sur le réalisme visuel brut, une niche encore peu couverte. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication actuelle : il s'agit pour l'instant d'une contribution de recherche ouverte, sans implémentation publique annoncée.

RechercheOpinion
1 source
REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique
381arXiv cs.RO 

REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique

Une équipe de chercheurs a publié REPAIR-Bench (Robot Error Perception And Interaction Recovery Benchmark), un jeu de données et de tâches d'évaluation conçu pour mesurer comment les utilisateurs humains perçoivent les pannes robotiques et y répondent. Le benchmark repose sur 214 essais d'interaction impliquant 41 participants exposés à quatre types de défaillances induites. Pour chaque session, les chercheurs ont capturé des données multimodales synchronisées : unités d'action faciale (AU), posture de la tête, transcriptions vocales, ainsi que des rapports d'affect et de stratégies de récupération recueillis après interaction. Trois tâches d'évaluation inédites structurent le benchmark : la détection de pannes sur des sessions interdépendantes (pour modéliser l'adaptation longitudinale de l'utilisateur), la classification visuelle du type de défaillance au-delà du simple binaire succès/échec, et la prédiction de stratégie de récupération centrée utilisateur. En baseline, un modèle récurrent hiérarchique atteint un F1 strict de 0,80 contre 0,68 pour un modèle mono-session, avec une erreur signée moyenne de -0,51 s et une erreur absolue médiane de 2,97 s pour la localisation temporelle des pannes. Pour la prédiction de récupération, un Mistral-7B affiné par QLoRA obtient Hit@5 = 0,76 et F1@5 = 0,32. L'intérêt scientifique de REPAIR-Bench tient à ce qu'il rompt avec trois limites persistantes de la littérature en interaction humain-robot (HRI) : le traitement des défaillances comme des événements isolés, la réduction de la détection à une décision binaire, et la modélisation de la récupération par des règles figées. En intégrant la dimension longitudinale, le benchmark permet de modéliser comment un utilisateur adapte progressivement son comportement face à des défaillances répétées, un phénomène documenté mais rarement instrumenté à cette échelle. Pour les équipes qui déploient des robots de service ou médicaux, c'est un signal concret : la robustesse perçue n'est pas seulement une propriété technique du système, mais une fonction de l'historique d'interaction. Le benchmark ouvre aussi la voie à des systèmes de récupération adaptatifs pilotés par les préférences inférées de l'utilisateur, plutôt que par des arbres de décision codés à la main, ce qui est pertinent pour les intégrateurs qui cherchent à réduire la charge cognitive des opérateurs. Ce travail s'inscrit dans un champ de recherche en expansion sur la fiabilité perçue des robots autonomes, accéléré par la multiplication des déploiements en contexte médical et industriel où une panne mal gérée peut rompre la confiance de façon durable. Les approches précédentes, comme les travaux sur la détection d'anomalies en manipulation ou les études d'affect en HRI, restaient souvent cloisonnées ; REPAIR-Bench propose un cadre unifié couvrant le cycle de vie complet de la défaillance. Le benchmark est publié sur arXiv (2606.29937) et cible explicitement les communautés HRI et HRI médicale. Les prochaines étapes naturelles incluent l'extension à des plateformes robotiques variées (bras manipulateurs, robots mobiles, humanoïdes) et l'évaluation de modèles de langage multimodaux en temps réel comme superviseurs de récupération, une piste que les résultats Mistral-7B rendent crédible sans pour autant la valider à l'échelle.

RecherchePaper
1 source
Optimisation de trajectoire sans collision pour la fabrication additive multi-axes par projection de gradient contraint
382arXiv cs.RO 

Optimisation de trajectoire sans collision pour la fabrication additive multi-axes par projection de gradient contraint

Une équipe de recherche vient de publier sur arXiv (2606.29766) un cadre de calcul pour optimiser les trajectoires de bras robotisés redondants utilisés en fabrication additive multi-axes (MAAM). Le système a été validé sur une plateforme à 8 degrés de liberté (DOF), exécutant des chemins d'outils longs, sans structure de support et conformes à la géométrie des pièces. Les résultats annoncés sont précis : erreur moyenne de position de la buse inférieure à 10 micromètres, réduction du jerk articulaire maximal jusqu'à 77,6 %, élimination de toutes les violations de collision et d'orientation détectées lors des tests. Par rapport à la méthode de référence SQP (programmation quadratique séquentielle), le gain de vitesse de convergence atteint 10,2x. Des impressions physiques de géométries complexes ont été réalisées, avec moins d'artefacts de dépôt visibles. L'intérêt technique réside dans la combinaison de deux contraintes difficiles à réconcilier dans la MAAM : maintenir la position exacte de la buse (contrainte d'égalité stricte au niveau de chaque waypoint) tout en évitant les collisions avec une pièce dont la géométrie évolue au fil du dépôt. Les auteurs formulent la cinématique relative buse-pièce via un Jacobien relatif, et modélisent les collisions avec une SDF (signed distance function) différentiable, ce qui permet de propager les gradients d'optimisation même lorsque la géométrie de fabrication change. La projection itérative sur la variété de self-motion du robot permet de respecter les contraintes de position sans compromettre l'évitement de collision. Pour un intégrateur ou un décideur industriel, c'est une avancée concrète : la MAAM redondante devient planifiable de manière robuste sur des trajectoires longues, ce qui ouvre la voie à des pièces aérospatiales ou médicales sans support imprimées directement sur robot 6+ axes. La fabrication additive multi-axes robotisée reste un domaine de niche, dominé par des travaux académiques issus de groupes en Europe, Asie et Amérique du Nord, sans acteur commercial dominant à ce jour. Les approches classiques d'optimisation (SQP, méthodes à points intérieurs) souffrent de temps de calcul prohibitifs sur des chemins longs, ce qui a freiné l'industrialisation. Ce travail s'inscrit dans une tendance plus large qui combine planification de mouvement différentiable et représentations géométriques implicites, une direction que partagent aussi des groupes travaillant sur la soudure robotisée et l'impression béton. L'article est un preprint non encore évalué par les pairs, et les conditions exactes des essais physiques (matériau, géométries testées, répétabilité sur série) mériteraient d'être détaillées avant toute adoption industrielle.

UERésultats potentiellement exploitables par les laboratoires européens actifs en fabrication additive multi-axes robotisée, sans impact identifié sur des acteurs industriels français à ce stade.

RecherchePaper
1 source
SPACE : champs de phéromones pour l'exploration adaptative d'essaims sans collision
383arXiv cs.RO 

SPACE : champs de phéromones pour l'exploration adaptative d'essaims sans collision

Des chercheurs ont présenté SPACE (Swarm Pheromone Fields for Adaptive Collision-Aware Exploration), un algorithme de coordination décentralisée pour essaims robotiques à grande échelle, publié en juin 2026 sur arXiv. Inspiré des phéromones de fourmis, le système guide des groupes allant jusqu'à 256 robots dans des environnements intérieurs inconnus via un champ environnemental partagé à trois couches : phéromones attractives vers les zones frontières inexplorées, phéromones répulsives marquant les zones déjà visitées, et champ de densité robotique calculé en temps réel. Les évaluations portent sur des données de bâtiments réels : seize plans de maisons issus du dataset HouseExpo et huit étages de campus du dataset KTH de Stockholm. Résultat central : SPACE réduit les contacts inter-robots de 4 à 17 fois par rapport à un planificateur glouton de type nearest-frontier classique, tout en maintenant le temps de couverture à moins de 2 % du planificateur quasi-optimal en temps. Le résultat le plus instructif n'est pas la performance brute, mais la conclusion qui l'accompagne : à grande échelle, la coordination améliore avant tout la sécurité, pas la vitesse d'exploration. Ce constat remet en question l'hypothèse répandue selon laquelle ajouter des robots accélère proportionnellement la couverture. Au-delà d'un certain seuil, les goulets d'étranglement, couloirs, portes, créent de la congestion, et chaque robot supplémentaire génère davantage de risques de collision qu'il n'apporte de gain de vitesse. SPACE se positionne sur la frontière de Pareto empirique : meilleure sécurité à chaque taille d'essaim congestionnée, sans sacrifier significativement la rapidité. Pour les intégrateurs de flottes AMR (robots mobiles autonomes) en entrepôt ou en logistique, ce travail fournit une base algorithmique solide pour arbitrer entre densité de déploiement et sécurité opérationnelle lors du passage à l'échelle industrielle. La navigation en essaim s'appuie sur la stigmergie, principe emprunté à l'entomologie : les individus se coordonnent non par communication directe, mais en modifiant un environnement partagé. Les approches nearest-frontier classiques sont efficaces pour de petits groupes mais génèrent des embouteillages à haute densité. Face aux méthodes centralisées, coûteuses en calcul à 256 unités, et aux systèmes à communication directe, fragiles sans réseau fiable, SPACE reste purement décentralisé via le champ partagé. Ce préprint arXiv n'a pas encore été évalué par les pairs et les expériences sont conduites en simulation sur floorplans réels : une validation sur robots physiques reste à établir. Les suites logiques incluent des tests sur hardware réel et l'intégration dans des middlewares standards comme ROS 2.

UELes intégrateurs européens de flottes AMR en logistique pourraient exploiter cette base algorithmique pour arbitrer densité de déploiement et sécurité à l'échelle, mais aucun acteur ou institution européen n'est directement impliqué dans ces travaux.

RecherchePaper
1 source
SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel
384arXiv cs.RO 

SCREP : génération de trajectoires perceptuelles par régression de coordonnées de scène et apprentissage évidentiel

Des chercheurs ont publié sur arXiv (référence 2507.07467v3) SCREP, un planificateur de trajectoire dit "perception-aware" conçu pour les drones autonomes évoluant en intérieur sans signal GPS. Le système repose sur la régression de coordonnées de scène (SCR, ou Scene Coordinate Regression) couplée à un apprentissage évidentiel : au lieu d'effectuer une reconstruction de carte 3D par appariement de features (approche classique mais coûteuse en calcul et en stockage), le réseau prédit directement les coordonnées 3D associées à chaque pixel de l'image embarquée, ce qui permet une estimation de pose absolue en temps réel. Un optimiseur de trajectoire à horizon glissant (receding-horizon) oriente activement la caméra vers les zones de la scène présentant la plus faible incertitude de localisation. Un lisseur à retard fixe (fixed-lag smoother) fusionne ensuite les estimations de pose SCR, de basse fréquence, avec les données IMU haute fréquence pour produire une estimation de pose continue et de haute qualité. En simulation, SCREP réduit l'erreur quadratique moyenne (RMSE) de translation d'au moins 4,9 % et celle de rotation d'au moins 30,8 % par rapport aux méthodes de référence. Des expériences hardware-in-the-loop valident la faisabilité dans des conditions proches du déploiement réel. L'intérêt industriel de cette approche tient à deux tensions classiques dans la navigation autonome en intérieur : la scalabilité des cartes de localisation visuelle et le coût de calcul embarqué. Les méthodes par appariement de features (comme celles utilisées dans ORB-SLAM ou HLoc) imposent une reconstruction préalable de la carte et souffrent d'une explosion mémoire dans les grands environnements entrepôts ou industriels. La SCR résout ce problème par un réseau compact appris offline, directement exploitable onboard sur un calculateur de drone. L'apport d'SCREP va plus loin : en intégrant l'incertitude estimée dans la boucle de planification de trajectoire, le système évite activement les zones visuellement ambiguës plutôt que de subir leur dégradation localement. C'est un changement de paradigme notable par rapport aux planificateurs classiques qui traitent la localisation comme une boîte noire externe. Pour un intégrateur ou un décideur industriel déployant des drones d'inspection ou d'inventaire, cela réduit le risque de dérive de pose dans les couloirs peu texturés ou les allées sombres. La navigation en environnement GPS-denied est un verrou technique persistant pour les drones d'intérieur autonomes, avec une communauté de recherche active depuis une décennie autour de VIO (Visual-Inertial Odometry), SLAM et, plus récemment, des méthodes apprises comme NeRF ou les champs de scène implicites. La SCR elle-même est une alternative proposée initialement par la communauté relocalisation visuelle (travaux pionniers Microsoft Research, DSAC++), mais son application dans une boucle de planification proactive reste peu explorée. SCREP se positionne comme une contribution de recherche académique, présentée sous forme de preprint arXiv sans affiliation industrielle identifiée ni annonce de déploiement commercial. Les résultats hardware-in-the-loop sont encourageants mais ne constituent pas une validation terrain à grande échelle. Les concurrents directs incluent les approches VIO+planification certifiée (ETH Zurich, MIT CSAIL), ainsi que des acteurs industriels comme Skydio ou Exotec pour la navigation autonome en entrepôt. Les prochaines étapes attendues seraient une évaluation sur des environnements réels de grande dimension et une comparaison avec des champs de scène neuraux récents comme l'iNeRF ou les Gaussian Splats.

UEImpact indirect sur Exotec (France) et autres opérateurs européens de drones d'entrepôt : si l'approche SCR+planification proactive se confirme à l'échelle terrain, elle pourrait réduire le coût des cartes de localisation visuelle dans les grands entrepôts logistiques européens.

RecherchePaper
1 source
Autonomie partagée intelligible : communication implicite des croyances du robot par le mouvement
385arXiv cs.RO 

Autonomie partagée intelligible : communication implicite des croyances du robot par le mouvement

Des chercheurs ont publié fin juin 2026 un preprint arXiv (2606.29846) présentant une nouvelle approche de l'autonomie partagée pour bras robotiques assistifs, baptisée "legible shared autonomy". Le principe : dans les systèmes actuels, un bras à six degrés de liberté (6-DOF) interprète les commandes d'un utilisateur à mobilité réduite pour inférer un objectif et l'assister en suivant le chemin le plus court vers cet objet cible. Le problème identifié est que ce mouvement efficient est ambigu lorsque plusieurs objets se trouvent dans une direction similaire, le robot "sait" ce qu'il vise, mais l'utilisateur, lui, ne le perçoit pas. L'équipe introduit une couche de communication implicite : le mouvement du robot est conçu pour révéler explicitement quelle cible a été inférée, en s'écartant délibérément du trajet optimal pour "pointer" vers l'objet choisi. L'allocation d'autorité est adaptative : le robot adopte des mouvements lisibles et assertifs quand sa confiance est haute, et rend la main à l'utilisateur quand elle est faible. Des expériences en simulation et sur un bras physique 6-DOF ont été conduites, avec des études utilisateurs. L'enjeu pour le secteur de la robotique assistive est concret. Les deux défauts corrigés sont symétriques et coûteux : quand le robot a raison mais ne le montre pas, l'utilisateur continue à contrôler inutilement, gaspillant effort moteur et temps, critique pour des personnes atteintes de handicaps neuromusculaires. Quand le robot se trompe, l'erreur n'est détectée que tardivement, après une déviation significative du bras, forçant une correction coûteuse. La contribution démontre qu'un mouvement délibérément sous-optimal du point de vue de l'efficacité peut être globalement plus performant en réduisant la charge de contrôle totale. C'est une réfutation empirique de l'hypothèse implicite dans beaucoup de systèmes HAI (human-autonomy interaction) selon laquelle "efficient = assistif". L'autonomie partagée pour la commande de bras robotiques est un axe de recherche actif depuis une décennie, notamment dans les groupes de Siddhartha Srinivasa (UW), Henny Admoni (CMU) et Brenna Argall (Northwestern), ces derniers ciblant spécifiquement la population en situation de handicap moteur. Ce travail s'inscrit dans la lignée des travaux sur la "legibility" introduits par Dragan et Srinivasa (2013), qui établissaient qu'un robot doit parfois sacrifier l'optimalité pour être compréhensible. Ce preprint reste une annonce académique sans déploiement ni partenaire industriel déclaré, et les études utilisateurs en situation réelle (fauteuil roulant, pathologies neuromusculaires variées) restent à confirmer à plus grande échelle.

RecherchePaper
1 source
KYON : quadrupède semi-modulaire roues-pattes aux capacités bimanuelles agiles
386arXiv cs.RO 

KYON : quadrupède semi-modulaire roues-pattes aux capacités bimanuelles agiles

KYON est un robot quadrupède hybride roue-jambes, doté d'un torse bimanel, présenté dans un preprint arXiv (2606.30243) publié fin juin 2026 par une équipe dont l'affiliation institutionnelle n'est pas précisée dans l'abstract. La plateforme adopte une architecture semi-modulaire : les membres inférieurs sont reconfigurables, permettant de basculer entre locomotion sur roues et locomotion sur pattes selon le terrain. Plutôt que de distribuer les actionneurs le long des membres, KYON les concentre dans le châssis central et transmet le mouvement via des mécanismes de transmission, ce qui réduit l'inertie distale et améliore l'agilité dynamique. Le système de contrôle combine un cadre de contrôle du corps entier (whole-body control) avec une politique d'apprentissage par renforcement (RL), traitant séparément mais de façon coordonnée les tâches de locomotion et de manipulation. Les résultats expérimentaux rapportés valident la capacité du robot à opérer en locomotion dynamique et en manipulation bimane dans des environnements non structurés -- aucun chiffre précis de charge utile, de degrés de liberté ou de temps de cycle n'est communiqué dans l'abstract. L'intérêt de KYON pour les intégrateurs industriels et les décideurs B2B tient à la combinaison rare d'une base mobile à double mode (roue/patte) et d'une capacité de manipulation à deux bras sur un même châssis compact. La réduction de l'inertie distale via la centralisation des actionneurs est un choix de conception déjà validé sur des plateformes comme l'ANYmal de ANYbotics ou le MIT Cheetah, et son application à un système bimane à mobilité hybride constitue un apport méthodologique tangible. L'usage du RL pour absorber les perturbations dynamiques sans recalibration manuelle est cohérent avec les avancées récentes en sim-to-real, bien que les conditions exactes de test et les métriques de robustesse ne soient pas détaillées, ce qui limite l'évaluation externe à ce stade. Le marché des quadrupèdes mobiles est aujourd'hui dominé par Boston Dynamics (Spot), ANYbotics (ANYmal C/D), Unitree (B2, Go2) et, en France, des acteurs comme Wandercraft sur le segment bipède. La niche hybride roue-patte est occupée par peu de plateformes commerciales matures, ce qui positionne KYON comme un candidat de recherche dans un espace encore peu peuplé. Publié en preprint sans validation par les pairs, ce travail reste au stade de prototype de laboratoire : aucun partenaire industriel, aucun déploiement ni calendrier de commercialisation ne sont mentionnés. Les prochaines étapes naturelles seraient une publication en conférence (ICRA, IROS, RSS) et des tests en conditions réelles d'entrepôt ou de logistique.

RecherchePaper
1 source
HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive
387arXiv cs.RO 

HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive

Des chercheurs ont publié sur arXiv (arXiv:2606.30404, juin 2026) un système baptisé HUMEMBR, Human-Centered Memory for Embodied Robots, conçu pour permettre à un robot incarné de modéliser, mémoriser et exploiter les routines comportementales des individus qu'il côtoie. Le système répond à des requêtes telles que « où se trouve probablement cette personne en ce moment » ou « à quelle heure quitte-t-elle habituellement le bâtiment », en s'appuyant sur un historique d'observations accumulé sur le long terme. HUMEMBR couple une construction mémoire continue à un mécanisme de récupération et d'interrogation parallèle, produisant des représentations structurées des routines humaines interrogeables à la demande. Le système a été validé sur un robot physique déployé dans deux environnements distincts, sans que le papier précise le modèle de plateforme, le nombre de DOF ni les conditions exactes des essais terrain. L'intérêt principal de HUMEMBR réside dans son efficacité computationnelle par rapport aux approches naïves à base de LLM en plein contexte : les auteurs rapportent de meilleures performances sur le raisonnement à long horizon tout en consommant significativement moins de tokens. Pour les intégrateurs de robots de service ou les déployeurs en environnement tertiaire (hôpitaux, entrepôts, bureaux), cela ouvre la voie à des robots capables d'anticiper la position d'un opérateur sans requête GPS ni tag actif, en inférant simplement depuis des patterns observés. C'est un pas vers la résolution du « routine gap », la difficulté à faire raisonner un robot sur des comportements récurrents et non étiquetés, au-delà de la navigation réactive classique. La navigation incarnée guidée par le langage (VLA, NavLLM) est un champ très actif depuis 2023, avec des travaux comme NavGPT, SayNav ou EmbodiedGPT qui explorent l'usage des LLMs comme planificateurs de trajectoire. HUMEMBR se différencie en ciblant explicitement la modélisation comportementale humaine sur la durée, plutôt que la seule compréhension d'instructions à la volée. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné dans l'abstract, il s'agit d'une contribution académique, pas d'un produit annoncé. Les prochaines étapes naturelles seraient de tester la robustesse face à des changements de routine imprévus et de quantifier les performances sur des métriques standardisées comme HM3D ou R2R.

RecherchePaper
1 source
RetrDex : récupération efficace d'objets dans des environnements encombrés avec une main dextérique
388arXiv cs.RO 

RetrDex : récupération efficace d'objets dans des environnements encombrés avec une main dextérique

RetrDex est un framework de recherche publié sur arXiv (référence 2502.18423, troisième révision) dont l'objectif est d'apprendre à un système bras-main dextre à récupérer des objets enfouis sous un empilement d'autres objets. L'approche repose sur du reinforcement learning (RL) parallèle à grande échelle conduit en simulation, couplé à une représentation spatiale qui encode les patterns d'occlusion ainsi que les relations géométriques entre la cible, la main multi-doigts et les objets alentour. La politique résultante développe un répertoire de gestes, poussée, agitation et piquage (poking), pour dégager activement les obstacles avant ou pendant la saisie. Évalué sur 16 objets ménagers courants dans des configurations variées, le système affiche de bonnes performances sur des cibles vues en entraînement comme sur des cibles inédites. Un transfert zero-shot vers un robot réel multi-doigts est revendiqué, sans fine-tuning supplémentaire. La récupération d'objets en scène encombrée est un problème ouvert en manipulation robotique : les approches classiques décomposent la tâche en étapes séquentielles indépendantes (retirer les objets qui gênent un par un, puis saisir), ce qui génère des séquences longues et peu robustes aux variations. RetrDex intègre ces interactions physiques directement dans la politique de récupération, réduisant potentiellement le nombre de mouvements nécessaires. La revendication la plus notable reste le zero-shot sim-to-real sur une main dextre : ce type de transfert est notoirement difficile à cause de la complexité des contacts multi-doigts et du gap dynamique entre simulation et réalité physique. Si les résultats tiennent à l'examen approfondi, cela renforce la thèse que le RL massivement parallèle en simulation peut généraliser sur du matériel réel pour des tâches de manipulation en espace contraint, sans données réelles supplémentaires. Le papier s'inscrit dans une tendance forte : utiliser le RL en simulation à très grande échelle pour entraîner des politiques de manipulation dextre, une direction explorée par des équipes de Berkeley (DexGraspNet), Stanford et, côté industriel, par des acteurs comme Unitree ou Agility Robotics sur leurs propres mains multi-doigts. Les méthodes concurrentes récentes, graphes de relations de support ou planification séquentielle avec contraintes géométriques, adoptent des stratégies que RetrDex cherche à dépasser en termes d'efficacité. Soumis initialement en février 2025 et révisé jusqu'en 2026, le travail n'annonce pas de code open-source dans son résumé, ce qui limite les possibilités de réplication à court terme. Les suites naturelles seraient des tests sur objets déformables, une extension à des charges utiles plus importantes et une intégration dans une chaîne logistique ou un poste d'assemblage industriel réel.

RecherchePaper
1 source
Passage de messages amélioré par flots normalisants pour la localisation collaborative multi-robots
389arXiv cs.RO 

Passage de messages amélioré par flots normalisants pour la localisation collaborative multi-robots

Des chercheurs proposent dans un preprint arXiv (identifiant 2606.29868, juin 2026) un algorithme de passage de messages pour la localisation collaborative distribuée de flottes multi-robots, en unifiant la propagation de croyances gaussiennes (GBP) et l'approximation champ moyen (MF). GBP préserve les dépendances entre les états des robots, tandis que MF estime dynamiquement les statistiques de bruit. Pour traiter les termes non conjugués issus de modèles de mesure non linéaires, l'algorithme intègre un estimateur de gradient basé sur des flux normalisants (NF), des modèles génératifs qui rendent l'échantillonnage paramétrique et entraînable de bout en bout, les paramètres du NF étant ajustés selon le comportement du passage de messages lors d'un entraînement global. La méthode est étendue aux espaces d'états sur groupes de Lie pour représenter correctement les rotations 3D, puis validée sur des véhicules de surface autonomes (ASV) en fusionnant odométrie, mesures GNSS et télémétrie inter-robots ultra-wideband (UWB). La nature distribuée de l'algorithme élimine tout point de défaillance centralisé : chaque robot maintient et propage ses propres estimations, ce qui est critique pour des flottes opérant en environnements dégradés ou à couverture GNSS partielle. L'intégration des flux normalisants comme estimateurs de gradient rend l'approximation adaptative, là où la linéarisation classique (EKF) perd en précision face à des non-linéarités fortes. La fusion odométrie/GNSS/UWB couvre explicitement les situations où le signal satellite seul est insuffisant, configuration typique en milieu maritime, portuaire ou en zone urbaine dense. La localisation collaborative multi-robots est un domaine actif depuis les années 2000, avec des approches allant des filtres particulaires décentralisés aux graphes de facteurs incarnés par des systèmes comme COVINS ou Kimera-Multi. L'apport des flux normalisants au cadre de passage de messages reste récent, et la validation expérimentale sur ASVs en simulation et en conditions réelles distingue ce travail des contributions purement théoriques. Les auteurs n'annoncent pas de déploiement opérationnel : l'étape suivante probable est la montée en échelle vers des flottes plus larges et l'intégration dans des pipelines de navigation pour l'inspection maritime ou la logistique portuaire autonome.

RecherchePaper
1 source
Apprentissage de politiques hiérarchiques par décomposition spectrale
390arXiv cs.RO 

Apprentissage de politiques hiérarchiques par décomposition spectrale

Des chercheurs ont publié le 30 juin 2026 sur arXiv (réf. 2606.29570) une nouvelle architecture de politique robotique appelée Causal Spectral Policy (CSP), fondée sur une décomposition spectrale des séquences d'actions via la transformée en cosinus discrète (DCT). L'observation centrale est la suivante : les composantes basse fréquence d'une séquence de mouvements encodent la trajectoire globale et l'intention de tâche, tandis que les composantes haute fréquence capturent le timing précis, l'alignement et les comportements de contact. CSP génère d'abord un mouvement grossier conditionné sur l'observation visuelle et l'instruction en langage naturel, puis produit des corrections fines conditionnellement sur la trajectoire réalisée, selon un processus causal dit "coarse-to-fine". Les évaluations en simulation et en environnement réel montrent des performances supérieures aux baselines sur des tâches de manipulation sensibles à la précision. L'équipe propose également une augmentation de données par injection de bruit de télé-opération humaine, simulant les imperfections naturelles des démonstrations collectées par opérateur. Cette approche répond à un défi structurel persistant de l'apprentissage par imitation (behavior cloning) : les politiques standards peinent à concilier cohérence globale du mouvement et précision locale au moment du contact. En séparant explicitement ces deux niveaux via la décomposition spectrale, CSP évite que les perturbations haute fréquence ne corrompent la planification de trajectoire, et inversement. La robustesse aux démonstrations bruitées est particulièrement pertinente pour les intégrateurs industriels qui collectent des données de télé-opération à grande échelle, où la qualité des démonstrations est intrinsèquement variable. Cela adresse aussi partiellement le problème du sim-to-real gap : traiter séparément la dynamique globale et les ajustements fins rend la politique moins sensible aux écarts entre simulation et réel. CSP s'inscrit dans un mouvement plus large de raffinement des politiques d'imitation, qui a vu émerger ces dernières années Diffusion Policy (Chi et al., 2023), ACT (Action Chunking with Transformers) ou des modèles VLA comme Pi-0 de Physical Intelligence et OpenVLA. Là où ces approches misent sur l'expressivité de l'architecture ou le volume de données d'entraînement, CSP parie sur un biais inductif structurel emprunté au traitement du signal. Il s'agit à ce stade d'un résultat de preprint sans déploiement industriel annoncé. Les prochaines étapes naturelles incluent des benchmarks sur des tâches de haute précision type assemblage ou vissage, et une validation sur des plateformes matérielles standardisées comme Franka ou UR.

RechercheOpinion
1 source
J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés
391arXiv cs.RO 

J-LAW : localisation conjointe et modélisation du monde orientée action via des graphes de facteurs latents couplés

Un préprint publié sur arXiv (identifiant 2606.28712) introduit J-LAW (Joint Localization and Actionable World Modeling), une architecture qui fusionne le SLAM classique et les modèles de monde conditionnés par l'action dans un unique graphe de facteurs probabilistes. L'objectif MAP (Maximum A Posteriori) commun optimise simultanément les poses métriques des objets, les états latents du monde et les embeddings latents de landmarks. Le pont entre ces deux formulations est un encodeur latent conditionné par la pose et un facteur de couplage pose-latent appris. Les expériences portent sur deux benchmarks : PushT, une tâche de manipulation planaire, et WildGS, un environnement de reconstruction 3D gaussienne. Les résultats montrent que la correction par graphe couplé réduit l'erreur quadratique moyenne de prédiction latente et la dérive de point final par rapport au rollout en boucle ouverte, tandis que la fermeture de boucle latente améliore la cohérence globale de trajectoire. L'enjeu est structurant pour la robotique de manipulation : les systèmes actuels souffrent d'une dichotomie entre localisation précise et planification prédictive. Le SLAM produit des cartes métriques que les planificateurs ne savent pas exploiter directement ; les modèles de monde appris prédisent l'effet des actions mais perdent la cohérence spatiale sur des horizons longs, limitant leur utilité en déploiement réel. J-LAW démontre qu'en couplant ces deux estimations, chaque composante améliore l'autre : une meilleure localisation stabilise la prédiction latente, et réciproquement. C'est une réponse partielle à la dérive en open-loop, problème concret dans les pipelines de manipulation autonome. Pour les équipes travaillant sur des systèmes VLA ou de navigation, ce cadre suggère une représentation unifiée, métrique et actionnable, sans orchestrer deux pipelines distincts. La séparation entre SLAM et modèles de monde appris est historiquement ancrée : le SLAM probabiliste date des années 2000, tandis que les modèles de monde deep (RSSM, DreamerV3) sont apparus dans la décennie suivante. Plusieurs travaux récents tentent ce rapprochement dans le champ des VLA, où la cohérence spatiale devient un enjeu croissant. J-LAW se positionne comme une contribution théorique structurée via la formalisation en graphe de facteurs, et non comme un système prêt au déploiement. Limite à noter : les expériences restent sur des benchmarks standardisés, sans validation sur robot physique réel en scène dynamique. Aucun partenariat industriel ni timeline de transfert n'est mentionné dans ce préprint.

RechercheOpinion
1 source
CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité
392arXiv cs.RO 

CAR : adaptation cinédynamique inter-véhicules par représentation de la mobilité

Des chercheurs proposent sur arXiv (arXiv:2603.06866) un cadre algorithmique baptisé CAR, pour Cross-vehicle kinodynamics Adaptation via mobility Representation, conçu pour transférer rapidement les modèles de comportement dynamique d'un robot mobile à un autre sans recollecte massive de données. Le système exploite un encodeur Transformer avec normalisation de couche adaptative (Adaptive Layer Normalization) pour projeter trajectoires et configurations physiques de véhicules dans un espace latent commun dit "espace de mobilité partagé". CAR identifie ensuite les voisins les plus proches dans cet espace pour extraire les comportements communs et les adapter à une nouvelle plateforme. Évalué sur le simulateur Verti-Bench, construit sur le moteur multi-physique Chrono, et validé sur quatre configurations distinctes de la plateforme Verti-4-Wheeler, le framework atteint une réduction de l'erreur de prédiction de 67,2 % par rapport à un transfert direct entre plateformes similaires, avec seulement une minute de nouvelles données de trajectoire. Ce résultat adresse un verrou opérationnel réel pour les déployeurs de flottes hétérogènes : adapter un système de navigation autonome à un nouveau châssis exige aujourd'hui soit des campagnes d'acquisition de données coûteuses et spécifiques à chaque plateforme, soit des modèles simplifiés (unicycle, bicyclette) qui ignorent la kinodynamique réelle du robot. Ces abstractions montrent rapidement leurs limites sur terrain accidenté ou en conditions industrielles. CAR propose un transfert de connaissances inter-plateformes à faible coût de calibration. Pour un intégrateur déployant des AMR avec plusieurs types de châssis, réduire à une minute la fenêtre d'adaptation représente un levier opérationnel concret, même si ces conditions de benchmark restent à reproduire en environnements de production réels. L'article s'inscrit dans un courant actif de la recherche en robotique de terrain visant à briser la dépendance aux modèles plateforme-spécifiques. La plateforme Verti-4-Wheeler, reconfigurable mécaniquement, et le simulateur Verti-Bench offrent un banc d'essai modulaire bien adapté à ce type d'étude. Les approches concurrentes incluent les méthodes de méta-apprentissage (MAML et dérivés) et les modèles à dynamiques latentes (Dreamer, RSSM) appliqués à la locomotion. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné : il s'agit d'un résultat académique en cours de révision (v3 sur arXiv), dont la validation à grande échelle reste à démontrer.

RecherchePaper
1 source
MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques
393arXiv cs.RO 

MoPe : permanence du mouvement pour une cartographie gaussienne monoculaire robuste en environnements dynamiques

Une équipe de recherche publie en préimpression sur arXiv (2606.29237) une méthode baptisée MoPe (Motion Permanence) qui vise à corriger un défaut structurel des systèmes de cartographie par Gaussian Splatting monoculaire en environnements dynamiques. Le problème ciblé est précis : les approches actuelles de SLAM avec Gaussian Splatting traitent chaque image de manière indépendante pour décider si une région est dynamique ou statique. Résultat, quand un piéton ralentit, s'arrête ou réapparaît après une occultation, la trame courante semble statique et le système intègre ce contenu mobile dans la carte permanente, générant des artefacts de type "fantôme" (ghosting). MoPe repose sur un principe qu'il nomme Motion Permanence : l'identité dynamique d'un objet doit persister dans le temps plutôt qu'être réévaluée à chaque image. Concrètement, la méthode propage le posterior dynamique historique via un warping géométriquement cohérent en SE(3), puis le fusionne avec les observations de la trame courante par mises à jour bayésiennes en log-odds bornées. Ce posterior persistant pilote le suivi, la cartographie, l'insertion sélective de gaussiennes et un post-nettoyage par gaussienne individuelle. Les auteurs évaluent MoPe sur trois benchmarks publics (Wild-SLAM, Bonn, TUM) et rapportent des gains de robustesse en tracking et une réduction des ghosting, avec les améliorations les plus marquées sur les séquences à humains dynamiques. L'enjeu pour les intégrateurs et les équipes de navigation autonome est direct : un SLAM qui "hallucine" des obstacles statiques là où un piéton s'était simplement immobilisé dégrade la planification de trajectoire et la prise de décision en aval. En introduisant une mémoire temporelle au niveau de la représentation de scène elle-même, MoPe traite le problème à la racine plutôt qu'en post-filtrage. La méthode prouve qu'un filtre d'incertitude à mémoire, relativement léger à implémenter, suffit à franchir une partie du fossé entre les démos en laboratoire et les déploiements réels en environnements peuplés, sans recourir à une caméra stéréo ou à un LiDAR. Le Gaussian Splatting appliqué au SLAM est un domaine en effervescence depuis 2023, porté par des travaux comme SplaTAM, MonoGS et GaussianSLAM, qui ont démontré la faisabilité d'une cartographie haute-fidélité en temps réel à partir d'une seule caméra. MoPe s'inscrit dans la vague des méthodes qui cherchent à rendre ces représentations exploitables hors des environnements contrôlés, aux côtés d'approches concurrentes comme RobustSplat ou les variantes uncertainty-aware de MonoGS. Il s'agit pour l'instant d'une préimpression non revue par les pairs, sans code publié ni validation sur robot réel annoncée, ce qui invite à tempérer les conclusions : les gains mesurés sur séquences vidéo ne garantissent pas un comportement équivalent sur plateforme embarquée avec contraintes temps-réel. Les prochaines étapes naturelles seront l'intégration dans un pipeline de navigation complet et la validation sur datasets intérieurs type HM3D ou ScanNet avec scènes plus peuplées.

RecherchePaper
1 source
Limites de stabilité et performance motrice dans les interactions dyadiques médiées par robot avec délai
394arXiv cs.RO 

Limites de stabilité et performance motrice dans les interactions dyadiques médiées par robot avec délai

Une équipe de chercheurs publie sur arXiv (référence 2510.14511, troisième révision) un cadre analytique permettant de déterminer avec précision les frontières de stabilité dans les systèmes d'interaction haptique à distance entre deux opérateurs humains médiatisés par un robot. La méthode repose sur une approche de passage par zéro dans le domaine fréquentiel, qui contourne les approximations conservatives habituellement employées dans la littérature pour extraire des limites de stabilité explicites, directement liées aux dynamiques matérielles du robot et à la raideur de couplage entre les interfaces. Les auteurs étendent ensuite l'analyse d'un couplage élastique simple vers une topologie de proxy virtuel asymétrique et complexe, démontrant la généralité du framework. Le résultat théorique central est que la raideur d'interaction contraint de manière non linéaire la marge de stabilité du système: augmenter la rigidité du couplage accroît la sensibilité aux délais réseau, ce qui est contre-intuitif pour des concepteurs habitués aux systèmes mécaniques passifs. Ce résultat est validé expérimentalement par des essais montrant une corrélation directe entre les marges de stabilité analytiques et les performances motrices empiriques mesurées lors d'interactions dyadiques avec délai. Pour les intégrateurs de solutions haptiques téléopérées -- rééducation neuromotrice, chirurgie à distance, collaboration industrielle distribuée -- ce travail fournit des règles de conception rigoureuses et pose les conditions préalables à l'élaboration de stratégies effectives de compensation du délai. Ce papier s'inscrit dans un champ de recherche actif sur la téléhaptique et le contrôle bilatéral à distance, où les approches classiques comme les variables d'onde (wave variables) ou les modèles passifs souffrent souvent d'un conservatisme excessif qui pénalise les performances. Le problème du délai réseau est critique au-delà d'environ 100 ms de latence aller-retour, seuil au-delà duquel les systèmes haptiques conventionnels basculent vers l'instabilité. Cette contribution, sous forme de preprint en troisième itération, n'est pas encore un produit déployé mais un outil théorique destiné aux chercheurs et concepteurs de systèmes d'interaction haptique distante, avec une application potentielle directe en robotique médicale et dans les environnements collaboratifs industriels géographiquement distribués.

RecherchePaper
1 source
FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
395arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré
396arXiv cs.RO 

LAMP : planification adaptative de manipulation à long horizon pour la collaboration multi-robots en espace encombré

Une équipe de chercheurs a publié sur arXiv (référence 2606.29358v1) un nouveau cadre de planification intitulé LAMP, pour Long-horizon Adaptive Manipulation Planning, conçu pour coordonner plusieurs robots manipulateurs dans des environnements très encombrés. Le système repose sur deux planificateurs complémentaires : LAMPA*, qui effectue une recherche systématique dans l'espace couplé objets-robots, et LAMP-Lazy, un planificateur dit "paresseux" qui diffère certaines évaluations pour permettre une replanification en temps réel. Les expériences ont été menées dans des environnements simulés à haute densité d'obstacles, où les méthodes existantes échouent à trouver des solutions. Aucun déploiement physique ni timeline de commercialisation n'est annoncé. Le verrou technique que LAMP cherche à lever est fondamental pour l'industrie : coordonner plusieurs bras robotiques sur des tâches longues dans des espaces confinés implique de raisonner simultanément sur les contacts physiques, les dynamiques couplées entre robots, et l'évitement de collision. Les deux approches dominantes aujourd'hui se heurtent à des murs de scalabilité distincts. L'apprentissage par renforcement end-to-end peine à généraliser dès que l'horizon de tâche s'allonge ou que le nombre de robots augmente. Les méthodes hybrides, qui planifient les trajectoires d'objets et apprennent des primitives de contact à courte portée, ne tiennent pas dans des scènes très denses. LAMP propose de rendre ce problème tractable via un modèle génératif appris, combiné à une stratégie de recherche adaptative, ce qui constitue une approche architecturalement différente des VLA (Vision-Language-Action models) qui dominent l'espace humanoïde. La planification multi-robot en environnement encombré est un problème central pour l'automatisation logistique et industrielle, où des acteurs comme Exotec (France) déploient des flottes de robots AMR dans des entrepôts à haute densité. La recherche en robotique académique a longtemps traité la manipulation et la coordination de flotte séparément ; des travaux comme LAMP signalent une convergence vers des systèmes unifiés capables de gérer les deux dimensions. Cependant, l'absence totale de validation sur hardware réel est une limite importante : le sim-to-real gap reste le principal obstacle entre des résultats de simulation convaincants et une industrialisation effective. Les prochaines étapes naturelles seraient des tests sur bancs physiques multi-bras, dans des configurations représentatives de cellules de picking ou d'assemblage.

RecherchePaper
1 source
WARP : rétargétage corps entier pour l'apprentissage par démonstrations humaines préenregistrées
397arXiv cs.RO 

WARP : rétargétage corps entier pour l'apprentissage par démonstrations humaines préenregistrées

Un pipeline de transformation de poses humaines en actions robotiques, baptisé WARP (Whole-body-Aware Retargeting from human Pose), vient d'être publié en préprint sur arXiv (2606.29940). L'objectif est de permettre la manipulation mobile corps-entier à partir de séquences de démonstrations humaines capturées hors-ligne, sans recourir à la télé-opération. La méthode centrale repose sur un solveur géométrique à forme fermée dit SEW (Shoulder-Elbow-Wrist), qui calcule de façon exacte la position et l'orientation des effecteurs terminaux du robot tout en conservant la cohérence globale de la posture. À cela s'ajoute une stratégie de contrôle "lazy" de la base mobile, qui minimise les déplacements inutiles de la plateforme pour produire des trajectoires cohérentes et déterministes. Les auteurs rapportent qu'en rejeu boucle ouverte sur robot réel, les données générées sont suffisamment fiables pour une exécution directe sans correction humaine, ce qui constitue leur principale validation expérimentale. L'enjeu central est la suppression de la télé-opération comme source de données d'entraînement. Collecter des données de téléopération à grande échelle reste coûteux, lent et difficile à généraliser entre plateformes. Les méthodes de retargeting existantes produisent des solutions ambiguës, engendrant une "multi-modalité d'action" qui empêche la convergence des politiques supervisées. WARP prétend résoudre ce problème via un solveur déterministe, ce qui aligne données humaines et action robot de façon univoque. Si la revendication "zero-shot" des auteurs se confirme en dehors de conditions contrôlées, cela réduirait significativement le coût d'acquisition de données pour les systèmes de manipulation mobile, en ouvrant l'accès à des corpus vidéo humains existants comme source d'entraînement à grande échelle. Ce travail s'inscrit dans une tendance forte de la recherche en robotique apprenante : exploiter la donnée humaine plutôt que la donnée robot. Des systèmes comme pi-0 (Physical Intelligence), OpenVLA ou ACT ont montré que les politiques visuomotrices peuvent apprendre depuis des démonstrations téléopérées ou humaines, mais le passage à la manipulation corps-entier sur base mobile restait un verrou technique non résolu. WARP ne mentionne ni déploiement industriel ni plateforme robot spécifique dans son résumé, ce qui cantonne pour l'instant la contribution au cadre académique. La prochaine étape logique serait de tester la robustesse hors distribution et de comparer les politiques issues de WARP à celles entraînées sur données téléopérées, sur des benchmarks communs comme ceux d'OXE ou LIBERO.

RecherchePaper
1 source
Contrôle de Koopman différentiable et adaptatif, guidé par la physique, pour un vol stable sous perturbations inconnues
398arXiv cs.RO 

Contrôle de Koopman différentiable et adaptatif, guidé par la physique, pour un vol stable sous perturbations inconnues

Des chercheurs ont publié sur arXiv (arXiv:2506.08319) un cadre de commande hybride baptisé DEKC (Differentiable data-Enabled Koopman Control), conçu pour permettre à des systèmes robotiques de voler ou de se déplacer de manière précise dans des environnements non structurés, malgré des perturbations extérieures non modélisées. L'approche combine un modèle physique nominal du système avec un réseau de neurones profond chargé de paramétrer la "lifting function" de l'opérateur de Koopman, un outil mathématique qui projette des dynamiques non linéaires dans un espace linéaire global, simplifiant ainsi la conception du contrôleur. Point central de la contribution : les perturbations (forces aérodynamiques, charges suspendues) sont modélisées non pas comme du bruit aléatoire, mais comme un système dynamique à part entière dont l'évolution temporelle est apprise et anticipée. Un mécanisme de mise à jour par gradient rétropropagé en ligne permet une adaptation en temps réel aux incertitudes variables. Les validations expérimentales couvrent des simulations sur un robot spatial amarré (tethered space robot) et des essais réels sur quadrirotor soumis à des perturbations aérodynamiques et à des charges utiles suspendues lors de trajectoires agiles. L'intérêt industriel tient à la dualité que DEKC résout : les méthodes d'apprentissage pur offrent une bonne capacité d'approximation mais exigent un entraînement hors ligne massif et ne fournissent aucune garantie théorique de stabilité, tandis que les contrôleurs robustes classiques restent purement réactifs, corrigeant les erreurs au lieu de les anticiper. DEKC adopte une posture proactive en intégrant la trajectoire future estimée des perturbations directement dans la loi de commande, ce qui réduit les erreurs de suivi sur des manoeuvres rapides. La validation sur quadrirotor physique constitue un argument concret de passage du simulateur au réel, un défi fréquemment sous-estimé dans les publications de contrôle. L'opérateur de Koopman est un formalisme de contrôle établi depuis plusieurs décennies, mais son application combinée à des réseaux différentiables et à une prédiction explicite des perturbations représente une direction de recherche active depuis 2020 environ. Les approches concurrentes incluent les contrôleurs adaptatifs à base de Gaussian Process (GP-MPC), les réseaux neuronaux résiduels couplés à un MPC classique, et les méthodes d-Learning entièrement sans modèle. DEKC se distingue en conservant la structure physique tout en apprenant uniquement la dynamique résiduelle, ce qui réduit la charge de données. L'article reste un preprint non encore évalué par les pairs ; aucune timeline de déploiement industriel ni partenariat avec un intégrateur n'est mentionné.

RecherchePaper
1 source
ActiveVital : surveillance des signes vitaux intégrant la géométrie corporelle pour robots de soins à domicile
399arXiv cs.RO 

ActiveVital : surveillance des signes vitaux intégrant la géométrie corporelle pour robots de soins à domicile

Des chercheurs présentent dans un preprint arXiv (référence 2606.30275, juin 2026) un système baptisé ActiveVital, conçu pour surveiller en continu les signes vitaux, fréquence respiratoire et rythme cardiaque, sans contact physique, à bord d'un robot domestique équipé d'un radar à ondes millimétriques (mmWave). Le problème physique de départ est précis : un radar mmWave ne mesure que la composante radiale du mouvement. Lorsque le robot n'est pas positionné face à la cage thoracique du patient, l'alignement angulaire se dégrade, rendant le signal inutilisable. Résultat avant correction : une erreur d'intervalle respiratoire de 0,87 seconde et une erreur de fréquence cardiaque de 13,59 bpm. Après activation d'ActiveVital, ces chiffres tombent à 0,14 seconde et 2,22 bpm, soit des performances comparables à celles obtenues dans des conditions de mesure statique et contrôlée. La contribution centrale n'est pas algorithmique au sens habituel : elle recadre le problème de la détection passive en régulation géométrique active. Le système détecte la position du thorax par points clés visuels, convertit l'erreur d'alignement en commandes de déplacement, et oriente dynamiquement le radar vers une incidence quasi-normale à la surface thoracique. Un module de rehaussement différentiel de phase stabilise ensuite l'extraction du signal pendant les mouvements résiduels. Pour un COO de EHPAD ou un intégrateur de robots de compagnie, cela signifie concrètement qu'un robot en patrouille libre peut surveiller les constantes d'un résident sans balise portée, sans caméra RVB dédiée aux signes vitaux, et sans immobilité imposée. Le monitoring non-contact par radar mmWave est un axe de recherche actif depuis au moins 2018, mais les travaux antérieurs supposaient des configurations statiques ou semi-contrôlées. Les acteurs industriels positionnés sur la robotique de soin incluent des plateformes comme Labrador Systems ou les robots de compagnie de Softbank, et côté capteur, des puces mmWave de Texas Instruments ou Infineon. ActiveVital reste à ce stade un prototype académique non affilié à un déploiement industriel annoncé ; aucun essai terrain ni partenariat industriel n'est mentionné dans le preprint. La prochaine étape naturelle sera la validation sur robot mobile réel dans des environnements non supervisés, puis l'évaluation sur des populations âgées avec comorbidités respiratoires.

RecherchePaper
1 source
HJ-SafeDMP : primitives de mouvement dynamiques guidées par Hamilton-Jacobi pour la sécurité certifiée du robot
400arXiv cs.RO 

HJ-SafeDMP : primitives de mouvement dynamiques guidées par Hamilton-Jacobi pour la sécurité certifiée du robot

Une équipe de chercheurs a publié sur arXiv (2506.28995) HJ-SafeDMP, un cadre algorithmique qui combine Dynamic Movement Primitives (DMP) et analyse de joignabilité Hamilton-Jacobi (HJ) pour garantir formellement la sécurité des trajectoires d'un robot. Les DMP assurent stabilité inhérente et généralisation de trajectoire depuis une seule démonstration humaine, mais sans certificat de sécurité formelle. HJ-SafeDMP apprend hors ligne une Control Barrier Value Function (CBVF) via une récursion HJ model-free à différences finies, puis la déploie comme filtre de sécurité en temps réel avec une loi de contrôle en forme fermée, sans résoudre de programme quadratique en ligne, contrairement aux approches CBF-QP classiques. Les expériences sur un manipulateur à 7 degrés de liberté (DOF) montrent une exécution plusieurs ordres de grandeur plus rapide que les baselines d'optimisation, avec garanties formelles d'évitement de collision et couverture probabiliste calibrée par prédiction conforme sur échantillon fini. L'enjeu industriel est direct : les DMP sont prisés pour leur robustesse aux perturbations et leur flexibilité temporelle, mais ils n'offrent aucun certificat de sécurité. À l'inverse, l'analyse HJ Reachability fournit des marges de sécurité au pire cas (worst-case safety margins), mais souffre de la malédiction de la dimensionnalité, ce qui la rend impraticable pour le contrôle en temps réel sur des architectures robotiques réelles. HJ-SafeDMP résout ce compromis sans coût d'optimisation en ligne, le rendant compatible avec les boucles de contrôle rapides des robots industriels et cobots. La calibration par prédiction conforme apporte en outre une garantie probabiliste quantifiée, un argument potentiellement pertinent pour les processus de certification de sécurité fonctionnelle en contexte d'interaction humain-robot. Les DMP ont été introduits au début des années 2000 par Stefan Schaal et sont restés une référence en apprentissage par imitation. Les méthodes CBF (Control Barrier Functions) constituent aujourd'hui le standard pour la sécurité temps réel, mais leur résolution QP à chaque pas de temps génère un goulot computationnel non négligeable. L'analyse HJ Reachability, portée notamment par la Berkeley HJ Reachability Toolbox, est théoriquement rigoureuse mais rarement déployée en temps réel faute de scalabilité sur des systèmes à haute dimensionnalité. HJ-SafeDMP s'en distingue aussi par un objectif d'apprentissage par expectile qui évite les requêtes hors distribution, un point de fragilité courant des approches offline. Il s'agit d'une contribution académique préliminaire : aucun partenaire industriel ni calendrier de déploiement en production n'est mentionné dans l'article.

UEContribution indirectement pertinente pour les équipes R&D cobot européennes travaillant sur la certification de sécurité fonctionnelle (ISO 10218, AI Act), mais aucun acteur FR/EU impliqué et aucun déploiement industriel annoncé.

RecherchePaper
1 source