Aller au contenu principal

Recherche — page 28

2151 articles · page 28 sur 44

Publications scientifiques en robotique : arXiv cs.RO, ICRA, IROS, Humanoids, CoRL — nouveaux algorithmes, benchmarks et datasets.

Douceur avant tout : une pince robotique souple cueille les fruits mûrs sans les meurtrir
1351Robohub RecherchePaper

Douceur avant tout : une pince robotique souple cueille les fruits mûrs sans les meurtrir

Des chercheurs du laboratoire Organic Robotics Lab de Cornell University, dirigé par Rob Shepherd, professeur de mécanique au Duffield College of Engineering, ont développé un préhenseur robotique souple capable de prédire la maturité de fruits au toucher et de les cueillir sans les endommager. Le système repose sur des capteurs fibre optique étirables intégrés dans les doigts du gripper : un capteur mesure la courbure du doigt lors de la saisie, un second mesure la pression à l'extrémité. Ensemble, ils permettent au robot d'estimer la forme de l'objet et d'ajuster sa prise en temps réel. Un mécanisme d'engrenage planétaire dans le poignet permet de faire pivoter le fruit pour le détacher en torsion, plutôt que de l'arracher, ce qui préserve la tige et le fruit. Une caméra embarquée dans la paume complète le dispositif pour détecter les fruits masqués par le feuillage. Les tests ont été réalisés sur des fraises, en partenariat avec Marvin Pritts, professeur d'horticulture au College of Agriculture and Life Sciences, spécialiste des méthodes de production durables pour les baies. Le modèle a été entraîné à corréler la rigidité mesurée par les capteurs avec le stade de maturité, puis validé par analyse colorimétrique visuelle. L'intérêt industriel de cette approche dépasse la fraise. Shepherd cite notamment l'avocat, l'ananas et le pawpaw, fruits dont la maturité est indétectable à l'oeil nu et qui résistent mal au transport ou à la mécanisation classique. Pour les intégrateurs en agri-tech, la combinaison sensorimotrice de ce gripper ouvre une voie concrète vers la récolte automatisée de fruits fragiles à haute valeur ajoutée, un segment aujourd'hui encore très dépendant de la main d'oeuvre humaine. La propriété clé du système est que les jauges de contrainte optiques partagent les mêmes propriétés mécaniques que la structure du doigt souple, ce qui élimine la discontinuité mécanique typique des capteurs rigides greffés sur des actionneurs mous. C'est un point de conception non trivial : les capteurs ne perturbent pas le comportement du préhenseur, ils en font partie intégrante. Le laboratoire Organic Robotics Lab travaille depuis plusieurs années sur l'extension des capteurs fibre optique étirables aux systèmes robotiques souples, après en avoir démontré le potentiel pour la proprioception et la perception tactile dynamique. La collaboration avec le département d'agriculture de Cornell marque une inflexion appliquée dans des travaux jusqu'ici majoritairement fondamentaux. Sur le plan concurrentiel, plusieurs acteurs se positionnent dans la récolte robotisée douce : Abundant Robotics (racheté), Tortuga AgTech, ou encore le projet Agrobot en Europe, mais la plupart s'appuient sur vision seule ou sur des capteurs de force rigides. L'originalité de Cornell réside dans l'intégration sensorielle mécano-optique dans la structure même du préhenseur. Le dispositif est au stade de prototype de recherche, aucun calendrier de commercialisation ni partenariat industriel n'a été annoncé à ce jour.

1 source
Apprentissage par renforcement visuel sur politique efficace via gradient de politique stochastique découplé
1352arXiv cs.RO 

Apprentissage par renforcement visuel sur politique efficace via gradient de politique stochastique découplé

Une équipe de recherche publie sur arXiv (2605.26478, mai 2026) une méthode d'apprentissage par renforcement visuel appelée SDPG (Stochastic Decoupled Policy Gradient), capable d'entraîner des politiques visuomotrices end-to-end en quelques heures sur un seul GPU NVIDIA RTX 4080. La clé : estimer les gradients de politique via des perturbations stochastiques de trajectoires, plutôt que via des centaines d'environnements rendus en batch, réduisant drastiquement mémoire et temps de calcul. Sur les benchmarks visuels MuJoCo, référence standard pour l'évaluation des politiques de contrôle à entrées visuelles, SDPG surpasse les méthodes concurrentes sur les trois critères mesurés : temps d'entraînement, empreinte mémoire et récompenses obtenues. L'article inclut également un premier transfert sim-to-real démontré sur matériel physique, couvrant des tâches de manipulation dextère et de locomotion en terrain difficile. L'enjeu touche directement à l'accessibilité du RL visuel pour la robotique. Jusqu'ici, les méthodes on-policy visuomotrices exigeaient des clusters GPU pour rester compétitives, concentrant de fait la recherche dans quelques grands laboratoires. Ramener le coût d'entraînement à un seul GPU grand public ouvre potentiellement la voie aux équipes académiques moins dotées et aux startups. La publication simultanée d'une suite de benchmarks de robotique visuelle réaliste tente de combler un autre manque structurel : la fragmentation des protocoles d'évaluation dans le domaine. Le transfert sim-to-real annoncé reste cependant à confirmer à plus grande échelle, un résultat sur hardware physique dans un preprint n'équivalant pas à une validation industrielle. Ce travail s'inscrit dans une dynamique de démocratisation du RL pour la robotique. Des approches comme DrQ-v2 (DeepMind) ou DreamerV3 ont progressivement amélioré l'efficacité en entrées visuelles, mais restent lourdes pour les environnements réalistes. Les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) contournent entièrement la boucle RL via des architectures de fondation préentraînées. SDPG choisit une troisième voie : rester dans le paradigme RL pur tout en réduisant radicalement le coût computationnel. La prochaine étape observable sera l'adoption ou le rejet de leurs benchmarks par la communauté comme référence standard de comparaison.

UEL'accessibilité réduite à un seul GPU grand public pourrait bénéficier aux équipes académiques européennes moins dotées en infrastructure de calcul, réduisant leur dépendance aux clusters HPC pour la recherche en RL visuel.

RecherchePaper
1 source
Champs vectoriels pour le suivi de trajectoire sur les groupes de Lie, appliqués au contrôle robotique
1353arXiv cs.RO 

Champs vectoriels pour le suivi de trajectoire sur les groupes de Lie, appliqués au contrôle robotique

Des chercheurs ont publié en février 2026 (arXiv 2602.21450) un cadre général de champs vectoriels pour le suivi de chemin sur les groupes de Lie, ciblant les systèmes robotiques capables de contrôler indépendamment leur position et leur orientation dans l'espace 3D. Les applications visées incluent les véhicules aériens omnidirectionnels, les robots sous-marins et les effecteurs de bras manipulateurs. Le problème est formalisé sur le groupe matriciel SE(3), qui encode l'ensemble des déplacements rigides dans l'espace à six degrés de liberté (trois en translation, trois en rotation). Le cadre proposé garantit la convergence vers une courbe paramétrique depuis presque toutes les conditions initiales, tout en assurant un mouvement continu le long du chemin. La commande en entrée est exprimée via le body twist, une représentation compacte de la vitesse locale combinant composantes linéaires et angulaires, ce qui s'aligne directement avec les interfaces de contrôle industrielles standard. Des expériences sur un manipulateur réel suivant des poses complexes valident l'approche, et une implémentation open-source accompagne la publication. La distinction entre trajectory tracking et path following est centrale : le tracking impose une contrainte temporelle stricte, alors que le path following ne contraint que la convergence spatiale vers le chemin. Pour un intégrateur ou un décideur industriel, cela se traduit par une robustesse accrue aux perturbations et une simplification de la programmation des tâches répétitives. L'usage du body twist comme représentation minimale réduit la charge computationnelle, avantage direct pour les boucles de contrôle temps-réel sur systèmes embarqués. La garantie de convergence topologique depuis "presque toutes" les conditions initiales distingue ce travail des approches locales classiques, qui exigent une initialisation proche de la trajectoire cible. Le contrôle de pose sur SE(3) est un champ actif depuis plusieurs décennies, avec des approches classiques souffrant de singularités liées aux représentations paramétriques comme les angles d'Euler ou les quaternions. Ce travail s'inscrit dans un mouvement plus large d'adoption de la géométrie différentielle en robotique, porté par plusieurs équipes académiques en Europe et en Amérique du Nord. Les méthodes d'apprentissage end-to-end comme les VLA (Vision-Language-Action) ne fournissent pas de garanties formelles équivalentes, ce qui maintient la pertinence de ces approches analytiques dans les contextes réglementés tels que le médical, le spatial ou le nucléaire. La disponibilité du code open-source abaisse la barrière d'adoption pour les équipes souhaitant intégrer ce framework sur leurs plateformes robotiques existantes.

UELes équipes R&D européennes en robotique peuvent adopter directement le framework open-source pour améliorer le contrôle de manipulateurs dans les secteurs réglementés (médical, spatial, nucléaire) où les garanties formelles de convergence sont exigées.

RecherchePaper
1 source
HyperSim : un cadre complet de transfert simulation-réel pour la manipulation robotique robuste
1354arXiv cs.RO 

HyperSim : un cadre complet de transfert simulation-réel pour la manipulation robotique robuste

Des chercheurs ont publié sur arXiv (arXiv:2605.26638) HyperSim, un framework bout-en-bout conçu pour transférer des politiques de manipulation robotique de la simulation vers le monde réel. La méthode repose sur trois piliers : la synthèse d'environnements haute fidélité visuelle, la génération de trajectoires adversariales, et un co-entraînement mixte simulation/réel. Validée sur 400 exécutions de tâches en conditions réelles, HyperSim atteint des taux de succès sim-to-real de 80 % avec le modèle ACT et 95 % avec π₀ (le modèle VLA de Physical Intelligence). Les politiques entraînées avec des trajectoires adversariales affichent par ailleurs un taux de complétion supérieur de 35 % sous perturbations physiques dynamiques, par rapport aux baselines sans ce module. Ces résultats adressent directement l'un des verrous les plus cités dans le déploiement de robots manipulateurs industriels : le sim-to-real gap, c'est-à-dire la dégradation de performance entre une politique entraînée en simulation et son comportement réel. Un taux de 95 % avec π₀ sur des tâches de manipulation représente un niveau de robustesse rarement publié à cette échelle d'évaluation (400 runs, trois métriques granulaires). Pour les intégrateurs et les équipes R&D, cela valide concrètement l'hypothèse que la donnée synthétique, lorsqu'elle est correctement augmentée et diversifiée, peut substituer en grande partie la collecte physique coûteuse. À noter cependant : l'article ne détaille pas les types de tâches ni les objets testés, ce qui limite l'interprétation de la généralité des résultats. La problématique sim-to-real est au cœur des efforts de plusieurs équipes concurrentes : Google DeepMind (avec RoboVerse et ses pipelines de données synthétiques), Physical Intelligence (dont le modèle π₀ est justement l'un des deux benchmarks utilisés ici), et des laboratoires académiques comme Stanford et CMU. HyperSim se distingue par son approche intégrée plutôt que modulaire, cherchant à traiter simultanément le gap visuel et le gap dynamique. La prochaine étape naturelle, non précisée dans le preprint, serait de tester la généralisation à des plateformes humanoïdes ou des scénarios multi-objet en environnement non structuré.

UELes laboratoires européens en manipulation robotique (CEA-List, INRIA) pourraient intégrer ce framework pour réduire leur dépendance aux démonstrations physiques coûteuses, sans implication institutionnelle directe.

RecherchePaper
1 source
SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot
1355arXiv cs.RO 

SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot

Des chercheurs du MIT ont publié SOLE-R1 (Self-Observing LEarner), un modèle de raisonnement vidéo-langage conçu pour fonctionner comme signal de récompense exclusif dans l'apprentissage par renforcement (RL) en robotique, sans aucun accès à des récompenses terrain, indicateurs de succès, démonstrations ou réglages spécifiques à la tâche. Soumis sur arXiv (2503.28730v2), le système prend en entrée uniquement des observations vidéo brutes et un objectif en langage naturel, puis génère à chaque pas de temps un raisonnement spatiotemporel de type chain-of-thought (CoT) pour estimer de façon dense la progression de la tâche. Entraîné sur un pipeline de synthèse massif de trajectoires vidéo annotées temporellement, SOLE-R1 combine fine-tuning supervisé et RL depuis des récompenses vérifiables. Évalué sur quatre environnements de simulation distincts et en setting réel, il réussit 24 tâches de manipulation inédites en apprentissage zéro-shot depuis une initialisation aléatoire. L'enjeu central que résout SOLE-R1 est celui du reward hacking : aujourd'hui, utiliser un VLM généraliste comme évaluateur RL expose le système à des erreurs perceptuelles sous observabilité partielle ou changement de distribution, que la politique apprenante exploite rapidement au lieu de résoudre réellement la tâche. SOLE-R1 surpasse nettement des comparatifs forts - Robometer, RoboReward, ReWiND, mais aussi GPT-5 et Gemini-3-Pro - sur la robustesse à ce phénomène. Pour les intégrateurs et ingénieurs robotique, c'est un signal concret que le goulot d'étranglement du RL sur robot réel (définir une fonction de récompense dense et fiable) peut être délégué à un modèle de raisonnement vidéo entraîné spécifiquement, sans instrumentation matérielle supplémentaire. SOLE-R1 s'inscrit dans un courant actif qui cherche à remplacer les récompenses codées à la main par des superviseurs fondationnels (EUREKA d'NVIDIA, VLM-RM, SuSIE). La différence revendiquée ici est le raisonnement CoT temporel explicite par pas de temps, contre des évaluations épisodiques ou des scores scalaires instantanés. Le projet est encore au stade preprint sans déploiement industriel annoncé, mais les modèles, données et code sont publiés en open access sur la page anonyme du MIT. Les prochaines étapes naturelles seraient la validation sur des plateformes commerciales (Figure, Unitree, Boston Dynamics Spot) et l'extension à des tâches longue-horizon en environnement non structuré, deux gaps que l'article ne comble pas encore.

RechercheOpinion
1 source
LAD-VF : la différentiation automatique par LLM permet la planification robotique sans ajustement fin à partir de méthodes formelles
1356arXiv cs.RO 

LAD-VF : la différentiation automatique par LLM permet la planification robotique sans ajustement fin à partir de méthodes formelles

Une équipe de chercheurs a publié LAD-VF (LLM-AutoDiff with Verification Feedback), un cadre de planification robotique basé sur les grands modèles de langage (LLM) qui élimine le besoin de fine-tuning. Présenté dans un article arXiv (2509.18384v2), le système combine la vérification formelle des contraintes avec un mécanisme de différenciation automatique appliqué directement au texte, baptisé LLM-AutoDiff. Concrètement, LAD-VF génère des boucles de rétroaction à partir d'un vérificateur formel qui évalue si les plans produits respectent les spécifications de sécurité et réglementaires, puis affine itérativement les prompts plutôt que les paramètres du modèle. Lors d'expériences sur des tâches de navigation et de manipulation robotique, le taux de succès progresse de 60 % à plus de 90 %, sans modification des poids du modèle sous-jacent. Ce résultat adresse un problème central pour le déploiement industriel des LLM en robotique : les modèles actuels violent fréquemment les contraintes de sécurité par hallucination ou par alignement insuffisant, ce qui freine leur adoption dans des environnements réglementés comme l'industrie manufacturière, la mobilité autonome ou la chirurgie assistée. Les approches classiques de réalignement telles que le Direct Preference Optimization (DPO) ou le RLHF exigent des annotations humaines coûteuses et des cycles de fine-tuning intensifs en calcul GPU. En substituant l'optimisation de prompt à celle des poids, LAD-VF ouvre une voie d'adaptation scalable sans infrastructure de réentraînement dédiée, et produit des prompts auditables qui simplifient la traçabilité requise par des normes comme l'ISO 10218 ou le futur règlement européen sur l'IA. LAD-VF s'inscrit dans un courant émergent qui cherche à rendre les LLM exploitables dans des contextes à haute criticité sans passer par des pipelines de fine-tuning lourds. Les approches concurrentes incluent les méthodes de formal-feedback avec fine-tuning, le Constitutional AI d'Anthropic ou les frameworks de planification symbolique hybride comme SayCan (Google DeepMind). La nouveauté de LAD-VF tient à l'intégration de la différenciation automatique au niveau textuel, un concept issu des travaux sur AdalFlow. L'architecture modulaire revendiquée suggère une compatibilité avec des familles de modèles variées (GPT-4, Llama, Qwen), mais les expériences publiées restent limitées à des environnements de simulation ; le passage au réel en conditions industrielles reste entièrement à démontrer.

UELes prompts auditables générés par LAD-VF pourraient faciliter la conformité au règlement européen sur l'IA pour les applications robotiques à haute criticité, mais le système reste limité à des environnements de simulation sans validation industrielle réelle.

RecherchePaper
1 source
Exploiter un potentiel variable : quand le contrôle réactif suffit aux comportements multi-objectifs
1357arXiv cs.RO 

Exploiter un potentiel variable : quand le contrôle réactif suffit aux comportements multi-objectifs

Une équipe de chercheurs a publié en mai 2026 (arXiv:2605.27314) une approche qui réhabilite le contrôle réactif pour des tâches multi-objectifs, domaine où cette famille de méthodes est traditionnellement jugée inadaptée. Le principe repose sur un modèle du monde sous forme de graphe, étendu par des projections dans l'espace nul (nullspace projections) : lorsque deux objectifs entrent en conflit, les gradients de plus faible priorité sont projetés dans le nullspace du gradient de plus haute priorité, les priorités étant calculées en continu en fonction de l'état courant du système. Les auteurs valident l'approche sur deux scénarios : navigation autour d'obstacles non-convexes, et poussée planaire (planar pushing) d'objets non-convexes. Sur cent configurations de poussée, la méthode atteint 100 % de réussite, contre 0 % pour la descente de gradient classique (steepest-descent) et environ 55 % pour une diffusion policy entraînée sur démonstrations. La même formulation est transférée directement sur un robot réel, intégrant des contraintes perceptuelles et cinématiques via le même mécanisme. Le résultat le plus saillant pour les praticiens est la comparaison avec la diffusion policy : un modèle génératif entraîné sur données, considéré comme l'état de l'art sur les tâches de manipulation déstructurées, plafonne à 55 % là où cette méthode purement réactive, sans démonstration ni réentraînement, atteint 100 %. Cela contredit directement la thèse selon laquelle les approches data-driven supplantent systématiquement les méthodes classiques en manipulation. Pour un intégrateur industriel, le signal est clair : le coût d'acquisition de données et les pipelines d'entraînement ne sont pas toujours nécessaires pour des tâches de saisie ou de manipulation d'objets à géométrie complexe. La légèreté computationnelle du contrôle réactif le rend également compatible avec des architectures embarquées à ressources limitées. Le contrôle réactif par champs de potentiel remonte aux travaux d'Oussama Khatib (1986), et les projections dans l'espace nul sont un pilier de la robotique à priorité de tâches (travaux de Siciliano, Chaumette). Ce papier ne réinvente pas ces fondamentaux mais résout leur point de défaillance historique : les minima locaux dus à des encodages statiques des objectifs. Face à cet axe purement classique, les approches concurrentes combinent apprentissage par renforcement, imitation learning (ACT, diffusion policy), et plus récemment les VLA (Vision-Language-Action models comme pi0 ou GR00T N2 de NVIDIA). Les auteurs ne précisent pas de roadmap industrielle, mais la capacité de transfert sim-to-real sans retraining est un argument fort pour des pilotes rapides. La prochaine étape naturelle serait l'extension à la manipulation 3D et aux objets articulés.

RecherchePaper
1 source
Estimation de pose et de forme d'objets pour la saisie : est-ce que ça fonctionne ?
1358arXiv cs.RO 

Estimation de pose et de forme d'objets pour la saisie : est-ce que ça fonctionne ?

Une étude publiée en preprint sur arXiv (2605.26944, mai 2026) s'attaque à une question centrale de la manipulation robotique : les méthodes modulaires, qui estiment d'abord la pose et la forme 3D d'un objet avant de générer des préhensions par échantillonnage antipolaire, surpassent-elles les approches bout-en-bout qui synthétisent directement des poses de saisie ? Le cadre expérimental se limite aux pinces à mâchoires parallèles, aux préhensions à 7 degrés de liberté (7-DOF), et à une entrée monoculaire RGB(-D). Trois pipelines modulaires sont évalués : deux s'appuient sur des modèles encodeur-décodeur (SAM3D, LRM, CRISP), le troisième sur des modèles de reconstruction par diffusion (InstantMesh, Zero123, SceneComplete), tous capables de reconstruire des formes 3D de façon catégorie-agnostique. Ces pipelines sont comparés à une méthode bout-en-bout de référence représentant l'état de l'art. Les résultats sont sans ambiguïté : les méthodes modulaires surpassent la baseline bout-en-bout dans l'intégralité des expériences, y compris sur les petits objets où l'approche bout-en-bout échoue complètement. Ce constat remet en question l'hypothèse dominante selon laquelle les architectures bout-en-bout s'imposent naturellement en manipulation. La qualité des préhensions reste cependant conditionnée à la précision de l'estimation de pose et de forme : dans les scènes encombrées (cluttered scenes), les performances se dégradent, exposant une limite structurelle des méthodes actuelles de reconstruction 3D monoculaire. Les auteurs montrent par ailleurs que ces pipelines modulaires peuvent être augmentés avec des modèles vision-langage (VLM) pour produire des préhensions conditionnées par des instructions en langage naturel depuis une seule image RGB-D, avec des performances comparables à la baseline LERF-TOGO. Ces travaux s'inscrivent dans une dynamique plus large de reconstruction 3D open-set portée par des modèles génératifs larges. Les approches encodeur-décodeur comme SAM3D ou LRM, et les modèles par diffusion comme InstantMesh ou Zero123, ont démontré une généralisation hors-distribution qui rend la reconstruction catégorie-agnostique exploitable en robotique industrielle. Côté positionnement concurrentiel, les méthodes bout-en-bout comme GraspNet restent des références, mais ce preprint suggère qu'un paradigme modulaire combinant estimation de forme et échantillonnage géométrique peut les surpasser dès lors que la reconstruction est suffisamment précise. La robustesse en scènes encombrées reste le défi ouvert majeur pour les équipes de recherche et les intégrateurs industriels.

RecherchePaper
1 source
PhyPush : une seule poussée suffit pour estimer les propriétés physiques sans capteurs grâce aux transformeurs guidés par la physique
1359arXiv cs.RO 

PhyPush : une seule poussée suffit pour estimer les propriétés physiques sans capteurs grâce aux transformeurs guidés par la physique

PhyPush, présenté dans un article arXiv (2605.18284) publié en mai 2026, est un framework basé sur un Transformer guidé par la physique, capable d'estimer la masse et le coefficient de friction d'un objet à partir d'une seule poussée. La particularité centrale : le système n'utilise que la vélocité cinématique de l'effecteur final, une donnée disponible nativement sur tout bras robotique standard, sans capteur de force/couple, sans réseau de capteurs tactiles, et sans système de capture de mouvement multi-caméras. Le modèle intègre directement les contraintes issues de la deuxième loi de Newton et du modèle de friction de Coulomb dans sa fonction de perte, ce qui renforce la cohérence physique des estimations. En simulation, PhyPush réduit l'erreur d'estimation de plus de 10 % par rapport à une baseline disposant pourtant d'un accès privilégié aux données de force complètes ; en conditions réelles, il surpasse une approche purement data-driven sur des objets et surfaces hors domaine d'entraînement. L'impact pour l'intégration industrielle est direct. L'estimation précise de la masse et de la friction est un prérequis pour la manipulation adaptative fiable, notamment dans les lignes de tri, d'assemblage ou de logistique où les objets varient constamment. Les approches existantes exigeaient soit un instrumentation coûteuse (capteurs F/T à 2 000-10 000 €/unité), soit des environnements contrôlés incompatibles avec un déploiement à l'échelle. PhyPush déplace ce prérequis vers une inférence logicielle sur hardware standard, ce qui ouvre la voie à une perception physique embarquée sur des flottes de robots sans sur-coût matériel. La preuve que l'apprentissage guidé par la physique peut surpasser une baseline disposant de plus d'information sensorielle est également un signal fort : la structure inductive correcte compense le manque de capteurs, ce qui contredit l'hypothèse selon laquelle plus de données brutes implique nécessairement de meilleures estimations. L'estimation interactive des propriétés physiques par poussée (push-based estimation) est un problème étudié depuis une décennie, mais les solutions robustes restaient dépendantes de setups lourds issus des labos de manipulation tactile (MIT, Stanford, CMU). L'émergence des Transformers appliqués à la dynamique robotique et l'intégration de prior physique dans les fonctions de perte sont des tendances récentes qui convergent ici. Côté concurrence, les travaux de perception tactile comme celles de GelSight ou des approches sim-to-real de Meta (DIGIT) adressent un problème similaire mais via du hardware dédié ; des équipes comme Physical Intelligence (Pi-0) ou Figure AI intègrent eux aussi des modules d'estimation d'état dans leurs pipelines VLA, mais sans publier les détails. PhyPush se positionne comme une brique bas coût et open science pour tout intégrateur souhaitant ajouter de l'adaptation physique à un bras existant. Les prochaines étapes logiques incluent la généralisation à des poussées multi-axes, l'intégration dans des boucles de contrôle en temps réel, et le test sur des plateformes humanoïdes où la variabilité des objets manipulés est maximale.

RecherchePaper
1 source
IA incarnée et capacités extensibles grâce aux outils
1360arXiv cs.RO 

IA incarnée et capacités extensibles grâce aux outils

Des chercheurs ont publié le 27 mai 2026 sur arXiv (2605.26637v1) une architecture pour les systèmes d'intelligence incarnée (embodied AI) appelée Embodied Tool Protocol, ou ETP. Le principe central, qualifié de "capability externalization", consiste à découpler perception, raisonnement, planification et contrôle moteur plutôt que de les fondre dans un seul modèle paramétrique bout-en-bout. Chaque capacité devient un outil indépendant, optimisé séparément et invoqué dynamiquement à l'inférence. L'équipe a constitué une base de plus de 100 outils validés couvrant quatre domaines : perception, cognition, raisonnement et exécution. Sur cette base, ils ont construit EmbodiedToolBench, un benchmark évaluant quatre dimensions de l'usage des outils : reconnaissance de la nécessité, sélection, exécution et composition de chaînes. Les expériences, menées en simulation et sur des plateformes physiques, affichent un gain moyen de 31 % sur EB-ALFRED et de 36 % sur EB-Navigation par rapport aux baselines sans augmentation d'outils. Ces chiffres sont pertinents pour un secteur où l'architecture VLA (Vision-Language-Action) bout-en-bout s'est imposée comme paradigme dominant depuis 2023. L'apport le plus concret est l'identification d'une asymétrie forte : la cognition et la perception bénéficient substantiellement de l'externalisation, tandis que les capacités d'exécution motrice restent peu améliorées par l'ajout d'outils externes. Pour un intégrateur ou un COO industriel, ce signal est utile : l'orchestration modulaire semble mature pour les couches décisionnelles et perceptuelles, mais le contrôle bas niveau conserve des contraintes structurelles que l'augmentation d'outils ne résout pas. L'article pointe également un goulot d'étranglement persistant sur tous les modèles testés : savoir quand, lequel et comment invoquer un outil, ce que les auteurs nomment "embodied tool competence". Le travail s'inscrit dans une tendance qui cherche à dépasser les limites de la politique monolithique, notamment la difficulté de généralisation hors distribution. Les approches concurrentes incluent les architectures hiérarchiques classiques (planificateur global + contrôleur bas niveau), les agents LLM à outils dans la lignée de ToolFormer, et des frameworks comme SayCan (Google DeepMind). Ni le code ni les outils ne semblent encore disponibles publiquement selon le texte du preprint, ce qui limite l'évaluation indépendante des gains annoncés. L'adoption d'EmbodiedToolBench comme référentiel commun dépendra de la qualité de la release publique. Les suites logiques seraient de tester la robustesse de la composition de chaînes d'outils dans des environnements non contrôlés, et d'étendre le protocole ETP à des plateformes hardware existantes comme les humanoïdes Figure, Unitree ou les bras manipulateurs industriels.

RechercheOpinion
1 source
TCBiRRT : planification rapide de mouvement pour manipulateur spatial à deux bras couplés par expansion aléatoire dans l'espace des tâches
1361arXiv cs.RO 

TCBiRRT : planification rapide de mouvement pour manipulateur spatial à deux bras couplés par expansion aléatoire dans l'espace des tâches

Des chercheurs ont publié le 27 mai 2026 sur arXiv (identifiant 2605.27167) un algorithme de planification de mouvement baptisé TCBiRRT (Task-space Constrained Bidirectional Rapidly-exploring Random Tree), conçu pour les manipulateurs spatiaux bi-bras à chaîne cinématique fermée. Le problème visé est concret : lors de l'assemblage orbital de grandes structures spatiales, un bras double qui tient rigidement un objet forme une boucle fermée entre ses deux effecteurs, ce qui réduit drastiquement l'espace de configurations valides. TCBiRRT contourne cette difficulté en effectuant l'échantillonnage aléatoire directement dans l'espace tâche, défini par la pose de l'objet manipulé, plutôt que dans l'espace articulaire de haute dimension. Un algorithme de cinématique inverse sur chemin mappe ensuite chaque noeud tâche vers une trajectoire articulaire continue, intégré dans un cadre RRT bidirectionnel avec mécanisme de re-saisie. Les simulations portent sur plusieurs scénarios d'assemblage orbital à complexité environnementale variable. Les résultats annoncés sont significatifs sur le plan algorithmique : taux de succès nettement supérieurs et temps de planification améliorés de plusieurs ordres de grandeur par rapport aux planificateurs de référence. Pour un intégrateur travaillant sur des systèmes robotiques orbitaux, cela se traduit par des fenêtres d'action plus courtes et une meilleure fiabilité dans des environnements encombrés, pièces de structure, équipements déjà déployés. Il faut cependant souligner que tous les résultats reposent exclusivement sur simulation ; aucun test en microgravité réelle ni sur prototype physique n'est rapporté à ce stade. Le gap sim-to-real reste donc entier, question centrale pour toute qualification de vol. La planification de mouvement sous contraintes de chaîne fermée est un problème ancien en robotique, mais son application aux manipulateurs orbitaux bi-bras, type Canadarm2 ou les projets plus récents de bras d'assemblage pour les stations lunaires Gateway et les futures plateformes LEO commerciales, redevient stratégique. Côté concurrence algorithmique, les approches existantes (CBiRRT, planificateurs config-space classiques) peinent à passer à l'échelle dans des environnements complexes : c'est précisément ce verrou que TCBiRRT prétend lever. Aucun lien industriel ni partenariat agence spatiale n'est mentionné dans le préprint ; les prochaines étapes naturelles seraient une validation matérielle et une intégration dans des simulateurs de référence comme NASA's RSVP ou ESA's VREP.

UEAucun partenariat institutionnel européen confirmé, mais l'ESA VREP est cité comme cible d'intégration naturelle pour une validation future, ce qui représente un intérêt indirect pour les projets orbitaux européens (Gateway, stations LEO commerciales).

RecherchePaper
1 source
Vers une navigation socialement adaptée dans les immeubles résidentiels : la méthode Look Further
1362arXiv cs.RO 

Vers une navigation socialement adaptée dans les immeubles résidentiels : la méthode Look Further

Des chercheurs ont publié sur arXiv (réf. 2605.26710) une étude portant sur la navigation sociale d'un robot de livraison dans les couloirs d'immeubles résidentiels. L'approche centrale, baptisée Proactive Lane-Changing (PLC), consiste à déporter latéralement le robot du centre vers le côté du couloir dès qu'un piéton est détecté à plus de huit mètres, soit deux à quatre fois la distance de réaction habituelle des systèmes actuels. Une étude utilisateur avec 42 participants a évalué cette stratégie selon trois critères : sécurité, fluidité et politesse. En couloir droit (approche frontale), le PLC surpasse de façon statistiquement significative les comportements classiques de la littérature - ralentissement, arrêt, évitement réactif en proximité - sur les trois dimensions. En revanche, dans les scénarios d'intersection à angle mort, aucune des approches testées ne se distingue, les préférences des participants restant très dispersées. Ce résultat interroge les intégrateurs de robots AMR en milieu indoor résidentiel. La navigation sociale s'est longtemps concentrée sur la zone de "personal space" - typiquement moins de deux mètres - en appliquant des règles d'évitement réactif. L'étude démontre qu'étendre la distance de réaction modifie la perception globale du mouvement robotique, pas uniquement la sensation d'intrusion à courte portée. C'est un signal utile pour les concepteurs de comportements : l'expérience utilisateur en couloir relève du design d'interaction à grande échelle spatiale, pas seulement de la sécurité physique. L'absence de résultat probant aux intersections souligne cependant que le problème des angles morts reste entier et que le PLC n'est pas une solution universelle. Le travail s'inscrit dans un champ actif depuis la popularisation des robots de service indoor et l'émergence de modèles comme le Social Force Model. Côté industrie, des acteurs comme Keenon, Aethon ou Savioke ont déployé des robots de livraison en hôtellerie et milieu hospitalier sans traiter explicitement la navigation sociale à longue distance. En Europe, Enchanted Tools (France, robot Miroka) et d'autres opèrent dans des environnements comparables et pourraient bénéficier de ce type d'approche comportementale. L'étude reste au stade de la recherche publiée : ni code disponible, ni déploiement commercial annoncé.

UEEnchanted Tools (France, robot Miroka) et d'autres acteurs européens de robots de service indoor pourraient intégrer l'approche PLC pour améliorer la navigation sociale à longue distance dans les couloirs résidentiels.

RecherchePaper
1 source
OSMa-Bench++ : vers une évaluation ouverte de la cartographie sémantique pour la manipulation via des scènes synthétiques générées par prompt
1363arXiv cs.RO 

OSMa-Bench++ : vers une évaluation ouverte de la cartographie sémantique pour la manipulation via des scènes synthétiques générées par prompt

Des chercheurs du laboratoire be2rlab publient OSMa-Bench++, une extension du framework d'évaluation OSMa-Bench, déposée sur arXiv en mai 2026. L'objectif est de pallier une limite structurelle des benchmarks actuels pour la cartographie sémantique appliquée à la manipulation robotique : leur dépendance à des jeux de données fixes, insuffisamment couverts en cas limites pertinents pour la manipulation. Le nouveau pipeline génère automatiquement des descriptions de scènes d'intérieur à partir de prompts textuels, synthétise les environnements correspondants via SceneSmith, puis les adapte dans un format de simulation compatible avec OSMa-Bench. Cette adaptation requiert une couche intermédiaire non triviale incluant la normalisation sémantique, la réparation de matériaux et textures, des politiques de fallback pour les shaders, la gestion des sols, la configuration de la navigation et un contrôle de l'éclairage. Le composant VQA (Visual Question Answering) est étendu avec une catégorie de questions ancrée sur le prompt d'origine, exploitant le fait que la spécification de la scène est connue à l'avance pour servir de référence sémantique vérifiable. Le code est disponible publiquement sur github.com/be2rlab/OSMa-Bench-v2. L'apport principal est de rendre le benchmarking de la cartographie sémantique extensible et contrôlable, deux propriétés absentes des benchmarks à scènes figées comme ScanNet ou Replica. Pour un intégrateur ou un équipe R&D travaillant sur des bras manipulateurs avec perception 3D, cela signifie pouvoir évaluer un modèle sur des conditions ciblées : objets de petite taille, occlusions partielles, encombrement variable, ou éclairage dégradé, sans avoir à constituer manuellement de nouveaux datasets. Le mécanisme de question-réponse ancré sur le prompt original permet une vérification objective contre une vérité terrain sémantique définie à la génération, ce qui réduit l'ambiguïté d'évaluation typique des VQA sur scènes non contraintes. OSMa-Bench, le framework d'origine, était déjà positionné sur l'évaluation de méthodes de cartographie sémantique pour la manipulation, un segment moins couvert que la navigation pure. SceneSmith, utilisé ici comme générateur de scènes, est un outil de synthèse procédurale d'environnements intérieurs. Dans le paysage des benchmarks pour la perception robotique, les approches à génération procédurale restent minoritaires face aux scènes scannées (HM3D, Matterport3D), mais gagnent du terrain pour leur capacité à couvrir des distributions hors-domaine. be2rlab n'annonce pas de déploiement industriel ni de partenariat : il s'agit d'une contribution de recherche académique, sous forme de pre-print non encore évalué par les pairs, avec mise à disposition du code comme principal livrable.

RecherchePaper
1 source
Apprentissage de l'équilibre entre sécurité thermique des moteurs et performance locomotrice quadrupède par politique résiduelle
1364arXiv cs.RO 

Apprentissage de l'équilibre entre sécurité thermique des moteurs et performance locomotrice quadrupède par politique résiduelle

Des chercheurs ont publié sur arXiv (référence 2605.27046) une méthode par apprentissage par renforcement pour intégrer la gestion thermique des moteurs dans la politique de locomotion d'un robot quadrupède. Le cadre d'entraînement proposé est structuré en deux étapes : une politique nominale est d'abord entraînée comme baseline capable de traverser des terrains variés, puis une politique résiduelle vient se superposer pour fournir des corrections d'actions en fonction de l'état thermique instantané de chaque actionneur. Le système repose sur un modèle thermique global (whole-body thermal model) intégré directement dans la boucle RL, qui met à jour les températures moteurs à chaque cycle. Les expériences physiques sur un Unitree A1 avec une charge utile de 3 kg montrent que le robot maintient une locomotion stable sur plusieurs types de terrain pendant plus de 13 minutes, contre environ 5 minutes avant surchauffe avec la politique nominale seule, soit un gain d'un facteur 2,6 sur la durée d'opération continue. La surchauffe des actionneurs est un facteur limitant concret pour les robots à pattes en déploiement prolongé, particulièrement sous charge utile, scénario typique en inspection industrielle, logistique ou search-and-rescue. La quasi-totalité des travaux académiques en RL pour la locomotion quadrupède optimisent vitesse, robustesse au terrain et stabilité, traitant les moteurs comme des systèmes sans contraintes thermiques. Ce papier démontre qu'une politique résiduelle thermiquement informée peut être ajoutée au-dessus d'une politique existante sans dégrader ses performances nominales à basse température : l'architecture ne remplace pas le comportement appris, elle lui superpose des corrections minimales, ce qui simplifie l'intégration et ouvre la voie à une modularité thermique applicable à d'autres plateformes. Le Unitree A1 est un quadrupède compact de recherche très répandu dans la communauté RL (actionneurs brushless, environ 12 kg, 12 DOF au total). Sur les plateformes commerciales comme Spot (Boston Dynamics) ou ANYmal (ANYbotics), la gestion thermique est généralement traitée au niveau firmware ou matériel, ce qui masque le problème aux chercheurs mais ne le résout pas pour les intégrateurs déployant des appareils sur des missions longues. Ce preprint n'a pas encore été évalué par les pairs. Les prolongements logiques incluent une validation sur des plateformes plus lourdes (Unitree B2, Go2) sous charges supérieures, ainsi que des politiques thermiques adaptatives pour des environnements à forte dissipation comme les pentes soutenues ou les obstacles répétitifs.

RecherchePaper
1 source
Modernisation de la navigation par apprentissage par renforcement pour la génération de graphes de scènes sémantiques par IA incarnée
1365arXiv cs.RO 

Modernisation de la navigation par apprentissage par renforcement pour la génération de graphes de scènes sémantiques par IA incarnée

Une équipe de recherche a publié sur arXiv (2603.25415v2) un composant de navigation modulaire destiné à la génération de graphes de scène sémantiques (SSG) par des agents embarqués. L'objectif central est de maximiser la qualité du modèle de monde construit par le robot dans un budget d'actions limité, en arbitrant entre gain d'information et coût de navigation. Les chercheurs remplacent l'algorithme d'optimisation de politique existant et revisitent la formulation de l'espace d'actions discret. Résultat clé : le simple remplacement de l'optimiseur améliore la complétude du SSG de 21 % en relatif par rapport à la baseline, à récompense identique. L'ajout d'une supervision par profondeur améliore principalement la sécurité d'exécution (réduction des collisions) sans modifier sensiblement la complétude. La combinaison d'un optimiseur moderne avec une représentation d'actions plus granulaire et factorisée en politique multi-têtes donne le meilleur compromis complétude-efficacité global. Ce résultat soulève une question pratique pour les équipes de robotique embarquée : combien de pipelines RL de navigation sont sous-performants non pas à cause de leur architecture, mais à cause d'algorithmes d'entraînement obsolètes ? Un gain de 21 % par simple swap d'optimiseur suggère que la dette technique dans les baselines de comparaison est substantielle. Par ailleurs, la politique multi-têtes factorisée réduit l'explosion combinatoire de l'espace d'actions, un problème classique dès que l'on augmente la granularité des mouvements. Sur le plan applicatif, les SSG sont une brique utile pour les robots autonomes opérant dans des environnements industriels non structurés : ils fournissent une représentation compacte des objets, relations et contexte spatial, au-delà des cartes purement géométriques. Ce travail s'inscrit dans le courant de l'Organic Computing, un paradigme de systèmes auto-adaptatifs sous contraintes de ressources et d'incertitude, qui reste davantage présent dans la recherche académique européenne que dans les déploiements industriels. La version v2 du preprint indique un raffinement itératif, signe d'une validation en cours. Le positionnement concurrentiel de cette approche structurée par graphes est à surveiller face aux modèles fondationnels vision-langage (VLA) qui absorbent de plus en plus les tâches de compréhension de scène. Les prochaines étapes probables incluent le transfert sim-to-real sur plateforme physique et l'évaluation à plus grande échelle environnementale.

UELe paradigme Organic Computing sous-jacent est davantage ancré dans la recherche académique européenne, ce qui pourrait faciliter le transfert de ces techniques de navigation vers des projets de robotique autonome industrielle en UE.

RecherchePaper
1 source
Planification par scénarios conjecturaux sensibles au risque pour la navigation robotique dynamique et sûre
1366arXiv cs.RO 

Planification par scénarios conjecturaux sensibles au risque pour la navigation robotique dynamique et sûre

Des chercheurs ont publié sur arXiv (preprint 2605.26348, mai 2026) une nouvelle couche de planification baptisée RCSP (Risk-Sensitive Conjectural Scenario Planning), conçue pour les robots mobiles évoluant dans des environnements à obstacles dynamiques. L'algorithme s'attaque à un problème précis, peu formalisé jusqu'ici : un robot peut se trouver dans une trajectoire localement sûre tout en s'engageant irrévocablement vers une configuration où des obstacles mobiles fermeront le passage avant qu'il ne puisse réagir. RCSP maintient une distribution probabiliste sur des conjectures de mouvements locaux, échantillonne des futurs d'interaction à horizon court, pénalise les queues de distribution à risque élevé, puis délègue l'exécution à une couche de sécurité locale. Les tests ont été conduits dans trois environnements : des goulots d'étranglement simulés sous MuJoCo, un empilement ROS2/Gazebo avec la pile Nav2 standard, et le benchmark DynaBARN sur la plateforme Jackal. Dans MuJoCo, RCSP atteint l'objectif sans collision et améliore les métriques de sécurité secondaire et de qualité de trajectoire par rapport à un prédicteur non adaptatif, mais au prix d'une latence accrue. Dans le setup Nav2, la couche RCSP réduit les quasi-collisions dynamiques. Sur le benchmark officiel DynaBARN, en revanche, les planificateurs classiques optimisés DWA (Dynamic Window Approach) et TEB (Timed Elastic Band) conservent un avantage net en taux de succès strict. Ce travail aborde un angle mort réel de la navigation en environnement industriel dynamique : la plupart des architectures de planification réactives raisonnent sur la sécurité instantanée, sans modéliser l'engagement dans le futur. Pour les intégrateurs d'AMR en entrepôt ou en usine, où des opérateurs humains ou d'autres robots traversent des couloirs étroits, ce "problème de quasi-collision prédicative" se traduit par des arrêts d'urgence non planifiés ou des collisions lentes. L'architecture modulaire de RCSP, greffable sur une pile Nav2 existante sans remplacer le planificateur de base, réduit le coût d'intégration. Les résultats mitigés sur DynaBARN sont significatifs : ils indiquent que l'approche probabiliste apporte une valeur dans des régimes de goulot d'étranglement dynamique spécifiques, mais ne surpasse pas encore des planificateurs classiques bien calibrés sur des benchmarks génériques, ce qui délimite honnêtement le domaine d'application. La navigation dynamique pour robots mobiles est un espace de recherche dense, où s'affrontent des méthodes classiques comme DWA et TEB, des approches par apprentissage par renforcement, et des planificateurs à base de champs de potentiel. RCSP se positionne explicitement comme un module complémentaire plutôt qu'un remplacement, ce qui facilite son adoption potentielle dans l'écosystème ROS2/Nav2 utilisé par la majorité des intégrateurs. Les résultats restent à ce stade entièrement simulés, sans validation sur hardware réel ni déploiement en production annoncé. Les prochaines étapes naturelles incluent des tests sur plateforme physique dans des environnements non contrôlés et une évaluation des performances en latence sur hardware embarqué contraint.

UELes intégrateurs européens d'AMR utilisant la pile Nav2/ROS2 pourraient à terme bénéficier de ce module pour réduire les quasi-collisions en environnements dynamiques, mais aucun acteur FR/EU n'est impliqué et les résultats restent entièrement simulés.

RecherchePaper
1 source
Sur les capacités de généralisation, les choix de conception et les limites de l'apprentissage par imitation de points clés
1367arXiv cs.RO 

Sur les capacités de généralisation, les choix de conception et les limites de l'apprentissage par imitation de points clés

Une équipe de chercheurs publie en mai 2026 sur arXiv (arXiv:2605.26649) une évaluation systématique du Keypoint Imitation Learning (KIL), méthode d'apprentissage par imitation pour la manipulation robotique. Le principe : plutôt que d'alimenter directement un modèle avec des images RGB brutes, on extrait d'abord des points-clés visuels via des modèles fondationnels (de type DINOv2 ou SAM), utilisés comme représentation intermédiaire compacte. Sur plus de 2 000 exécutions réelles couvrant cinq tâches de manipulation distinctes, le KIL atteint un taux de succès global de 75 %, contre 47 % pour la baseline RGB pure, et légèrement au-dessus de S2-diffusion (73 %), méthode concurrente fondée sur la diffusion. L'étude teste également la généralisation à des objets et configurations de scène inédits, et étend la méthode aux tâches impliquant plusieurs instances d'un même objet. Ce résultat consolide le KIL comme approche data-efficiente : moins de démonstrations humaines sont nécessaires pour atteindre une performance correcte, ce qui est un levier critique pour tout intégrateur cherchant à réduire le coût d'annotation en manipulation industrielle. Cependant, les auteurs tempèrent eux-mêmes l'enthousiasme : le KIL ne surpasse pas systématiquement les représentations alternatives sur l'ensemble des métriques, et hérite des limitations des modèles fondationnels utilisés pour l'extraction des points-clés, notamment la sensibilité aux occultations et aux ambiguïtés multi-instances. Les 75 % annoncés couvrent cinq tâches sans détail des conditions exactes de chaque scénario, et les vidéos disponibles sur le site compagnon restent des démonstrations sélectionnées, pas une validation en production. L'apprentissage par imitation à base de RGB souffre depuis plusieurs années d'une faible généralisation hors distribution, ce qui a stimulé des travaux sur les représentations intermédiaires : keypoints, poses 6D, champs de distance implicites. Côté positionnement concurrentiel, les approches par diffusion (Diffusion Policy, S2-diffusion) et les VLA (Vision-Language-Action, dont OpenVLA ou pi-0 de Physical Intelligence) dominent actuellement la recherche en manipulation dextère. Le KIL se positionne comme alternative plus légère et plus interprétable, sans prétendre détrôner ces approches sur les tâches complexes. Les auteurs indiquent comme suites l'extension à des scènes plus encombrées et la robustification de l'extraction de keypoints face aux imperfections des modèles fondationnels.

RecherchePaper
1 source
Filtres de Koopman robustes pour un apprentissage par renforcement acteur-critique sûr
1368arXiv cs.RO 

Filtres de Koopman robustes pour un apprentissage par renforcement acteur-critique sûr

Une équipe a déposé sur arXiv (2605.26452) Robust Koopman-CBF SAC, un framework de RL sûr pour la robotique qui s'affranchit du modèle dynamique pré-établi. La méthode apprend un prédicteur de Koopman à dimension finie depuis des trajectoires d'expérience, construit des Control Barrier Functions (CBF) dans l'espace "levé" où la dynamique non linéaire devient affine, puis les applique via une couche de programme quadratique (QP) qui corrige minimalement les actions de la politique Soft Actor-Critic (SAC). Une marge résiduelle projetée, estimée sur des rollouts de validation distincts de l'entraînement, compense les erreurs d'approximation inhérentes au modèle Koopman fini. Sur le benchmark CartPole (stabilisation et suivi de trajectoire), le système atteint zéro violation de contrainte tout en égalant ou dépassant les performances d'un SAC non contraint. Sur les tâches de locomotion haute dimension de Safety Gymnasium, les violations diminuent dans certains scénarios, mais les barrières de vitesse du premier ordre et les modèles EDMD linéaires révèlent des limites structurelles non résolues. L'enjeu est concret pour les intégrateurs: déployer des robots autonomes en environnement industriel exige que les contraintes dures (zones interdites, limites articulaires, forces maximales) ne soient jamais violées, y compris pendant la phase d'entraînement et pas seulement en déploiement. Les approches existantes imposent soit un modèle dynamique précis, difficile à obtenir pour des robots complexes, soit des certificats de sécurité conçus à la main par des experts contrôle. Ici, la dynamique est inférée depuis les données, et la linéarité de l'espace Koopman rend les CBF algébriquement tractables sans expertise manuelle. Le zéro violation sur CartPole est reproductible (code disponible sur GitHub), pas une démonstration sélectionnée. Les limitations exposées sur Safety Gymnasium délimitent honnêtement le périmètre de validité: systèmes à dynamique quasi-linéaire et contraintes de vitesse simples, ce qui est plus informatif que beaucoup de publications dans ce domaine. L'opérateur de Koopman a été réintroduit en robotique et en contrôle vers 2017-2020 notamment via les travaux de Brunton, Kaiser et Kutz sur l'EDMD (Extended Dynamic Mode Decomposition). Les CBF ont été formalisées par Aaron Ames et ses collaborateurs à Caltech puis au Georgia Tech, avec une influence croissante dans le contrôle certifié depuis 2017. Dans le RL sûr, les méthodes de référence comme CPO (Constrained Policy Optimization) et TRPO-Lagrangien peinent à garantir des contraintes dures pendant l'entraînement. Ce travail se positionne explicitement comme pont entre ces deux communautés. Les extensions annoncées incluent des CBF d'ordre supérieur pour mieux traiter les contraintes de vitesse, et des modèles Koopman non linéaires ou multi-pas pour les locomotions haute dimension.

RecherchePaper
1 source
L-Learning : une approche basée sur Lyapunov exploitant la mécanique lagrangienne pour un suivi robotique efficace et stable
1369arXiv cs.RO 

L-Learning : une approche basée sur Lyapunov exploitant la mécanique lagrangienne pour un suivi robotique efficace et stable

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.26648) un framework de contrôle baptisé L-Learning, conçu pour améliorer le suivi de trajectoire des robots dans des environnements dynamiques et incertains. L'approche combine deux cadres mathématiques éprouvés : la théorie de stabilité de Lyapunov, qui garantit la convergence d'un système vers un état stable, et la mécanique lagrangienne, qui modélise le comportement physique d'un système à partir de ses fonctions d'énergie. Concrètement, L-Learning apprend cette fonction d'énergie directement depuis les données collectées, puis s'en sert pour calculer des commandes qui assurent à la fois précision de suivi et stabilité en boucle fermée. Les auteurs mettent en avant trois propriétés clés : précision de contrôle supérieure, garanties théoriques de stabilité, et haute efficacité en termes de complexité d'échantillonnage. L'enjeu industriel est réel. Le contrôle robotique moderne est pris en étau entre deux familles de méthodes : les approches classiques (PID, MPC) offrent des garanties formelles de stabilité mais se dégradent dès que le modèle du système est imprécis ou que l'environnement évolue ; à l'inverse, les méthodes data-driven (apprentissage par renforcement, politiques neuronales) s'adaptent mieux mais nécessitent de grands volumes de données d'entraînement et ne proposent aucune garantie formelle, ce qui complique leur certification pour un déploiement industriel. L-Learning prétend combler ce fossé, et si ses performances se confirment expérimentalement, cela pourrait réduire la barrière à la mise en production de contrôleurs appris sur des robots manipulateurs ou mobiles, y compris dans des contextes soumis à certification. Le framework s'inscrit dans un courant de recherche actif autour des fonctions de Lyapunov neuronales, avec des travaux concurrents menés notamment chez DeepMind, MIT CSAIL et Caltech sur l'apprentissage de certificats de stabilité. À noter que cette publication est un preprint arXiv sans revue par les pairs finalisée : l'abstract ne fournit aucun benchmark chiffré sur des plateformes réelles (bras, humanoïdes, AMR), ni de comparaison directe avec des baselines standards comme CLF-QP ou des politiques RL classiques. La valeur concrète de L-Learning restera à confirmer lors d'expériences sur matériel physique, ce qui constitue le prochain test décisif pour cette approche.

RecherchePaper
1 source
Planification de mouvements sûre sous perturbations inconnues, avec garanties formelles
1370arXiv cs.RO 

Planification de mouvements sûre sous perturbations inconnues, avec garanties formelles

Des chercheurs ont publié sur arXiv (arXiv:2605.26625) un algorithme de planification de mouvement par échantillonnage qui garantit formellement la sûreté de systèmes robotiques soumis à des perturbations aléatoires dont la distribution est inconnue. L'approche s'applique aux robots à dynamique linéaire ou linéarisable évoluant dans des environnements encombrés avec des obstacles de forme arbitraire, sous contraintes d'état et de commande. La sûreté est formulée comme des chance-constraints (contraintes probabilistes), et l'algorithme apprend depuis des trajectoires observées un "tube d'ambiguïté de Wasserstein", une séquence d'ensembles d'ambiguïté qui contient, avec haute confiance, la distribution d'état réelle du système. Ce tube est ensuite intégré dans un arbre de planification probabilistiquement complet. Les auteurs introduisent également un vérificateur de validité basé sur les bandits multi-bras qui accélère significativement les performances empiriques sans compromettre la complétude. Les cas d'étude montrent que l'algorithme trouve des trajectoires valides dans des environnements denses sous des seuils de sécurité stricts, surpassant les méthodes de référence actuelles. L'enjeu pratique est considérable pour les intégrateurs de robots industriels et les équipes d'autonomie : la plupart des planificateurs de mouvement existants supposent soit une distribution de bruit connue (hypothèse souvent irréaliste), soit ignorent les perturbations stochastiques au profit de marges de sécurité conservatives et figées. Cette méthode data-driven contourne les deux écueils en apprenant directement l'incertitude depuis des données de trajectoires, sans hypothèse paramétrique forte. La réduction du conservatisme via des tubes d'ambiguïté de faible dimension, plusieurs tubes en basse dimension plutôt qu'un seul en haute dimension, améliore la scalabilité, un obstacle classique des approches distributionally robust appliquées à la robotique. C'est un pas concret vers des robots opérant en production dans des environnements non contrôlés, sans recalibration systématique du modèle de bruit. La planification de mouvement sûre sous incertitude est un champ actif depuis deux décennies, structuré autour de méthodes comme RRT/RRT*, les MPC robustes et les approches de tube invariant. L'utilisation de la distance de Wasserstein pour construire des ensembles d'ambiguïté s'inscrit dans le courant des méthodes distributionally robust optimization (DRO), popularisées en contrôle ces cinq dernières années notamment par les groupes de ETH Zurich, Caltech et MIT. Ce preprint n'est pas encore évalué par les pairs. Les prochaines étapes attendues incluent une validation sur hardware réel (les cas d'étude présentés restent en simulation) et une extension aux dynamiques non linéaires, deux conditions nécessaires avant toute intégration dans des pipelines d'autonomie industrielle.

RecherchePaper
1 source
Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles
1371arXiv cs.RO 

Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles

Des chercheurs ont publié sur arXiv (référence 2605.26430) R2P2 (Roles with Rules and Proportional-control Primitive), une architecture décentralisée pour le transport collaboratif de caisses rectangulaires par plusieurs robots agissant par poussée, sans préhension. Le système assigne dynamiquement trois rôles distincts à chaque robot - pousser, soutenir ou bloquer - selon le mode de manipulation requis : rotation ou translation de la caisse. R2P2 a été évalué en simulation sur NVIDIA IsaacSim avec une équipe de six robots, testée sur des surfaces planes, en montée et en descente avec des variations de friction et de masse de caisse. La validation physique implique quatre TurtleBots déplaçant une caisse de 1,2 kg. Les auteurs revendiquent un meilleur taux de succès que l'approche de référence par leader-suiveur virtuel, sans préciser de métriques chiffrées au-delà des graphes de comparaison. L'élément différenciant clé est l'architecture décentralisée : chaque robot prend ses décisions localement en observant uniquement sa propre position et celle de la caisse, sans communication inter-robots, consensus ou coordinateur central. Cela élimine le point de défaillance unique et réduit les contraintes de synchronisation critiques pour un déploiement en entrepôt ou en zone sinistrée. La gestion simultanée d'inclinaison et de friction variables représente un défi rarement traité dans la littérature, où la plupart des démonstrateurs fonctionnent sur sol plat homogène. La validation sim-to-real, même à petite échelle, confirme que le contrôle proportionnel basé sur les rôles reste transposable au matériel réel - un résultat non trivial pour une méthode sans apprentissage. Le transport collaboratif par poussée est un problème ouvert en robotique multi-agents depuis les années 1990, qui regagne de l'intérêt avec la montée en puissance des flottes AMR dans la logistique et la construction. Les approches concurrentes incluent les méthodes par leader-suiveur centralisé, les algorithmes de consensus distribué et, plus récemment, le renforcement multi-agent. R2P2 se positionne comme une solution légère, interprétable et sans phase d'entraînement, un avantage pour les intégrateurs qui privilégient la prédictibilité et la facilité de certification. NVIDIA IsaacSim, utilisé ici pour les tests en simulation, est devenu la plateforme de référence pour la validation robotique, notamment adoptée par Figure, Boston Dynamics et 1X. Les auteurs ne mentionnent pas de déploiement industriel ni de partenariats : il s'agit d'une contribution académique, avec comme suites logiques des tests sur des charges plus lourdes, des géométries irrégulières et des équipes plus importantes.

RecherchePaper
1 source
Navigation et exploration collaboratives avec des processus gaussiens épars bêta
1372arXiv cs.RO 

Navigation et exploration collaboratives avec des processus gaussiens épars bêta

Une équipe de chercheurs a publié sur arXiv (référence 2605.26304) un cadre algorithmique pour la navigation collaborative de robots hétérogènes dans des environnements inconnus. Le scénario étudié met en jeu deux plateformes : un robot principal chargé d'atteindre une cible, secondé par un robot capteur mobile (un drone dans les exemples) qui observe l'environnement local et transmet des informations sous contraintes de bande passante. Le système proposé, baptisé β-Sparse Gaussian Processes (βSGP), permet au drone de sélectionner simultanément quels points de sa carte transmettre et quelle trajectoire d'exploration adopter. Les simulations conduites sur des cartes Mars et terrestres affichent une réduction de 18 % du coût de chemin par rapport à une navigation sans communication, et une diminution de 76 % des données transmises face aux approches par transmission brute. L'intérêt principal du travail réside dans la co-optimisation de la communication et de l'action. Dans la majorité des systèmes multi-robots existants, la sélection des données à transmettre et la planification de trajectoire sont traitées séparément ; ici, elles sont couplées dans un cadre variationnel unique, ce qui permet au drone d'anticiper les zones non encore explorées et de prioriser l'information utile à la navigation du robot principal. Pour un intégrateur ou un opérateur industriel, cela se traduit par une architecture réaliste sous contrainte radio, applicable à l'inspection de sites isolés, à la cartographie d'urgence ou à l'exploration planétaire où les liaisons haut-débit sont exclues. Les Gaussian Processes sont une approche probabiliste classique pour la modélisation spatiale, mais leur passage à l'échelle se heurte à une complexité cubique. Les variantes sparse (à points inducteurs) sont connues depuis les travaux de Snelson et Ghahramani (2006), mais la sélection de ces points reste généralement agnostique à la tâche aval. Le βSGP adresse précisément ce verrou. Il convient de noter que les résultats présentés sont exclusivement en simulation ; aucun déploiement réel n'est rapporté, et l'écart sim-to-real reste à évaluer. Les prochaines étapes naturelles impliqueraient une validation sur plateforme physique et une comparaison avec des approches par apprentissage (GNN, transformers de cartes).

RecherchePaper
1 source
Apprentissage de règles symboliques compositionnelles à partir de démonstrations par programmation logique inductive
1373arXiv cs.RO 

Apprentissage de règles symboliques compositionnelles à partir de démonstrations par programmation logique inductive

Des chercheurs ont déposé sur arXiv (réf. 2605.26828) une méthode combinant apprentissage par démonstration (LfD) et programmation logique inductive (ILP) pour extraire des règles symboliques à partir d'exemples fournis par un opérateur humain. Plutôt que de reproduire les gestes observés, le système décompose une tâche complexe en une hiérarchie d'objectifs d'apprentissage à plusieurs niveaux d'abstraction ontologique : les règles inférées au bas de la hiérarchie sont réutilisées comme briques pour construire des structures de tâches plus élaborées, selon un principe de raisonnement compositionnel. Les expériences ont été conduites dans un scénario synthétique d'assemblage de blocs, et montrent une généralisation aux configurations inédites, y compris avec des objets absents de la phase d'entraînement. À mesure que les robots industriels gagnent en autonomie, la lisibilité et la réutilisabilité de leurs représentations internes de tâches deviennent des enjeux critiques pour les intégrateurs et les équipes de validation. L'ILP produit des règles symboliques explicites et modifiables par un ingénieur, à l'opposé des approches neuronales d'imitation telles que le behavior cloning ou les VLA (vision-language-action models), dont les décisions restent opaques et difficiles à auditer. La capacité du système à généraliser à des tâches plus difficiles avec des objets jamais vus est un résultat encourageant, que les auteurs qualifient eux-mêmes de "preuve préliminaire" : l'évaluation se limite à un environnement entièrement simulé, sans validation sur robot physique ni mesure du sim-to-real gap. L'apprentissage par démonstration est un paradigme fondateur de la robotique programmable, mais les méthodes récentes basées sur le deep learning sacrifient souvent l'interprétabilité à la performance brute. L'ILP, issu de l'IA symbolique des années 1990, connaît un regain d'intérêt dans le mouvement plus large du raisonnement neurosymbolique, qui cherche à allier la flexibilité du machine learning et la rigueur du raisonnement logique. Ce travail s'inscrit dans ce courant sans prétendre à un déploiement industriel immédiat : les étapes suivantes attendues sont la validation sur hardware réel et des scénarios de manipulation plus diversifiés, seuls capables de mesurer la robustesse effective de l'approche hors simulation.

RecherchePaper
1 source
Fermer la boucle en téléopération : évaluation et retour qualité par épisode pour des démonstrations fiables
1374arXiv cs.RO 

Fermer la boucle en téléopération : évaluation et retour qualité par épisode pour des démonstrations fiables

Des chercheurs ont publié sur arXiv (2605.26349) un framework baptisé DQAF (Data Quality Assessment and Feedback) destiné à améliorer la qualité des données de téleopération pour l'entraînement de robots. Le système évalue automatiquement chaque épisode de démonstration en extrayant des signaux quantifiables : progression des sous-tâches, fluidité du mouvement, temps d'arrêt (stalls), et proximité des limites articulaires (kinematic limits). Ces métriques sont ensuite converties en une évaluation structurée accompagnée de retours en langage naturel, transmis à l'opérateur immédiatement après chaque tentative. Une étude de validation a comparé les rejets produits par le système avec ceux d'un réviseur humain lors du curation de dataset. Une étude pilote a impliqué trois opérateurs novices sur deux tâches de manipulation, et les résultats montrent que l'opérateur ayant reçu les retours automatisés a progressé plus rapidement, produisant des démonstrations de meilleure qualité en moins d'itérations que les deux autres. L'enjeu dépasse la simple UX de collecte de données. La transition vers la Physical AI, c'est-à-dire des systèmes robotiques adaptatifs entraînés sur de grandes quantités de démonstrations réelles, crée une demande massive en données de téleopération de haute qualité. Le problème identifié est structurel : un épisode peut être "task-successful" (la tâche est accomplie) mais inutilisable pour entraîner un modèle si les trajectoires sont hésitantes, redondantes, ou proches des butées mécaniques. Le DQAF introduit une distinction importante entre succès binaire et qualité exploitable, ce qui change le paradigme de collecte. Pour des intégrateurs ou des équipes MLops qui construisent des datasets de manipulation à grande échelle, un tel filtre automatisé en boucle fermée peut réduire significativement le coût humain de curation post-hoc, tout en accélérant la montée en compétence des opérateurs. Ce travail s'inscrit dans un contexte d'industrialisation accélérée de la collecte de données pour les VLA (Vision-Language-Action models) et les politiques d'imitation. Des acteurs comme Physical Intelligence (pi0), Figure AI, ou les équipes robotique de Google DeepMind ont tous mis en avant le volume et la qualité des démonstrations humaines comme variable critique de performance. Des frameworks concurrents comme ALOHA ou RoboVQA abordent la qualité du côté des architectures ou des interfaces, mais peu ferment la boucle au niveau de l'opérateur en temps quasi-réel. L'étude pilote reste modeste (3 opérateurs, 2 tâches), et les auteurs ne publient pas encore de dataset ni de code ouvert. Les prochaines étapes naturelles seraient une validation à plus grande échelle et une intégration dans des pipelines de collecte industriels, où la réduction du taux de rejet des épisodes a un impact direct sur le coût de production des datasets.

RechercheOpinion
1 source
AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux
1375arXiv cs.RO 

AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux

Des chercheurs du laboratoire be2rlab publient sur arXiv (arXiv:2605.25901) AgentGrounder, un système de localisation visuelle 3D zéro-shot opérant directement sur des nuages de points colorés, sans entraînement spécifique à la tâche. L'architecture repose sur deux étapes : une phase hors ligne construit une table de correspondance d'objets (Object Lookup Table, OLT) regroupant identifiants d'instances, labels sémantiques et boîtes englobantes 3D ; une phase en ligne déploie un agent qui décompose chaque requête en langage naturel, récupère les candidats pertinents dans l'OLT, effectue un scoring géométrique, puis déclenche un rendu d'image à la demande lorsque des indices visuels supplémentaires (couleur, texture, angle de vue) sont nécessaires. Évalué sur les benchmarks ScanRefer et Nr3D en configuration zéro-shot, AgentGrounder surpasse SeeGround de +2,5 % en précision Acc@0.5 sur ScanRefer et de +6,3 % sur Nr3D, dont un gain de +6,3 % sur les requêtes indépendantes du point de vue. Le code est publié sur GitHub. Ce résultat est directement pertinent pour les équipes travaillant sur la manipulation robotique et la navigation en environnements intérieurs non structurés. L'absence d'entraînement dédié abaisse la barrière d'intégration : un robot équipé d'un LiDAR ou d'une caméra de profondeur pourrait répondre à des commandes en langage naturel sans fine-tuning sur l'environnement cible, ce qui simplifie les déploiements dans des entrepôts ou des espaces de service variables. Le mécanisme de récupération sélective dans l'OLT réduit les erreurs en cascade typiques des pipelines d'ancrage-cible fixes, qui saturent la fenêtre de contexte des modèles de langage avec des objets non pertinents. L'inspection visuelle adaptative évite par ailleurs de solliciter inutilement les capacités multimodales coûteuses lorsque la géométrie seule suffit à discriminer. La localisation visuelle 3D est un domaine de recherche structuré autour de benchmarks comme ScanRefer (2020) et Nr3D, qui évaluent la capacité à identifier un objet précis dans une scène intérieure 3D à partir d'une description textuelle ambiguë. Les méthodes zéro-shot antérieures supposaient souvent des ensembles d'images multi-vues préexistants et peinaient face aux limites sémantiques des outils de segmentation 3D standards, SeeGround représentant jusqu'ici l'état de l'art sur ces benchmarks. Côté industrie, NVIDIA intègre des capacités de grounding 3D dans son framework GR00T pour la manipulation robotique, tandis qu'Enchanted Tools en France et les équipes embodied AI de Meta FAIR travaillent sur des modules similaires de compréhension spatiale ouverte. AgentGrounder, encore au stade de preprint non évalué par les pairs, devra confirmer ses performances hors contexte académique avant toute adoption en conditions réelles.

UEEnchanted Tools (France), explicitement citée comme travaillant sur des modules similaires de compréhension spatiale ouverte, peut utiliser AgentGrounder comme référence zéro-shot pour réduire les coûts de fine-tuning dans ses déploiements robotiques.

RechercheOpinion
1 source
RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés
1376arXiv cs.RO 

RoboManipBaselines : un cadre unifié d'apprentissage par imitation pour la manipulation robotique en environnements réels et simulés

Des chercheurs de l'ISRI-AIST, le laboratoire national de recherche industrielle japonais, ont publié RoboManipBaselines, un framework open-source unifié pour l'apprentissage par imitation appliqué à la manipulation robotique. Disponible sur GitHub et accompagné d'une page projet dédiée, ce cadre couvre l'intégralité du pipeline d'imitation learning : collecte de données, entraînement de politiques et exécution en rollout, aussi bien en simulation que sur robots réels. Concrètement, il supporte plusieurs simulateurs et environnements physiques via une interface unifiée, intègre des capteurs multimodaux (dont tactiles et capteurs 3D), et propose une bibliothèque de modèles de politiques variés. Les évaluations publiées s'appuient sur des datasets publics, ce qui est explicitement conçu pour garantir la reproductibilité des résultats. Plusieurs applications de recherche sont démontrées : augmentation de données, intégration de modèles tactiles, systèmes robotiques interactifs, évaluation de la perception 3D, et extensions matérielles. Ce framework répond à un problème structurel de la recherche en manipulation robotique : l'absence de benchmarks standardisés reproductibles, qui rend la comparaison entre approches quasi impossible et ralentit les transferts vers l'industrie. En proposant un pipeline cohérent du sim au réel, RoboManipBaselines facilite l'évaluation du sim-to-real gap, l'un des verrous critiques avant tout déploiement industriel. Pour un intégrateur ou un ingénieur robotique, l'extensibilité annoncée (ajout de nouveaux robots, tâches et politiques) réduit le coût d'entrée pour tester des architectures de type VLA (Vision-Language-Action) sur des configurations matérielles propres. C'est aussi un outil de validation expérimentale qui peut accélérer la qualification de politiques avant passage en production. L'imitation learning pour la manipulation connaît une effervescence depuis 2023-2024, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA, ou encore les travaux de Stanford et Berkeley. Dans cet écosystème, plusieurs frameworks concurrents existent déjà, notamment LeRobot de HuggingFace, RoboSuite (Stanford), ou MimicGen. RoboManipBaselines se distingue par son accent explicite sur la reproductibilité via datasets publics et son ancrage dans un laboratoire national disposant de plateformes matérielles réelles. L'AIST, acteur historique de la robotique japonaise (humanoïde HRP inclus), apporte une crédibilité expérimentale que les frameworks purement académiques n'ont pas toujours. La prochaine étape naturelle serait une adoption par des équipes industrielles pour valider des politiques sur des tâches d'assemblage ou de picking en conditions non contrôlées.

RecherchePaper
1 source
Étude de l'effet d'un retrofit à actionnement élastique en série sur des actionneurs boîte noire
1377arXiv cs.RO 

Étude de l'effet d'un retrofit à actionnement élastique en série sur des actionneurs boîte noire

Des chercheurs ont publié sur arXiv (référence 2605.24127, mai 2026) les résultats d'une étude portant sur le retrofit d'un élément élastique en série (SEA, Series Elastic Actuation) sur un actionneur dit "boîte noire", c'est-à-dire un actionneur commercial dont les paramètres internes sont inaccessibles. L'élément élastique torsionnel a été dimensionné par analyse en éléments finis (FE analysis), aboutissant à une raideur de 2 155,4 Nm/rad. Le résultat principal est une amélioration de la bande passante en contrôle d'effort en boucle ouverte, passant de 10,32 Hz pour le moteur seul à 30,32 Hz avec le module SEA intégré, soit un gain de 2,93x. En boucle fermée, le module surpasse un capteur d'effort commercial de 7,63%, pour un coût matière de seulement 25 GBP. Ce résultat a une portée directe pour les intégrateurs robotiques confrontés à des actionneurs industriels standard dont ils ne maîtrisent pas la couche logicielle basse. Les actionneurs rigides à faible jeu mécanique sont omniprésents en robotique industrielle précisément parce qu'ils garantissent répétabilité et précision, mais ils sont inadaptés dès que la tâche exige du contrôle d'effort ou une compliance face à des contacts incertains. Le principe SEA, qui insère un ressort entre le moteur et la charge pour mesurer les efforts via la loi de Hooke, est connu depuis les travaux de Gill Pratt au MIT dans les années 1990, mais son application reste généralement cantonnée aux plateformes conçues pour l'accepter dès l'origine. Ce travail démontre qu'un retrofit peu coûteux peut débloquer la mesure d'effort haute fidélité sans remplacer l'actionneur existant. L'approche s'inscrit dans un courant de recherche actif autour de la compliance en actionnement, qui irrigue aussi bien les robots humanoïdes (Boston Dynamics Atlas, Agility Digit, Figure 02) que les exosquelettes et cobots collaboratifs. Les concurrents directs de cette approche incluent le quasi-direct drive (QDD), popularisé par MIT Cheetah et repris chez nombre de fabricants chinois (Unitree, Fourier Intelligence), ainsi que les capteurs d'effort six axes montés en poignet. La limite principale du SEA reste la réduction de bande passante, que ce travail atténue mais ne supprime pas entièrement. Les prochaines étapes logiques concerneraient des validations sur tâches manipulatoires réelles et une caractérisation de la durée de vie mécanique de l'élément élastique retrofit dans des cycles répétitifs.

RecherchePaper
1 source
Optimisation par données des configurations de capteurs tactiles pour la manipulation dextérique
1378arXiv cs.RO 

Optimisation par données des configurations de capteurs tactiles pour la manipulation dextérique

Des chercheurs ont publié sur arXiv (arXiv:2409.20473v3) un cadre méthodologique permettant, pour la première fois, de quantifier la contribution individuelle de chaque capteur tactile à la performance d'une politique d'apprentissage par renforcement profond (DRL) appliquée à la manipulation dextère. L'étude cible la Shadow Hand, une main robotique à 24 degrés de liberté équipée de 92 capteurs tactiles. En deux étapes, les auteurs réduisent ce réseau dense à 14 capteurs tout en conservant plus de 90 % de la performance initiale sur trois tâches de manipulation standardisées (bloc, oeuf, stylo). La première phase, empirique, écrête le nombre de capteurs de 92 à 21 en maintenant 93 % des performances. La seconde phase, plus fine, combine une régression par processus gaussiens (GPR) et une régression Lasso pour classer l'importance fonctionnelle de chaque capteur restant. Le résultat le plus saillant contredit l'intuition habituelle en robotique : les capteurs du doigt médius contribuent négativement à l'apprentissage, dégradant activement la politique DRL plutôt que de l'améliorer. À l'inverse, le pouce, l'annulaire et l'auriculaire concentrent l'essentiel de l'information utile au contrôle de contact. Pour les intégrateurs et les équipes de R&D en manipulation robotique, cela signifie qu'une réduction drastique du nombre de capteurs n'est pas seulement possible sans sacrifier les performances, elle peut même les améliorer en éliminant des signaux redondants ou antagonistes. Des expériences de transfert zéro-shot sur deux nouveaux objets et une validation croisée sur l'Allegro Hand et la Leap Hand confirment que ces classements d'importance se généralisent au-delà de la plateforme d'entraînement. La problématique de placement de capteurs tactiles reste largement non résolue dans la littérature, en l'absence de méthodes systématiques comparables à celles développées pour la vision. Ce travail s'inscrit dans un contexte où plusieurs laboratoires et entreprises, dont Sanctuary AI, Agility Robotics ou encore OpenAI avec Dexterous Manipulation, investissent massivement dans la manipulation fine comme prochain verrou de la robotique humanoïde. Les concurrents directs sur la Shadow Hand incluent des frameworks basés sur le sim-to-real (IsaacGym, MuJoCo), qui peinent encore à modéliser fidèlement le retour tactile dense. Les auteurs proposent leurs critères de déploiement comme des guidelines quantitatifs applicables à d'autres morphologies robotiques, ouvrant la voie à des configurations capteurs optimisées dès la phase de conception mécanique plutôt qu'a posteriori.

RecherchePaper
1 source
Distillation neuronale de Koopman dynamique pour le contrôle robotique en temps réel par modèles de diffusion
1379arXiv cs.RO 

Distillation neuronale de Koopman dynamique pour le contrôle robotique en temps réel par modèles de diffusion

Une équipe de chercheurs a publié sur arXiv (2605.24924) un cadre nommé Dynamic Neural Koopman Distillation (DNKD), réduisant la latence d'inférence des politiques de diffusion robotiques à quelques millisecondes, contre des centaines pour les modèles originaux. Le problème central : les modèles de diffusion génèrent des trajectoires multimodales de qualité mais leur débruitage itératif (10 à 100 étapes) est incompatible avec la commande en boucle fermée à 50-100 Hz. La solution repose sur une couche Factorized Dynamic Koopman (FDK), qui distille ce processus en un seul passage avant via une transition latente factorisée à gains modaux dépendants de l'état. Validée sur les benchmarks D4RL MuJoCo et sur un bras Kinova physique, la méthode surpasse significativement les baselines de distillation à une étape sur les tâches de locomotion et maintient un taux de succès comparable en manipulation réelle. L'enjeu industriel est direct : les politiques de diffusion, plébiscitées pour leur gestion des tâches ambiguës à solutions multiples, étaient jusqu'ici confinées aux systèmes tolérant la latence. Ramener l'inférence au régime milliseconde ouvre la voie aux contrôleurs embarqués sans accélérateur dédié. Pour un intégrateur ou un COO industriel, c'est un accès aux politiques génératives puissantes sans compromis sur la réactivité, paramètre critique pour la sécurité machine et la cadence de production. La méthode confirme aussi que la distillation de connaissance, technique éprouvée en NLP, est transférable aux politiques d'action multimodales. Ce travail s'inscrit dans un courant ouvert par Diffusion Policy (Chi et al., 2023, Columbia) et industrialisé par Physical Intelligence avec pi-0. Les approches concurrentes pour l'accélération d'inférence incluent les consistency models, le rectified flow (présent dans GR00T N2 de NVIDIA) et DDIM. Le DNKD se distingue par son ancrage dans la théorie de l'opérateur de Koopman, qui linéarise la dynamique non linéaire dans un espace latent, garantie théorique absente des méthodes purement empiriques. La publication reste un preprint arXiv non évalué par les pairs, sans partenaire industriel annoncé ; les démonstrations sont disponibles sur fdkoopman.github.io.

RechercheActu
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
1380arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
Commande corpo-entière sûreté-critique pour robots humanoïdes via les barrières de contrôle entrée-état
1381arXiv cs.RO 

Commande corpo-entière sûreté-critique pour robots humanoïdes via les barrières de contrôle entrée-état

Des chercheurs ont publié sur arXiv (référence 2605.25546) un framework hiérarchique de contrôle sécurisé corps entier pour robots humanoïdes, fondé sur les fonctions barrières robustes aux perturbations (ISSf-CBF, Input-to-State Safe Control Barrier Functions). L'architecture s'articule en trois couches : un contrôleur whole-body cinématique (KinWBC) qui génère des références articulaires à partir de tâches priorisées, un filtre ISSf-CBF qui les ajuste au minimum pour satisfaire les contraintes de sécurité sous perturbations bornées, et un contrôleur whole-body dynamique (DynWBC) qui garantit la faisabilité corps entier et la stabilité des contacts. Les contraintes couvertes incluent les limites articulaires, l'évitement d'auto-collision, l'évitement d'obstacles et les frontières du workspace. Validé en simulation et sur robot réel, le système a été testé dans trois scénarios : locomotion, téleopération et équilibre monopode avec contrôle simultané des mains. L'intérêt de l'approche tient à un problème fondamental en robotique humanoïde : les garanties de sécurité formelles s'effondrent dès qu'apparaît un écart entre le modèle de simulation et le comportement physique réel. Les CBFs classiques supposent un système parfaitement connu et deviennent fragiles face aux incertitudes de modèle, aux erreurs de suivi de trajectoire ou aux perturbations externes, précisément les conditions d'un environnement industriel. Les ISSf-CBFs étendent ce formalisme en admettant des perturbations bornées tout en maintenant des garanties formelles transférables du niveau cinématique vers la dynamique complète. Le filtre intervient de façon minimalement invasive, ne corrigeant les références nominales que lorsque nécessaire, ce qui préserve la performance globale. C'est une réponse directe au "demo-to-reality gap" structurellement reproché aux humanoïdes actuels, et un prérequis pour toute certification de robot collaboratif en environnement humain. Les Control Barrier Functions sont un outil bien établi en automatique, popularisé dans les années 2010 pour les véhicules autonomes et les bras robotiques. Leur extension aux ISSf-CBFs pour la robustesse aux perturbations est plus récente, et leur application à un humanoïde corps entier avec des dizaines de degrés de liberté, des contacts multiples et des dynamiques non linéaires représente un saut de complexité notable. Dans la course actuelle aux humanoïdes, les acteurs comme Figure, Boston Dynamics, Tesla (Optimus), Agility Robotics, Apptronik ou Unitree publient peu sur les garanties de sécurité formelles corps entier, un domaine resté majoritairement académique. Ce travail n'annonce pas de déploiement industriel, mais fournit une brique méthodologique directement applicable aux pipelines de validation et de certification des futurs robots collaboratifs.

UELes garanties de sécurité formelles apportées par ce framework sont directement pertinentes pour la certification des robots collaboratifs humanoïdes dans le cadre du Machinery Regulation et de l'AI Act européens.

RecherchePaper
1 source
Accessibilité différentiable parallèle pour l'apprentissage et la planification avec dynamiques neuronales et contrôleurs certifiés
1382arXiv cs.RO 

Accessibilité différentiable parallèle pour l'apprentissage et la planification avec dynamiques neuronales et contrôleurs certifiés

Une équipe de recherche a publié en mai 2026 (arXiv:2605.25346) un cadre de vérification formelle parallélisable et différentiable pour systèmes robotiques pilotés par réseaux de neurones (NN). Implémenté en JAX pour exploiter le calcul GPU-batché, le framework combine la construction de "flowpipes" par modèles de Taylor avec la propagation de bornes linéaires de type CROWN, une technique issue de la vérification des NN adversariaux. Le résultat est une représentation unifiée qui préserve les dépendances affines tout en supportant la différentiation automatique. Sur cette base, les auteurs proposent deux applications concrètes : une méthode d'entraînement certifié qui pousse les modèles NN à produire des dynamiques "reachability-friendly", et un schéma de commande prédictive (MPC) combinant échantillonnage et raffinement par gradient. Les expériences couvrent la manipulation non préhensile (objets poussés sans saisie) et des drones quadrotors, avec des évaluations hardware et des systèmes allant jusqu'à 72 dimensions d'état. Le problème central que ce travail adresse est le fossé entre performance des NN et garanties formelles de sécurité : les outils de "reachability" existants (NNV, Veritex, CROWN-reach) produisent des sur-approximations valides des ensembles atteignables, mais sont trop lents pour être intégrés dans une boucle d'apprentissage ou de planification en ligne, et rarement différentiables. Rendre ce calcul GPU-compatible et différentiable ouvre la voie à une co-optimisation contrôleur/garantie, ce qui change la logique de déploiement : au lieu de vérifier après entraînement (post-hoc, coûteux), on certifie pendant l'entraînement. Pour les intégrateurs industriels et les équipes robotique, c'est un pas vers des robots NN-pilotés qui satisfont des contraintes de sécurité hard sans sacrifier la performance apprise. La vérification formelle pour les NN en robotique est un axe de recherche actif depuis 2018, porté notamment par les travaux CROWN (Zhang et al.), qui ciblaient initialement la robustesse adversariale en vision. L'extension à la dynamique continue et aux boucles fermées reste un problème ouvert, avec des groupes concurrents chez MIT, CMU et DeepMind. Ce preprint positionne JAX comme plateforme centrale pour ce type de pipeline hybride apprentissage/vérification, une tendance émergente face à PyTorch. Les prochaines étapes probables incluent des tests sur manipulateurs industriels à plus haute dimensionnalité et l'intégration dans des frameworks MPC embarqués.

UELa certification embarquée dans la boucle d'entraînement s'aligne directement avec les exigences de vérifiabilité formelle de l'AI Act pour les systèmes IA à haut risque (dont les robots industriels et autonomes), réduisant le coût de mise en conformité pour les équipes R&D européennes.

RecherchePaper
1 source
Contrôle par échantillonnage en temps réel sous contraintes strictes : l'approche MPPI avec contraintes de variété
1383arXiv cs.RO 

Contrôle par échantillonnage en temps réel sous contraintes strictes : l'approche MPPI avec contraintes de variété

Une équipe du RCI Lab publie MC-MPPI (Manifold-Constrained Model Predictive Path Integral), un framework de contrôle temps-réel déposé sur arXiv le 26 mai 2026 (arXiv:2605.24813). La méthode répond à une limitation structurelle du MPPI standard : l'impossibilité de garantir des contraintes d'égalité strictes (hard constraints) lors de tâches de manipulation en chaîne fermée. MC-MPPI sépare le problème en deux niveaux : une planification dans un espace latent de faible dimension, apprise par un VAE (Variational Autoencoder) qui encode la variété de contraintes, suivie d'une correction d'exécution par un contrôleur QP (Quadratic Programming) résolvant en un seul appel l'erreur résiduelle. Sur un système bi-bras à 14 degrés de liberté en chaîne fermée, le framework tourne à 100 Hz aussi bien en simulation qu'en conditions réelles, et surpasse significativement les méthodes de référence en précision de suivi de trajectoire. Le verrou adressé est structurel : les pénalités de coût douces du MPPI standard ne garantissent pas la faisabilité des trajectoires candidates, rendant la méthode inapplicable à la manipulation bimanuelle contrainte, aux systèmes à deux points de contact rigide, ou à toute chaîne cinématique fermée. MC-MPPI conserve le parallélisme massif qui rend MPPI attractif : le VAE génère des trajectoires quasi-faisables sans modification par échantillon, permettant une linéarisation précise des contraintes et réduisant la correction d'exécution à un QP résolu en un seul passage au lieu d'une projection itérative coûteuse. Pour un intégrateur ou un responsable technique industriel, cela ouvre MPPI à des tâches d'assemblage et de manipulation précise jusqu'ici réservées aux solveurs par optimisation itérative comme iLQR ou SQP. MPPI est une méthode de contrôle prédictif par échantillonnage stochastique, introduite par Williams et al. à Georgia Tech en 2016 et depuis adoptée en navigation robotique et pour les systèmes sous-actionnés. Les extensions contraintes existantes recourent à des projections itératives coûteuses ou à des reformulations variationnelles qui dégradent la fréquence de contrôle. MC-MPPI se distingue en apprenant la géométrie de contrainte hors-ligne via le VAE, limitant la charge en ligne au seul QP. Les approches concurrentes incluent les méthodes CBF-QP (Control Barrier Function), le MPC différentiable, et les planificateurs neuronaux pour la manipulation bimanuelle. L'équipe met à disposition vidéos et implémentation à rcilab.github.io/mcmppi ; des validations sur des configurations plus complexes ou des manipulateurs mobiles constitueraient des étapes naturelles.

RecherchePaper
1 source
LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
1384arXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires. Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle. LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

RechercheOpinion
1 source
Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent
1385arXiv cs.RO 

Apprentissage de séquences d'actions continues haute fréquence dans l'espace latent

Des chercheurs de TARS Robotics ont publié sur arXiv (2605.24931) une méthode de contrôle robotique haute fréquence baptisée RTR (Reuse-then-Refine), visant à résoudre un problème identifié dans les politiques d'action chunking actuelles. À 60 Hz, les systèmes qui exécutent des séquences pré-calculées de commandes motrices génèrent des mouvements saccadés et spatialement incohérents, ce que les politiques standard ne parviennent pas à corriger. L'approche RTR déplace l'apprentissage depuis l'espace d'action direct vers un espace latent encodé par un auto-encodeur variationnel (VAE), ce qui améliore significativement la consistance temporelle et spatiale. Elle intègre également une stratégie de raffinement par chunk permettant une transition fluide entre séquences adjacentes lors d'une inférence asynchrone. Les auteurs valident la méthode sur trois tâches réelles à contact riche, avec une exécution continue et moins de pauses involontaires. Le code et les données sont publiés en open source sur GitHub (tars-robotics/RTR). Le passage de 10-30 Hz à 60 Hz représente une frontière critique pour la manipulation robotique : à basse fréquence, le robot doit compenser sa lenteur par des pauses de recalcul, limitant son utilité en production industrielle. Les politiques de type VLA (Vision-Language-Action) ou diffusion policy, actuellement dominantes en imitation learning, fonctionnent généralement en dessous de 30 Hz. En montrant qu'un encodage latent peut absorber la variance temporelle sans sacrifier la précision spatiale, RTR apporte une réponse concrète au problème de "jerkiness" qui freine le déploiement des robots manipulateurs en conditions réelles. Pour un intégrateur ou un décideur B2B, c'est une voie vers des systèmes capables d'assurer une cadence de travail continue sans interruption de flux de production. L'action chunking a été popularisé par ACT (Action Chunking with Transformers, Zhao et al., 2023) et les travaux sur Diffusion Policy, tous deux conçus pour des fréquences modérées. TARS Robotics se positionne dans un espace concurrentiel qui inclut Physical Intelligence avec pi0-FAST (ciblant 50-200 Hz via flow-matching) et les efforts de Figure AI, Agility Robotics et Boston Dynamics sur le contrôle haute cadence. RTR se distingue de pi0-FAST en proposant un raffinement incrémental du chunk existant plutôt qu'une régénération complète, ce qui réduit la charge computationnelle par inférence. Il s'agit pour l'instant d'une contribution de recherche validée en laboratoire sur robot réel, sans timeline de déploiement industriel ni partenariat annoncé.

RechercheOpinion
1 source
Elevator-LIO : odométrie LiDAR-inertielle robuste pour la navigation multi-étages dans les ascenseurs
1386arXiv cs.RO 

Elevator-LIO : odométrie LiDAR-inertielle robuste pour la navigation multi-étages dans les ascenseurs

Une équipe de chercheurs a publié sur arXiv (arXiv:2605.24495) Elevator-LIO, un framework d'odométrie LiDAR-inertielle conçu pour maintenir la localisation continue d'un robot pendant ses déplacements en ascenseur. Le système repose sur un modèle d'estimation d'état découplé qui modélise séparément le mouvement du robot par rapport à la cabine et le mouvement de la cabine elle-même, intégré dans un filtre de Kalman itératif à erreur d'état dépendant du mode. Un gestionnaire de mode détecte l'entrée et la sortie de l'ascenseur via des statistiques de télémétrie LiDAR, puis déclenche des mises à jour de vitesse nulle et d'accélération nulle lorsque la cabine est à l'arrêt afin de supprimer la dérive verticale accumulée. Une stratégie de sous-échantillonnage voxel adaptatif maintient un nombre stable de points efficaces lors des changements d'échelle environnementale. Les tests portent sur 20 séquences réelles comprenant 79 trajets en ascenseur, couvrant des espaces de grande dimension, de longs déplacements verticaux, des piétons en mouvement et des réflexions sur miroirs. L'erreur de hauteur terminale reste inférieure à 1 cm dans 17 séquences sur 20. Ce résultat est significatif pour les déploiements de robots mobiles autonomes (AMR) en environnement multi-étages, un cas d'usage que les systèmes LIO conventionnels gèrent mal : les accélérations non inertielles d'un ascenseur saturent le filtre IMU standard et provoquent des dérives cumulatives qui corrompent la carte et la pose estimée. Elevator-LIO démontre qu'une modélisation explicite du référentiel non inertiel, plutôt qu'un post-traitement correctif, permet une localisation robuste sans recalage a posteriori. Les auteurs indiquent également que la méthode reste compétitive sur les benchmarks Hilti 2022 et 2023, ce qui suggère qu'elle n'est pas spécialisée au détriment des scénarios intérieurs standards. La navigation multi-étages est depuis plusieurs années l'un des verrous opérationnels majeurs pour les robots de livraison et de service en milieu tertiaire ou hospitalier. Des acteurs comme Boston Dynamics (Spot), Keenon Robotics ou Savioke affrontent ce problème avec des solutions ad hoc souvent dépendantes d'infrastructure. Dans l'écosystème européen, des entreprises comme Enchanted Tools (Miroki) ou Exotec opèrent principalement en environnement mono-niveau, mais la pression vers des déploiements bâtimentaires complets s'intensifie. Elevator-LIO est pour l'instant un prototype académique sans déploiement annoncé, mais son intégration dans des stacks LIO open-source comme FAST-LIO2 ou LIO-SAM serait techniquement directe, ce qui pourrait accélérer l'adoption industrielle.

UELes acteurs français comme Enchanted Tools (Miroki) et Exotec, qui opèrent aujourd'hui principalement en environnement mono-niveau, pourraient s'appuyer sur cette technologie pour étendre leurs déploiements robotiques aux bâtiments multi-étages sans dépendre d'infrastructures dédiées.

RecherchePaper
1 source
InvariantCloud : un framework de nuage de points globalement invariant et indexé de manière unique pour le suivi robuste de pose tactile à 6 DOF
1387arXiv cs.RO 

InvariantCloud : un framework de nuage de points globalement invariant et indexé de manière unique pour le suivi robuste de pose tactile à 6 DOF

Une équipe de chercheurs a publié le 26 mai 2026 sur arXiv (arXiv:2605.25216) un framework de suivi de pose tactile 6-DoF baptisé InvariantCloud, conçu pour les capteurs tactiles visuels, ces dispositifs équipés d'une caméra interne qui observe une surface gel texturée en contact avec un objet. L'approche repose sur l'exploitation de la constellation globale des marqueurs de surface du capteur comme référentiel invariant : plutôt que de suivre localement les déplacements relatifs des marqueurs, InvariantCloud effectue un recalage de nuage de points globalement invariant en une seule passe (one-shot), ce qui supprime l'accumulation de dérive caractéristique des méthodes séquentielles. Les expérimentations montrent des performances supérieures aux benchmarks existants sur la précision du suivi en lacet (rotation autour de l'axe Z) et sur la répétabilité de la relocalisation dans des tâches longues durée. Le problème de la dérive cumulative dans l'estimation du lacet est notoire dans la littérature sur la perception tactile : les approches incrémentales perdent leur référence absolue sur les longues séquences, rendant les manipulations fines peu fiables. InvariantCloud adresse directement ce point aveugle en ancrant chaque estimation à une référence globale plutôt qu'à l'état précédent, ce qui le rend particulièrement pertinent pour les tâches de manipulation précise en robotique industrielle ou dans les bras téléopérés. La convergence actuelle entre l'apprentissage par imitation (imitation learning) et les modèles vision-langage-action (VLA) crée une demande accrue pour une perception tactile haute fidélité fiable sur des horizons longs, domaine où ce travail apporte une contribution mesurable. Les capteurs tactiles visuels de référence -- GelSight, DIGIT, Soft-Bubble -- souffrent tous de limitations similaires sur l'estimation du lacet, un problème ouvert depuis plusieurs années. InvariantCloud s'insère dans un écosystème de recherche actif incluant des travaux récents comme TactiFind ou DenseTact, avec lesquels il se compare expérimentalement. Il s'agit à ce stade d'un preprint non encore soumis à peer review, ce qui invite à la prudence sur la généralisation des résultats : les conditions expérimentales précises, la diversité des objets testés et les capteurs supportés ne sont pas détaillés dans le résumé disponible. Des travaux d'intégration dans des pipelines de manipulation open-source constitueraient une prochaine étape naturelle pour valider l'applicabilité industrielle.

RecherchePaper
1 source
Combler le fossé : permettre au Soft Actor Critic des performances élevées en locomotion sur pattes
1388arXiv cs.RO 

Combler le fossé : permettre au Soft Actor Critic des performances élevées en locomotion sur pattes

Une équipe de chercheurs publie sur arXiv (preprint 2605.24975, mai 2026) une série de modifications ciblées permettant à l'algorithme Soft Actor-Critic (SAC) d'atteindre les performances de Proximal Policy Optimization (PPO) dans l'entraînement à grande échelle de robots à pattes. PPO s'impose depuis plusieurs années comme l'algorithme de référence pour la locomotion bipède et quadrupède, notamment dans les environnements de simulation massivement parallèles comme IsaacLab (NVIDIA). Son défaut structurel est son caractère on-policy : chaque mise à jour de gradient exige de nouvelles données fraîches, le rendant inutilisable pour un apprentissage continu directement sur le robot physique. SAC, algorithme off-policy capable de réutiliser l'expérience passée, était un candidat naturel, mais échouait systématiquement à rivaliser en performance dans ces mêmes conditions. Les auteurs identifient trois correctifs spécifiques : une initialisation améliorée de la politique, un calcul de la valeur cible corrigé pour les épisodes tronqués (timeout-aware critic targets), et une estimation multi-pas du retour (multi-step return estimation). Ces ajustements ferment entièrement l'écart avec PPO, validé sur plusieurs plateformes de robots à pattes et une diversité de tâches de locomotion. L'enjeu pour l'industrie robotique est concret. PPO contraint les équipes à retourner systématiquement en simulation pour chaque cycle d'amélioration, allongeant les boucles de développement et compliquant l'adaptation à des environnements physiques non anticipés. Un SAC équivalent en performance à l'entraînement offline ouvre la voie à un workflow unifié : un seul algorithme pour la phase de simulation initiale, puis pour l'adaptation en ligne sur le robot déployé, sans boucle retour sim-to-real. Pour les intégrateurs travaillant sur des robots mobiles à pattes en inspection industrielle ou logistique, cela réduit potentiellement les cycles de re-entraînement lors de changements de terrain ou de configuration. Ce résultat conteste aussi l'hypothèse selon laquelle le sim-to-real gap exige des algorithmes fondamentalement différents entre entraînement et déploiement. PPO a été popularisé pour la locomotion robotique par les travaux de l'ETH Zurich sur ANYmal (2019-2022) et s'est généralisé avec l'adoption massive d'IsaacLab comme environnement de référence. SAC avait été introduit en 2018 par Tuomas Haarnoja et ses collègues à l'UC Berkeley, mais ses applications à la locomotion à grande échelle se heurtaient à des instabilités numériques en parallèle massif. Boston Dynamics, Unitree et Agility Robotics n'ont pas divulgué leurs pipelines d'entraînement internes, mais la littérature académique récente sur les robots H1 (Unitree) ou Digit (Agility) reste majoritairement dans l'écosystème PPO. Ce preprint demeure une contribution de recherche et non un produit déployé : sa portée pratique dépendra d'implémentations publiques dans IsaacLab ou MuJoCo et de validations indépendantes par la communauté.

RecherchePaper
1 source
NeuralTouch : des descripteurs neuronaux pour un contrôle tactile précis en transfert simulation-réel
1389arXiv cs.RO 

NeuralTouch : des descripteurs neuronaux pour un contrôle tactile précis en transfert simulation-réel

Une équipe de chercheurs a publié sur arXiv (réf. 2510.20390v2) NeuralTouch, un framework multimodal combinant les Neural Descriptor Fields (NDF) avec le retour haptique pour améliorer la précision de préhension des robots manipulateurs. Le principe repose sur deux étages : les NDF génèrent une représentation implicite de la géométrie de contact cible à partir de données visuelles, puis une politique d'apprentissage par renforcement profond (deep RL) affine la saisie en temps réel via des capteurs tactiles. Le système a été validé sur des tâches de manipulation fine, insertion de cheville dans un trou (peg-out-in-hole) et ouverture de bouchon de bouteille, avec un transfert zéro-shot du simulateur vers l'environnement physique, sans fine-tuning supplémentaire. Les études d'ablation en simulation et les tests réels montrent une amélioration significative de la précision et de la robustesse par rapport aux baselines, bien que les métriques quantitatives précises ne figurent pas dans le résumé publié. Le problème adressé est bien connu des intégrateurs : les NDF seuls souffrent d'imprécisions dues à une calibration caméra imparfaite, des nuages de points incomplets et la variabilité géométrique des objets. À l'inverse, les approches tactiles existantes restent cantonnées à des géométries de contact prédéfinies et simples, ce qui limite leur déployabilité industrielle. NeuralTouch contourne cette dualité en conditionnant la politique RL sur les descripteurs neuronaux sans nécessiter de spécification explicite du type de contact, ce qui est précisément le verrou que le secteur cherche à lever pour rendre les bras manipulateurs économiquement viables dans des environnements non structurés. La capacité de généralisation inter-catégories d'objets sans ré-entraînement représente un argument concret pour les COO industriels cherchant à réduire les coûts d'intégration. Ce travail s'inscrit dans un courant actif autour du sim-to-real pour la manipulation de précision, où Stanford, MIT et CMU rivalisent avec des acteurs industriels comme Sanctuary AI, 1X Technologies et Physical Intelligence, dont le modèle pi-0 cible également la manipulation généraliste. NeuralTouch se distingue par son approche hybride vision-tactile conditionnée sur des descripteurs neuronaux, évitant la fragmentation habituelle entre les pipelines purement visuels et les politiques haptiques spécialisées. Reste à démontrer la robustesse du framework sur une gamme plus large de géométries et sur des plateformes robotiques commerciales, étapes qui conditionneront le passage d'une démonstration académique à un outil industriellement pertinent.

RecherchePaper
1 source
Primitives de mouvement par le langage : ancrer les modèles de langage dans le mouvement robotique
1390arXiv cs.RO 

Primitives de mouvement par le langage : ancrer les modèles de langage dans le mouvement robotique

Des chercheurs du Collaborative Robotics Lab de Virginia Tech ont publié Language Movement Primitives (LMP), un framework qui relie les modèles de vision-langage (VLM) aux Dynamic Movement Primitives (DMP), une famille de contrôleurs de trajectoire établie en robotique depuis les années 2000. Le principe: les DMP définissent des trajectoires continues et stables via un faible nombre de paramètres interprétables, et les VLM configurent ces paramètres directement à partir d'instructions en langage naturel. Testé sur 31 tâches de manipulation de bureau en conditions réelles, LMP atteint un taux de succès de 65%, contre 35% pour le meilleur système de référence évalué. Le pipeline fonctionne en mode zéro-shot, sans fine-tuning spécifique aux tâches cibles. L'article est disponible sur arXiv (2602.02839, troisième révision) et accompagné de vidéos de démonstration. Le vrai problème que LMP cible est le "grounding" moteur: transformer un raisonnement abstrait en commandes physiquement cohérentes. Les VLM comme GPT-4V excellent à décomposer une tâche en étapes logiques, mais produire des trajectoires exécutables reste hors de leur portée native. À l'inverse, les modèles de fondation robotique tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou RT-2 de Google génèrent des actions directement, mais nécessitent généralement un fine-tuning coûteux en données in-domain pour s'adapter à de nouvelles tâches. LMP propose une troisième voie: les DMP servent d'interface structurée entre le raisonnement LLM et le contrôle bas niveau, préservant la stabilité dynamique sans apprentissage supplémentaire. Le gain de 30 points de pourcentage en zéro-shot sur des tâches réelles est notable, même si le choix des baselines et les conditions de test précises mériteront une vérification indépendante par la communauté. Les DMP ont été formalisés par Schaal et al. dans les années 2000 et restent un outil de référence pour la manipulation grâce à leur stabilité et leur capacité de généralisation. L'approche de LMP s'inscrit dans la lignée de SayCan (Google) et Code-as-Policies (Liang et al.), mais descend plus bas dans la pile de contrôle sans passer par un réseau de politique intermédiaire. Les concurrents directs sont les VLA bout-en-bout comme OpenVLA ou le récent Helix d'Figure AI, qui offrent plus de flexibilité mais restent tributaires de larges jeux de données de démonstration. Les prochaines étapes probables incluent l'extension à des environnements non-tabulaires et à des robots à plus haute dimensionnalité, notamment la manipulation dextre sur bras 7-DOF.

RechercheOpinion
1 source
CollaBot : manipulation collaborative simultanée guidée par modèle vision-langage
1391arXiv cs.RO 

CollaBot : manipulation collaborative simultanée guidée par modèle vision-langage

Une équipe de chercheurs a publié sur arXiv (arXiv:2508.03526v2) CollaBot, un framework généraliste de manipulation collaborative simultanée par plusieurs robots. L'approche articule trois composants : un module de segmentation de scène basé sur SEEM (Segment Everything Everywhere all at once Model) pour isoler l'objet cible dans l'environnement, un framework de saisie collaborative qui décompose la tâche en génération locale de poses de préhension par chaque robot et coordination globale entre agents, et un module de planification en deux étapes pour produire des trajectoires sans collision. Testé sur des configurations variées, nombre de robots, types d'objets (dont des objets volumineux comme des tables), types de tâches, CollaBot atteint un taux de réussite de 72 %, surpassant les méthodes basées sur le behavior cloning. Des expériences en conditions réelles confirment la faisabilité de l'approche hors simulation. Ce résultat pointe un angle mort structurel de la robotique de manipulation : la quasi-totalité des frameworks existants ciblent des robots seuls opérant sur des objets de petite taille, alors que les environnements industriels et domestiques exigent fréquemment la manipulation coordonnée d'objets volumineux, tables, panneaux, charges lourdes. La décomposition explicite du problème (saisie locale + coordination globale) se révèle plus robuste que l'apprentissage bout-en-bout pur pour la généralisation multi-robot, ce qui constitue une piste d'architecture à retenir pour les intégrateurs industriels cherchant à déployer des cellules multi-bras flexibles. Le taux de 72 % mérite toutefois d'être nuancé : le papier ne détaille pas précisément la diversité des objets testés en conditions réelles ni les critères de succès retenus, ce qui limite la comparaison directe avec d'autres systèmes. La manipulation multi-robot collaborative reste un champ en structuration, sans cadre généraliste interopérable établi à ce jour. CollaBot s'inscrit dans une tendance plus large d'intégration de modèles vision-langage dans la planification robotique, dans l'esprit des architectures VLA portées par Physical Intelligence avec Pi-0, Figure AI avec Figure 03, ou Google DeepMind avec GR00T N2, mais appliqué spécifiquement à la coordination multi-agents sur objets larges, un scénario que les VLA classiques traitent mal. Les suites logiques seraient de tester le framework avec un nombre de robots plus élevé, dans des environnements encombrés, et de publier des benchmarks complets pour permettre une reproductibilité indépendante et une comparaison sérieuse avec les approches concurrentes.

RecherchePaper
1 source
Système LiDAR-SLAM décentralisé à optimalité certifiée pour l'optimisation de graphe de poses
1392arXiv cs.RO 

Système LiDAR-SLAM décentralisé à optimalité certifiée pour l'optimisation de graphe de poses

Des chercheurs ont publié sur arXiv (référence 2605.25051v1) un système de LiDAR-SLAM décentralisé conçu pour les missions multi-robots collaboratives, intégrant pour la première fois un backend d'optimisation de graphe de poses (PGO) certifié optimal. Le coeur de l'approche repose sur l'algorithme de descente de coordonnées par blocs riemanniens (RBCD), qui garantit mathématiquement la convergence vers une solution globalement cohérente sans nécessiter d'estimation initiale précise. Contrairement aux méthodes existantes qui s'arrêtent à des optima locaux ou n'alignent les repères qu'une seule fois en début de mission, ce système maintient une cohérence globale de trajectoire tout au long de la mission. Les expériences rapportées montrent une amélioration de la RMSE de trajectoire allant jusqu'à 48,9 % par rapport à DiSCo-SLAM, référence actuelle pour les architectures décentralisées. L'enjeu est substantiel pour les intégrateurs de flottes robotiques autonomes. Le SLAM multi-robot est un pilier des missions en environnements sans GPS : entrepôts, mines souterraines, bâtiments industriels, zones sinistrées. Le problème central est la cohérence globale : quand plusieurs robots fusionnent leurs cartes locales construites indépendamment, les dérives cumulées et les ambiguïtés géométriques (couloirs symétriques, espaces ouverts) conduisent souvent à des incohérences non détectées. Que l'optimisation soit "certifiablement optimale" signifie qu'on peut prouver formellement l'optimalité de la solution, ce que les approches à recherche locale comme iSAM2 ou DCS ne peuvent pas garantir. Pour un COO déployant des flottes d'AMR en logistique ou un intégrateur en robotique d'inspection, c'est une promesse de robustesse qualitativement différente des solutions actuelles. Le SLAM décentralisé multi-robot est un domaine de recherche actif depuis une décennie. DiSCo-SLAM, Kimera-Multi et LAMP 2.0 représentent les références récentes, mais tous s'appuient sur des heuristiques d'optimisation locale. L'introduction du RBCD dans ce contexte transpose des techniques issues de l'optimisation riemannienne vers la robotique de terrain. À ce stade, le travail reste un preprint expérimental sans déploiement industriel annoncé ni partenaire commercial identifié. Les prochaines étapes naturelles seraient une validation sur des jeux de données publics de référence comme MulRan ou KITTI, et des tests en conditions réelles avec des robots hétérogènes.

RecherchePaper
1 source
Actionneurs pneumatiques souples pour la robotique molle : revue des mécanismes d'actionnement et compromis de performance
1393arXiv cs.RO 

Actionneurs pneumatiques souples pour la robotique molle : revue des mécanismes d'actionnement et compromis de performance

Une équipe de chercheurs vient de déposer sur arXiv (réf. 2605.25109) une revue systématique des actionneurs pneumatiques souples, constituant l'une des technologies centrales de la robotique souple. Le papier organise ces systèmes selon quatre classes de mouvement : linéaire, flexion, torsion et omnidirectionnel. Pour chaque classe, les auteurs analysent les paramètres structurels qui définissent le chemin de déformation : angle de tresse, géométrie des plis, orientation des fibres, arrangement des chambres, asymétrie structurelle et couches de contrainte internes. Le constat de départ est net : la réponse mécanique de ces actionneurs ne dépend pas uniquement de la pression appliquée, mais de l'ensemble de leur architecture, ce que la littérature existante traite de façon fragmentée et difficilement comparable. L'intérêt de ce travail tient à un problème concret qui ralentit les équipes de développement : l'impossibilité de comparer les résultats publiés entre études. Deux actionneurs à base de flexion peuvent produire des déplacements similaires tout en différant radicalement sur la demande en débit d'air, la répétabilité ou la durée de vie en cycles. La revue introduit un cadre de conditions de sélection explicites à évaluer lors du choix ou de la comparaison d'actionneurs : pression de travail, condition de charge, taille physique de l'actionneur, disponibilité de l'alimentation pneumatique et hystérésis. Pour un intégrateur ou un ingénieur robotique, ce cadre réduit les essais empiriques coûteux en phase de prototypage, à condition que les publications futures adoptent ces métriques de manière systématique, ce qui reste une hypothèse de travail à ce stade. La robotique souple s'est imposée comme alternative aux systèmes rigides pour des applications en contact avec le corps humain ou des environnements non structurés, en compétition directe avec les actionneurs à câbles, les élastomères diélectriques et les alliages à mémoire de forme. Les applications visées par la revue sont explicitement le biomédical, le portabilité et la robotique mobile. En Europe, des acteurs comme Wandercraft sur les exosquelettes ou Enchanted Tools sur les robots collaboratifs opèrent précisément dans des espaces où ces arbitrages de conception sont déterminants. Ce papier de classification arrive au moment où plusieurs équipes tentent le passage du prototype de laboratoire au déploiement industriel, une transition qui exige la rigueur comparative que cette revue cherche à structurer, sans toutefois proposer de benchmarks quantitatifs normalisés propres à accélérer ce saut.

UELe cadre de sélection proposé est directement exploitable par des équipes françaises comme Wandercraft (exosquelettes) et Enchanted Tools (robots collaboratifs) pour réduire les essais empiriques lors du choix d'actionneurs souples en phase de prototypage.

RecherchePaper
1 source
Quelles questions les robots devraient-ils pouvoir répondre ? Un jeu de données pour la robotique explicable
1394arXiv cs.RO 

Quelles questions les robots devraient-ils pouvoir répondre ? Un jeu de données pour la robotique explicable

Une équipe de chercheurs a publié sur arXiv (référence 2510.16435) un jeu de données de 1 893 questions posées par des utilisateurs à des robots domestiques, issu d'une collecte auprès de 100 participants recrutés via la plateforme Prolific. Les données ont été structurées en 12 catégories et 70 sous-catégories, à partir de 22 stimuli au total : 15 vidéos et 7 scénarios textuels dépeignant des robots effectuant des tâches ménagères variées. Dans le jeu de données final, les questions les plus fréquentes portent sur les détails d'exécution des tâches (21,4 %), les capacités du robot (12,6 %) et l'évaluation de ses performances (10,7 %). À noter que les questions relatives aux scénarios difficiles ou à la fiabilité du comportement sont moins nombreuses, mais que les participants les jugent comme les plus importantes auxquelles un robot devrait pouvoir répondre. Ce travail comble un angle mort structurel dans la recherche en robotique explicable : la quasi-totalité des travaux existants se concentre sur les questions de type "pourquoi" (justification d'une décision), alors que ce dataset couvre un spectre bien plus large, des détails opérationnels aux hypothèses contrefactuelles. Pour les intégrateurs et concepteurs de systèmes d'interaction humain-robot, cela signifie que les modules de question-réponse embarqués doivent gérer des requêtes que les architectures conversationnelles actuelles ne priorisent pas. Le constat que les utilisateurs novices posent des questions plus factuelles et immédiates, tandis que les utilisateurs expérimentés interrogent davantage les capacités généralisées du robot, a des implications directes pour la conception des interfaces et la gestion du niveau de détail dans les réponses. Ce dataset s'inscrit dans un contexte où les grands modèles de langage (LLMs) sont de plus en plus intégrés comme couche conversationnelle dans des systèmes robotiques, des plateformes comme Boston Dynamics Spot aux robots de service de PAL Robotics ou Enchanted Tools. Il constitue une ressource de référence pour trois usages : identifier quelles données les robots doivent logger et exposer via une interface conversationnelle, benchmarker les modules de QA en HRI, et aligner les stratégies d'explication avec les attentes réelles des utilisateurs. Les prochaines étapes naturelles incluent l'extension du dataset à d'autres contextes (industriel, médical) et son utilisation pour entraîner ou évaluer des modèles vision-langage-action (VLA) dans des scénarios d'interaction explicite.

UELe dataset pourrait servir de référence pour les équipes européennes (dont Enchanted Tools et PAL Robotics) qui intègrent des LLMs comme couche conversationnelle dans leurs robots de service, en orientant la conception de leurs modules QA vers des questions que les architectures actuelles ne priorisent pas.

RecherchePaper
1 source
ParkourFormer : supervision prédictive et modélisation séquentielle pour la locomotion parkour
1395arXiv cs.RO 

ParkourFormer : supervision prédictive et modélisation séquentielle pour la locomotion parkour

Des chercheurs ont publié le 27 mai 2026 un preprint arXiv (2605.25782) présentant ParkourFormer, un système de locomotion pour humanoïdes capable de traverser des terrains variés, escaliers, fossés, pentes, surfaces irrégulières et obstacles -- sans changer de politique de contrôle. Le coeur de l'approche repose sur un Transformer qui reformule la locomotion comme un problème de décision conditionné par le futur : l'état courant du robot interroge via un mécanisme de cross-attention un historique de trajectoires sensorimotrices, tandis qu'une tête de prédiction légère anticipe les états proprioceptifs à court horizon. Ces états futurs prédits, supervisés par un signal d'apprentissage dédié, sont fusionnés avec les caractéristiques temporelles pour générer les commandes motrices. Les expériences en simulation et sur un robot humanoïde réel donnent un taux de succès moyen de 93,85 % sur l'ensemble des terrains testés, avec des gains allant jusqu'à 42,73 % par rapport aux baselines MLP, MLP à mélange d'experts (MoE) et Transformer standard. Ce résultat est notable parce qu'il cible précisément le talon d'Achille des politiques de locomotion agile actuelles : leur caractère purement réactif. La plupart des systèmes RL existants mappent directement observations vers actions, sans modéliser l'évolution du corps dans le temps. Or pour des transitions de contact rapides -- typiques du parkour ou d'un environnement industriel encombré -- anticiper la dynamique corporelle quelques centièmes de seconde à l'avance change fondamentalement la robustesse. Le fait qu'une politique unique couvre cinq classes de terrain sans spécialisation par environnement est également un signal fort pour les intégrateurs : réduire la fragmentation des politiques simplifie le déploiement sur robots physiques. ParkourFormer s'inscrit dans une vague de travaux qui cherchent à dépasser le gap simulation-réalité pour la locomotion agile humanoïde, aux côtés de systèmes comme PKU-DynaGait, Agility Robotics Digit ou les travaux open-source de Berkeley Humanoid. L'article reste un preprint non encore évalué par les pairs, et les vidéos de démonstration n'ont pas encore été rendues publiques à la date de soumission -- ce qui invite à réserver son jugement sur les performances réelles. Les auteurs n'annoncent pas de déploiement industriel ni de partenariat commercial ; les prochaines étapes naturelles seraient une évaluation sur des plateformes humanoïdes commerciales (Unitree H1/G1, Fourier GR-1) et une confrontation à des conditions extérieures non contrôlées.

RecherchePaper
1 source
Simulateur différentiable neuronal adaptatif : modélisation des contacts rigides par transfert réel-vers-simulation
1396arXiv cs.RO 

Simulateur différentiable neuronal adaptatif : modélisation des contacts rigides par transfert réel-vers-simulation

Des chercheurs ont publié sur arXiv (référence 2603.06218v2) un framework baptisé "Few-Shot Neural Differentiable Simulator", conçu pour calibrer des simulateurs analytiques rigides à partir d'un volume réduit de données réelles, puis générer des jeux de données synthétiques à grande échelle. L'approche combine un simulateur analytique traditionnel, utilisé comme générateur de données après calibration, avec un réseau de neurones sur graphe (GNN) basé sur des maillages 3D, chargé de modéliser la dynamique avant des corps rigides. La contribution technique centrale réside dans la dérivation de gradients de substitution pour la détection de collision, rendant l'ensemble du pipeline entièrement différentiable. Les expériences portent sur des scénarios d'interaction multi-objets, où le système apprend des politiques de manipulation directement par optimisation basée sur les gradients dans le simulateur. Ce travail s'attaque à l'un des verrous majeurs du apprentissage robotique : le coût prohibitif de la collecte de données réelles et l'écart persistant entre simulation et réalité (sim-to-real gap). En n'exigeant qu'un petit nombre d'épisodes réels pour recaler le simulateur analytique, plutôt que des milliers de trajectoires pour entraîner un modèle purement appris, le framework réduit significativement la barrière d'accès à la simulation haute-fidélité. La différentiabilité complète est un avantage concret pour les concepteurs de politiques robotiques : elle permet de propager des gradients à travers la dynamique de contact, évitant le recours à des méthodes d'optimisation sans gradient (evolutionary strategies, RL model-free) typiquement moins efficaces en échantillons. Les résultats présentés indiquent que le GNN ainsi entraîné surpasse des baselines différentiables analytiques pour répliquer des trajectoires réelles, bien que ces résultats restent à ce stade expérimentaux et non validés en conditions industrielles réelles. Le problème de la simulation de contact rigide mobilise depuis plusieurs années des équipes académiques et industrielles majeures. Les simulateurs dominants comme MuJoCo (DeepMind), Isaac Sim (NVIDIA) et PyBullet offrent une différentiabilité partielle, mais peinent à modéliser fidèlement les contacts complexes sans paramétrage expert lourd. Des approches concurrentes comme DiffTaichi ou Brax (Google) ont exploré la différentiabilité à l'échelle, tandis que des laboratoires comme MIT CSAIL et Stanford travaillent sur des simulateurs neuronaux pour la manipulation. Ce preprint, non encore soumis à révision par pairs, ouvre une direction crédible vers des simulateurs "grounded" en peu de données réelles, pertinente pour les déploiements en manipulation industrielle et en robotique de service où les données réelles sont coûteuses à acquérir.

RecherchePaper
1 source
Débruitage par priorité d'action pour un découpage fluide en temps réel
1397arXiv cs.RO 

Débruitage par priorité d'action pour un découpage fluide en temps réel

Une équipe de chercheurs a publié le 26 mai 2026 sur arXiv (réf. 2605.25537) une méthode baptisée Soft RTC (Soft Real-Time Chunking), visant à rendre les politiques d'action par blocs plus fluides lorsqu'elles opèrent sous délai d'inférence. Le problème de départ est concret : les politiques de type diffusion génèrent les commandes motrices en « chunks » (séquences d'actions), mais l'inférence prend du temps. Le RTC standard résout cela en conditionnant chaque nouveau chunk sur les actions déjà engagées par le précédent, grâce à un masque binaire de préfixe. Soft RTC remplace ce masque binaire par un mécanisme de dénaturation partielle (action-prior denoising) : les tokens de chevauchement entre deux chunks ne partent plus d'un bruit pur, mais d'états partiellement dénaturés, alignés sur le chunk précédent via une règle de mélange par token. Sur les 12 niveaux Kinetix publiés (environnements de simulation de manipulation complexe), un fenêtrage "soft" court atteint un taux de résolution de 0,809 contre 0,815 pour le hard RTC, soit un écart marginal. Un fenêtrage medium réduit quant à lui le delta d'action et le jerk (à-coup) en régime de fort délai de respectivement 9,1 % et 9,6 % par rapport au hard RTC classique. Une étude préliminaire sur robot réel en tri d'objets confirme l'amélioration de la complétion et donne à Soft RTC les meilleures métriques de douceur de commande parmi les politiques testées. L'enjeu pour la robotique industrielle est précis : le jerk élevé, c'est l'usure mécanique, les alarmes de sécurité, et l'impossibilité de travailler en cobotique. Les politiques de diffusion pour la manipulation (pi-0 de Physical Intelligence, ACT, Diffusion Policy) ont démontré des capacités de généralisation impressionnantes, mais leur déploiement en temps réel reste contraint par la latence d'inférence, typiquement plusieurs centaines de millisecondes sur GPU embarqué. Hard RTC avait déjà attaqué ce problème ; Soft RTC prouve qu'on peut gagner significativement en douceur de mouvement sans sacrifier ni le taux de succès ni le coût computationnel, les deux variantes conservent un overhead « quasi-naïf » à l'inférence, sans guidance coûteuse au déploiement. Ce résultat contredit l'idée que fluidité et performance sont nécessairement en tension dans les politiques diffusion pour la manipulation. La problématique du délai d'inférence dans les politiques d'action par diffusion est active depuis que ces architectures ont montré leur supériorité en manipulation dextère, notamment avec les travaux de Stanford (Diffusion Policy, 2023) et de Physical Intelligence (pi-0, 2024). Le hard RTC de référence avait établi une baseline robuste mais au prix de transitions sèches entre chunks. Côté acteurs, Physical Intelligence, Unitree, Figure AI et les équipes de Google DeepMind (GR00T, RT-2) travaillent tous sur des politiques à base de diffusion pour leurs humanoïdes et bras manipulateurs. Soft RTC s'inscrit dans la couche d'inférence basse latence de ces systèmes, indépendamment de l'architecture VLA sous-jacente. Aucun partenaire industriel ni timeline de déploiement n'est mentionné, il s'agit d'une contribution de recherche, avec code et niveaux Kinetix publiés, mais sans implémentation industrielle annoncée à ce stade.

RecherchePaper
1 source
Agir face à l'invisible : filtrage collaboratif sans communication pour l'allocation décentralisée de tâches multi-robots
1398arXiv cs.RO 

Agir face à l'invisible : filtrage collaboratif sans communication pour l'allocation décentralisée de tâches multi-robots

Des chercheurs ont présenté sur arXiv (2605.25584) un cadre théorique et algorithmique baptisé Zero-Knowledge MRTA (ZK-MRTA), conçu pour l'allocation de tâches dans des équipes de robots sans aucune communication inter-agent, sans modèle de tâche préalable et sans coordinateur central. Dans ce régime, chaque robot ne dispose que d'une vue partielle et bruitée du flux public des résultats de ses coéquipiers. L'algorithme proposé, SwarmCF, exploite une structure cachée de faible rang (low-rank) qui gouverne l'adéquation entre chaque robot et chaque type de tâche, en appliquant du filtrage collaboratif en ligne, le même principe mathématique que les systèmes de recommandation Netflix ou Spotify. Les expériences montrent que SwarmCF récupère environ 80 % des performances d'un système centralisé avec communication complète, et maintient cet avantage même sous contention de capacité 1 (chaque tâche assignée à un seul robot à la fois). L'enjeu théorique est substantiel: les auteurs prouvent formellement que tout algorithme sans structure est coincé au plancher d'erreur de la moyenne a priori sur les paires (robot, tâche) jamais tentées, tandis que SwarmCF atteint une complexité d'échantillonnage par robot en Theta(d) au lieu de Theta(n), où d est le rang de la structure latente et n le nombre total de tâches, typiquement d est très inférieur à n. Cette séparation est catégorielle, pas un simple facteur constant. Pour les intégrateurs de flottes robotiques (entrepôts AMR, inspection industrielle, agriculture), cela signifie qu'une flotte hétérogène peut s'auto-organiser sur des tâches inédites sans infrastructure de communication, ce qui réduit la complexité système et améliore la résilience aux pannes réseau. Le scaling est positif: la compétence par robot sur les tâches non vues augmente avec la taille de l'équipe. Le problème d'allocation multi-robots (MRTA) est étudié depuis les années 2000, avec des approches classiques comme les enchères distribuées (CBBA), les méthodes à base de marché ou les algorithmes de consensus qui supposent toutes un canal de communication fiable. ZK-MRTA s'attaque au cas extrême opposé, commun dans les déploiements industriels réels (réseaux dégradés, robots hétérogènes sans protocole commun) mais largement ignoré en théorie. Côté concurrence, des travaux récents sur le multi-armed bandit collaboratif ou le federated reinforcement learning adressent des problèmes voisins mais supposent soit une communication périodique, soit un modèle de récompense partagé. La prochaine étape naturelle serait de valider SwarmCF sur des flottes physiques, notamment dans des contextes entrepôts ou de manipulation, où le sim-to-real gap reste la principale inconnue pour les méthodes fondées sur l'observation passive de coéquipiers.

RecherchePaper
1 source
OASIS : alignement espace observation-action par prédiction de trajectoire SE(3) pour la manipulation robotique
1399arXiv cs.RO 

OASIS : alignement espace observation-action par prédiction de trajectoire SE(3) pour la manipulation robotique

Des chercheurs ont soumis sur arXiv (réf. 2505.25829) OASIS, un nouveau modèle de politique visuomotrice pour la manipulation robotique dont le nom complet est "Observation-Action Space Alignment via SE(3) Trajectory Prediction". L'architecture combine un encodeur de features 3D qui fusionne données visuelles, linguistiques et de profondeur métrique, avec un prédicteur de trajectoire dans le groupe SE(3), l'espace mathématique des rotations et translations rigides en trois dimensions. Ce prédicteur génère une trajectoire de l'effecteur terminal dans le référentiel caméra; ses états cachés, supervisés par pose, conditionnent ensuite un décodeur d'actions qui produit des blocs d'actions ("action chunks") géométriquement cohérents. Les auteurs rapportent des expériences en simulation et en conditions réelles sur des tâches de manipulation, surpassant les baselines VLA et WAM sur le taux de succès et la généralisation hors-distribution. Aucun chiffre absolu n'est fourni dans l'abstract, ce qui invite à attendre la lecture complète du papier avant toute conclusion quantitative. Le problème visé est structurel dans les modèles VLA actuels : leurs représentations intermédiaires restent dans l'espace d'observation (pixels, tokens) alors que la manipulation exige une géométrie de corps rigide. Forcer le décodeur à récupérer cette géométrie implicitement introduit un biais que les auteurs considèrent coûteux en données et en robustesse. L'alignement explicite via SE(3) est une piste sérieuse, et l'amélioration annoncée sur la généralisation hors-distribution est la métrique la plus pertinente pour les intégrateurs industriels, pour qui re-collecter des données à chaque nouvelle variante de tâche est prohibitif. Si les résultats se confirment à la lecture complète, OASIS apporte un argument concret au débat sur la bonne inductive bias à injecter dans les VLA. Le champ des VLA a été structuré ces dix-huit mois par Pi-0 (Physical Intelligence), OpenVLA, RoboVLMs, et plus récemment GR00T N2 de NVIDIA, tous cherchant à unifier compréhension linguistique et contrôle moteur fin. Les WAMs ont ajouté la prédiction d'états visuels futurs comme signal auxiliaire. OASIS s'inscrit dans ce second courant en changeant l'espace de prédiction : des pixels vers une trajectoire géométrique explicite en SE(3), un choix qui converge avec des travaux antérieurs comme SE(3)-DiffusionFields ou EquiBot. L'URL du projet (npuhandsome.github.io) suggère une affiliation avec la Northwestern Polytechnical University de Xi'an, laboratoire actif en robotique et apprentissage. Le papier est un preprint non encore évalué par les pairs; les démonstrations vidéo sur la page projet sont à interpréter avec la prudence habituelle avant tout déploiement applicatif.

RechercheOpinion
1 source
PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot
1400arXiv cs.RO 

PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot

Des chercheurs ont publié PACT (Proactive Asking for Continual Task Assistance), un framework de collaboration humain-robot sur la durée, soumis sur arXiv en mai 2026 (arXiv:2605.24350). Le problème posé est concret : un assistant robotique déployé sur plusieurs jours ignore initialement les habitudes et préférences de son utilisateur, rendant l'inférence passive peu fiable dès les premières interactions. PACT propose une logique "ask-or-act" : plutôt que d'agir sans certitude, le robot décide à chaque instant s'il doit demander une clarification ou exécuter directement la tâche. Le système combine les observations courantes avec un historique d'interactions multi-jours pour évaluer la suffisance contextuelle avant d'agir. L'implémentation principale repose sur du reinforcement learning, et les auteurs introduisent une nouvelle métrique, la "clarification utility", qui mesure le compromis entre précision de l'assistance et fréquence des interruptions imposées à l'utilisateur. Ce framework répond à un déficit structurel des robots d'assistance actuels : en inférant silencieusement, un robot avec un modèle utilisateur incomplet accumule les erreurs et dégrade rapidement la confiance opérationnelle. PACT inverse la logique -- le robot reconnaît son incertitude et l'exprime plutôt que de la masquer. Pour les intégrateurs envisageant des robots en assistance à domicile, en co-robotique de bureau ou en environnement industriel léger, cette approche réduit la nécessité d'une modélisation préalable exhaustive des préférences utilisateur. Les expériences en scénarios multi-jours montrent des gains consistants en précision et en utilité des clarifications face aux baselines d'inférence passive, bien que la validation sur plateforme matérielle réelle reste à démontrer. Le défi de l'adaptation continue en collaboration humain-robot est partagé par plusieurs axes de recherche actifs, dont les benchmarks domestiques ALFRED et les travaux de personnalisation menés chez Figure, 1X ou Boston Dynamics pour leurs robots humanoïdes. Des équipes européennes -- INRIA, TU Delft -- explorent également ces mécanismes d'apprentissage en contexte prolongé. PACT se distingue en traitant l'incertitude épistémique par le dialogue explicite plutôt que par des mécanismes d'inférence silencieux, une approche complémentaire aux méthodes VLA (Vision-Language-Action) actuellement dominantes. La publication reste un preprint sans validation industrielle annoncée ; l'étape critique sera de quantifier le coût cognitif réel des clarifications répétées pour l'utilisateur dans des contextes de travail prolongés.

UEDes équipes européennes dont l'INRIA (France) et TU Delft (Pays-Bas) travaillent sur des mécanismes similaires d'apprentissage contextuel prolongé, ce qui positionne PACT comme référence pertinente pour la communauté HRI européenne, sans impact industriel direct à ce stade.

RecherchePaper
1 source