Aller au contenu principal

Dossier arXiv cs.RO — page 32

2504 articles · page 32 sur 51

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

Modélisation par réseau de Petri et ordonnancement sans interblocage pour systèmes AGV hétérogènes attachables
1551arXiv cs.RO IndustrielPaper

Modélisation par réseau de Petri et ordonnancement sans interblocage pour systèmes AGV hétérogènes attachables

Une équipe de chercheurs a publié sur arXiv (identifiant 2508.00724) un cadre de planification sans interblocage pour des systèmes de véhicules autoguidés (AGV) hétérogènes et attachables, où des unités "porteuses" (carriers) et des "navettes" (shuttles) peuvent s'accoupler physiquement pour accomplir des tâches coopératives avant de se séparer à la demande. Ce mode d'opération introduit une difficulté computationnelle sévère : la synchronisation imposée par les couplages physiques rend la flotte fortement interdépendante et vulnérable aux interblocages (deadlocks), situations où aucun véhicule ne peut progresser parce que chacun attend qu'un autre se déplace. Pour y répondre, les auteurs proposent un modèle en réseau de Petri intégré dans un algorithme de recherche adaptative à grand voisinage (ALNS), capable de transformer des permutations statiques de tâches en processus collaboratifs dynamiques et de prévenir proactivement les interblocages par analyse structurelle. L'intérêt industriel de ce travail tient à la combinaison de deux verrous : la planification de flottes hétérogènes (où les AGV ne sont pas interchangeables) et la gestion des deadlocks sans exploration exhaustive de l'espace d'états. Les expériences sur instances réelles et synthétiques montrent que l'ALNS proposé surpasse à la fois la politique opérationnelle actuellement déployée sur site, les solveurs exacts, et les métaheuristiques de référence, avec un gain significatif en efficacité computationnelle. Une analyse de sensibilité fournit par ailleurs des recommandations concrètes pour le dimensionnement optimal de la flotte, ce qui rend le cadre potentiellement actionnable pour des décideurs logistiques ou des intégrateurs industriels. Ce travail s'inscrit dans un courant de recherche actif sur la coordination de flottes AMR et AGV hétérogènes, domaine où des acteurs comme Exotec en France (systèmes Skypod) ou Geek+ et Quicktron en Asie proposent des flottes spécialisées mais généralement homogènes. La thèse centrale du papier reste à confronter à des déploiements industriels à grande échelle : les instances "réelles" mentionnées dans le résumé ne sont pas quantifiées en termes de nombre d'AGV ou de volume de tâches traités, ce qui limite la portée immédiate des conclusions. Les extensions naturelles incluent l'intégration de contraintes de recharge, la gestion de topologies dynamiques, et la validation sur des benchmarks standardisés du secteur AMR.

UELe cadre proposé pourrait à terme informer la conception de flottes AGV hétérogènes chez des acteurs européens de la logistique robotisée comme Exotec, dont les systèmes Skypod actuels restent homogènes.

1 source
Politiques de récupération sensibles aux différences pour l'apprentissage par imitation
1552arXiv cs.RO 

Politiques de récupération sensibles aux différences pour l'apprentissage par imitation

Une équipe du Weird Lab de l'Université de Washington publie sur arXiv (arXiv:2606.09758, juin 2026) une méthode appelée DARP (Difference-Aware Retrieval Policies for Imitation Learning), une approche semi-paramétrique d'apprentissage par imitation. Le principe central : plutôt que d'apprendre un mapping global état-action via un réseau de neurones pur (behavior cloning standard), DARP entraîne un modèle à prédire des actions en s'appuyant sur les k plus proches voisins (k-NN) extraits des démonstrations expertes, leurs actions associées, et les vecteurs de distance relative entre les états voisins et l'état requête courant. En reformulant le problème d'imitation en termes de structure de voisinage local plutôt que de mappings directs, la méthode revendique des gains de performance de 15 à 46 % sur behavior cloning standard, mesurés sur des benchmarks de contrôle continu et de manipulation robotique, y compris avec des représentations visuelles haute dimension. L'amplitude de cette fourchette suggère des variations importantes selon les tâches et les domaines évalués. L'intérêt concret de DARP réside dans sa capacité à atténuer le problème de "compounding errors" : lors du déploiement, un agent entraîné par behavior cloning accumule des erreurs en rencontrant des états hors distribution, dégradant rapidement les performances. En réutilisant les données d'entraînement au moment de l'inférence, DARP introduit une forme de mémoire épisodique sans nécessiter de collecte de données supplémentaires, de feedback expert en ligne, ni de connaissance spécifique à la tâche. C'est là la distinction clé vis-à-vis de méthodes comme DAgger (Ross et Bagnell, 2011), qui résolvent la distribution shift mais exigent des requêtes à l'expert pendant l'entraînement, une contrainte souvent rédhibitoire en robotique industrielle réelle. Le behavior cloning reste une méthode de référence pour son absence de contraintes opérationnelles, mais sa fragilité face à la distribution shift en limite la portée pour des déploiements à grande échelle. DARP s'inscrit dans un courant de méthodes semi-paramétriques qui connaît un regain d'intérêt avec la montée des politiques génératives : l'idée de conserver explicitement une mémoire des démonstrations plutôt que de tout comprimer dans des poids de réseau est cohérente avec les architectures hybrides actuelles, comme les VLA Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les résultats sur représentations visuelles haute dimension ouvrent la voie à des applications sur des manipulateurs avec vision RGB, domaine où les approches purement paramétriques montrent encore des limites significatives. Le code et les démonstrations sont disponibles publiquement via le site des auteurs.

RecherchePaper
1 source
Planification et commande de mouvement sûres par polytopes imbriqués et fonctions de barrière de contrôle
1553arXiv cs.RO 

Planification et commande de mouvement sûres par polytopes imbriqués et fonctions de barrière de contrôle

Des chercheurs présentent dans un preprint arXiv (2606.09719) une méthode de planification de mouvement locale pour robots mobiles autonomes évoluant dans des espaces confinés. L'approche repose sur la représentation polytopique du footprint du robot : modéliser sa géométrie réelle par un polygone convexe plutôt que de la simplifier à un point ou un cercle. La condition de sécurité, le robot doit rester à l'intérieur d'une région libre convexe continuellement mise à jour, est formulée comme un ensemble de contraintes de type Control Barrier Function (CBF) intégrées dans un contrôleur prédictif à modèle (MPC). Les expériences sur matériel embarqué, avec un robot non-holonome équipé de LiDAR et de grilles d'occupation, valident le système à 10 Hz en temps réel, avec évitement réactif d'obstacles dynamiques. L'analyse comparative affiche une réduction du temps de calcul pouvant atteindre 91x face à une formulation classique basée sur la détection d'obstacles, lorsque la densité de l'environnement augmente. L'intérêt pour les intégrateurs de systèmes AMR tient à deux propriétés distinctes. Le nombre de contraintes de sécurité dépend uniquement de la complexité géométrique locale et de la forme du robot, pas du nombre d'obstacles, ce qui garantit une tenue en temps réel dans des environnements denses. Par ailleurs, l'absence de nécessité de détecter ou segmenter les obstacles individuellement simplifie le pipeline de perception. La validation sur hardware, et pas seulement en simulation, place ce travail au-delà d'un résultat purement théorique, même si la montée en charge vers des environnements industriels à grande échelle reste à démontrer. La fréquence de 10 Hz sur ordinateur embarqué est un indicateur crédible de déployabilité réelle. Les approches classiques de navigation sûre pour robots à empreinte non-triviale recourent soit à des simplifications conservatives, soit à des formulations obstacle-par-obstacle dont le coût de calcul croît avec la densité de la scène, un problème bien documenté dans les entrepôts opérés par des acteurs comme Exotec ou dans la navigation maritime autonome. Les CBF appliqués à la planification en espace libre s'inscrivent dans une tendance croissante aux côtés de méthodes comme MPPI ou les planificateurs basés sur des tubes de sécurité. Ce preprint n'a pas encore été soumis à révision par les pairs, mais la démonstration embarquée sur robot réel constitue un signal d'applicabilité sérieux pour les équipes R&D robotique cherchant à naviguer dans des couloirs étroits sans surestimer les marges de sécurité.

UELes équipes R&D d'intégrateurs AMR européens (dont Exotec en France) pourraient bénéficier de cette méthode pour améliorer la navigation en environnements confinés sans surcoût computationnel, mais le travail reste un preprint non encore validé par les pairs.

RecherchePaper
1 source
ReCoVLA : un système de récompense guidé par VLM pour la récupération d'échecs dans les politiques VLA
1554arXiv cs.RO 

ReCoVLA : un système de récompense guidé par VLM pour la récupération d'échecs dans les politiques VLA

ReCoVLA (Reward Compilation for VLA recovery) est un framework de récupération d'erreurs présenté dans un preprint arXiv publié le 9 juin 2026, conçu pour pallier la fragilité des politiques VLA (Vision-Language-Action) face aux états hors-nominal. Le principe : maintenir une politique VLA pré-entraînée gelée (frozen), déléguer à un modèle vision-langage externe (VLM) l'inférence du mode de défaillance et du stade de récupération, puis compiler une récompense structurée pour entraîner une politique résiduelle corrective en simulation. Cette politique résiduelle est ensuite déployée en zéro-shot sur robot réel sans réentraînement. Sur des tâches de manipulation couvrant des horizons courts, longs et des contacts riches, ReCoVLA fait passer le taux de succès moyen de 36,7 % (baseline π0.5 fine-tuné) à 66,7 % en simulation, et atteint 61,7 % en déploiement physique zéro-shot sim-to-réel. L'apport conceptuel central est de ne pas utiliser le VLM pour générer des actions ou des récompenses directement, mais comme un sélecteur sémantique de récompenses : il prédit un descripteur de récupération et un masque de récompense parmi des composants prédéfinis liés à la tâche. Cette séparation entre compréhension sémantique de haut niveau et contrôle correctif de bas niveau adresse un angle mort bien documenté des architectures VLA actuelles : elles offrent de bons priors pour la manipulation conditionnée au langage, mais s'effondrent dès qu'elles rencontrent un état non prévu à l'entraînement. Le framework se veut agnostique à la politique VLA sous-jacente, ce qui le rendrait compatible avec différents modèles de base. Le travail s'inscrit dans une compétition intense autour des politiques génératives pour la manipulation robotique. Des modèles comme π0 et π0.5 (Physical Intelligence), RT-2 (Google DeepMind) ou OpenVLA ont démontré la faisabilité des VLA à grande échelle, mais la robustesse aux défaillances reste un problème ouvert. ReCoVLA propose une réponse modulaire qui n'exige pas de réentraîner la politique de base, ce qui réduit théoriquement les coûts d'adaptation. Il convient toutefois de noter que ce preprint ne fait pas état d'un déploiement industriel : les expériences physiques restent en contexte laboratoire, avec un périmètre de tâches limité. Les prochaines étapes naturelles concernent la généralisation à d'autres architectures VLA et l'évaluation sur des chaînes causales plus longues.

RechercheOpinion
1 source
Objectifs définis par ensembles, pas par états : des buts de robots interrogeables via le réétiquetage rétrospectif par ensemble d'objectifs
1555arXiv cs.RO 

Objectifs définis par ensembles, pas par états : des buts de robots interrogeables via le réétiquetage rétrospectif par ensemble d'objectifs

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (référence 2606.09476) une méthode baptisée Goal-Set Hindsight Relabeling (GS-HER), qui reformule le problème du ré-étiquetage a posteriori en apprentissage robot hors-ligne. Là où la technique standard HER (Hindsight Experience Replay) convertit chaque état final atteint en objectif singleton exact, GS-HER opère au niveau des prédicats : une requête binaire spécifie quelles variables de l'état définissent le succès, transformant le critère d'objectif en paramètre configurable à l'inférence plutôt qu'en constante d'entraînement. Le système a été évalué sur les benchmarks OGBench avec cinq algorithmes d'apprentissage offline orientés objectifs (GCRL), et améliore les performances sur l'ensemble des configurations testées lorsque les objectifs en pleine dimension sont pénalisés par des variables parasites -- les "nuisance dimensions" -- qui n'ont aucun impact sur le succès réel de la tâche. L'intérêt de GS-HER pour un intégrateur ou un déploiement industriel tient dans sa modularité : un unique checkpoint entraîné peut répondre à plusieurs définitions d'objectifs sans nécessiter de ré-entraînement. Concrètement, une même politique apprise peut être interrogée différemment selon le contexte opérationnel, en modifiant uniquement la requête à l'inférence. La méthode adresse aussi une limite bien connue du GCRL offline : dans les tâches réelles, la définition exacte d'un état-but final est souvent impossible à spécifier sans introduire de contraintes artificielles. GS-HER relaxe cette sur-contrainte en ne demandant au robot de vérifier que les dimensions effectivement pertinentes au succès, ce qui rapproche la formulation théorique de la réalité opérationnelle. HER a été introduit par Andrychowicz et al. (OpenAI) en 2017 et est devenu l'une des pierres angulaires du GCRL, notamment pour la manipulation robotique. Des variantes ont depuis émergé pour gérer les trajectoires sous-optimales et les objectifs bruités, mais peu s'attaquaient à la sur-contrainte dimensionnelle. GS-HER se positionne comme une couche de généralisation compatible avec les algorithmes GCRL existants, ce qui limite la friction d'adoption. La limite principale à ce stade : les résultats sont exclusivement issus de simulations (OGBench), sans validation sur hardware réel -- l'écart sim-to-real reste donc à démontrer. Aucun acteur européen n'est impliqué dans la publication selon les informations disponibles.

RecherchePaper
1 source
Q-VGM : un guidage par gradient de valeur pour les politiques VLA à flux normalisants
1556arXiv cs.RO 

Q-VGM : un guidage par gradient de valeur pour les politiques VLA à flux normalisants

Une équipe de chercheurs propose Q-VGM (Q-Guided Value-Gradient Matching), une méthode d'apprentissage par renforcement hors-politique conçue pour affiner les politiques VLA (Vision-Language-Action) reposant sur le flow-matching. Partant de pi0.5, le modèle VLA de Physical Intelligence, comme initialisation few-shot, la méthode améliore les taux de réussite sur trois environnements : sur le benchmark LIBERO, le taux de succès passe de 75,0 % à 92,5 % ; sur RoboTwin 2.0, de 76,4 % à 87,2 % ; sur deux tâches de manipulation réelles en environnement tabletop, de 40,0 % à 67,5 %. Ces gains sont obtenus sans supervision experte supplémentaire, à partir de données d'expérience auto-générées par le robot (rollouts). L'étude est disponible en preprint sur arXiv (2606.08015) et n'a pas encore été soumise à évaluation par les pairs à la date de publication. Le verrou que Q-VGM résout est l'un des obstacles les plus tenaces du fine-tuning RL pour les VLA de type flow-matching : propager les gradients d'une fonction de valeur (Q-function) à travers le processus de débruitage itératif est numériquement instable à grande échelle, tandis que les méthodes de policy-gradient exigent des vraisemblances d'actions indisponibles sous débruitage itératif. Q-VGM contourne ces deux contraintes via VGG-Flow, un cadre théorique qui convertit le gradient de valeur en un champ de guidage appliqué pendant le débruitage, sans rétropropagation end-to-end ni calcul de vraisemblance explicite. Pour un intégrateur ou une équipe robotique, le paradigme est directement opérationnel : quelques démonstrations pour amorcer la politique (few-shot SFT), puis amélioration continue à partir de l'expérience propre du système. La progression de 40 % à 67,5 % sur robot réel est encourageante, bien que les conditions expérimentales restent circonscrites à deux tâches tabletop contrôlées. Physical Intelligence a lancé pi0 fin 2024, puis pi0.5, des architectures VLA fondées sur le flow-matching devenues un point de référence pour la manipulation généraliste. Q-VGM s'inscrit dans un courant de recherche actif visant à greffer l'apprentissage par renforcement sur ces fondations pré-entraînées, en concurrence avec des approches comme OpenVLA-OFT ou les adaptations RLVR appliquées aux VLA. LIBERO et RoboTwin 2.0 sont des benchmarks standards de manipulation simulée, ce qui rend les comparaisons reproductibles mais soulève la question classique du transfert en conditions réelles non supervisées. La prochaine étape pour ce type de méthode sera de démontrer la robustesse sur des plateformes robotiques variées et dans des environnements moins contrôlés.

RechercheOpinion
1 source
MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)
1557arXiv cs.RO 

MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.09827, juin 2026) MemoryVLA++, un framework de modélisation temporelle pour modèles VLA (Vision-Language-Action). L'architecture combine trois composants : une mémoire de travail construite à partir des tokens perceptifs et cognitifs générés par un VLM pré-entraîné sur l'observation courante ; une banque mémoire Perceptual-Cognitive qui indexe contexte sémantique et détails bas niveau des interactions passées via un mécanisme de consolidation sans redondance ; et un modèle du monde simulant des états futurs dans un espace latent de débruitage. Ces latents imaginés, guidés par la mémoire, alimentent un expert d'action à diffusion qui produit des séquences d'actions temporellement cohérentes. Évalué sur cinq benchmarks de simulation (Libero, SimplerEnv, Mikasa-Robo, Calvin, Libero-Plus) et trois catégories de tâches réelles sur trois robots distincts, le système affiche des gains de +9 % sur les tâches générales, +26 % sur les tâches mémoire-dépendantes, et +28 % sur les tâches d'anticipation. Ces résultats adressent une faiblesse structurelle des VLAs actuels (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA), tous limités à l'observation instantanée et incapables de maintenir un contexte opérationnel sur plusieurs étapes. Pour des tâches longue-portée (reprendre une manipulation interrompue, enchaîner des gestes interdépendants), cette limitation est rédhibitoire en environnement industriel réel. Le gain de +26 % sur les tâches mémoire-dépendantes, mesuré hors simulation, est le point le plus solide de la publication : il suggère que l'architecture surmonte partiellement le sim-to-real gap qui affaiblit beaucoup de travaux académiques récents. Pour un intégrateur ou un COO industriel, c'est la différence entre un robot qui réinitialise sa compréhension à chaque step et un qui maintient un contexte cohérent sur l'ensemble de la séquence de manipulation. MemoryVLA++ s'inscrit dans une vague de travaux cherchant à injecter du raisonnement temporel dans les fondations robotiques, face aux architectures VLA portées par Physical Intelligence, NVIDIA et Google DeepMind. L'inspiration est explicitement cognitive : mémoire de travail (buffer court terme), système hippocampique (mémoire épisodique des interactions passées) et simulation mentale d'états futurs, trois mécanismes documentés en neurosciences. L'article reste un preprint non relu par les pairs, et les vidéos de démonstration sur la page projet méritent une lecture critique avant toute conclusion définitive. Les suites naturelles seraient une validation sur bras industriels à 6-7 DOF en environnement non contrôlé et une comparaison rigoureuse avec des approches à mémoire externe de type RAG robotique. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes
1558arXiv cs.RO 

Accélérer et étendre l'apprentissage par renforcement guidé par MPC pour la locomotion et la manipulation humanoïdes

Une équipe de recherche publie sur arXiv (arXiv:2606.05687v1) une méthode hybride MPC-RL pour le contrôle moteur des robots humanoïdes, baptisée MPC-RL. Le principe : intégrer un contrôleur prédictif par modèle (MPC) directement dans la boucle d'entraînement par renforcement (RL), en utilisant les trajectoires générées par le MPC comme signal de récompense basé sur la dynamique centroïdale du robot. La contribution technique centrale est un solveur GPU appelé pi-n-MPC, parallélisé à la fois sur l'horizon temporel et sur les instances de simulation, sans nécessiter de précompilation ni de construction explicite du problème à chaque pas. Les auteurs reportent des validations sur hardware réel, sans préciser les plateformes matérielles ni les cycles de tests. Le code est disponible en open source sur GitHub. L'enjeu industriel derrière ce travail est réel : le RL massif en simulation parallèle (Isaac Gym, Mujoco MJX) est devenu le standard pour entraîner des compétences de locomotion et de manipulation humanoïde, mais y injecter un MPC est historiquement coûteux en temps de construction et en mémoire GPU. Pi-n-MPC contourne ces deux goulots d'étranglement en opérant directement sur des dynamiques variables dans le temps, sans accumuler de mémoire excessive. Si les gains revendiqués se confirment à l'échelle, cela ouvre la voie à des politiques hybrides MPC/RL entraînables sur des clusters GPU standard, sans infrastructure spécialisée. Attention toutefois : le papier s'appuie sur des études comparatives internes et des validations hardware dont les conditions exactes (charges, cycles, environnements) ne sont pas détaillées dans le résumé disponible, ce qui limite l'évaluation externe des performances annoncées. La combinaison MPC-RL n'est pas nouvelle dans la recherche en locomotion : des travaux comme ceux de DeepMind sur le contrôle de quadrupèdes ou les approches whole-body de CMU et ETH Zurich ont exploré des directions similaires. La spécificité ici réside dans l'accent mis sur la scalabilité GPU et l'absence de précompilation, deux verrous pratiques qui freinent l'adoption dans les pipelines d'entraînement industriels. Les acteurs qui déploient activement des humanoïdes en environnement réel, comme Figure AI, Apptronik ou Agility Robotics, travaillent tous à réduire le sim-to-real gap sur la manipulation dextre : une infrastructure d'entraînement MPC-RL plus légère pourrait accélérer leurs cycles d'itération. La prochaine étape naturelle serait une validation sur des plateformes nommées et des tâches de manipulation avec contraintes de contact.

RecherchePaper
1 source
DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils
1559arXiv cs.RO 

DexFuture : ciblage visuomoteur hiérarchique par états futurs pour la manipulation bimanuelle d'outils

Des chercheurs ont publié DexFuture (arXiv:2606.05699), une architecture hiérarchique pour la manipulation bimanuelle dextre avec des outils. Le système se décompose en deux niveaux : un prédicteur de cibles visuomotrices futures (Future-State Visuomotor Target Predictor) en haute couche, et une politique d'exécution bas niveau conditionnée sur ces cibles (Target-Conditioned Structured Dexterous Policy). Le prédicteur exploite un flux RGB égocentrique, des données proprioceptives et un historique géométrique pour générer une trajectoire multi-étape via un transformeur conditionné sur l'horizon temporel ; le module d'exécution suit ensuite ces cibles articulation par articulation (per-link) à 60 Hz. Sur le benchmark OakInk2 de tâches bimanuelles avec outils, DexFuture atteint 90 % des performances d'un oracle disposant d'états privilégiés (informations inaccessibles en déploiement réel), contre seulement 7 % pour une politique sans référence future, et s'exécute environ 250 fois plus vite que les approches de planification CEM de type DexWM. Ce résultat est notable car il s'attaque à l'un des verrous fondamentaux de la robotique dextre : comment générer une référence future dynamiquement cohérente sans s'appuyer sur des états privilégiés issus de démonstrations humaines, et sans planification contrefactuelle lente sur des séquences d'actions à haute dimension. L'écart de performance entre la politique sans référence (7 %) et DexFuture (90 %) illustre à quel point le conditionnement sur un horizon temporel est déterminant pour la manipulation fine à deux mains. Pour les intégrateurs et décideurs B2B, l'exécution à 60 Hz est compatible avec du contrôle temps-réel sur hardware standard, là où les approches CEM nécessitaient des cycles bien trop longs pour un déploiement industriel. La séparation explicite entre prédiction sémantique lente (long horizon) et exécution haute fréquence (bas niveau) est une architecture qui se répand dans la robotique de précision, et DexFuture en fournit une validation quantitative significative sur benchmark public. Le benchmark OakInk2 est une référence académique établie pour évaluer la manipulation d'outils à deux mains avec des mains anthropomorphes, couvrant des tâches réalistes de préhension, transfert et utilisation d'outils courants. Le champ des politiques visuomotrices pour mains dextres est en pleine effervescence : DexWM (world models pour la dextérité), Pi-0 de Physical Intelligence, et les approches VLA (Vision-Language-Action) de Google DeepMind et Figure AI poussent la généralisation vers des niveaux inédits. DexFuture se distingue en ciblant la cohérence dynamique de la trajectoire future sans supervision privilégiée, une contrainte plus réaliste que les méthodes supposant un accès complet à l'état du système. L'article n'annonce ni déploiement physique ni timeline commerciale : il s'agit d'un résultat de recherche fondamentale validé en simulation et sur données de démonstration. Les étapes naturelles seraient le passage à des mains physiques (sim-to-real), l'extension à des outils non vus à l'entraînement, et l'intégration dans des pipelines VLA pour des tâches de longue durée.

RecherchePaper
1 source
VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique
1560arXiv cs.RO 

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique

Des chercheurs ont publié sur arXiv (identifiant 2606.05395) un framework nommé VASO, pour "Verification-guided Self-evolution of LLM-generated robot skill contracts", qui vise à rendre les compétences robotiques générées par des grands modèles de langage à la fois réutilisables et formellement vérifiables. L'idée centrale : chaque compétence n'est plus un simple script exécutable mais un contrat sémantique à double interface, une interface formelle qui aligne états du robot, observations et commandes de contrôle avec des propositions logiques pour le model checking, et une interface orientée planificateur qui guide la génération de comportements exécutables. Lorsqu'un plan généré échoue à la vérification, VASO traduit la trace de contre-exemple en un gradient textuel qui met à jour le contrat de compétence réutilisable, sans toucher aux poids du modèle de fondation. Sur des plateformes Clearpath Jackal et PX4 (quadrocoptère), le framework atteint 97,2 % de conformité aux spécifications temporelles formelles en moins de 100 échantillons d'optimisation, surpassant les baselines de feedback d'exécution, d'optimisation de prompt et de fine-tuning. Le problème adressé est précis et rarement traité : les boucles d'évolution de compétences existantes, retour d'exécution, tests unitaires, récompenses d'environnement, auto-critique LLM, ne fournissent que des preuves au niveau de la trace. Elles montrent qu'une compétence a fonctionné sur des exécutions échantillonnées, pas qu'elle satisfait des contrats de sécurité temporelle dans des conditions non testées. Pour un intégrateur ou un COO industriel, c'est la différence entre une démo convaincante en lab et un déploiement certifiable en production. Le fait que VASO maintienne les poids du modèle gelés est également notable sur le plan économique : pas de fine-tuning, pas de GPU dédié à la mise à jour du modèle. Ce travail s'inscrit dans la tendance des "physical AI agents" où les LLM orchestrent des comportements robotiques à long horizon depuis des instructions en langage naturel. Les compétences réutilisables sont devenues les unités de base de ces architectures, mais leur fiabilité formelle reste un angle mort notable. Des approches concurrentes comme les VLA (Vision-Language-Action models) ou les frameworks d'optimisation de prompts comme OPRO ne ferment pas cette boucle vérification-évolution. VASO affirme être le premier à le faire explicitement. Il s'agit néanmoins d'un preprint sans validation industrielle publiée, et les résultats obtenus sur deux plateformes relativement simples devront être confirmés sur des environnements plus complexes et des chaînes de compétences plus longues avant d'envisager un déploiement en conditions réelles.

RecherchePaper
1 source
WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée
1561arXiv cs.RO 

WAM-Nav : modélisation monde-action asymétrique en espace latent pour la navigation visuelle unifiée

Des chercheurs ont publié WAM-Nav (Latent World-Action Model for Navigation), un système de navigation visuelle incarnée qui couple la génération d'actions et la prévision visuelle dans un seul modèle, déposé sur arXiv en juin 2026 (réf. 2606.04907). L'architecture repose sur un Diffusion Transformer partagé qui effectue une diffusion jointe asymétrique : il génère simultanément des actions à long horizon et une anticipation visuelle à court horizon, sans recourir aux rollouts autorégressifs multi-étapes qui alourdissent la latence d'inférence. Un mécanisme de conditionnement contextuel à double flux intègre l'historique d'ego-motion à l'échelle de l'épisode et les observations visuelles séquentielles, favorisant des trajectoires lisses et cohérentes. Un module d'alignement d'objectif unifié permet à WAM-Nav de gérer trois modes dans une seule politique : Image-Goal, Point-Goal et exploration libre (No-Goal). Sur les benchmarks ClutterScenes et InternScenes, le système améliore les taux de réussite de 15,7 % en Image-Goal et de 3,3 % en Point-Goal. En déploiement réel, WAM-Nav atteint 85 % de taux de succès moyen sur des environnements intérieurs et extérieurs variés, sans fine-tuning, soit un transfert sim-to-real zéro-shot. Ce résultat intéresse directement les intégrateurs de robotique mobile pour deux raisons concrètes. D'abord, la résolution simultanée de l'action et de l'imagination visuelle dans un seul réseau réduit l'accumulation d'erreurs typique des architectures modulaires, où le prédicteur de scène et le module de politique sont entraînés séparément et se propagent mutuellement leurs erreurs. Ensuite, un taux de 85 % en zéro-shot sur des environnements variés représente un indicateur sérieux, même si les conditions de test (densité d'obstacles, vitesses, types de sols) ne sont pas détaillées dans le résumé et méritent d'être examinées dans le papier complet. Pour un COO ou un décideur B2B, cette architecture suggère des robots de navigation capables de s'adapter à de nouveaux scénarios sans collecte de données coûteuse sur site. Le sim-to-real gap reste l'un des blocages majeurs de la robotique mobile autonome depuis des années : les politiques entraînées en simulation échouent souvent au contact du monde réel en raison des différences de rendu, de dynamique et de bruit des capteurs. WAM-Nav s'inscrit dans une vague de travaux qui combinent modèles de diffusion pour la génération d'actions et représentations latentes du monde, dans la lignée des World Models de type RSSM ou des VLA comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA. Sur le plan concurrentiel, des approches comme NoMaD, ViNT ou les stacks Nav2/ROS 2 restent des références opérationnelles sur AMR commerciaux, et WAM-Nav devra être comparé à ces systèmes dans des conditions contrôlées identiques pour confirmer sa supériorité pratique. L'étape suivante naturelle serait une validation sur des plateformes matérielles réelles en conditions industrielles, dont aucun partenariat ni timeline n'est annoncé à ce stade.

RecherchePaper
1 source
MineXplore : un benchmark d'exploration open-source par apprentissage par renforcement pour environnements souterrains sans GNSS
1562arXiv cs.RO 

MineXplore : un benchmark d'exploration open-source par apprentissage par renforcement pour environnements souterrains sans GNSS

Des chercheurs ont publié MineXplore, un benchmark open-source basé sur MuJoCo pour entraîner des agents d'exploration autonome dans des mines souterraines en environnement GNSS-dénié. L'environnement reconstitue un réseau de tunnels de 104 423 m² à partir du relevé d'une mine de cuivre chilienne (dataset Leung et al., 2017), via un pipeline en six étapes (contour-to-MJCF) générant des sections de galeries octogonales, une géométrie de parois irrégulières issue de données LiDAR, trois zones de friction au sol distinctes, une inclinaison globale de 5 degrés et un éclairage ponctuel périodique. La fidélité géométrique est validée à un IoU de 0,9538 par rapport à la carte de relevé source, et la similarité de texture de surface atteint 79,4 % sur six dimensions structurelles. Un agent PPO entraîné via RLlib sur cinq graines aléatoires indépendantes atteint une couverture roulante maximale de 88,89 %, trois des cinq runs franchissant le seuil cible de 90 %. L'apport principal est de combler un vide concret dans l'écosystème open-source : aucun benchmark compatible avec les pipelines d'apprentissage accélérés par GPU n'existait pour des environnements miniers souterrains à géométrie réaliste. Les mines constituent des cas extrêmes pour la navigation autonome, sans GNSS, éclairage dégradé, topologie en boucle non convexe, qui mettent en défaut les approches développées en terrain ouvert. La reproductibilité des résultats sur cinq seeds indépendantes valide la stabilité du benchmark pour des comparaisons inter-méthodes rigoureuses, un critère essentiel pour les publications futures. Pour les équipes développant des robots d'inspection ou de cartographie minière, MineXplore réduit le sim-to-real gap dans des environnements où les tests terrain sont coûteux, longs à organiser et potentiellement dangereux. Le benchmark s'ancre dans des données de terrain réelles plutôt qu'une géométrie synthétique, ce qui lui confère une crédibilité sectorielle plus solide que les environnements procéduraux courants. La communauté avait déjà travaillé le problème souterrain via le challenge DARPA SubT (2019-2021), qui a produit des résultats notables avec des plateformes comme Boston Dynamics Spot ou ANYbotics ANYmal, mais favorisait les architectures modulaires classiques. MineXplore occupe un espace complémentaire, centré explicitement sur l'apprentissage par renforcement et les politiques end-to-end. Les extensions naturelles concernent les scénarios multi-agents, les capteurs additionnels (RGB, thermique) et des topologies de mines plus variées. Le code est disponible publiquement sur arXiv, ce qui devrait accélérer les contributions de la communauté autour de la robotique en milieu confiné.

RecherchePaper
1 source
Flow matching guidé par le potentiel pour l'amélioration des politiques VLA
1563arXiv cs.RO 

Flow matching guidé par le potentiel pour l'amélioration des politiques VLA

Des chercheurs ont publié le 5 juin 2026 sur arXiv (2606.04968) une méthode baptisée ForesightFlow, conçue pour améliorer les politiques de type vision-langage-action (VLA) sans recourir à un critique externe. Le problème de départ est concret : lorsqu'un robot déploie une politique VLA entraînée par imitation, il génère inévitablement des trajectoires de qualité variable, succès complets, récupérations partielles, erreurs rattrapables, échecs francs. L'imitation comportementale classique reproduit les erreurs, le filtrage par seuil de qualité écarte des sous-trajectoires pourtant exploitables, et le renforcement offline ajoute un critique séparé coûteux. ForesightFlow contourne ces trois écueils en augmentant chaque chunk d'actions généré d'une trajectoire de potentiel de succès apprise conjointement. Le même réseau de flow matching propose et note les actions candidates, permettant une inférence de type best-of-K sans module additionnel. Sur cinq tâches de simulation BEHAVIOR-1K et cinq tâches réelles bimanipulation, la méthode dépasse les baselines d'imitation, égale le meilleur baseline avec critique séparé en simulation, améliore le taux de succès en conditions réelles et réduit le coût d'entraînement de 38 %. L'apport industriel le plus direct est cette réduction de 38 % des ressources de calcul à performance comparable, un argument budgétaire non négligeable pour les labos qui entraînent des modèles VLA de grande taille. Plus fondamentalement, ForesightFlow montre qu'il est possible de valoriser les données de déploiement imparfaites sans jeter les mauvais épisodes ni payer le coût d'un critic offline. La clé technique est un "decoupled advantage-weighted flow matching" : les poids d'avantage exponentié s'appliquent uniquement aux vitesses d'action, tandis que les vitesses de potentiel sont entraînées uniformément, évitant ce que les auteurs appellent la "value hallucination". Un estimateur de frontière en un seul pas forward (stop-gradient) rend le calcul des avantages suffisamment léger pour être intégré dans la boucle d'entraînement. Ce travail s'inscrit dans une vague de recherche dense autour des VLA pour la manipulation robotique, où Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA ont établi les références récentes en termes d'architectures génératives. Le recours au flow matching, alternative à la diffusion, plus rapide à l'inférence, pour la politique robotique est une tendance émergente depuis 2024. ForesightFlow est à ce stade une contribution académique, pas un produit ou un déploiement annoncé ; aucun partenariat industriel ni timeline commerciale n'est mentionné. Les prochaines étapes naturelles seraient la validation sur des benchmarks plus larges type LIBERO ou RLBench, et l'intégration dans des pipelines VLA à plus grande échelle comme ceux entraînés sur Open-X Embodiment.

RechercheOpinion
1 source
Génération de mouvements extrêmes par contrôle hybride en espace nul pour le suivi de trajectoire en ligne droite
1564arXiv cs.RO 

Génération de mouvements extrêmes par contrôle hybride en espace nul pour le suivi de trajectoire en ligne droite

Des chercheurs présentent dans un preprint arXiv (2606.03390) une méthode baptisée "extreme motion generation" qui vise à maximiser la longueur du chemin cartésien parcouru par un manipulateur à base fixe sur une trajectoire rectiligne prédéfinie. L'objectif concret : pousser un bras robotique jusqu'aux limites de son espace de travail sans déclencher les butées articulaires, ce qui est critique pour des applications continues comme le revêtement de surface ou le soudage. Le système a été évalué sur 10 000 tâches de suivi de chemin en ligne droite avec un Franka FR3 à 7 degrés de liberté. Résultat : une augmentation de 27 % de la longueur moyenne de trajectoire par rapport à une baseline entièrement basée sur un contrôleur modèle, avec des gains bien supérieurs sur les cas extrêmes. L'intérêt technique réside dans l'architecture hybride proposée. Un contrôleur par apprentissage par renforcement (RL) gère les décisions à long horizon, là où il excelle, tandis qu'un contrôleur modèle classique prend la relève lorsque le manipulateur s'approche des limites articulaires, une zone où la politique RL se dégrade en raison d'une couverture de données insuffisante. La bascule entre les deux modes se fait selon une distance normalisée aux limites articulaires. L'initialisation des configurations articulaires est résolue par un modèle de diffusion conditionnel, qui exploite un prior de mouvement appris pour choisir des configurations de départ favorables. Ce découplage explicite entre prise de décision à long terme (RL) et stabilisation locale (contrôle modèle) est une réponse directe au problème dit du "safety boundary avoidance" dans les trajectoires longues, un problème qui reste mal résolu par les approches purement data-driven. Ce travail s'inscrit dans un corpus croissant autour des contrôleurs hybrides RL+modèle pour la manipulation industrielle, à côté d'approches comme celles de Lux et al. ou des travaux sur le null-space control dans les bras redondants. Il ne s'agit pas ici d'un robot humanoïde ni d'une VLA généraliste, mais d'une contribution ciblée sur les manipulateurs fixes à tâche contrainte, directement pertinente pour les intégrateurs en soudage robotisé ou en peinture automatisée. Le Franka FR3 est un bras de recherche standard à 7 degrés de liberté, ce qui rend les résultats reproductibles mais limite leur généralisation directe à d'autres cinématiques. Les vidéos et le site projet sont accessibles publiquement ; aucun déploiement industriel ni partenariat commercial n'est mentionné dans ce preprint.

UEMéthode directement exploitable sur le Franka FR3 (bras allemand, Franka Robotics GmbH), ce qui la rend pertinente pour les intégrateurs européens en soudage robotisé et revêtement automatisé.

IndustrielPaper
1 source
EaDex : un cadre de manipulation dextérique multi-plateforme à partir de démonstrations à faible coût
1565arXiv cs.RO 

EaDex : un cadre de manipulation dextérique multi-plateforme à partir de démonstrations à faible coût

EaDex, un framework de manipulation dextère multi-corps présenté dans un preprint arXiv (2606.03268, juin 2026), propose d'entraîner des mains robotiques articulées à partir de démonstrations humaines capturées avec une simple caméra RGB-D grand public. Le pipeline repose sur le modèle paramétrique MANO pour reconstruire la géométrie 3D de la main, suivi d'une étape de normalisation et de retargeting cinématique vers différentes morphologies robotiques. Le système a été évalué sur trois mains dextères distinctes et trois catégories de tâches d'ouverture d'objets articulés, couvrant neuf configurations cross-embodiment. Par rapport à une baseline sans mécanisme d'annealing de démonstrations, EaDex affiche une amélioration relative de 55,3 %. Le verrou adressé est structurel pour le secteur: le reinforcement learning pur en manipulation dextère exige une exploration interactive à grande échelle, coûteuse en temps machine et difficile à transférer, tandis que l'imitation learning classique dépend de démonstrations à haute fidélité collectées via des gants haptiques ou des systèmes de motion capture onéreux. EaDex cherche à abaisser ce seuil avec du matériel accessible. Son mécanisme central, l'"annealing dynamique de démonstrations basé sur les récompenses de contact", est notable: il guide l'exploration initiale en s'appuyant sur les trajectoires humaines, puis réduit progressivement cette dépendance à mesure que l'agent accumule des contacts réussis, évitant le sur-ajustement aux trajectoires de référence. Que le même pipeline fonctionne sur trois architectures de main aux cinématiques différentes est le point le plus pertinent pour un intégrateur: cela suggère une généralisation morphologique réelle, pas un résultat ajusté manuellement par configuration. L'approche s'inscrit dans un effort plus large de la communauté pour rendre la collecte de données de manipulation bon marché et scalable, face à des méthodes concurrentes comme DAPG ou DexMimicGen qui requièrent des infrastructures plus lourdes. Le papier n'annonce pas de déploiement industriel ni de partenariat commercial: c'est un résultat de recherche en phase preprint, sans validation sur des objets non-vus ni en conditions réelles non-contrôlées. Les suites naturelles incluront des tests sur des tâches plus complexes (bimanuel, objets déformables) et une comparaison systématique avec des pipelines VLA récents sur des benchmarks standardisés.

IA physiquePaper
1 source
Raisonnement guidé par ontologie pour des explications fondées sur les affordances en navigation robotique
1566arXiv cs.RO 

Raisonnement guidé par ontologie pour des explications fondées sur les affordances en navigation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.00117) une méthode d'explication de la navigation robotique fondée sur le raisonnement ontologique et la théorie des affordances. L'approche construit, en temps réel, une ontologie locale représentant les entités proches du robot avec leurs affordances (ce qu'elles permettent de faire), leurs états possibles, et leurs relations spatiales qualitatives. Face à un obstacle, le système ne se contente pas de détecter le blocage : il évalue des hypothèses de changement d'état -- une porte peut-elle être ouverte, une chaise déplacée -- afin de générer des explications actionnables sur la manière de poursuivre la navigation. L'approche est validée sur un benchmark centré sur un scénario de robot bibliothécaire, avec des cas de navigation générés de manière procédurale. Les résultats montrent que le raisonnement ontologique identifie les facteurs d'explication pertinents avec une précision supérieure à une approche purement sémantique (semantic-only baseline), et reste robuste lorsque la densité d'objets non pertinents augmente -- ce qu'on appelle le semantic clutter, l'un des talons d'Achille des systèmes de navigation en environnement humain réel. Pour un intégrateur déployant des robots dans des espaces partagés (entrepôts mixtes, hôpitaux, bureaux), la capacité à expliquer les décisions de navigation répond à une exigence opérationnelle et réglementaire croissante, notamment sous l'AI Act européen. L'explication n'est pas ici cosmétique : elle est structurellement liée au raisonnement, ce qui la rend vérifiable et auditable par un opérateur humain. L'approche s'inscrit dans le courant de l'IA explicable (XAI) appliquée à la robotique. La théorie des affordances, conceptualisée par le psychologue James Gibson dans les années 1970, connaît un regain d'intérêt depuis l'émergence des vision-language models (VLMs) et des LLMs. Les approches concurrentes incluent les scene graphs sémantiques utilisés par Boston Dynamics et Sanctuary AI, ainsi que les planificateurs fondés sur LLM comme SayCan (Google DeepMind). Par rapport à ces méthodes, l'ontologie locale proposée ici est plus légère et plus explicite formellement, mais reste évaluée sur un benchmark synthétique limité -- le passage à des environnements réels non contrôlés reste à démontrer. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : ce travail est une contribution académique de fond, pas un produit en voie de commercialisation.

UEL'approche répond structurellement aux exigences de l'AI Act pour les systèmes autonomes navigant en environnement humain, en fournissant des explications auditables sur les décisions de navigation, pertinent pour les intégrateurs européens déployant des robots en espaces partagés.

RecherchePaper
1 source
Navigation hiérarchique augmentée par la sémantique : transport optimal et raisonnement par graphes pour la navigation vision-langage
1567arXiv cs.RO 

Navigation hiérarchique augmentée par la sémantique : transport optimal et raisonnement par graphes pour la navigation vision-langage

Une équipe de chercheurs a publié le 2 juin 2026 sur arXiv (identifiant 2606.01565) le cadre HSAN (Hierarchical Semantic-Augmented Navigation), une architecture de navigation pour agents autonomes en environnements 3D intérieurs non contraints, dit VLN-CE (Vision-Language Navigation in Continuous Environments). Le principe : un agent reçoit des instructions en langage naturel ("va jusqu'à la cuisine et tourne à gauche avant la porte") et doit naviguer dans un espace réel sans carte préétablie. HSAN propose trois composants imbriqués : d'abord, un graphe de scène sémantique hiérarchique et dynamique, construit en temps réel à partir de modèles vision-langage, qui représente l'environnement sur trois niveaux (objets, régions, zones) ; ensuite, un planificateur topologique basé sur le transport optimal (dualité de Kantorovich) qui sélectionne des sous-objectifs à long terme en pondérant pertinence sémantique et accessibilité spatiale, avec garanties théoriques d'optimalité ; enfin, une politique de contrôle bas niveau entraînée par apprentissage par renforcement et sensible à la structure du graphe, chargée de la navigation fine et de l'évitement d'obstacles. Les auteurs rapportent des résultats état de l'art sur plusieurs benchmarks VLN-CE standards, sans préciser les métriques exactes dans le résumé disponible. L'intérêt de cette approche tient à la façon dont elle traite le problème des tâches à horizon long, un point de friction majeur des systèmes VLN existants qui perdent le contexte spatial sur des trajectoires de plusieurs dizaines de mètres. En structurant la représentation de l'environnement en graphe multi-niveaux plutôt qu'en carte voxel statique, HSAN permet à l'agent de raisonner sur des concepts spatiaux ("la pièce d'à côté", "le couloir du fond") plutôt que sur des coordonnées brutes. Le planificateur par transport optimal est notable : il évite les heuristiques ad hoc (distance euclidienne, A* classique) en reformulant la sélection de sous-objectifs comme un problème de couplage optimal entre distributions sémantiques, ce qui est théoriquement plus robuste. Pour les intégrateurs de robots de service ou de livraison intérieure, ce type d'architecture facilite potentiellement l'instruction en langage naturel sans cartographie préalable, à condition que le sim-to-real gap soit résolu, ce que le papier n'aborde pas explicitement. La navigation guidée par langage en environnement continu est un champ actif depuis les benchmarks R2R (Room-to-Room, 2018) et VLN-CE (2021, basé sur Matterport3D). Les approches antérieures dominantes combinent généralement des cartes topologiques statiques avec des politiques Transformer (CWP, DUET, GridMM). HSAN s'en distingue en rendant le graphe de scène dynamique et en y couplant le transport optimal, une technique rare dans ce domaine mais bien établie en vision par ordinateur (alignement de nuages de points, correspondance d'images). Aucun acteur industriel ni laboratoire nommé n'est associé à la publication dans le résumé disponible, et il s'agit d'un preprint non encore évalué par les pairs. Les prochaines étapes attendues dans ce type de travaux incluent des expériences sur robots physiques (Boston Dynamics Spot, Fetch, TIAGo) pour valider le transfert simulation-réel.

RechercheOpinion
1 source
Modélisation physique et contrôle des comportements émergents dans les essaims de robots
1568arXiv cs.RO 

Modélisation physique et contrôle des comportements émergents dans les essaims de robots

Des chercheurs ont déposé le 2 juin 2026 sur arXiv (arXiv:2606.01597) un cadre baptisé PhySwarm pour modéliser et contrôler les comportements collectifs émergents d'essaims de robots. L'approche couple un niveau macroscopique, le modèle Macro-ADR (advection-diffusion-réaction multi-phases), qui décrit l'évolution de la densité spatiale de l'essaim au fil des phases comportementales, à un niveau microscopique, le Micro-EDM, qui traduit ces dynamiques en consignes de déplacement individuel via des champs de potentiel et des transitions d'état gérées par seuils. Un contrôleur neuro-physique (NPC), entraîné par un objectif hybride alliant apprentissage par renforcement (RL) et réseaux de neurones physique-informés (PINN), mappe les observations locales et la mémoire temporelle de chaque robot à des paramètres physiques bornés. Les auteurs valident l'approche sur trois missions en preuve de concept : fourragement guidé par piste, navigation avec reconfiguration de formation, et recherche-sauvetage avec réaffectation dynamique des rôles. L'intérêt principal de PhySwarm est l'interprétabilité des comportements émergents. Contrairement aux méthodes purement neurales où les dynamiques collectives restent des boîtes noires, le cadre produit des champs de densité et des paramètres physiques explicites (coefficients d'advection, de diffusion, taux de transition de phase), permettant d'auditer pourquoi un essaim adopte un comportement donné. Pour les intégrateurs et les décideurs industriels, c'est un levier concret : la capacité à décomposer et à certifier un comportement collectif est un prérequis pour déployer des essaims dans des environnements critiques, logistique entrepôt ou intervention d'urgence. La contrainte PINN force aussi l'apprentissage à rester physiquement cohérent, ce qui réduit théoriquement le fossé simulation-réel (sim-to-real gap), même si toutes les expériences présentées restent en simulation et ne constituent pas encore des déploiements terrain. Le contrôle formel d'essaims est un domaine actif depuis les années 1990, mais la modélisation des comportements multi-phases y reste un problème ouvert. Les approches concurrentes vont de la stigmergie bio-inspirée au multi-agent reinforcement learning (MARL) pur, en passant par les formulations de champ moyen (mean-field games). PhySwarm se positionne à l'intersection physique et deep learning, un créneau également exploré par des équipes d'ETH Zurich, MIT CSAIL et Carnegie Mellon. Du côté industriel, des acteurs comme Exotec (France) pour la logistique entrepôt déploient déjà des flottes de robots sans coordination physique-informée formelle ; ce type de cadre pourrait outiller une prochaine génération de systèmes multi-robots à comportements certifiables.

UEImpact prospectif uniquement : le cadre PhySwarm pourrait à terme outiller des acteurs français comme Exotec pour certifier les comportements de leurs flottes multi-robots, mais aucune institution ou entreprise européenne n'est impliquée dans cette recherche.

RecherchePaper
1 source
MiNI-Q : un quadrupède miniature sans fil aux articulations de jambes indépendantes
1569arXiv cs.RO 

MiNI-Q : un quadrupède miniature sans fil aux articulations de jambes indépendantes

Des chercheurs ont publié sur arXiv (ref. 2603.11537) les spécifications et résultats expérimentaux du MiNI-Q², un robot quadrupède miniature sans fil doté de joints de pattes à 2 degrés de liberté (DOF) mécaniquement non limités. Contrairement à la quasi-totalité des robots à pattes actuels, chaque joint peut pivoter librement sur l'intégralité de sa plage angulaire, sans butée mécanique. Le robot se replie à une hauteur minimale de 2,5 cm et atteint une vitesse de déplacement de 0,46 m/s. Les tests expérimentaux documentent des allures oscillatoires et rotatoires, du rampement sous faible garde au sol, de la montée d'escaliers, de la locomotion en position inversée (dos au sol), ainsi que des sauts et des backflips. L'ensemble des fichiers de conception mécanique et électrique est publié en open source. L'absence de butées mécaniques sur les joints est le point saillant de cette conception. Dans les robots à pattes classiques, ces limites restreignent l'espace de travail de la jambe, contraignent la conception des allures et augmentent le risque de dommages matériels en cas de chute ou de contact inattendu. En les supprimant, MiNI-Q² ouvre théoriquement un espace de gait design plus large, notamment pour des comportements de récupération après renversement ou pour des locomotions non conventionnelles comme la rotation continue des membres. À l'échelle miniature, où le câblage interne est une source majeure de défaillances d'assemblage, l'architecture sans fil représente un gain de fiabilité tangible. Pour les équipes de recherche qui travaillent sur le sim-to-real ou l'apprentissage par renforcement sur petits platforms, disposer d'un design open source reproductible avec des contraintes articulaires réduites est un levier concret pour accélérer l'expérimentation. Le MiNI-Q² s'inscrit dans la continuité directe du Q8bot, une plateforme miniature quadrupède développée par la même équipe, dont il reprend et améliore l'architecture sans fil pour en renforcer la robustesse d'assemblage à petite échelle. Dans l'espace des petits quadrupèdes de recherche, les références comparables incluent le Stanford Doggo (open source, ~50 cm), le MIT Mini Cheetah (12 kg) et diverses plateformes académiques type Unitree Go1, mais aucune ne descend à ce niveau de miniaturisation avec des joints non bornés. Le segment des micro-robots quadrupèdes reste majoritairement un terrain de recherche fondamentale, sans déploiement industriel identifié à ce stade. La mise en open source complète du design est la prochaine étape logique pour la communauté: elle permettra de valider la reproductibilité du robot dans d'autres laboratoires, condition préalable à toute adoption plus large comme plateforme d'expérimentation standardisée.

RecherchePaper
1 source
AffordGen : génération de démonstrations variées pour la manipulation d'objets généralisable par correspondance d'affordances
1570arXiv cs.RO 

AffordGen : génération de démonstrations variées pour la manipulation d'objets généralisable par correspondance d'affordances

Des chercheurs présentent AffordGen, un framework conçu pour résoudre l'un des goulets d'étranglement centraux de l'apprentissage par imitation en robotique : la rareté et le manque de diversité géométrique des données d'entraînement. Le système combine des modèles génératifs 3D à grande échelle avec des vision foundation models (VFMs) pour produire automatiquement de nouvelles trajectoires de manipulation. Le mécanisme repose sur la correspondance sémantique de keypoints fonctionnels (les affordances) entre des maillages 3D issus de bibliothèques volumineuses : AffordGen localise les points pertinents (prise, contact, pivot) sur un objet de référence, puis les transpose à de nouvelles géométries pour générer des démonstrations synthétiques variées. Ce dataset affordance-aware entraîne ensuite une politique visuomotrice en boucle fermée qui combine généralisation sémantique et robustesse réactive de l'apprentissage de bout en bout. Des expériences en simulation et dans le monde réel rapportent des taux de réussite élevés et, surtout, une capacité de généralisation zero-shot à des objets réellement inédits lors de l'entraînement. L'enjeu industriel est direct. Collecter manuellement des démonstrations robotiques reste coûteux, lent et difficile à diversifier sur des variantes géométriques d'objets. AffordGen génère cette diversité de façon programmatique, sans requérir de téléopération supplémentaire. La généralisation zero-shot représente un indicateur fort de viabilité en déploiement réel, car les environnements industriels exposent en permanence des objets non anticipés. Le fait que la politique reste en boucle fermée la distingue des approches open-loop souvent fragiles hors laboratoire. Ces résultats renforcent l'hypothèse que le "data gap" de la manipulation peut être partiellement comblé par génération synthétique, à condition que les affordances soient correctement modélisées, ce que les auteurs n'ont toutefois démontré que sur un périmètre de tâches restreint. AffordGen s'inscrit dans un courant de recherche visant à augmenter les données de manipulation sans démonstrations humaines massives, aux côtés de MimicGen (NVIDIA), RoboAgent ou RoboGen. La diffusion policy et ACT (Action Chunking Transformer) ont démontré la puissance de l'imitation learning conditionnée à un volume de données suffisant ; AffordGen attaque précisément ce prérequis amont. Le papier est disponible sur arXiv (arXiv:2604.10579v2, version mise à jour). Les prochaines étapes naturelles concernent la scalabilité sur des tâches de manipulation multi-étapes et l'intégration dans des stacks industrielles telles que celles de 1X Technologies, Boston Dynamics ou Apptronik, qui restent tributaires de la diversité des données pour déployer des politiques robustes hors des environnements contrôlés.

RecherchePaper
1 source
SpaceTools : raisonnement spatial augmenté par des outils via apprentissage par renforcement interactif double
1571arXiv cs.RO 

SpaceTools : raisonnement spatial augmenté par des outils via apprentissage par renforcement interactif double

Une équipe de chercheurs a publié, début juin 2026 sur arXiv, les travaux sur SpaceTools, un modèle de vision-langage (VLM) entraîné à coordonner plusieurs outils de perception spatiale via un nouveau cadre d'apprentissage par renforcement baptisé DIRL (Double Interactive Reinforcement Learning). Le système s'appuie sur des outils standards de perception robotique comme les estimateurs de profondeur, les modèles de segmentation et les estimateurs de pose, que le VLM apprend à orchestrer de manière autonome sans pipeline fixe. La validation expérimentale porte sur trois benchmarks de compréhension spatiale, RoboSpatial-Home, BLINK et BOP-ASK, où SpaceTools atteint l'état de l'art, avec des gains de +12 points de pourcentage sur RoboSpatial par rapport à un fine-tuning supervisé standard (SFT) et +16 points par rapport à un RL mono-outil de référence. Les tests en manipulation réelle ont été conduits sur un bras robotique à 7 degrés de liberté (7-DOF). L'enjeu central adressé par ces travaux est le fossé entre la compréhension visuelle qualitative des VLMs actuels et la précision métrique exigée par les applications embarquées. Les VLMs savent décrire une scène, mais peinent à répondre à des questions du type "à quelle distance exacte se trouve cet objet" ou "quel est l'angle de rotation optimal pour saisir cette pièce", ce qui bloque leur intégration dans des systèmes de manipulation industrielle. DIRL résout ce problème en deux phases : une phase d'enseignement qui combine des démonstrations issues d'un spécialiste mono-outil et des traces générées par un modèle frontier utilisant tous les outils disponibles, suivie d'une phase d'exploration où le modèle affine lui-même la coordination multi-outils par RL interactif. Ce résultat contredit l'hypothèse selon laquelle le multi-tool reasoning via RL serait inaccessible en raison de l'explosion combinatoire de l'espace de recherche. Ces travaux s'inscrivent dans la dynamique plus large d'intégration des VLMs dans la robotique embodied, un axe de recherche en forte croissance depuis les travaux SayCan (Google, 2022) et RT-2 (DeepMind, 2023). Sur le front concurrent, des approches comme ToolkenGPT ou des pipelines handcrafted restent prisonniers de séquences d'outils prédéfinies, tandis que SpaceTools apprend à choisir dynamiquement ses outils. Il s'agit pour l'instant d'un preprint de recherche, sans déploiement industriel annoncé, et les vidéos de manipulation sur le bras 7-DOF restent des démonstrations lab-controlled dont la généralisation en conditions réelles reste à confirmer. Le code et les détails sont accessibles via la page projet spacetools.github.io.

RechercheOpinion
1 source
Politique de diffusion supervisée par ensembles : apprentissage du découpage d'actions par corrections
1572arXiv cs.RO 

Politique de diffusion supervisée par ensembles : apprentissage du découpage d'actions par corrections

Des chercheurs proposent Set-Supervised Diffusion Policy (SDP), un cadre d'entraînement pour politiques de diffusion appliquées à la manipulation robotique, publié en preprint sur arXiv le 2 juin 2026 (arXiv:2606.01865). La méthode exploite les corrections humaines lors du déploiement comme signal d'entraînement contrastif : quand un robot échoue et qu'un opérateur corrige sa trajectoire, le système enregistre à la fois l'action-chunk non désirée du robot et l'action-chunk corrective de l'humain. SDP construit à partir de ces paires un ensemble d'action-chunks désirés, puis entraîne la politique de diffusion à s'aligner sur cet ensemble via une loss contrastive. Des expériences sur plusieurs tâches de manipulation valident l'approche, avec des gains particulièrement nets en robustesse aux données bruitées et en efficacité d'agrégation de données. Le problème visé est fondamental en imitation learning : le distributional shift. Un robot entraîné par behavior cloning sur des démonstrations d'expert sort rapidement du domaine dès le déploiement, ce qui dégrade ses performances et force des interventions humaines répétées. Les pipelines d'agrégation de données de type DAgger ajoutent des démonstrations correctives, mais ignorent le signal négatif, c'est-à-dire les actions erronées du robot lui-même. Résultat : surapprentissage sur les démonstrations de l'enseignant, et besoin croissant de données expertes coûteuses. SDP inverse la logique en intégrant ce signal négatif explicitement dans la fonction de perte, réduisant la dépendance aux démonstrations coûteuses tout en produisant des datasets agrégés de meilleure qualité. Les politiques de diffusion pour la robotique ont émergé comme référence depuis les travaux de Chi et al. (Diffusion Policy, 2023), et l'action chunking a été popularisé par ACT (Zhao et al., 2023). L'apprentissage par correction interactive remonte à DAgger (Ross et al., 2011). Physical Intelligence avec π0, ou des variantes RLHF adaptées à la robotique, explorent des voies proches sans pour autant exploiter explicitement le signal contrastif issu des actions indésirables. SDP se positionne comme une brique modulaire greffable sur des architectures de diffusion existantes : le code est disponible publiquement. Les suites naturelles pointent vers une mise à l'échelle sur des tâches de manipulation longue-durée et des robots mobiles, où le coût de collecte de données expertes est un vrai frein industriel.

RechercheOpinion
1 source
Une théorie cinétique de la propagation d'information par rencontres dans les systèmes multi-robots
1573arXiv cs.RO 

Une théorie cinétique de la propagation d'information par rencontres dans les systèmes multi-robots

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.02296v1) un cadre théorique pour modéliser la propagation d'information dans les essaims de robots mobiles opérant sans connectivité réseau permanente. L'étude aborde le problème via le cas d'usage du suivi de cible (target tracking) : dans ces systèmes, les robots n'échangent des données que lors de rencontres physiques, transformant chaque interaction en un événement de transport d'information. Les auteurs formalisent trois limites structurelles qui gouvernent la performance collective. La première, la limite d'accès, stipule que l'information ne peut coordonner l'équipe que si elle se propage au-delà des robots ayant directement observé la cible. La deuxième, la limite de fraîcheur (staleness), traduit la perte de valeur d'une donnée à mesure que la cible se déplace entre le moment de la collecte et celui de l'utilisation. La troisième, la limite géométrique, correspond au régime de saturation où la vitesse de déplacement de la cible dépasse la capacité de transport d'information du réseau, rendant les améliorations de communication seules sans effet mesurable sur l'erreur de suivi. La validation repose sur des simulations à grande échelle faisant varier la taille de l'équipe, la superficie de la zone d'opération, la portée de communication et la vitesse de la cible. Ce travail apporte une valeur analytique concrète aux concepteurs de systèmes multi-robots déployés dans des environnements dégradés, typiquement la logistique d'entrepôt autonome, la surveillance de périmètre ou les opérations en zone sans infrastructure. La décomposition accès-fraîcheur-géométrie offre aux ingénieurs un outil de diagnostic : avant d'investir dans une augmentation de la portée radio ou de la densité d'agents, il est possible de déterminer quelle limite est effectivement contraignante dans un scénario donné. Le résultat le plus opérationnellement utile est la linéarité locale de la réponse en régime contraint, qui autorise des approximations de conception simples, contrastant avec le comportement non-linéaire observé sur des plages plus larges de paramètres. En pratique, cela signifie qu'un intégrateur AMR ne peut pas simplement extrapoler les performances d'un petit essai pilote à un déploiement à grande échelle sans tenir compte des transitions de régime identifiées ici. Ce papier s'inscrit dans un corpus croissant autour des réseaux robotiques intermittents, un domaine stimulé par les limites des communications sans fil en milieu industriel et la montée en puissance des flottes autonomes hétérogènes. Les approches concurrentes mobilisent généralement soit la théorie des graphes dynamiques (temporal networks), soit les modèles épidémiques pour modéliser la diffusion d'information, tandis que cette contribution emprunte explicitement au formalisme cinétique inspiré de la physique statistique, ce qui en distingue l'angle. Côté acteurs, des laboratoires comme MIT CSAIL, CMU Robotics et ETH Zurich travaillent sur des problématiques connexes de coordination sans infrastructure. En France, des équipes comme celle de l'INRIA sur les systèmes multi-agents embarqués ou les travaux de recherche liés à Exotec sur la coordination de flotte pourraient trouver dans ce cadre des outils théoriques applicables. La prochaine étape naturelle pour ce type de travail est l'intégration dans des boucles de planification de mouvement adaptatives, où la politique de déplacement des robots serait directement optimisée pour maximiser les rencontres informationnellement utiles.

UEDes équipes françaises comme l'INRIA et des industriels comme Exotec pourraient exploiter ce cadre théorique pour dimensionner et diagnostiquer leurs flottes AMR en environnements sans infrastructure réseau permanente, avant de passer à grande échelle.

RecherchePaper
1 source
Actionneur élastique non linéaire série-parallèle intégré appliqué au mouvement d'inclinaison d'un simulateur de vélo
1574arXiv cs.RO 

Actionneur élastique non linéaire série-parallèle intégré appliqué au mouvement d'inclinaison d'un simulateur de vélo

Des chercheurs ont publié sur arXiv (ref. 2606.00201) les travaux de conception et de validation expérimentale du SPINEA, Series Parallel Integrated Nonlinear Elastic Actuator, un actionneur mécatronique qui fusionne deux architectures classiques, le SEA (Series Elastic Actuator) et le PEA (Parallel Elastic Actuator), au sein d'un unique élément élastique. Le prototype a été appliqué au mouvement de tangage latéral d'un simulateur haptique de vélo, une application exigeant à la fois des couples élevés et une restitution de force précise pour garantir des interactions réalistes et sûres avec le cycliste. Les essais ont confirmé une bande passante de couple de 4,25 Hz avec le cadre de vélo fixe et de 4 Hz en conditions réelles avec des pilotes en selle. L'intérêt technique du SPINEA réside dans l'économie d'architecture qu'il propose. Les SEA améliorent le contrôle de force en découplant l'impédance moteur via un ressort en série, tandis que les PEA ajoutent un ressort en parallèle pour réduire la puissance moteur nominale sur les tâches à couple élevé. Les approches hybrides existantes requièrent généralement deux éléments élastiques distincts ou un mécanisme d'embrayage, augmentant la masse et la complexité. Ici, une transmission non linéaire avec axes moteur et charge non alignés permet à un seul ressort de jouer les deux rôles simultanément. Pour les intégrateurs en robotique haptique, simulation de conduite ou rééducation, cette compacité est un argument concret : moins de pièces, meilleure densité de couple, faible impédance en boucle ouverte. La demande en actionneurs haute-fidélité haptique est portée par plusieurs marchés convergents : simulateurs industriels, exosquelettes médicaux, membres robotiques. Les architectures SEA ont été popularisées dès les années 1990 par le MIT (Pratt & Williamson), et les PEA ont progressé en parallèle dans la robotique de locomotion. Le SPINEA s'inscrit dans cette filiation mais vise à dépasser le compromis habituel compacité/performance. Aucun déploiement industriel n'est annoncé à ce stade, il s'agit d'un résultat de laboratoire avec prototype fonctionnel. Les auteurs évoquent des applications potentielles dans tout actionneur compact haute-performance, ce qui couvre la robotique collaborative et les assistants physiques, des marchés où des acteurs européens comme Wandercraft (exosquelette de marche) ou Pollen Robotics font également valoir des architectures d'actionnement différenciées.

UELes acteurs européens de l'actionnement haptique et des exosquelettes (Wandercraft, Pollen Robotics) pourraient bénéficier de cette architecture compacte SEA+PEA, mais aucune collaboration ou transfert technologique vers l'Europe n'est annoncé à ce stade.

RecherchePaper
1 source
Hybrid TD3 : analyse du biais de surestimation et optimisation stable des politiques pour les espaces d'actions hybrides
1575arXiv cs.RO 

Hybrid TD3 : analyse du biais de surestimation et optimisation stable des politiques pour les espaces d'actions hybrides

Une équipe de recherche propose Hybrid TD3 (arXiv:2603.01302v2), une extension de Twin Delayed Deep Deterministic Policy Gradient (TD3) pour les espaces d'action hybrides discrets-continus en manipulation robotique. En manipulation, un agent doit simultanément prendre des décisions de haut niveau (quelle action exécuter, domaine discret) et contrôler finement les articulations (domaine continu). Les approches existantes discrétisent les composantes continues ou relaxent les choix discrets en approximations continues, au prix d'une scalabilité limitée et d'une instabilité croissante sous domain randomization en grande dimension. Hybrid TD3 traite nativement les espaces hybrides paramétrés via une analyse théorique formelle du biais de surestimation (overestimation bias), en dérivant des bornes sous architectures twin-critic et en établissant un ordre de biais sur cinq variantes algorithmiques sous hypothèses gaussiennes synchronisées. Les auteurs introduisent une cible Q-learning pondérée avec écrêtage, marginalisant sur la distribution des actions discrètes, qui obtient une réduction de biais équivalente au clipped double Q-learning classique tout en améliorant le lissage de politique. Les résultats expérimentaux montrent une stabilité d'entraînement supérieure et des performances compétitives face aux baselines hybrides de l'état de l'art. Pour les ingénieurs développant des contrôleurs de bras manipulateurs ou des politiques de pick-and-place, l'apport central est un algorithme dont la stabilité est mathématiquement caractérisée plutôt qu'empiriquement espérée. La littérature disposait d'analyses du biais pour les espaces purement discrets (DQN) ou continus (TD3, SAC), mais pas pour leur combinaison paramétrée. Le weighted clipped Q-learning target peut ainsi réduire les comportements erratiques en entraînement sans surcoût computationnel majeur, un point pertinent pour les équipes travaillant sous contrainte de temps de simulation. TD3 a été introduit par Fujimoto et al. en 2018 comme amélioration de DDPG contre le biais de surestimation via un mécanisme twin-critic et des mises à jour retardées. Les espaces d'action hybrides ont depuis été adressés par plusieurs algorithmes, dont P-DQN, HHQN et MAHHQN, utilisés ici comme baselines de comparaison. Hybrid TD3 se distingue par son fondement théorique explicite là où les prédécesseurs restaient largement empiriques. Il s'agit d'un preprint arXiv en version 2, révisé mais sans validation par peer-review, et les expériences semblent conduites exclusivement en simulation. Aucun déploiement sur robot physique ni partenariat industriel n'est mentionné. Une validation sur benchmarks standards tels que Gym-Hybrid ou des environnements MuJoCo avec espaces d'action paramétrés constituerait la prochaine étape attendue par la communauté.

RecherchePaper
1 source
Pied électro-permanent magnétique à haute densité de charge pour robots quadrupèdes grimpeurs
1576arXiv cs.RO 

Pied électro-permanent magnétique à haute densité de charge pour robots quadrupèdes grimpeurs

Des chercheurs ont présenté un pied magnétique électro-permanent à haute densité de charge pour robots quadrupèdes, capable de grimper sur des surfaces ferromagnétiques verticales, inclinées ou au plafond. Le dispositif, appelé CHN-EPM (Circular Halbach-Net Electro-Permanent Magnet), génère une force d'adhérence maximale supérieure à 1 000 N avec un rapport charge/poids dépassant 200:1. Sa structure exploite un circuit magnétique tridimensionnel avec effet de concentration de flux, ce qui crée des chemins de flux parallèles distribués : concrètement, le système maintient une adhérence efficace même en contact partiel avec la surface, et reste relativement insensible aux variations d'entrefer. Un pilote de magnétisation associé à une stratégie de contrôle du courant impulsionnel en deux étapes régule précisément l'amplitude et la durée d'excitation, tandis qu'un capteur de pression flexible intégré assure un retour d'effort en temps réel pour surveiller les états d'attachement et de détachement. L'ensemble a été intégré sur le robot quadrupède commercial Unitree GO2, démontrant une locomotion stable sur des surfaces peintes, perforées et courbes. Ce résultat est significatif pour plusieurs raisons industrielles. Le rapport 200:1 entre charge utile et poids propre du pied positionne cette technologie bien au-dessus des solutions à ventouses pneumatiques, qui restent dépendantes d'une source d'air comprimé et peinent sur les surfaces irrégulières ou perforées. La boucle de retour de force permet une commutation d'adhérence fiable dans des conditions de contact incertaines, ce qui est directement pertinent pour l'inspection de coques navales, de réservoirs industriels ou de structures métalliques en hauteur. Contrairement aux aimants permanents passifs, le caractère contrôlable de l'EPM permet de switcher entre adhérence et détachement sans consommation d'énergie continue, un avantage opérationnel notable pour les missions longue durée. Les robots quadrupèdes capables de grimper sur des surfaces ferromagnétiques font l'objet d'un intérêt croissant depuis que Boston Dynamics a montré Spot dans des environnements industriels complexes, et que des équipes académiques ont exploré les configurations à ventouses ou à micro-crochets inspirés des geckos. Unitree, constructeur du GO2 utilisé ici, est devenu une plateforme de référence pour la recherche en locomotion avancée grâce à son accessibilité tarifaire. Les approches concurrentes incluent les systèmes à ventouses développés par des équipes coréennes et japonaises, ainsi que les pieds magnétiques passifs, moins agiles en détachement. Les auteurs n'annoncent pas de calendrier de commercialisation ou de déploiement industriel dans cet article de préprint arXiv ; les prochaines étapes logiques seraient une validation sur des géométries complexes réelles et l'intégration dans une boucle de contrôle autonome complète.

RecherchePaper
1 source
Fusion tactile-proprioceptive pour estimer les forces de contact dans l'interaction physique humain-robot en corps entier
1577arXiv cs.RO 

Fusion tactile-proprioceptive pour estimer les forces de contact dans l'interaction physique humain-robot en corps entier

Des chercheurs ont publié sur arXiv (2605.28412) un framework de fusion sensorielle tactile-proprioceptive destiné à améliorer l'interaction physique entre humains et robots. L'approche combine des capteurs de peau pneumatiques, des coussins souples disposés sur la surface du bras robotique, avec la proprioception basée sur le courant moteur, afin de reconstruire des forces de contact multi-axes en temps réel. Le point clé : les signaux tactiles servent d'indicateurs de contact binaires, permettant de contourner l'ambiguïté classique entre les résidus de frottement et les forces externes appliquées. Pour corriger la dérive due à l'hystérésis de frottement lors des transitions stick-slip (adhérence/glissement), les auteurs intègrent un réseau de convolutions temporelles (TCN). Le système est validé sur un bras robotique équipé de cette peau artificielle, dans deux scénarios : reconstruction stationnaire des forces multi-axes et enseignement cinesthésique simultané, c'est-à-dire guider le robot à la main pendant qu'il enregistre la trajectoire. Ce travail adresse un goulot d'étranglement concret dans le déploiement de robots collaboratifs : la difficulté à distinguer un contact intentionnel d'un contact perturbateur sans modéliser explicitement le frottement. La fusion tactile-proprioceptive proposée améliore la sensibilité et la réactivité par rapport aux approches uniquement tactiles ou uniquement proprioceptives, ce qui a des implications directes pour la programmation par démonstration (LfD) et les environnements de coproduction humain-robot. Le TCN est un choix pragmatique, il gère la non-linéarité dynamique sans forcer une identification de friction au préalable, ce qui réduit la complexité de mise en service pour les intégrateurs industriels. Ce type de "peau robotique" fait l'objet de recherches intensives depuis une décennie, mais les résultats ont longtemps souffert du fossé simulation-réalité et d'une fragile généralisation à la manipulation en mouvement. Des acteurs comme Wandercraft (France), qui développe des exosquelettes à interaction physique, ou des laboratoires comme le DLR et l'IIT travaillent sur des problématiques similaires. La publication reste une preuve de concept sur bras isolé, sans données de cycle time, de robustesse sur durée ni de coût de fabrication de la peau pneumatique, des paramètres déterminants avant tout transfert industriel. Les prochaines étapes naturelles seraient une validation sur robot humanoïde complet et des tests en conditions d'usine.

UEDes laboratoires européens comme le DLR et l'IIT, ainsi que Wandercraft en France pour ses exosquelettes, travaillent sur des problématiques similaires et pourraient s'appuyer sur ce framework de fusion sensorielle, mais l'impact reste indirect à ce stade de preuve de concept.

RecherchePaper
1 source
Gradients fonctionnels naturels pour l'optimisation de trajectoires fluides
1578arXiv cs.RO 

Gradients fonctionnels naturels pour l'optimisation de trajectoires fluides

Une équipe de chercheurs a soumis sur arXiv (référence 2605.28202, mai 2026) un framework d'optimisation de trajectoire pour la manipulation robotique dans des environnements encombrés ou à passages étroits. La méthode introduit ce que les auteurs nomment des "gradients fonctionnels naturels" : plutôt que d'opérer dans un espace discret de waypoints, les mises à jour sont calculées directement dans l'espace fonctionnel, découplant la régularité de la trajectoire du pas de discrétisation temporelle. L'algorithme optimise un objectif lissé par noyau gaussien et emploie un estimateur Monte-Carlo du gradient naturel, ce qui le rend utilisable sans gradients analytiques, un avantage déterminant lorsque la détection de collision ou les simulations à contacts riches empêchent toute différentiation exacte. Les expériences portent sur des tâches de manipulation contrainte aux dégagements géométriques étroits. Pour un intégrateur ou un ingénieur en manipulation, l'apport concret réside dans la capacité à produire des trajectoires faisables là où des planificateurs établis comme CHOMP, TrajOpt ou GPMP2 peinent à converger ou génèrent des mouvements saccadés. La compatibilité "boîte noire" avec n'importe quel simulateur de contacts ouvre également la voie à une intégration dans des pipelines sim-to-real existants sans modifier le moteur physique sous-jacent. Les résultats présentés montrent une amélioration mesurable de la faisabilité et du lissé par rapport à ces baselines, bien que le préprint ne soit pas encore soumis à comité de lecture et que les conditions précises d'évaluation restent à examiner de façon indépendante. L'optimisation de trajectoire est un problème central depuis CHOMP (2009) et TrajOpt (2013) ; l'idée de gradient naturel, issue des travaux d'Amari en apprentissage statistique, n'avait pas encore été formalisée dans l'espace fonctionnel des trajectoires robotiques. Ce travail s'inscrit dans une dynamique active où les méthodes d'optimisation classique doivent maintenir leur pertinence face aux politiques diffusion et aux VLA (Vision-Language-Action models, modèles action guidés par le langage et la vision), qui représentent aujourd'hui une approche concurrente croissante pour la manipulation en espace contraint. Le code source et les vidéos de démonstration sont accessibles sur la page projet des auteurs ; une soumission à ICRA, IROS ou CoRL constituerait la prochaine étape naturelle de validation.

RecherchePaper
1 source
OSMa-Bench++ : vers une évaluation ouverte de la cartographie sémantique pour la manipulation via des scènes synthétiques générées par prompt
1579arXiv cs.RO 

OSMa-Bench++ : vers une évaluation ouverte de la cartographie sémantique pour la manipulation via des scènes synthétiques générées par prompt

Des chercheurs du laboratoire be2rlab publient OSMa-Bench++, une extension du framework d'évaluation OSMa-Bench, déposée sur arXiv en mai 2026. L'objectif est de pallier une limite structurelle des benchmarks actuels pour la cartographie sémantique appliquée à la manipulation robotique : leur dépendance à des jeux de données fixes, insuffisamment couverts en cas limites pertinents pour la manipulation. Le nouveau pipeline génère automatiquement des descriptions de scènes d'intérieur à partir de prompts textuels, synthétise les environnements correspondants via SceneSmith, puis les adapte dans un format de simulation compatible avec OSMa-Bench. Cette adaptation requiert une couche intermédiaire non triviale incluant la normalisation sémantique, la réparation de matériaux et textures, des politiques de fallback pour les shaders, la gestion des sols, la configuration de la navigation et un contrôle de l'éclairage. Le composant VQA (Visual Question Answering) est étendu avec une catégorie de questions ancrée sur le prompt d'origine, exploitant le fait que la spécification de la scène est connue à l'avance pour servir de référence sémantique vérifiable. Le code est disponible publiquement sur github.com/be2rlab/OSMa-Bench-v2. L'apport principal est de rendre le benchmarking de la cartographie sémantique extensible et contrôlable, deux propriétés absentes des benchmarks à scènes figées comme ScanNet ou Replica. Pour un intégrateur ou un équipe R&D travaillant sur des bras manipulateurs avec perception 3D, cela signifie pouvoir évaluer un modèle sur des conditions ciblées : objets de petite taille, occlusions partielles, encombrement variable, ou éclairage dégradé, sans avoir à constituer manuellement de nouveaux datasets. Le mécanisme de question-réponse ancré sur le prompt original permet une vérification objective contre une vérité terrain sémantique définie à la génération, ce qui réduit l'ambiguïté d'évaluation typique des VQA sur scènes non contraintes. OSMa-Bench, le framework d'origine, était déjà positionné sur l'évaluation de méthodes de cartographie sémantique pour la manipulation, un segment moins couvert que la navigation pure. SceneSmith, utilisé ici comme générateur de scènes, est un outil de synthèse procédurale d'environnements intérieurs. Dans le paysage des benchmarks pour la perception robotique, les approches à génération procédurale restent minoritaires face aux scènes scannées (HM3D, Matterport3D), mais gagnent du terrain pour leur capacité à couvrir des distributions hors-domaine. be2rlab n'annonce pas de déploiement industriel ni de partenariat : il s'agit d'une contribution de recherche académique, sous forme de pre-print non encore évalué par les pairs, avec mise à disposition du code comme principal livrable.

RecherchePaper
1 source
Vers une navigation socialement adaptée dans les immeubles résidentiels : la méthode Look Further
1580arXiv cs.RO 

Vers une navigation socialement adaptée dans les immeubles résidentiels : la méthode Look Further

Des chercheurs ont publié sur arXiv (réf. 2605.26710) une étude portant sur la navigation sociale d'un robot de livraison dans les couloirs d'immeubles résidentiels. L'approche centrale, baptisée Proactive Lane-Changing (PLC), consiste à déporter latéralement le robot du centre vers le côté du couloir dès qu'un piéton est détecté à plus de huit mètres, soit deux à quatre fois la distance de réaction habituelle des systèmes actuels. Une étude utilisateur avec 42 participants a évalué cette stratégie selon trois critères : sécurité, fluidité et politesse. En couloir droit (approche frontale), le PLC surpasse de façon statistiquement significative les comportements classiques de la littérature - ralentissement, arrêt, évitement réactif en proximité - sur les trois dimensions. En revanche, dans les scénarios d'intersection à angle mort, aucune des approches testées ne se distingue, les préférences des participants restant très dispersées. Ce résultat interroge les intégrateurs de robots AMR en milieu indoor résidentiel. La navigation sociale s'est longtemps concentrée sur la zone de "personal space" - typiquement moins de deux mètres - en appliquant des règles d'évitement réactif. L'étude démontre qu'étendre la distance de réaction modifie la perception globale du mouvement robotique, pas uniquement la sensation d'intrusion à courte portée. C'est un signal utile pour les concepteurs de comportements : l'expérience utilisateur en couloir relève du design d'interaction à grande échelle spatiale, pas seulement de la sécurité physique. L'absence de résultat probant aux intersections souligne cependant que le problème des angles morts reste entier et que le PLC n'est pas une solution universelle. Le travail s'inscrit dans un champ actif depuis la popularisation des robots de service indoor et l'émergence de modèles comme le Social Force Model. Côté industrie, des acteurs comme Keenon, Aethon ou Savioke ont déployé des robots de livraison en hôtellerie et milieu hospitalier sans traiter explicitement la navigation sociale à longue distance. En Europe, Enchanted Tools (France, robot Miroka) et d'autres opèrent dans des environnements comparables et pourraient bénéficier de ce type d'approche comportementale. L'étude reste au stade de la recherche publiée : ni code disponible, ni déploiement commercial annoncé.

UEEnchanted Tools (France, robot Miroka) et d'autres acteurs européens de robots de service indoor pourraient intégrer l'approche PLC pour améliorer la navigation sociale à longue distance dans les couloirs résidentiels.

RecherchePaper
1 source
MuJoCoUni : des primitives d'exécution persistantes et vectorisées pour MuJoCo
1581arXiv cs.RO 

MuJoCoUni : des primitives d'exécution persistantes et vectorisées pour MuJoCo

Un préprint arXiv (réf. 2605.24922, mai 2026) présente MuJoCoUni, une distribution dérivée du simulateur physique MuJoCo ciblant l'apprentissage robot en ligne et l'évaluation physique batchée. L'objet central de la bibliothèque est le BatchEnvPool, un exécuteur écrit en C++ et exposé via pybind11, qui maintient des copies indépendantes de mjModel par environnement, des workers mjData par thread, et un pool de threads interne. BatchEnvPool comble ce que l'API upstream mujoco.rollout ne couvrait pas : l'exécution stateful d'environnements en parallèle, avec stepping final-state-only, reset sparse, randomisation de domaine au moment du reset (reset-lifecycle domain randomization), évaluation forward des capteurs sans avancer la dynamique, et requêtes batchées de Jacobiens et de champs de hauteur. Le package est disponible en open source via pip install mujoco-uni. L'enjeu pratique est significatif pour les pipelines de reinforcement learning robotique. L'entraînement RL en ligne exige un débit élevé de transitions simulées, souvent plusieurs milliers d'environnements en parallèle. La plupart des solutions à haute cadence comme Isaac Lab (NVIDIA) ou Brax (Google/JAX) sacrifient la fidélité physique de MuJoCo, notamment sa gestion fine des contacts et des contraintes, au profit de la vitesse GPU. MuJoCoUni prend le parti inverse : conserver la sémantique CPU de MuJoCo intacte, solveur, modèle de contact et intégrateur compris, en parallélisant uniquement au niveau de la couche de liaison Python, sans forker le coeur du simulateur. C'est une approche plus conservative, mais potentiellement plus fiable pour les tâches où la précision physique conditionne le transfert sim-to-real, notamment en manipulation dextre ou en locomotion sur terrain irrégulier. MuJoCo, développé initialement à l'Université de Washington par Emo Todorov, a été acquis par DeepMind en 2021 puis rendu open source en octobre 2022 sous licence Apache 2.0, ce qui a considérablement élargi son adoption dans la communauté RL robotique. L'écosystème s'est depuis structuré autour de plusieurs stacks concurrentes : Isaac Lab (GPU-natif, NVIDIA), Genesis (multi-backend, open source) et Brax (JAX). MuJoCoUni occupe un créneau spécifique : exécution batchée stateful sur CPU avec sémantique MuJoCo garantie, utile pour les équipes qui ne disposent pas d'infrastructure GPU ou qui exigent la reproductibilité exacte du simulateur de référence. Les auteurs publient simultanément des scripts de validation et de benchmark avec le package. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade ; il s'agit d'une contribution infrastructure open source à destination des équipes de recherche et des intégrateurs construisant des pipelines RL robotiques.

InfrastructurePaper
1 source
OASIS : alignement espace observation-action par prédiction de trajectoire SE(3) pour la manipulation robotique
1582arXiv cs.RO 

OASIS : alignement espace observation-action par prédiction de trajectoire SE(3) pour la manipulation robotique

Des chercheurs ont soumis sur arXiv (réf. 2505.25829) OASIS, un nouveau modèle de politique visuomotrice pour la manipulation robotique dont le nom complet est "Observation-Action Space Alignment via SE(3) Trajectory Prediction". L'architecture combine un encodeur de features 3D qui fusionne données visuelles, linguistiques et de profondeur métrique, avec un prédicteur de trajectoire dans le groupe SE(3), l'espace mathématique des rotations et translations rigides en trois dimensions. Ce prédicteur génère une trajectoire de l'effecteur terminal dans le référentiel caméra; ses états cachés, supervisés par pose, conditionnent ensuite un décodeur d'actions qui produit des blocs d'actions ("action chunks") géométriquement cohérents. Les auteurs rapportent des expériences en simulation et en conditions réelles sur des tâches de manipulation, surpassant les baselines VLA et WAM sur le taux de succès et la généralisation hors-distribution. Aucun chiffre absolu n'est fourni dans l'abstract, ce qui invite à attendre la lecture complète du papier avant toute conclusion quantitative. Le problème visé est structurel dans les modèles VLA actuels : leurs représentations intermédiaires restent dans l'espace d'observation (pixels, tokens) alors que la manipulation exige une géométrie de corps rigide. Forcer le décodeur à récupérer cette géométrie implicitement introduit un biais que les auteurs considèrent coûteux en données et en robustesse. L'alignement explicite via SE(3) est une piste sérieuse, et l'amélioration annoncée sur la généralisation hors-distribution est la métrique la plus pertinente pour les intégrateurs industriels, pour qui re-collecter des données à chaque nouvelle variante de tâche est prohibitif. Si les résultats se confirment à la lecture complète, OASIS apporte un argument concret au débat sur la bonne inductive bias à injecter dans les VLA. Le champ des VLA a été structuré ces dix-huit mois par Pi-0 (Physical Intelligence), OpenVLA, RoboVLMs, et plus récemment GR00T N2 de NVIDIA, tous cherchant à unifier compréhension linguistique et contrôle moteur fin. Les WAMs ont ajouté la prédiction d'états visuels futurs comme signal auxiliaire. OASIS s'inscrit dans ce second courant en changeant l'espace de prédiction : des pixels vers une trajectoire géométrique explicite en SE(3), un choix qui converge avec des travaux antérieurs comme SE(3)-DiffusionFields ou EquiBot. L'URL du projet (npuhandsome.github.io) suggère une affiliation avec la Northwestern Polytechnical University de Xi'an, laboratoire actif en robotique et apprentissage. Le papier est un preprint non encore évalué par les pairs; les démonstrations vidéo sur la page projet sont à interpréter avec la prudence habituelle avant tout déploiement applicatif.

RechercheOpinion
1 source
Manipulation souple par poussée non-préhensile
1583arXiv cs.RO 

Manipulation souple par poussée non-préhensile

Des chercheurs ont publié sur arXiv (2605.25672) une méthode permettant à un bras manipulateur de pousser des objets en milieu humain sans les saisir, tout en maintenant une compliance passive. L'approche étend un modèle de poussée existant intégré à un contrôle en impédance, puis construit un cadre de commande prédictive (MPC) qui module conjointement position et vitesse du robot pour produire la force de contact voulue et adapter le point de contact selon la trajectoire désirée de l'objet. Un filtre de passivité basé sur un "energy tank" module ensuite la vitesse de référence pour éviter l'accumulation incontrôlée d'énergie lors d'interactions extérieures imprévues. La méthode a été validée en simulation puis expérimentalement sur deux systèmes robotiques physiques distincts. Ce travail répond à un besoin croissant dans la robotique collaborative: déplacer des objets sans préhension dans des espaces humains sans risquer de blesser un opérateur en cas de contact non planifié. La plupart des approches MPC pour la manipulation par poussée supposent un robot rigide, ce qui les rend inadaptées aux environnements partagés. En combinant impédance et passivité, cette méthode ouvre la voie à des manipulateurs opérant en mode "open floor" dans des entrepôts ou sur des lignes d'assemblage. Le mécanisme d'energy tank, issu de la robotique haptique, applique ici un principe de stabilité éprouvé à la manipulation non-préhensile. Limite notable: le papier ne fournit pas de métriques de cycle time ni de masse utile testée en conditions réalistes, ce qui limite les conclusions directes pour les intégrateurs industriels. Ce développement s'inscrit dans un champ actif où des équipes comme celles de Berkeley (pushing as pre-grasp manipulation) et d'ETH Zurich (planar pushing) ont posé les bases théoriques; la brique compliance manquait pour un transfert industriel crédible. Côté commercial, la manipulation sans préhension reste peu déployée: Righthand Robotics et Covariant privilégient la préhension adaptative, tandis que des solutions de poussée planaire existent dans les AMR mais sans bras articulé compliant. En France, les acteurs logistiques comme Exotec restent dépendants de la préhension pour la manipulation fine d'objets. La prochaine étape naturelle serait une validation sur scénario d'entrepôt réel avec un spectre plus large de géométries et masses d'objets, perspective que les auteurs mentionnent explicitement.

UELes acteurs logistiques européens comme Exotec pourraient à terme bénéficier de cette approche pour réduire leur dépendance à la préhension fine en entrepôt, mais l'absence de métriques industrielles réalistes retarde tout transfert opérationnel.

RecherchePaper
1 source
PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot
1584arXiv cs.RO 

PACT : une approche proactive pour l'assistance continue aux tâches en collaboration humain-robot

Des chercheurs ont publié PACT (Proactive Asking for Continual Task Assistance), un framework de collaboration humain-robot sur la durée, soumis sur arXiv en mai 2026 (arXiv:2605.24350). Le problème posé est concret : un assistant robotique déployé sur plusieurs jours ignore initialement les habitudes et préférences de son utilisateur, rendant l'inférence passive peu fiable dès les premières interactions. PACT propose une logique "ask-or-act" : plutôt que d'agir sans certitude, le robot décide à chaque instant s'il doit demander une clarification ou exécuter directement la tâche. Le système combine les observations courantes avec un historique d'interactions multi-jours pour évaluer la suffisance contextuelle avant d'agir. L'implémentation principale repose sur du reinforcement learning, et les auteurs introduisent une nouvelle métrique, la "clarification utility", qui mesure le compromis entre précision de l'assistance et fréquence des interruptions imposées à l'utilisateur. Ce framework répond à un déficit structurel des robots d'assistance actuels : en inférant silencieusement, un robot avec un modèle utilisateur incomplet accumule les erreurs et dégrade rapidement la confiance opérationnelle. PACT inverse la logique -- le robot reconnaît son incertitude et l'exprime plutôt que de la masquer. Pour les intégrateurs envisageant des robots en assistance à domicile, en co-robotique de bureau ou en environnement industriel léger, cette approche réduit la nécessité d'une modélisation préalable exhaustive des préférences utilisateur. Les expériences en scénarios multi-jours montrent des gains consistants en précision et en utilité des clarifications face aux baselines d'inférence passive, bien que la validation sur plateforme matérielle réelle reste à démontrer. Le défi de l'adaptation continue en collaboration humain-robot est partagé par plusieurs axes de recherche actifs, dont les benchmarks domestiques ALFRED et les travaux de personnalisation menés chez Figure, 1X ou Boston Dynamics pour leurs robots humanoïdes. Des équipes européennes -- INRIA, TU Delft -- explorent également ces mécanismes d'apprentissage en contexte prolongé. PACT se distingue en traitant l'incertitude épistémique par le dialogue explicite plutôt que par des mécanismes d'inférence silencieux, une approche complémentaire aux méthodes VLA (Vision-Language-Action) actuellement dominantes. La publication reste un preprint sans validation industrielle annoncée ; l'étape critique sera de quantifier le coût cognitif réel des clarifications répétées pour l'utilisateur dans des contextes de travail prolongés.

UEDes équipes européennes dont l'INRIA (France) et TU Delft (Pays-Bas) travaillent sur des mécanismes similaires d'apprentissage contextuel prolongé, ce qui positionne PACT comme référence pertinente pour la communauté HRI européenne, sans impact industriel direct à ce stade.

RecherchePaper
1 source
Robots capables de demander des précisions : corriger des récompenses mal alignées grâce à des explications ciblées
1585arXiv cs.RO 

Robots capables de demander des précisions : corriger des récompenses mal alignées grâce à des explications ciblées

Des chercheurs ont publié fin mai 2026 (arXiv:2605.22986) un cadre algorithmique permettant à un robot d'identifier automatiquement les aspects d'une tâche qu'il n'a pas correctement appris à partir de démonstrations humaines, puis de formuler en langage naturel des requêtes ciblées pour obtenir des démonstrations correctives. Le système s'applique à l'apprentissage de fonctions de récompense par imitation : lorsqu'un humain montre plusieurs fois comment accomplir une tâche, certains comportements sont bien couverts, d'autres sous-représentés, soit par charge cognitive, soit par difficulté physique à les démontrer de façon cohérente. Le mécanisme de détection repose sur une observation statistique simple : les caractéristiques bien spécifiées présentent peu de variance entre démonstrations, tandis que celles qui sont ambiguës varient largement. Le robot exploite ce signal pour inférer ses propres lacunes, puis explique verbalement à l'opérateur humain les aspects comportementaux incertains avant de demander de nouvelles démonstrations ciblées sur ces gaps. Le dispositif a été validé sur un domaine de manipulation de table simulé et dans une étude utilisateur avec un robot Franka réel. L'enjeu est direct pour les intégrateurs et les équipes d'automatisation industrielle : l'apprentissage par démonstration (LfD) est l'une des voies les plus prometteuses pour programmer des robots sans expertise en robotique, mais son talon d'Achille reste précisément le comportement divergent au déploiement quand les démonstrations ne couvrent pas suffisamment l'espace des situations réelles. Ce travail propose une boucle de correction active qui réduit l'ambiguïté résiduelle sans imposer à l'opérateur de savoir a priori quoi re-démontrer, ce que ne permettent ni la collecte passive de données supplémentaires ni les requêtes aléatoires. Les résultats montrent une amélioration significative de la récupération de la fonction de récompense correcte, ce qui constitue un signal concret contre l'hypothèse que le "demo-to-deploy gap" serait inévitable avec des démonteurs non experts. Ce travail s'inscrit dans la dynamique actuelle autour des architectures d'apprentissage interactif pour la robotique, à côté des approches de type RLHF robot (reinforcement learning from human feedback) ou des corrections par retour haptique. Il se distingue en rendant le robot explicitement demandeur d'information plutôt que passif. Les concurrents directs incluent les travaux sur l'active inverse reward design de Sadigh et al., ainsi que les approches de preference learning à la PEBBLE. La validation sur Franka, robot dominant des labos académiques, donne une crédibilité matérielle, bien qu'une évaluation sur manipulateurs industriels ou humanoïdes reste à faire. La prochaine étape logique serait de tester ce mécanisme en environnement non structuré ou avec des opérateurs non techniques, ce que les auteurs n'ont pas encore adressé.

UELes équipes de recherche en robotique française (INRIA, CEA-List) et les intégrateurs européens déployant l'apprentissage par démonstration peuvent directement évaluer ce cadre pour réduire le gap démo-déploiement sans imposer une expertise robotique aux opérateurs.

RecherchePaper
1 source
SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique
1586arXiv cs.RO 

SE3Kit : une bibliothèque Python légère pour les primitives géométriques spécialisées en robotique

Une équipe de chercheurs a publié SE3Kit sur arXiv (identifiant 2605.22633), une bibliothèque Python légère dédiée aux opérations géométriques sur les groupes de Lie SE(3) (groupe euclidien spécial, qui encode rotations et translations rigides en 3D) et SO(3) (groupe orthogonal spécial, rotations pures). L'implémentation est entièrement en Python pur avec NumPy comme unique dépendance, sans recours à des frameworks de deep learning ni à des outils de visualisation. Les cas d'usage ciblés sont le déploiement embarqué (systèmes à ressources contraintes), le prototypage rapide et l'enseignement de la robotique. L'écosystème Python de robotique souffre d'un vide bien documenté : les bibliothèques existantes tombent dans deux catégories extrêmes. D'un côté, SpatialMath et PyPose offrent de la rigueur mathématique mais embarquent des dépendances lourdes (PyTorch pour PyPose, notamment) qui les rendent inadaptées aux contextes embarqués ou à l'enseignement. De l'autre, SciPy fournit des outils génériques de rotation sans sémantique robotique explicite ni opérations natives sur les algèbres de Lie. SE3Kit vise l'espace intermédiaire : une implémentation stricte des opérations de groupe (exponentielle, logarithme, adjoint, interpolation géodésique) sans surcoût logiciel. Pour un intégrateur travaillant sur un bras manipulateur ou un système de navigation, cela signifie pouvoir utiliser des primitives mathématiquement correctes sur un microcontrôleur ou dans un notebook pédagogique sans installer un stack complet. La publication arrive dans un contexte où la fragmentation des outils de transformation en robotique Python est un frein récurrent, notamment pour les équipes qui passent de la simulation (ROS/Gazebo, souvent C++) vers des pipelines Python embarqués. SE3Kit n'est pas le premier à tenter ce positionnement : la bibliothèque transforms3d de Matthew Brett et pytransform3d de Alexander Fabisch couvrent un périmètre similaire, mais avec des niveaux variables de rigueur sur les groupes de Lie. La valeur différenciante annoncée de SE3Kit est l'absence totale de dépendances non-NumPy, ce qui reste à vérifier sur des benchmarks indépendants. Aucun déploiement industriel ni partenariat n'est mentionné dans la publication ; il s'agit pour l'instant d'une contribution académique en phase d'annonce.

RechercheOpinion
1 source
Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur
1587arXiv cs.RO 

Manutention industrielle bi-bras de boîtes par estimation inertielle en ligne et optimisation convexe du torseur

Des chercheurs ont déposé en mai 2026 sur arXiv (arXiv:2605.22021) un framework de manutention dual-bras conçu pour la manipulation industrielle de colis dont la masse et le centre de masse sont inconnus à l'avance. Le système s'appuie sur deux composants couplés : une estimation en temps réel des propriétés inertielles de l'objet à partir des torseurs de contact mesurés (forces et moments aux points de préhension), et un optimiseur convexe de type SOCP (second-order cone program, programme conique du second ordre) qui calcule des forces de contact compatibles avec les contraintes de friction, modélisées par des surfaces limites ellipsoïdales. Une étape de raffinement de trajectoire hors-ligne complète le pipeline pour éviter les contacts indésirables entre l'objet et l'environnement en présence de contraintes géométriques. Les expériences ont été réalisées sur un robot dual-bras réel soumis à plusieurs configurations de centre de masse, sans connaissance préalable des propriétés inertielles. L'enjeu est direct pour les intégrateurs en logistique industrielle : les bras robotiques doivent manipuler des colis dont le contenu varie (masse, répartition du poids, centre de gravité décentré), et les approches classiques génèrent glissements, chutes, déviations d'orientation ou serrage excessif endommageant les produits. La contribution principale est de traiter la faisabilité de friction comme une contrainte dure plutôt qu'un objectif de régulation séparé à calibrer, unifiant ainsi slip avoidance et évitement de l'écrasement dans un seul problème d'optimisation. Pour un responsable de ligne de palettisation, cela signifie moins de paramétrage manuel à chaque changement de référence produit et une meilleure robustesse aux variabilités de conditionnement, deux points de friction concrets dans les déploiements actuels. La manipulation dual-bras d'objets à propriétés inertielles inconnues est un problème ouvert depuis plusieurs années, adressé par des approches allant du contrôle en force classique jusqu'à l'apprentissage par renforcement. Plusieurs acteurs commerciaux proposent des cellules dual-bras pour la logistique : ABB avec le YuMi, Fanuc, et des startups comme Apptronik ou Figure AI qui intègrent des manipulateurs dans des plateformes humanoïdes. Ce travail reste au stade de la publication académique en preprint, sans affiliation commerciale identifiée, sans données de cycle time ni de volume de déploiement. Les expériences décrites constituent une preuve de concept sur système réel plutôt qu'un déploiement industriel, et les suites naturelles seraient l'intégration dans des cellules de palettisation ou de dépalettisation automatisées, un marché en forte croissance porté par la pression logistique de l'e-commerce.

UELes intégrateurs européens en logistique industrielle, notamment autour des cellules dual-bras ABB (YuMi) et KUKA, pourraient exploiter cette approche pour réduire le paramétrage manuel face à des conditionnements à masse variable.

RecherchePaper
1 source
Robots mous mobiles terrestres : une revue de la littérature
1588arXiv cs.RO 

Robots mous mobiles terrestres : une revue de la littérature

Une équipe de chercheurs vient de publier sur arXiv (référence 2605.20304) une revue systématique consacrée aux robots mobiles terrestres à corps souple (soft mobile robots) dépourvus de roues. Ce travail recense les avancées passées et récentes en matière de stratégies de locomotion, méthodes d'actionnement, approches de modélisation et systèmes de contrôle. Les domaines d'application ciblés sont larges : recherche et sauvetage, surveillance, services aux personnes, exploration d'environnements hostiles et fabrication industrielle. Il s'agit d'un preprint non encore soumis à révision par les pairs, ce qui en limite pour l'instant l'autorité formelle, mais le périmètre de la revue en fait une référence de synthèse utile pour ce domaine en expansion rapide. Les robots à corps souple tirent leur intérêt de leur capacité à se déformer, à s'adapter à des surfaces irrégulières et à naviguer dans des espaces confinés inaccessibles aux plateformes rigides conventionnelles. Contrairement aux robots à roues ou articulés rigides, ils présentent une conformité mécanique intrinsèque qui réduit les risques d'endommagement de l'environnement et de l'objet manipulé. Pour les intégrateurs industriels et les équipes de robotique d'intervention, cette synthèse identifie explicitement les verrous technologiques à lever : précision du contrôle en boucle fermée sur un corps déformable, durabilité des matériaux souples sous cycles répétés, autonomie énergétique limitée, et surtout le "sim-to-real gap", c'est-à-dire l'écart persistant entre les simulations physiques et le comportement réel des structures élastomères en environnement non contrôlé. La robotique souple terrestre s'est constituée comme champ autonome depuis le milieu des années 2010, portée par des laboratoires comme le Harvard Wyss Institute (robots pneumatiques, grippers en silicone) et le MIT CSAIL, ainsi que plusieurs groupes européens soutenus par les programmes Horizon 2020. Les méthodes d'actionnement recensées couvrent un spectre large : actionneurs pneumatiques et hydrauliques, alliages à mémoire de forme (SMA), élastomères diélectriques, tendons et câbles. En positionnement indirect face aux plateformes rigides de Boston Dynamics (Spot) ou ANYbotics (ANYmal) sur les marchés d'inspection, la robotique souple vise des niches où la conformité et la discrétion mécanique priment sur la vitesse ou la force brute. Les prochaines étapes attendues par la communauté sont la standardisation des métriques de performance comparatives et l'intégration de méthodes d'apprentissage automatique pour le contrôle adaptatif en conditions réelles.

UELa revue mentionne explicitement des groupes européens financés par Horizon 2020 comme contributeurs au champ de la robotique souple, offrant un ancrage indirect pour les équipes R&D européennes qui suivent ce domaine.

RecherchePaper
1 source
Un cadre pratique d'indicateurs de performance clés pour les tests sur le terrain avec plusieurs robots lunaires et planétaires
1589arXiv cs.RO 

Un cadre pratique d'indicateurs de performance clés pour les tests sur le terrain avec plusieurs robots lunaires et planétaires

Une équipe de chercheurs a publié sur arXiv (référence 2601.20529, version 3) un cadre structuré d'indicateurs clés de performance (KPI) destiné à évaluer les missions multi-robots lors d'essais analogiques lunaires et planétaires. Le constat de départ : les nombreux tests de terrain simulant la prospection lunaire (ilménite, terres rares, glace d'eau) utilisent des métriques hétérogènes propres à chaque scénario, rendant toute comparaison inter-missions quasi impossible. Le cadre est dérivé de trois scénarios multi-robots représentatifs et organise les KPI autour de trois axes : efficacité (couverture de terrain, débit d'exploration), robustesse (taux de pannes, reprise après défaillance) et précision (qualité des données scientifiques collectées). Validé lors d'un test de terrain réel, il se révèle directement applicable pour les métriques d'efficacité et de robustesse ; les KPI de précision se heurtent en revanche à l'impossibilité pratique d'obtenir des données de vérité terrain fiables dans des environnements extérieurs non instrumentés. L'absence de standard commun est l'un des freins principaux au développement de la robotique planétaire : sans référentiel partagé, comparer deux systèmes multi-robots issus de plateformes et de configurations expérimentales différentes reste impossible, même lorsqu'ils visent le même objectif scientifique. Ce framework comble ce manque en reliant les métriques d'ingénierie aux objectifs de mission (ressources extractibles, couverture cartographique), ce qui est directement utile pour arbitrer entre architectures de flotte ou stratégies de coordination distribuée. La limite identifiée sur les KPI de précision est significative et honnête : mesurer la localisation absolue d'un essaim de robots en extérieur sans infrastructure de référence reste un problème ouvert, ce qui conditionne directement la fiabilité des futurs démonstrateurs ISRU (In-Situ Resource Utilization). La prospection robotique lunaire connaît une structuration accélérée sous l'impulsion du programme Artemis (NASA), des ambitions lunaires de l'ESA et d'acteurs privés comme ispace (Japon/Luxembourg) ou Astrobotic (États-Unis). Les missions analogiques terrestres sur substrats simulant le régolite sont l'outil standard avant vol, mais leur prolifération sans méthode commune a produit une littérature difficile à synthétiser et à comparer. Ce papier s'inscrit dans un mouvement de standardisation comparable à ce que l'IEEE a accompli pour les robots AMR industriels ; l'étape logique serait son adoption par des consortiums comme l'ESA-ESRIC lors de compétitions analogiques de référence, telles que l'ESRIC Space Resources Challenge, pour confirmer sa portée au-delà d'un seul contexte expérimental.

UEPotentiellement utile pour l'ESA et les consortiums européens (ESA-ESRIC) travaillant sur la robotique planétaire, notamment dans le cadre de compétitions analogiques comme l'ESRIC Space Resources Challenge.

RecherchePaper
1 source
Génération itérative et compositionnelle de données pour le contrôle de robots
1590arXiv cs.RO 

Génération itérative et compositionnelle de données pour le contrôle de robots

Une équipe de chercheurs propose, dans un article arXiv (2512.10891, cinquième révision), un modèle génératif appelé "semantic compositional diffusion transformer" pour produire des données d'entraînement en manipulation robotique. Le principe central consiste à décomposer chaque transition dans l'espace d'état en quatre composantes distinctes, propres au robot, aux objets manipulés, aux obstacles, et à l'objectif de la tâche, dont les interactions sont apprises via des mécanismes d'attention. Entraîné sur un sous-ensemble limité de combinaisons de tâches, le modèle génère en inférence zéro-shot des transitions synthétiques de haute qualité pour des configurations jamais vues : nouveaux objets, nouveaux environnements, nouvelles associations robot-tâche. Un processus d'auto-amélioration itératif complète l'approche : les données synthétiques générées sont validées par apprentissage par renforcement hors-ligne (offline RL), puis réintégrées dans les rounds d'entraînement suivants. Au terme de ce cycle, le système résout la quasi-totalité des tâches de test non vues lors de l'entraînement. L'enjeu industriel est direct : collecter des démonstrations robotiques réelles pour couvrir l'espace combinatoire de toutes les tâches possibles en environnement multi-objets, multi-robots, multi-sites est économiquement prohibitif. Ce travail démontre qu'une structure compositionnelle apprise permet de briser cette malédiction combinatoire, sans démonstrations exhaustives. La boucle génération-validation-réentraînement est particulièrement notable : elle réduit le risque classique de drift sim-to-real en filtrant les transitions synthétiques non viables avant qu'elles ne contaminent le pipeline de policy learning. Les résultats surpassent significativement les baselines monolithiques et les approches compositionnelles à règles fixes (hard-coded), ce qui suggère que la structure compositionnelle émergente est réellement capturée par les représentations apprises, et non artificiellement injectée. Ce travail s'inscrit dans une dynamique de recherche qui cherche à contourner le goulot d'étranglement des données en robotique, aux côtés d'approches comme Diffusion Policy (Chi et al., CMU) ou les Visual Language Action models (VLA) tels que Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). Là où ces derniers misent sur des fondations visuolinguistiques massives, cette contribution cible la généralisation compositionnelle avec des données d'entraînement réduites. La première soumission datant de décembre 2025 et le papier en étant à sa cinquième révision, les auteurs ont visiblement consolidé leurs expériences au fil des retours communautaires. Les prochaines étapes naturelles seraient une validation sur hardware réel et une extension aux chaînes de manipulation longue-horizon, domaine où l'absence de compositionnalité reste le principal point de rupture des approches actuelles.

RecherchePaper
1 source
REACT : Architecture adaptative pour la navigation en formation continue de robots mobiles à roues
1591arXiv cs.RO 

REACT : Architecture adaptative pour la navigation en formation continue de robots mobiles à roues

Des chercheurs ont déposé sur arXiv (réf. 2605.18441, mai 2026) un article décrivant REACT (Real-time Environment-Adaptive architecture for Continuous formation navigaTion), une architecture hiérarchique pour la navigation en formation de robots mobiles à roues (WMR). L'architecture se divise en deux couches : une couche supérieure qui génère des formations adaptées à l'environnement en temps réel et calcule des affectations robot-cible sans conflits via l'algorithme TCF-R2T (Trajectory-Conflict-Free Robot-to-Target assignment), dont la complexité est garantie polynomiale ; et une couche inférieure où chaque robot exécute JSTP (Joint Spatio-Temporal trajectory Planning), une méthode qui optimise simultanément positions spatiales et durées temporelles pour maintenir la formation en continu. L'ensemble a été validé en simulation et lors d'expériences en conditions réelles, dont les séquences vidéo sont publiées sur le site du projet. La contribution principale de REACT face à l'existant est son adaptabilité dynamique : la grande majorité des travaux publiés sur la navigation en formation impose des configurations prédéfinies, incapables de réagir aux obstacles dynamiques ou à des environnements non balisés. Pour les applications industrielles visées (logistique de transport, surveillance environnementale, opérations de secours), cette rigidité constitue le principal frein au déploiement réel. La garantie polynomiale de TCF-R2T est particulièrement significative sur le plan de la scalabilité : elle indique que le calcul des affectations reste tractable à mesure que la taille de la flotte augmente, contrairement aux approches combinatoires qui deviennent rapidement inextricables. La coordination spatio-temporelle de JSTP réduit par ailleurs les risques de collisions inter-agents lors des transitions de formation, un point de friction classique dans les systèmes multi-robots. La commande de formation de robots mobiles est un champ de recherche actif depuis les années 2000, avec des approches classiques basées sur le suivi de leader, les structures virtuelles ou les champs de potentiel. REACT s'inscrit dans une tendance plus récente vers des architectures hybrides centralisé/distribué, une direction explorée tant dans les milieux académiques que par des éditeurs de flottes AMR tels qu'Exotec ou Balyo côté européen. L'article reste toutefois au stade de la preuve de concept : aucune entreprise partenaire ni timeline de commercialisation n'est mentionnée, et la taille des flottes testées en conditions réelles n'est pas précisée dans le résumé. La prochaine étape logique serait un pilote à plus grande échelle en entrepôt ou en environnement de secours structuré, pour valider le passage à des flottes de taille industrielle.

UELes acteurs européens de flottes AMR comme Exotec et Balyo pourraient bénéficier de cette architecture adaptative si elle est validée à l'échelle industrielle, réduisant un frein clé au déploiement réel de flottes multi-robots.

RecherchePaper
1 source
Interaction thérapeute-exosquelette-patient pour la rééducation à la marche
1592arXiv cs.RO 

Interaction thérapeute-exosquelette-patient pour la rééducation à la marche

Des chercheurs ont publié sur arXiv (2507.16059v2) un paradigme inédit de rééducation locomotrice post-AVC appelé pHRHI, pour physical Human-Robot-Human Interaction. Le principe : thérapeute et patient portent simultanément des exosquelettes de membres inférieurs, reliés virtuellement au niveau des hanches et des genoux par des éléments ressort-amortisseur. Cette connexion bidirectionnelle permet au thérapeute de guider les mouvements du patient tout en recevant un retour haptique en temps réel sur plusieurs articulations simultanément. L'étude clinique, conduite sur huit patients atteints d'un AVC chronique, a comparé des sessions pHRHI à la marche conventionnelle sur tapis roulant guidée manuellement par un thérapeute. Les résultats indiquent des améliorations mesurées sur l'amplitude articulaire, les métriques de pas (longueur, symétrie), l'activation musculaire et la motivation des patients. L'échantillon reste cependant très limité (n=8) et l'article ne précise pas le matériel exosquelette utilisé. Le défi central de la rééducation locomotrice post-AVC est de combiner la précision mécanique du robot (support multi-articulaire, feedback objectif, reproductibilité) avec l'intuition clinique du thérapeute. Les systèmes existants placent le thérapeute dans un rôle de supervision passif, effaçant la richesse de l'interaction physique directe. La pHRHI résout cette tension en faisant du clinicien un acteur haptiquement couplé au système, capable de moduler l'assistance sur plusieurs degrés de liberté en temps réel, ce qu'une aide manuelle ne permet pas physiquement. Pour les services de Médecine Physique et de Réadaptation et les intégrateurs de solutions robotiques, ce paradigme ouvre la voie à des protocoles où le robot amplifie l'expertise du clinicien plutôt que de le substituer, ce qui représente un changement de philosophie notable par rapport aux approches autonomes actuelles. Le marché des exosquelettes de rééducation est dominé par Hocoma avec le Lokomat, Ekso Bionics et ReWalk Robotics, dont les systèmes reposent sur des stratégies de contrôle prédéfinies ou en boucle fermée autonome. En France, Wandercraft (Paris) commercialise l'Atalante, exosquelette destiné aux centres de rééducation avec une approche axée sur la mobilité autonome sans béquilles. La spécificité du pHRHI est son positionnement dual-robot avec couplage haptique clinicien-patient, inédit dans la littérature clinique publiée à cette échelle. Les prochaines étapes logiques incluent des études à plus grand effectif, une validation sur des populations en phase subaiguë (plus réceptives aux gains fonctionnels), et l'intégration de métriques temps réel pour automatiser l'adaptation de l'assistance selon l'effort du patient. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le papier actuel.

UELes services de Médecine Physique et de Réadaptation français et Wandercraft (Paris, Atalante) pourraient s'inspirer de ce paradigme de couplage haptique clinicien-patient pour différencier leurs protocoles de rééducation robotisée, bien qu'aucun partenariat industriel français ne soit impliqué dans cette étude.

ExosquelettesPaper
1 source
FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques
1593arXiv cs.RO 

FUSE : un cadre unifié pour l'estimation d'état dans les systèmes SLAM robotiques

Une équipe de chercheurs a publié sur arXiv (référence 2605.18047) FUSE, un cadre logiciel pour l'estimation d'état unifiée dans les systèmes SLAM robotiques. Le problème adressé est structurel : les architectures SLAM à couplage serré lient dans un même bloc monolithique le traitement temporel, l'association géométrique locale, la formulation de l'estimateur et la politique de mise à jour de carte, rendant toute modification d'un composant coûteuse. FUSE propose quatre interfaces standardisées (ingestion d'observations, propagation, mise à jour, requête d'état) pour séparer ces responsabilités. L'instanciation LiDAR-IMU a été évaluée sur une séquence corridor bouclée de 418 m et produit une erreur de trajectoire de 1,626 m bout en bout, soit une réduction relative de 7,9 % par rapport à Faster-LIO, meilleure référence sur cette séquence. Le gain de 7,9 % reste modeste, mais l'intérêt principal de FUSE est architectural. Découpler proprement les choix de conception dans un pipeline SLAM permet de changer l'estimateur, adapter la cadence de mise à jour ou intégrer un nouveau type de capteur sans réarchitecturer l'ensemble du système. Pour les intégrateurs d'AMR ou les équipes de navigation industrielle, cela réduit significativement le coût de portage entre plateformes. La gestion explicite de la dégénérescence directionnelle constitue un point technique concret : en environnement corridor, le LiDAR ne perçoit pas de contraintes suffisantes dans l'axe latéral, rendant l'estimation instable. FUSE intègre un mécanisme de correction adaptatif ciblant ces directions faiblement observables, un problème rarement traité proprement dans les frameworks publics existants. Le SLAM LiDAR-IMU est un domaine très concurrentiel. Les références académiques dominantes incluent FAST-LIO2 et Faster-LIO (équipe Cai, HKUST) ainsi que LIO-SAM (Shan et al., MIT). Dans l'industrie, des fournisseurs comme Exotec (France) ou MiR intègrent des stacks de localisation dérivées de ces travaux dans leurs flottes d'AMR. FUSE ne cherche pas à battre ces systèmes sur les benchmarks de performance pure, mais à proposer une abstraction permettant de composer des composants algorithmiques de façon indépendante. Il s'agit d'une prépublication arXiv sans code public annoncé à ce stade, ce qui en fait pour l'instant une contribution académique à valider plutôt qu'un outil industriel prêt à l'emploi. La suite logique serait une mise à disposition open-source permettant de tester des instanciations alternatives, radar ou RGB-D, à travers les mêmes interfaces standardisées.

UEExotec (France) est cité comme exemple d'intégrateur AMR susceptible de bénéficier de l'abstraction architecturale proposée ; une mise à disposition open-source de FUSE réduirait le coût de portage SLAM pour les équipes de navigation industrielle européennes.

RecherchePaper
1 source
Architecture hybride intelligente à base de LLM pour l'ordonnancement des tâches robotiques
1594arXiv cs.RO 

Architecture hybride intelligente à base de LLM pour l'ordonnancement des tâches robotiques

Une équipe de chercheurs a publié sur arXiv (arXiv:2605.15486, mai 2026) un framework hybride exploitant des grands modèles de langage (LLM) pour orchestrer la planification de tâches de robots de chantier. L'architecture repose sur deux agents LLM fonctionnant en parallèle : un agent générateur basé sur GPT-4 (OpenAI) chargé de produire les séquences de tâches, et un agent superviseur interchangeable parmi Gemma 3 (Google DeepMind), Llama 4 (Meta) ou Mistral 7b, chargé de valider et corriger les plannings générés. Le système intègre une interface en langage naturel (NLP) permettant aux professionnels du bâtiment de communiquer directement leurs contraintes opérationnelles, et peut s'adapter en temps réel à des conditions imprévues sur site. Les résultats sont évalués sur un scénario simplifié avec des métriques quantitatives d'efficacité temporelle et d'utilisation des ressources. L'intérêt principal de cette approche réside dans la combinaison d'un modèle de raisonnement puissant (GPT-4) avec un modèle superviseur plus léger et remplaçable, ce qui réduit potentiellement le coût d'inférence tout en maintenant une validation en boucle fermée. Pour les intégrateurs de robotique dans le BTP, la couche NLP représente une piste concrète pour réduire la dépendance à des opérateurs spécialisés en programmation robot. Cela dit, l'évaluation reste limitée à un scénario dit "straightforward", ce qui ne permet pas de conclure sur la robustesse en conditions réelles de chantier, où la multiplicité des aléas (retards livraison, obstacles, météo) constitue le vrai défi. La validité industrielle de la méthode reste à démontrer à plus grande échelle. La planification automatisée de tâches multi-robots dans la construction est un axe actif depuis plusieurs années, notamment avec les travaux sur les systèmes BIM-to-robot et les AMR (autonomous mobile robots) de chantier. Des acteurs comme Boston Dynamics (avec Spot en inspection), Hilti (robots d'ancrage) ou NLink explorent déjà des formes de programmation par intention. En Europe, des initiatives comme Versatile (projet H2020) ont tracé des pistes similaires. Ce preprint s'inscrit dans une tendance plus large d'utilisation des VLA (Vision-Language-Action models) et des LLM comme couche de planification symbolique au-dessus de robots exécutants, une approche que des laboratoires comme Stanford (Mobile ALOHA) et CMU poussent en parallèle. Les prochaines étapes attendues seraient une validation sur chantier réel et une comparaison formelle entre les différents agents superviseurs testés.

UEApproche potentiellement exploitable par des intégrateurs robotiques européens actifs dans le BTP (Versatile/H2020), mais sans validation sur chantier réel ni déploiement en Europe à ce stade.

RechercheOpinion
1 source
Estimation simultanée de l'état et apprentissage du modèle en ligne dans un système robotique souple
1595arXiv cs.RO 

Estimation simultanée de l'état et apprentissage du modèle en ligne dans un système robotique souple

Des chercheurs proposent, dans une prépublication arXiv (2602.14092v2), une méthode permettant d'estimer simultanément la pose d'un robot souple et d'apprendre en ligne son modèle de rigidité à la flexion, à partir des seules mesures des forces exercées à la base du robot. L'approche repose sur un filtre particulaire marginalisé (marginalized particle filter) interfacé avec un processus gaussien (GP) chargé de modéliser la rigidité en flexion, sans capteurs proprioceptifs distribués le long du corps du robot. Le modèle nominal utilisé est le classique modèle à courbure constante (constant-curvature), réputé simple mais inexact dès que les charges ou les déformations deviennent hétérogènes. La méthode a été validée sur un robot souple physique, et les résultats montrent une réduction mesurable de l'erreur sur les prédictions multi-pas (multi-step forward predictions), signe que le GP appris améliore effectivement la qualité globale du modèle. L'enjeu est de taille pour quiconque cherche à déployer des robots souples dans des contextes industriels ou médicaux : ces systèmes sont intrinsèquement difficiles à modéliser car leur rigidité varie avec la charge, la fatigue du matériau et les conditions environnementales. La majorité des schémas de contrôle prédictif (MPC, par exemple) exigent un modèle précis et stable, condition rarement remplie en pratique. En remplaçant l'hypothèse d'une rigidité constante par un GP appris en temps réel, les auteurs montrent qu'il est possible de réduire le sim-to-real gap sans capteurs supplémentaires ni phase de calibration longue. Cela distingue cette approche des méthodes de marche aléatoire sur les paramètres de rigidité, qui permettent l'estimation mais pas la prédiction. Les robots souples connaissent un regain d'intérêt dans la manipulation de précision, la chirurgie mini-invasive et l'interaction humain-robot, portés notamment par des groupes académiques comme le Soft Robotics Lab de l'ETH Zurich, le CHARM Lab de Stanford ou des acteurs industriels comme Festo (bionic cobotics). Le verrou historique reste la modélisation : un corps déformable infiniment dimensionnel réduit à quelques paramètres discrets. L'identification gray-box, hybride entre modèle physique et apprentissage données, est aujourd'hui l'une des pistes les plus prometteuses pour franchir ce verrou à coût computationnel raisonnable. La prochaine étape naturelle serait d'intégrer cette estimation en boucle fermée dans un contrôleur MPC temps réel et de tester la robustesse sur des charges variables ou des matériaux vieillissants.

UEFesto (Allemagne) et l'ETH Zurich (Suisse) sont explicitement cités comme acteurs clés de la robotique souple ; une meilleure modélisation en ligne bénéficierait directement à leurs programmes de cobotics biologique et de chirurgie mini-invasive.

RecherchePaper
1 source
Introduction à l'apprentissage par renforcement profond et par imitation
1596arXiv cs.RO 

Introduction à l'apprentissage par renforcement profond et par imitation

Un document de référence publié sur arXiv (identifiant 2512.08052, troisième version) propose une introduction structurée et autosuffisante au Deep Reinforcement Learning (DRL) et au Deep Imitation Learning (DIL) appliqués aux agents incarnés, c'est-à-dire aux robots et personnages virtuels capables d'agir dans un environnement physique ou simulé. L'ouvrage couvre le spectre complet, des fondations mathématiques (processus de décision markoviens) jusqu'aux algorithmes avancés : côté DRL, REINFORCE puis Proximal Policy Optimization (PPO) ; côté DIL, le Behavioral Cloning, Dataset Aggregation (DAgger) et Generative Adversarial Imitation Learning (GAIL). L'approche retenue est délibérément "depth-first" : un petit nombre d'algorithmes fondateurs traités en profondeur, plutôt qu'un panorama exhaustif du champ. Ce type de ressource pédagogique répond à un besoin concret dans l'industrie robotique : les équipes d'intégration et les laboratoires qui cherchent à embarquer des politiques de contrôle apprises se heurtent souvent à une littérature fragmentée, supposant des prérequis hétérogènes. La distinction que l'auteur opère entre DRL (apprentissage par signal de récompense, adapté aux environnements où la démonstration experte est coûteuse) et DIL (apprentissage par imitation sur des trajectoires expertes, plus direct mais plus sensible à la distribution shift) est précisément le choix d'architecture sur lequel butent aujourd'hui les équipes qui déploient des bras manipulateurs ou des robots mobiles en environnement industriel. Des algorithmes comme PPO sont devenus des briques standard dans des pipelines tels que ceux d'OpenAI, IsaacLab (NVIDIA) ou MuJoCo ; DAgger, lui, est au coeur de nombreuses approches Vision-Language-Action (VLA) récentes. Le contexte de publication est significatif : l'arXiv connaît depuis 2023 une explosion des travaux sur les agents incarnés, portée par les avancées en sim-to-real (IsaacSim, Genesis) et par les déploiements humanoïdes annoncés chez Figure AI, Physical Intelligence (pi0) ou Boston Dynamics. Ce document n'est pas un papier de recherche original mais un outil pédagogique structuré, comparable dans sa vocation aux cours de Sergey Levine (UC Berkeley) ou aux notes de David Silver (DeepMind). Sa valeur est d'offrir un accès cohérent et autonome à des méthodes dont la maîtrise conditionne directement la capacité des équipes à itérer sur des politiques de contrôle pour robots réels.

RecherchePaper
1 source
Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
1597arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source
WarmPrior : rectification des politiques de flow matching avec des a priori temporels
1598arXiv cs.RO 

WarmPrior : rectification des politiques de flow matching avec des a priori temporels

Une équipe de chercheurs propose WarmPrior (arXiv:2605.13959, mai 2025), une modification de la distribution source dans les politiques génératives pour le contrôle robotique visuomoteur. Ces politiques, fondées sur la diffusion ou le flow matching, sont devenues le paradigme dominant pour apprendre des comportements de manipulation à partir de démonstrations. Plutôt que d'utiliser une distribution gaussienne standard comme point de départ du processus de génération d'actions, WarmPrior construit un prior temporel simple à partir de l'historique récent des actions exécutées par le robot. Appliqué à des tâches de manipulation en behavior cloning, ce remplacement améliore systématiquement les taux de réussite. L'article démontre également des gains en efficacité d'échantillonnage et en performance finale lorsque WarmPrior est utilisé dans un cadre d'apprentissage par renforcement dans l'espace des priors. L'explication de ces gains est géométrique : WarmPrior produit des chemins de probabilité sensiblement plus droits dans l'espace des actions, un effet analogue à celui des couplages de transport optimal dans Rectified Flow. Des trajectoires plus droites réduisent le nombre de pas d'intégration requis à l'inférence, ce qui peut accélérer le contrôle et améliorer la précision des mouvements. Pour les équipes robotique, l'intérêt est immédiatement pratique : WarmPrior est compatible avec les architectures existantes et ne nécessite aucune donnée supplémentaire. Plus fondamentalement, l'article identifie le choix de la distribution source comme un axe de conception structurant et jusqu'ici sous-exploré dans le contrôle génératif, orthogonal aux approches habituelles centrées sur l'architecture réseau ou le volume de données d'entraînement. WarmPrior s'inscrit dans l'accélération des politiques diffusion pour la manipulation, un champ formalisé notamment par Diffusion Policy (Chi et al., 2023, Columbia/MIT) et ses nombreuses variantes. Le paradigme flow matching, popularisé par Rectified Flow et adopté par Physical Intelligence dans pi-0 pour le contrôle de bras et d'humanoïdes, s'est imposé comme référence pour l'inférence à haute fréquence. WarmPrior, applicable sans modification architecturale aux deux familles de méthodes, représente un levier directement intégrable dans des pipelines existants comme ACT, Diffusion Policy ou pi-0. À noter que les résultats présentés restent pour l'instant au niveau des benchmarks de laboratoire ; une validation sur matériel réel et dans des conditions industrielles serait nécessaire pour établir la portée opérationnelle effective de la méthode.

RechercheOpinion
1 source
TouchAnything : jeu de données et framework pour l'estimation tactile bimanuelle en vidéo égocentrique
1599arXiv cs.RO 

TouchAnything : jeu de données et framework pour l'estimation tactile bimanuelle en vidéo égocentrique

Une équipe de chercheurs a publié EgoTouch (arXiv 2605.13083), un dataset égocentrique à grande échelle combinant vidéo multi-vues et supervision tactile dense pour l'interaction bimanuelle main-objet. Le jeu de données couvre 208 tâches de manipulation réparties en 1 891 épisodes collectés en environnements intérieurs et extérieurs variés, synchronisés avec trois flux RGB simultanés (une caméra montée sur la tête et deux caméras fixées aux poignets), une estimation 3D de la pose des deux mains et des cartes de pression continues issues de capteurs tactiles portables. Sur cette base, les auteurs proposent TouchAnything, un modèle de prédiction vision-to-touch qui utilise la vue égocéntrique comme entrée principale et intègre optionnellement les vues poignet à l'inférence. Les gains mesurés atteignent 5,0% en Contact IoU et 6,1% en Volumetric IoU par rapport à la vue égocentrique seule. Le dataset, le code et un benchmark seront publiés en open source, sans date précise annoncée. L'absence de modalité tactile dans les datasets égocentriques existants constitue un frein reconnu à l'apprentissage de représentations physiquement ancrées : la vidéo seule ne transmet pas les signaux de contact, de force ou de pression nécessaires pour modéliser les dynamiques réelles d'interaction avec les objets. EgoTouch adresse ce verrou en montrant qu'il est possible d'inférer le retour tactile depuis la seule observation visuelle, ouvrant la voie à une supervision tactile scalable sans déploiement coûteux de matériel instrumenté. Pour les équipes travaillant sur des robots manipulateurs ou des politiques de saisie, cela représente une voie d'entraînement potentiellement peu onéreuse pour des comportements sensibles au contact, problème central dans l'assemblage délicat, le tri de pièces fragiles ou la manipulation de souples. Ce travail prolonge l'essor des datasets égocentriques type Ego4D (Meta, 2022), qui ont établi la valeur des flux vidéo à la première personne pour l'apprentissage embodied. Les datasets tactiles antérieurs, notamment autour de GelSight (MIT) ou DIGIT (Meta), restaient de petite échelle et difficiles à généraliser hors contexte de doigts robotiques instrumentés. TouchAnything se positionne comme une alternative scalable via des capteurs portables grand public. Les concurrents directs incluent les équipes travaillant sur le transfert tactile sim-to-real chez Meta AI et MIT CSAIL, ainsi que les projets VLA tels que pi0 de Physical Intelligence ou OpenVLA, qui intègrent progressivement la modalité tactile dans leurs pipelines d'apprentissage par imitation. Aucun acteur français ou européen n'est impliqué dans ce preprint.

RecherchePaper
1 source
Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides
1600arXiv cs.RO 

Prismatic World Model : apprentissage de la dynamique compositionnelle pour la planification dans les systèmes hybrides

Une équipe de recherche a publié sur arXiv (arXiv:2512.08411v2, décembre 2025) le Prismatic World Model (PRISM-WM), une architecture de modèle du monde destinée à améliorer la planification dans les systèmes robotiques à dynamiques hybrides. Le problème central que PRISM-WM cherche à résoudre est structurel : les mouvements continus sont régulièrement interrompus par des événements discrets, contacts, impacts, transitions de phases (vol vs appui, glissement vs adhérence), qui créent des discontinuités difficiles à modéliser. Les architectures classiques à réseaux neuronaux monolithiques, comme les modèles latents de type RSSM ou DreamerV3, imposent une continuité globale qui lisse ces transitions et génère des erreurs cumulatives lors des simulations à long horizon (rollouts), rendant la planification peu fiable aux frontières physiques. PRISM-WM y répond par un cadre Mixture-of-Experts (MoE) contextuel : un mécanisme de gating identifie implicitement le mode physique courant, et des experts spécialisés prédisent la dynamique de transition associée. Une contrainte d'orthogonalisation latente force la diversité des experts, prévenant l'effondrement de modes. Les expériences portent sur des benchmarks de contrôle continu incluant des humanoïdes haute dimension et des configurations multi-tâches, couplés à l'algorithme d'optimisation de trajectoires TD-MPC. Les résultats montrent que PRISM-WM réduit le drift en simulation lors des rollouts étendus, offrant un substrat de haute fidélité pour les algorithmes d'optimisation de trajectoires. Pour les équipes de contrôle en robotique humanoïde, cela adresse directement le gap simulation-réalité lié à la gestion des contacts, une limitation structurelle des approches model-based existantes. La décomposition en primitives composables ouvre aussi une piste vers des architectures plus interprétables, un enjeu concret pour les déploiements industriels où la robustesse aux variations de terrain ou de tâche est critique. PRISM-WM s'inscrit dans la dynamique des world models pour la robotique, domaine en forte progression depuis les travaux de Hafner et al. sur DreamerV3 et les avancées de TD-MPC sur des tâches de locomotion complexe. L'approche MoE transposée à la dynamique physique rejoint des tendances observées dans les grands modèles de langage (Mixtral, GPT-4). Il n'est pas associé à une entreprise commerciale identifiée ; il s'agit d'une contribution académique pure, sans pilote industriel annoncé. La prochaine étape logique serait une validation sur hardware réel, notamment sur des plateformes humanoïdes où la gestion des contacts reste un verrou technique central de la sim-to-real transfer.

RecherchePaper
1 source