Aller au contenu principal

Dossier arXiv cs.RO — page 45

2437 articles · page 45 sur 49

Les preprints robotique sur arXiv cs.RO : les avancées techniques avant publication, dont planification, learning from demos, sim2real, manipulation.

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
2201arXiv cs.RO RecherchePaper

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

1 source
SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels
2202arXiv cs.RO 

SpikeVLA : modèles vision-langage-action (VLA) avec réseaux de neurones impulsionnels

Une équipe de chercheurs propose SpikeVLA, une nouvelle architecture de contrôle robotique publiée en préprint sur arXiv (arXiv:2606.27807v1, juin 2026), qui combine les modèles VLA (Vision-Language-Action) avec des réseaux de neurones impulsionnels, ou SNN (Spiking Neural Networks). L'architecture s'articule autour de trois blocs distincts : Spike-V, un encodeur visuel impulsionnel qui substitue aux couches denses traditionnelles des couches événementielles pour réduire le coût énergétique de la représentation visuelle ; Spike-L, un grand modèle de langage multimodal impulsionnel qui reformule le raisonnement cross-modal via une dynamique de spikes et une sparsité par token ; et Spike-A, un réseau de politique d'action s'appuyant sur un codage de population à noyau laplacien et un SNN multicouche entièrement connecté pour convertir l'activité impulsionnelle en commandes de contrôle continu. Les auteurs rapportent une réduction significative de la consommation énergétique et du coût computationnel tout en maintenant des performances compétitives sur des tâches de navigation et de contrôle robotique, sans toutefois détailler de métriques quantitatives dans l'abstract. L'enjeu est structurel : les modèles VLA dominants (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA de Stanford, Octo de Berkeley) reposent sur des transformers de grande taille, dont l'inférence exige des GPU embarqués ou une connexion à des serveurs distants. Cette dépendance représente un frein réel au déploiement autonome sur des robots à budget énergétique contraint, en particulier pour des applications edge sans infrastructure lourde. L'approche SNN répond à ce problème de manière fondamentalement différente : les neurones n'activent une computation que lors d'un spike, ce qui rend la consommation proportionnelle à l'activité réelle du réseau plutôt que constante. Si les gains annoncés se confirment sur benchmarks ouverts, cela ouvrirait la voie à du contrôle VLA temps réel sur du matériel embarqué standard. Un bémol éditorial s'impose néanmoins : l'abstract ne cite aucun ratio d'efficacité énergétique précis, aucun score sur benchmark de référence (LIBERO, RLBench, OpenX), ni cycle time, ce qui rend l'évaluation indépendante impossible à ce stade. Les VLA ont émergé comme paradigme dominant du contrôle robot généraliste entre 2023 et 2025, porté par des labos académiques (Berkeley, Stanford, CMU) et des startups comme Physical Intelligence. La recherche en calcul neuromorphique, dont les SNN sont le vecteur principal, dispose elle d'une décennie de travaux (Intel Loihi, IBM TrueNorth, BrainScaleS en Europe), mais leur application à des architectures VLA complètes reste peu explorée et n'a pas encore produit de système déployé en conditions industrielles. Aucun concurrent direct dans l'espace SNN-VLA n'est mentionné par les auteurs, et aucun partenariat industriel ni timeline de déploiement n'est annoncé. SpikeVLA reste pour l'instant un prototype de recherche soumis pour revue : l'étape critique sera la publication complète avec benchmarks reproductibles et comparaison rigoureuse contre les VLA transformers en conditions d'inférence embarquée.

UESi les gains énergétiques se confirment sur benchmarks ouverts, l'approche SNN-VLA pourrait bénéficier aux initiatives neuromorphiques européennes comme BrainScaleS, mais SpikeVLA reste un prototype de recherche sans impact concret immédiat pour la France ou l'UE.

IA physiqueOpinion
1 source
Langage des signes pour essaims : communication par le mouvement entre drones
2203arXiv cs.RO 

Langage des signes pour essaims : communication par le mouvement entre drones

Des chercheurs ont publié fin juin 2026 sur arXiv (référence 2606.27883) un système permettant à des drones en essaim de se transmettre de l'information via leurs seuls mouvements, sans émettre le moindre signal radio. L'architecture repose sur deux blocs principaux : un estimateur de pose qui surveille en temps réel la trajectoire du drone émetteur, et un réseau neuronal maison baptisé 3DTrajDecoder, capable de classifier et segmenter la séquence spatiotemporelle observée tout en estimant simultanément son échelle et le vecteur normal associé. Les trajectoires utilisées comme signaux sont modulaires et dynamiquement faisables, c'est-à-dire contraintes par la physique réelle du vol, ce qui les distingue de simples animations. Pour entraîner le décodeur à la fois sur des trajectoires communicantes et non-communicantes, l'équipe a développé un pipeline de génération procédurale en ligne, configurable et exécutable à la volée. Le système a été validé en simulation et en conditions réelles, avec une étude d'ablation documentant les choix architecturaux et les limites opérationnelles. L'intérêt principal tient au contexte opérationnel visé : les environnements dits "stealth-constrained", où les émissions radio actives risquent d'être brouillées ou géolocalisées. Dans des scénarios militaires, de surveillance ou de recherche et sauvetage en zones contestées, une communication purement visuelle entre agents autonomes représente une alternative résiliente aux liaisons RF conventionnelles. Le fait que le 3DTrajDecoder fonctionne sur des trajectoires planaires générées procéduralement, et non sur un vocabulaire fixe, suggère une capacité de généralisation que les approches à codage discret n'offrent pas. Le papier reste cependant au stade de la preuve de concept : aucun chiffre de portée, de débit d'information ou de taux d'erreur en conditions dégradées n'est fourni dans l'abstract, ce qui rend difficile toute comparaison avec l'état de l'art. La communication visuelle inter-drones n'est pas un sujet nouveau : des travaux antérieurs ont exploré les LEDs, les marqueurs visuels ou les codes couleur, mais ces approches supposent des conditions d'éclairage contrôlées ou des équipements spécialisés. Le mouvement comme vecteur sémantique est conceptuellement plus robuste en extérieur, mais exige une reconnaissance de pose fiable à distance, ce qui reste un défi ouvert en robotique aérienne. Les prochaines étapes logiques seraient de publier les métriques quantitatives complètes, de tester avec des essaims de plus de deux agents, et d'évaluer la robustesse au vent et aux occlusions partielles. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné.

RecherchePaper
1 source
Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée
2204arXiv cs.RO 

Infrastructure de simulation cloud-native évolutive, reproductible et en boucle fermée pour l'IA incarnée

Des chercheurs ont déposé le 27 juin 2026 sur arXiv (arXiv:2606.27962) un framework d'infrastructure de simulation cloud-native pour l'intelligence embarquée, conçu pour unifier en une seule plateforme la génération d'environnements de simulation, l'exécution de tâches, la collecte de trajectoires, l'évaluation de modèles et la gestion de données. L'architecture s'articule en quatre couches fonctionnelles et intègre quatre systèmes représentatifs : D-VLA, RL-VLA3, Sword et Pre-VLA, couvrant respectivement la simulation scalable, la planification dynamique des ressources, l'augmentation visuelle et le filtrage de données en temps réel. Le tout repose sur des technologies cloud-native telles que l'ordonnancement élastique des ressources et la simulation conteneurisée, pour gérer des workloads multi-modèles et multi-tâches à grande échelle. L'enjeu sous-jacent touche directement au goulot d'étranglement qui freine les modèles VLA (Vision-Language-Action) : la collecte de données réelles est coûteuse, peu reproductible et difficile à scaler. Ce framework propose une réponse systémique en substituant ou en complétant les données terrain par de la simulation industrialisée, avec une boucle fermée (closed-loop) permettant d'optimiser les données de façon itérative. Si les composants comme Pre-VLA (filtrage temps réel) et RL-VLA3 (apprentissage par renforcement sur architecture VLA) tiennent leurs promesses à l'échelle, cela pourrait réduire significativement le sim-to-real gap qui reste l'obstacle majeur pour déployer des robots génériques en environnement industriel réel. Il faut toutefois noter que la publication reste au stade de preprint sans benchmarks indépendants validés, et les performances sur robots physiques ne sont pas documentées dans ce papier. Ce travail s'inscrit dans une compétition internationale intense autour des infrastructures de simulation pour l'IA incarnée. NVIDIA pousse Isaac Sim avec l'écosystème Isaac Lab pour l'entraînement par renforcement, tandis que Genesis (dévoilé en 2024, affilié MIT) et MuJoCo Playground ciblent eux aussi la simulation GPU-accélérée à grande échelle. L'approche présentée ici se distingue par son orientation service (SOA) et sa couche de gestion de données unifiée, pensée pour des déploiements multi-équipes plutôt qu'un usage chercheur individuel. Les auteurs ne précisent pas d'affiliation institutionnelle clairement identifiable ni de calendrier de mise à disposition publique du code, deux points qui limiteront concrètement l'adoption tant qu'ils resteront non documentés.

RechercheOpinion
1 source
AO-ARC : planification de mouvement multi-robots presque sûrement asymptotiquement optimale avec ARC
2205arXiv cs.RO 

AO-ARC : planification de mouvement multi-robots presque sûrement asymptotiquement optimale avec ARC

Une équipe de recherche a publié sur arXiv (référence 2606.27495) AO-ARC, un algorithme de planification de mouvement multi-robots (MRMP) dit "anytime", c'est-à-dire capable de fournir une première solution valide immédiatement, puis de l'améliorer de façon continue sans délai fixé. L'algorithme combine le meta-algorithme AO-x, qui convertit des solveurs de faisabilité en algorithmes anytime, avec la méthode ARC (Adaptive Robot Coordination) appliquée itérativement sur des instances MRMP bornées, sous une métrique de makespan, le temps nécessaire à l'ensemble des robots pour atteindre leurs cibles. Les auteurs affirment que AO-ARC atteint des temps de première solution comparables aux solveurs de faisabilité de l'état de l'art, tout en convergeant plus rapidement et plus régulièrement que les méthodes anytime existantes à mesure que le nombre de robots augmente, avec une preuve formelle d'optimalité asymptotique. L'évaluation porte sur des scénarios 2D à différents niveaux de complexité de coordination et sur un scénario 3D avec bras manipulateurs, représentatif d'applications industrielles réelles. L'enjeu pratique est significatif : la planification multi-robots est NP-difficile en général, et le passage à l'échelle (10, 50, 100 robots) reste le talon d'Achille des méthodes existantes, notamment dans les entrepôts automatisés ou les cellules robotiques denses. La propriété anytime est particulièrement critique en déploiement réel, où un système ne peut pas attendre une solution optimale avant d'agir. La métrique makespan, en optimisant le temps de fin de la tâche collective plutôt que la somme des distances individuelles, est directement corrélée au débit industriel. Le mécanisme de couplage adaptatif d'ARC, choisir dynamiquement quand planifier des robots conjointement ou indépendamment, est préservé tout en maintenant une borne de coût cohérente sur les décompositions, ce qui est la difficulté théorique centrale que ce travail prétend résoudre. ARC, le solveur sous-jacent, avait déjà démontré des performances compétitives sur des benchmarks MRMP en exploitant ce couplage sélectif. AO-ARC s'inscrit dans une lignée de recherches visant à combiner garanties théoriques et efficacité pratique, face à des méthodes concurrentes comme CBS (Conflict-Based Search), ECBS ou les variantes de dRRT*, qui peinent à combiner rapidité de première solution et qualité asymptotique à grande échelle. Ce travail reste un preprint arXiv non encore évalué par les pairs, sans déploiement annoncé ni partenaire industriel mentionné, les benchmarks utilisés, bien que représentatifs, ne constituent pas une validation terrain.

RecherchePaper
1 source
LiMoDE : repenser la manipulation robotique continue par une approche mélange d'experts dynamiques
2206arXiv cs.RO 

LiMoDE : repenser la manipulation robotique continue par une approche mélange d'experts dynamiques

Une équipe de chercheurs a présenté LiMoDE (Lifelong Mixture of Dynamic Experts), une architecture destinée à permettre à un robot de maîtriser de nouvelles tâches de manipulation sans effacer les compétences précédemment acquises. Publiée en préprint sur arXiv (réf. 2606.26183), la méthode repose sur un schéma d'apprentissage en deux étapes. Dans un premier temps, un pré-entraînement multi-tâches construit une structure MoE (Mixture of Experts) dynamique : un nombre variable d'experts hétérogènes est activé sélectivement en fonction des informations de mouvement, chaque expert spécialisant une forme de manipulation à court terme. Dans un second temps, le mécanisme LiMoEAM (Lifelong MoE Adaptation Mechanism) ajoute de nouveaux experts "lifelong" qui se combinent dynamiquement avec les experts figés issus du pré-entraînement, transférant les connaissances acquises vers les nouvelles tâches. Le système a été évalué sur un benchmark de lifelong learning simulé ainsi que sur des tâches réelles, avec un surcoût décrit comme modéré en paramètres entraînables et en overhead d'inférence. L'intérêt de LiMoDE réside dans sa réponse au problème de l'oubli catastrophique, verrou persistant du déploiement de robots généralistes en environnement industriel réel. Là où les approches par fine-tuning efficace en paramètres (PEFT, LoRA) permettaient l'adaptation à une tâche unique mais dégradaient les performances précédentes, LiMoDE isole les compétences réutilisables dans des experts distincts et en préserve les poids lors de l'adaptation. Pour un intégrateur ou un COO industriel, cela signifie théoriquement qu'un robot pourrait acquérir de nouvelles opérations de saisie ou d'assemblage sans réentraînement complet de la flotte, réduisant les fenêtres d'indisponibilité. Le fait que la méthode n'ajoute qu'un nombre "modéré" de paramètres reste à quantifier précisément dans des configurations à grande échelle. Le problème du lifelong learning robotique est traité depuis plusieurs années dans la communauté du continual learning, notamment via des approches EWC (Elastic Weight Consolidation) ou des replay buffers. Les travaux récents sur les VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les politiques diffuses de Figure AI ont montré que des modèles pré-entraînés à large échelle s'adaptent rapidement à de nouveaux scénarios, mais peinent à maintenir les performances sur l'ensemble des tâches antérieures sans retraining. LiMoDE se positionne comme une solution architecturale intermédiaire entre le fine-tuning monolithique et le modèle généraliste à réentraînement systématique. Il s'agit à ce stade d'un article de recherche académique sans annonce de déploiement commercial ni partenariat industriel identifié.

RecherchePaper
1 source
GRAFT : transfert d'affordances à base de graphes par correspondance de parties
2207arXiv cs.RO 

GRAFT : transfert d'affordances à base de graphes par correspondance de parties

Des chercheurs ont publié sur arXiv (identifiant 2606.25241) GRAFT, un cadre de transfert d'affordance par correspondance de parties pour la manipulation robotique d'objets inconnus. Le principe : à partir d'un seul exemple par objet stocké dans un buffer de démonstrations, GRAFT permet à un robot de manipuler des instances qu'il n'a jamais vues, sans réentraînement. Chaque objet est représenté sous forme de graphe structuré par parties fonctionnelles, avec deux niveaux de descripteurs : des descripteurs au niveau des parties pour retrouver l'instance la plus proche fonctionnellement et géométriquement dans le buffer, puis des descripteurs au niveau des sommets pour localiser les points de contact précis à propager sur le nouvel objet. Ce que GRAFT apporte de concret, c'est la prise en compte explicite de la géométrie, là où les approches précédentes de transfert d'affordance s'appuyaient uniquement sur la similarité sémantique. Retrouver qu'une cafetière et une théière appartiennent à la même catégorie ne suffit pas si leurs anses diffèrent morphologiquement : le point de préhension optimal change, et un robot guidé uniquement par sémantique rate la saisie. En combinant alignement fonctionnel et correspondance géométrique fine des parties, GRAFT vise à réduire les échecs sur les variantes d'un même objet. Pour des intégrateurs en cellule flexible ou des équipes de bin-picking, cela signifie théoriquement moins de démonstrations à collecter pour couvrir la diversité d'un flux de pièces réel. La généralisation à de nouveaux objets avec peu d'exemples est un frein majeur en manipulation depuis des années : les méthodes d'imitation classiques requièrent typiquement des dizaines à des centaines de démonstrations par objet. Des approches récentes comme AnyGrasp, GraspNet ou les méthodes par affordance visuelle fondées sur CLIP (F3RM, CLIP-Fields) cherchent à réduire ce coût via des fondations vision-langage. GRAFT prend le pari inverse, en misant sur la correspondance structurelle de parties plutôt que sur le langage. Il s'agit d'une pré-publication arXiv sans institution mentionnée dans l'abstract et sans résultats quantitatifs accessibles sans lire le papier complet : les benchmarks de référence (YCB, OCID, RLBench) et les comparaisons avec les baselines restent à consulter dans le corps du travail avant toute conclusion sur les performances réelles.

RecherchePaper
1 source
De la correction locale à la généralisation : améliorer les politiques neuro-symboliques avec MEMO
2208arXiv cs.RO 

De la correction locale à la généralisation : améliorer les politiques neuro-symboliques avec MEMO

Des chercheurs de Virginia Tech ont publié MEMO (Memory Enhanced Manipulation), un système visant à lever le verrou fondamental des politiques neuro-symboliques en manipulation robotique. Ces architectures utilisent des modèles de vision et de langage (VLM) pour décomposer des tâches complexes en sous-tâches sémantiques, exécutées via des "skills" : primitives de mouvement, fonctions codées ou fragments de trajectoire. La contrainte est structurelle : si la bibliothèque de skills ne couvre pas la situation courante, la politique échoue quelle que soit la qualité du raisonnement de haut niveau. MEMO contourne cette limite en exploitant les corrections en langage naturel des opérateurs humains ("non, va plus haut") : le système collecte, regroupe et reformule ces retours à travers plusieurs utilisateurs et tâches pour synthétiser des templates de skills généralisables, stockés dans un skillbook à récupération augmentée (RAG) consulté à l'exécution pour générer de nouveaux skills à la volée. L'intérêt opérationnel est concret : MEMO déplace le coût d'amélioration depuis les ingénieurs (codage manuel de nouveaux skills) vers les opérateurs terrain, dont les retours naturels deviennent données structurées réutilisables. Les expériences rapportées dans la publication démontrent une généralisation à des tâches inédites là où les baselines existantes échouent, ce qui valide l'hypothèse centrale : l'abstraction des corrections locales produit une guidance plus robuste que le simple rappel du texte exact. Avantage pratique pour les équipes de déploiement : le système n'exige pas de réentraînement du modèle de base, ce qui réduit significativement le coût d'adaptation. Ce travail s'inscrit dans la compétition entre approches neuro-symboliques et approches VLA end-to-end (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui apprennent des politiques denses sans décomposition symbolique explicite. Les architectures symboliques conservent des avantages en interprétabilité et modularité, mais pâtissaient précisément de cette rigidité du skill-set post-déploiement ; MEMO tente de combler cet écart sans sacrifier la lisibilité du raisonnement. La publication arXiv (2603.04560) ne mentionne aucun partenaire industriel ni calendrier de commercialisation, positionnant clairement ce travail à un stade TRL expérimental, avec la démonstration consultable sur le site du laboratoire Collab de Virginia Tech.

RecherchePaper
1 source
Apprentissage par auto-imitation temporelle
2209arXiv cs.RO 

Apprentissage par auto-imitation temporelle

Un preprint arXiv déposé fin juin 2026 (référence 2606.19752) présente TSIL (Temporal Self-Imitation Learning), un cadre d'apprentissage par renforcement pour les politiques de manipulation robotique sur longues séquences d'actions. Le principe : identifier, au fil de l'entraînement, les trajectoires réussies les plus rapides, puis les convertir en supervision réutilisable pour les itérations suivantes via des cibles temporelles adaptatives conditionnées par la configuration ("configuration-conditioned adaptive temporal targets") et une réimitation pondérée par l'efficacité relative de chaque comportement. La méthode a été évaluée sur 15 tâches de manipulation longue séquence distinctes ; aucun déploiement sur robot physique n'est annoncé dans le papier. L'apport adresse un défaut bien documenté des approches par récompense dense (reward shaping) : un agent peut satisfaire le signal de récompense tout en produisant des comportements lents ou redondants, puisque rien ne pénalise explicitement l'inefficacité temporelle, et les rares séquences vraiment rapides tendent à être oubliées au fil de l'entraînement. TSIL propose de traiter le temps d'exécution lui-même comme signal d'auto-supervision scalable, complémentaire aux récompenses manuelles. Sur les 15 tâches testées, la méthode améliore simultanément l'efficacité d'apprentissage global, l'efficacité de complétion de tâche, la réintégration des comportements rapides et la robustesse aux instabilités d'entraînement. Pour les équipes cherchant à réduire l'ingénierie de récompense sur des tâches industrielles complexes, le signal est pertinent, mais il s'agit d'un résultat de recherche en simulation, non d'un produit validé terrain. TSIL s'inscrit dans la lignée de SAIL (Self-Imitation Learning, Oh et al. 2018) et de HER (Hindsight Experience Replay), deux méthodes exploitant les expériences passées pour guider l'apprentissage par renforcement, en y ajoutant une dimension temporelle explicite absente des approches précédentes. La manipulation longue séquence reste un verrou majeur pour les bras industriels et les humanoïdes ; des acteurs comme Physical Intelligence (Pi-0), Figure AI ou les équipes RL de Boston Dynamics travaillent sur des problématiques similaires. Ce preprint, non encore évalué par des pairs, ne mentionne ni partenaire industriel ni horizon de transfert sur robot réel. La prochaine étape logique sera de tester la robustesse de l'approche hors simulation, là où le sim-to-real gap remet généralement en cause les gains obtenus en environnement contrôlé.

RecherchePaper
1 source
Commande prédictive convexe robuste avec garanties d'évitement de collision pour bras manipulateurs
2210arXiv cs.RO 

Commande prédictive convexe robuste avec garanties d'évitement de collision pour bras manipulateurs

Des chercheurs présentent dans un pré-print arXiv (référence 2508.21677, troisième révision) une méthode de contrôle par modèle prédictif (MPC) conçue pour les bras manipulateurs industriels à 6 degrés de liberté (DOF) opérant dans des environnements encombrés. L'approche repose sur deux composantes : un tube MPC robuste, qui encapsule les trajectoires dans un tube garanti même en présence d'incertitudes paramétriques du modèle, et un algorithme de planification de corridor qui génère des chemins exemptes de collisions. La formulation qui en résulte est convexe, propriété rare dans ce domaine, ce qui permet une résolution rapide et compatible avec des boucles de contrôle temps réel. Validée uniquement en simulation, la méthode surpasse des approches de référence en tolérant des niveaux plus élevés d'incertitude de modèle tout en maintenant des vitesses d'exécution supérieures. Aucun déploiement matériel ni partenaire industriel n'est mentionné à ce stade. La portée industrielle de ce travail tient à un problème concret : les incertitudes de modèle dans les manipulateurs (charge variable, usure, flexibilité des joints) imposent aujourd'hui des limites de vitesse conservatives dans les cellules robotisées, ce qui réduit la cadence. Une méthode MPC offrant des garanties formelles de sécurité tout en réduisant ce conservatisme permettrait aux intégrateurs de pousser les vitesses nominales sans compromettre la conformité aux normes de sécurité (ISO 10218). La formulation convexe est ici un point-clé : elle rend le MPC compatible avec des solveurs rapides type QP (quadratic programming), là où les approches non-convexes nécessitent souvent des relaxations coûteuses ou des horizons de prédiction courts. Le contrôle prédictif pour manipulateurs est un axe de recherche actif depuis une décennie, avec des approches concurrentes incluant les MPC non-linéaires (via ACADO ou FORCES Pro), les méthodes basées sur les fonctions barrières de contrôle (CBF), ou encore les planificateurs par échantillonnage (MPPI). Ce travail se positionne sur la robustesse formelle et la rapidité de résolution, deux propriétés rarement combinées. La limite principale reste la validation purement simulée : le passage au réel (sim-to-real gap, flexibilité mécanique non modélisée, latences capteurs) n'est pas abordé. Les prochaines étapes naturelles seraient une validation sur hardware, par exemple sur un UR10 ou un KUKA LBR, et une extension à des horizons d'évitement dynamique face à des obstacles mobiles.

UELes intégrateurs et fabricants européens (ABB, KUKA) pourraient à terme exploiter cette méthode pour augmenter la cadence de leurs cellules sans compromettre la conformité ISO 10218, mais aucun partenariat ni déploiement européen n'est mentionné à ce stade.

RecherchePaper
1 source
EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets
2211arXiv cs.RO 

EffiNav : fusion de la profondeur et du modèle vision-langage pour une navigation efficace vers des objets

Une équipe de chercheurs a publié EffiNav, un framework de navigation robotique orientée-objet (Object Goal Navigation, ObjNav) qui fusionne perception de profondeur et modèles vision-langage pour améliorer l'efficacité des trajectoires d'exploration en environnement inconnu. La contribution, déposée en preprint sur arXiv (2606.18634) en juin 2026, évalue le système sur deux simulateurs de référence du domaine, HM3D (Habitat Matterport 3D) et OVON (Open-Vocabulary Object goal Navigation), puis le valide sur robots physiques en conditions réelles. Les auteurs l'étendent également à GOAT-BENCH, un benchmark de navigation avec mémoire augmentée, pour démontrer la généralisation du framework au-delà du protocole ObjNav standard. Sur les deux métriques habituelles du domaine, taux de succès (SR) et succès pondéré par longueur de chemin (SPL), EffiNav égale ou dépasse les baselines récentes, sans que le preprint ne communique de valeurs numériques absolues permettant une comparaison chiffrée directe. L'apport principal porte moins sur le taux de réussite brut que sur le SPL, qui pénalise les trajets inutilement longs. C'est précisément là que les approches actuelles divergent : les modèles entraînés end-to-end, y compris certains VLA (Vision-Language-Action), peinent à généraliser à de nouveaux environnements, tandis que les frameworks modulaires sans apprentissage accumulent des allers-retours redondants et revisitent des zones déjà explorées. EffiNav prétend adresser ces deux pathologies simultanément en combinant une estimation de la profondeur pour la représentation géométrique de l'espace et un modèle vision-langage pour l'interprétation sémantique. Pour les intégrateurs de robots de service ou les décideurs B2B, l'efficacité de trajectoire est directement liée au temps disponible pour les tâches secondaires, donc à la rentabilité opérationnelle d'un déploiement en entrepôt ou en environnement indoor. Le champ ObjNav s'est structuré autour de l'écosystème Habitat de Meta AI Research, qui fournit les simulateurs HM3D et OVON utilisés ici. Les approches concurrentes incluent des pipelines modulaires à cartographie explicite comme SemExp ou OpenFMNav, et des VLA appliqués à la navigation. EffiNav se positionne comme un framework hybride ne nécessitant ni encodeurs supplémentaires lourds ni réentraînement complet par domaine. Aucune timeline commerciale ni partenariat industriel n'est mentionné dans le preprint ; la prochaine étape naturelle serait une validation sur des plateformes AMR variées pour confirmer le transfert sim-to-real sur des morphologies autres que celles testées.

RecherchePaper
1 source
Planification de trajets robotiques adaptée à la congestion en environnements encombrés
2212arXiv cs.RO 

Planification de trajets robotiques adaptée à la congestion en environnements encombrés

Des chercheurs ont publié sur arXiv (réf. 2606.19031, juin 2026) un planificateur de tournées probabiliste pour robots mobiles autonomes (AMR) en espaces publics encombrés. Le système vise à guider un robot de service, qu'il soit guide en centre commercial, livreur en entrepôt de préparation de commandes ou médiateur muséal, à travers une séquence de points de passage en tenant compte du comportement stochastique des foules. L'approche repose sur des cartes CLiFF (Circular Linear Flow Field), des modèles statistiques appris qui prédisent les trajectoires piétonnes à partir d'une observation initiale. Ces prédictions alimentent un processus de décision markovien (MDP) résolu en ligne, autorisant un recalcul d'itinéraire à chaque nouvelle observation de passants. La validation s'appuie sur un jeu de données réel collecté dans un centre commercial. Le problème est concret et régulièrement sous-estimé dans les déploiements AMR : les manoeuvres d'évitement de collision déclenchées par la présence humaine dégradent les temps de cycle de manière non linéaire, particulièrement dans les espaces à densité variable selon l'heure de la journée. Traiter la foule comme un processus stochastique temporel plutôt que comme un simple bruit à filtrer représente un changement d'approche pertinent pour les intégrateurs opérant en logistique retail ou en accueil public. La contribution d'ingénierie centrale est la replanification en ligne sans recalcul global du MDP, ce qui conditionne l'utilisabilité réelle en environnement dynamique. A noter : les métriques de performance (gains de temps de cycle, taux de succès de tournée) ne sont pas quantifiées dans le résumé publié, et l'évaluation reste limitée à un seul site, ce qui limite la généralisation des conclusions. Les cartes CLiFF constituent un cadre existant de modélisation des flux piétons, ici couplé pour la première fois à un MDP online dans un contexte de planification multi-points de passage. La navigation sociale est un champ de recherche actif depuis une décennie, avec des approches concurrentes basées sur les modèles de force sociale, le protocole ORCA, ou des méthodes d'apprentissage profond sur trajectoires piétonnes (GNN, Transformer). Ce travail reste au stade de preprint académique, sans partenaire industriel ni déploiement commercial annoncé. La prochaine étape logique serait une validation multi-sites et une comparaison quantitative directe avec ces méthodes concurrentes, en particulier sur des géométries d'espaces plus complexes et des horizons temporels plus longs.

RecherchePaper
1 source
FlowMPC : amélioration des politiques de correspondance de flux avec des modèles du monde
2213arXiv cs.RO 

FlowMPC : amélioration des politiques de correspondance de flux avec des modèles du monde

Un préprint publié sur arXiv en juin 2026 (arXiv:2606.16286) présente FlowMPC, un cadre expérimental qui combine une politique d'imitation par Flow Matching (FM) avec un modèle de monde appris, pour améliorer les performances à l'inférence sans modifier l'entraînement initial. Le framework s'appuie sur TD-MPC2 (Hansen et al., 2024) et recourt à la planification Model Predictive Path Integral (MPPI) pour évaluer des séquences d'actions candidates générées par la politique FM à chaque pas de décision. Les expériences sont conduites sur le benchmark de manipulation ManiSkill (Tao et al., 2025), sur deux tâches : PickCube et PickSingleYCB. Dans les deux cas, l'ajout du modèle de monde améliore les performances par rapport à la politique FM seule, avec des gains particulièrement nets sur le taux de succès en fin d'épisode, l'indicateur le plus exigeant de ces benchmarks. Ce résultat illustre une tendance croissante en robotique apprise : augmenter les politiques d'imitation par du raisonnement prospectif au moment de l'inférence, sans retraining coûteux. Flow Matching est une approche récente pour les espaces d'action multimodaux, typiques des tâches de manipulation, mais elle n'est pas conçue pour maximiser directement un retour cumulatif. FlowMPC comble ce déficit en couplant le FM à un modèle de monde : la politique génère des actions candidates, le planificateur MPPI les filtre selon leur valeur estimée. Ce découplage entraînement/test ouvre une voie pragmatique pour les intégrateurs robotiques, car il permet d'améliorer des politiques déployées sans relancer des pipelines d'entraînement lourds. Ce travail s'inscrit dans un paysage de recherche dense où plusieurs approches cherchent à marier imitation et planification. TD-MPC2, sur lequel FlowMPC s'appuie directement, est une référence établie pour l'apprentissage par renforcement basé sur des modèles. Signé d'un seul auteur et non encore soumis à revue par les pairs, ce preprint reste à un stade préliminaire : les tests se limitent à deux tâches simulées, sans évaluation sur robot physique ni comparaison avec des politiques concurrentes majeures telles que Pi-0 (Physical Intelligence) ou les diffusion policies (Chi et al., 2023). La prochaine étape naturelle serait de valider le transfert sim-to-real et de tester sur des benchmarks de manipulation plus complexes, comme l'assemblage de pièces ou la manipulation d'objets déformables.

RecherchePaper
1 source
Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné
2214arXiv cs.RO 

Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné

Des chercheurs ont publié en juin 2026 sur arXiv (2606.15685) un framework appelé SCE (Skill-Compositional Experts), conçu pour permettre à des robots manipulateurs d'apprendre de nouvelles tâches en continu sans effacer les comportements déjà maîtrisés. L'approche repose sur deux blocs : un mécanisme de Compositional Skill Grounding (CSG) qui décompose des démonstrations en primitives réutilisables, puis un système DETE (Dual Execution-and-Transition Experts) à deux branches, l'une assurant l'exécution de chaque skill et l'autre pilotant les transitions entre eux pour produire un comportement cohérent. Les évaluations portent sur les benchmarks LIBERO (manipulation en simulation) ainsi que sur des tâches en environnement réel, avec des gains de rétention et de performance globale par rapport aux méthodes de référence. Le problème visé, le "catastrophic forgetting" en boucle fermée, est nettement plus sévère qu'en continual learning classique : sous contrôle séquentiel, la dérive des représentations internes (feature drift) s'accumule et dégrade progressivement les comportements antérieurs. Pour les industriels déployant des bras robotiques multi-tâches en logistique, assemblage ou alimentation, c'est un verrou réel : introduire une nouvelle tâche risque d'invalider les précédentes, imposant des revalidations coûteuses. SCE propose de structurer explicitement les skills en une base réutilisable, ce qui pourrait, si cela tient à l'échelle, réduire ce surcoût d'intégration. À noter cependant : il s'agit d'un preprint non encore évalué par les pairs, et les résultats en environnement réel restent peu détaillés dans l'abstract. L'Embodied Continual Learning a gagné en visibilité avec l'essor des politiques robotiques généralisables, notamment sous l'influence des Visual Language Action models (VLA) et des travaux de sim-to-real transfer. Les benchmarks LIBERO sont devenus une référence pour évaluer la généralisation des politiques de manipulation. Les approches concurrentes, comme SkillDiffuser ou les méthodes à mémoire épisodique, traitent la même problématique sans structurer explicitement les transitions entre skills, ce qui constitue la contribution centrale de SCE. Les auteurs publient une page projet mais n'annoncent ni partenariat industriel ni timeline de déploiement, ce qui situe ce travail à la frontière entre preuve de concept académique et transfert applicatif.

RecherchePaper
1 source
TO-SoFiT : optimisation topologique d'une queue de poisson souple hydraulique pour une locomotion ondulatoire programmable
2215arXiv cs.RO 

TO-SoFiT : optimisation topologique d'une queue de poisson souple hydraulique pour une locomotion ondulatoire programmable

Des chercheurs ont mis en ligne en juin 2026 sur arXiv (preprint 2606.15645) une méthode baptisée TO-SoFiT (Topology Optimization of Soft Fish Tail), destinée à automatiser la conception de queues de poissons souples hydrauliques pour la robotique sous-marine biomimétique. Le coeur de l'approche repose sur un modèle issu de la loi de Darcy, augmenté d'un terme de drainage, pour simuler les pressions hydrauliques spatialement variables à l'intérieur de la structure souple, puis les convertir en forces nodales via analyse par éléments finis. Une formulation d'optimisation multi-critères équilibre simultanément l'efficacité de déformation, l'interaction fluide-structure, la fabricabilité géométrique et la rigidité requise pour la nage 3D. L'actionneur obtenu, intégré dans un réseau pneumatique, est validé par simulation sous différentes charges hydrauliques, atteignant des amplitudes d'ondulation réglables et une flexion multiaxe pour le contrôle de profondeur. En cascadant plusieurs segments optimisés, les auteurs obtiennent des schémas de nage programmables à différentes pressions. Le code et les simulations sont disponibles publiquement sur GitHub. Ce travail répond à un verrou persistant de la robotique douce : l'absence de cadre de conception systématique pour des mouvements 3D complexes par actuation hydraulique ou pneumatique. Jusqu'ici, les concepteurs s'appuyaient sur des géométries empiriques, souvent rectangulaires, dont les performances sont sous-optimales. TO-SoFiT démontre en simulation que la topologie optimisée surpasse son équivalent rectangulaire en amplitude d'ondulation et en agilité multiaxe. L'approche formalise également le couplage entre actuation et déformation structurelle, souvent traité de manière découplée dans la littérature, ouvrant une voie vers la co-conception automatisée d'actionneurs souples. La robotique douce sous-marine mobilise plusieurs groupes de référence, dont le MIT CSAIL, Harvard et plusieurs équipes chinoises spécialisées dans les robots-poissons pneumatiques. L'industriel allemand Festo illustre le potentiel commercial du biomimétisme aquatique avec ses projets BionicFinWave et AquaPenguin. TO-SoFiT se positionne avant tout comme un outil de conception amont plutôt que comme un prototype : le preprint ne présente aucune fabrication physique ni test en bassin, ce qui laisse ouverte la question critique du sim-to-real gap, généralement significatif avec les élastomères souples. Les prochaines étapes naturelles sont la fabrication par moulage en silicone et la validation expérimentale, en vue d'applications dans l'inspection de structures sous-marines ou la biologie aquatique.

RecherchePaper
1 source
C-3TO : optimisation continue de trajectoires 3D sur champs de distances euclidiennes signées neuronaux
2216arXiv cs.RO 

C-3TO : optimisation continue de trajectoires 3D sur champs de distances euclidiennes signées neuronaux

Une équipe de recherche a publié sur arXiv (identifiant 2509.20084v2) un framework de planification de trajectoires 3D baptisé C-3TO (Continuous 3D Trajectory Optimization), ciblant la navigation autonome de drones en environnements encombrés. Le coeur du système repose sur un champ de distance signée euclidien (ESDF) neuronal mis à jour en temps réel, sur lequel les trajectoires sont optimisées de façon continue plutôt que sur une grille discrétisée. Celles-ci sont paramétrées par des polynômes de cinquième ordre, ce qui garantit la continuité des dérivées jusqu'à l'accélération et au-delà. L'optimisation s'effectue en deux étapes non linéaires successives qui mettent en balance efficacité computationnelle, sécurité vis-à-vis des obstacles et régularité du mouvement. Les expériences menées démontrent que le système génère des trajectoires à la fois collision-free et dynamiquement faisables. L'intérêt de cette approche tient à un point précis : les méthodes classiques construisent des ESDFs discrètes et interpolent entre les voxels pour obtenir les gradients, ce qui introduit des erreurs numériques lors de l'optimisation. En travaillant directement sur une représentation neuronale continue, C-3TO dispose de gradients exacts sur l'intégralité du chemin, pas seulement aux noeuds d'une grille. Pour les systèmes de replanification locale embarquée sur drone, cela réduit potentiellement le risque de trajectoires sous-optimales autour d'obstacles complexes. La flexibilité du framework dans le réglage de la taille des fenêtres locales et des paramètres d'optimisation le rend adaptable sans redéveloppement majeur, un argument pertinent pour les équipes d'intégration en robotique aérienne. Le domaine de la planification de trajectoires en temps réel pour UAV est actif depuis plusieurs années, avec des travaux notables autour des EGO-Planner (Zhu et al., 2021) et FASTER (Tordesillas et al., 2022), qui s'appuient eux aussi sur des représentations de distance pour l'évitement d'obstacles. C-3TO se positionne comme une évolution méthodologique de cet écosystème, en substituant le réseau neuronal à la grille voxel traditionnelle. Le paper n'annonce pas de déploiement matériel ni de validation sur plateforme physique en conditions réelles ; les résultats présentés restent à ce stade expérimentaux, et la robustesse sim-to-real n'est pas adressée explicitement.

RecherchePaper
1 source
R2RDreamer : augmentation de données 3D pour des politiques de manipulation 2D spatialement généralisées
2217arXiv cs.RO 

R2RDreamer : augmentation de données 3D pour des politiques de manipulation 2D spatialement généralisées

Des chercheurs présentent R2RDreamer, un cadre d'augmentation de données pour entraîner des politiques de manipulation robotique à faible coût de collecte, publié en préprint sur arXiv (2606.17040) en juin 2026. Le problème ciblé est la généralisation spatiale : une politique apprise par imitation sur quelques démonstrations réelles échoue souvent dès que l'objet est légèrement déplacé, la caméra repositionée, ou le bras robotique reconfiguré. R2RDreamer part d'un nombre limité de démonstrations réelles et en génère artificiellement des variantes cohérentes. Son pipeline fonctionne en deux étapes : d'abord, un module 3D léger édite les nuages de points incomplets de la scène et les trajectoires de l'effecteur terminal dans un référentiel commun ; ensuite, ces scènes modifiées sont projetées en vidéos de contrôle masquées (avec raisonnement occlusion-aware), puis complétées en séquences RGB temporellement cohérentes par un modèle image-vers-vidéo à contrôle dense. Les expériences valident la méthode sur des tâches de manipulation avec déplacement spatial, en combinaison avec des politiques de type diffusion 2D et des politiques vision-langage-action (VLA). Ce travail s'attaque à un verrou concret du déploiement industriel : le coût prohibitif de la collecte de démonstrations multi-pose, multi-viewpoint en environnement réel. Les approches concurrentes basées sur la simulation (MuJoCo, Isaac Gym) exigent une modélisation précise des objets et restent exposées au sim-to-real gap. Les méthodes real-to-real existantes contournent ce gap mais requièrent une reconstruction 3D complète et produisent des observations adaptées aux politiques sur nuages de points, inadaptées aux pipelines RGB classiques. R2RDreamer déplace la complétion visuelle dans l'espace vidéo 2D, ce qui le rend compatible avec les architectures VLA dominantes comme pi0 ou OpenVLA, sans nécessiter une reconstruction de scène exhaustive. C'est une avancée méthodologique qui pourrait réduire les besoins en données téléopérées d'un facteur significatif, même si les expériences rapportées ne quantifient pas encore de ratio précis. R2RDreamer s'inscrit dans une famille de travaux real-to-real (RoboAgent, GenAug, SceneAug) cherchant à s'affranchir de la simulation. La nouveauté réside dans l'hybridation : garder la rigueur géométrique de l'édition 3D pour les trajectoires, mais déléguer la cohérence visuelle à un modèle vidéo génératif, évitant ainsi les artefacts de rendu 3D. Côté compétiteurs, des approches comme AugmentationX ou les méthodes de diffusion in-painting (Paint-it, RoboGen) font le même pari mais sans édition jointe trajectoire-observation. Aucun partenaire industriel ni calendrier de transfert ne sont mentionnés dans ce preprint : il s'agit d'une contribution de recherche fondamentale, et l'étape suivante probable sera une évaluation sur des plateformes matérielles standardisées (Franka, UR5, ou une humanoïde) avec des benchmarks publics type RoboMimic ou LIBERO.

RecherchePaper
1 source
Apprentissage par renforcement avec estimateur de dynamique interne pour la manipulation aérienne en environnement incertain
2218arXiv cs.RO 

Apprentissage par renforcement avec estimateur de dynamique interne pour la manipulation aérienne en environnement incertain

Des chercheurs ont publié sur arXiv (preprint 2606.16621) une architecture de contrôle hiérarchique pour manipulateurs aériens, visant à résoudre l'un des problèmes les plus épineux de la robotique de terrain : faire travailler un bras articulé monté sur drone sans que les mouvements du bras ne déstabilisent l'engin, même quand la charge utile varie de façon imprévue. Le système combine un apprentissage par renforcement (RL) en boucle externe avec un estimateur de dynamique en boucle interne. La couche RL traduit des cibles en 6 degrés de liberté (DOF) pour l'effecteur terminal en commandes coordonnées pour l'ensemble du corps de l'engin, sans nécessiter un modèle dynamique couplé précis. La boucle interne prend le relais pour compenser en temps réel les perturbations inertielles transitoires, notamment lors de changements brusques de payload ou de mouvements rapides du bras à 3-DOF. Les expériences matérielles ont été conduites sur un quadrotor instrumenté à cet effet, dans des conditions de charge variable. Comparée à deux baselines de référence (RL+PID et RL+INDI+PID), l'approche réduit l'erreur de suivi de l'effecteur terminal et améliore le taux de succès des tâches. Ce résultat est pertinent parce que le couplage dynamique bras-drone reste le principal frein à la manipulation aérienne fiable en conditions réelles : chaque mouvement du bras modifie le centre de masse et génère des couples parasites que les contrôleurs classiques peinent à absorber. En séparant la couche d'apprentissage (qui gère la coordination tâche-corps) de la couche d'estimation (qui absorbe les incertitudes à basse latence), les auteurs proposent une architecture modulaire qui ne dépend pas d'un modèle système précis, ce qui simplifie le passage du simulateur au matériel réel. Pour les intégrateurs industriels qui ciblent l'inspection de structures, la maintenance d'infrastructures ou la construction en hauteur, c'est un verrou technique concret qui se desserre. Le domaine de la manipulation aérienne est encore largement académique, avec des contributions dispersées entre laboratoires européens, américains et asiatiques, sans acteur dominant identifié à ce stade. Côté français, Alerion et quelques spin-offs de l'ISAE-SUPAERO ou de l'ENAC travaillent sur des drones à haute précision, mais sans manipulateur embarqué à ce niveau de sophistication. Ce travail reste un preprint non encore soumis à revue par les pairs, et les expériences rapportées portent sur un prototype unique dans un environnement contrôlé. Les métriques de succès ne sont pas détaillées quantitativement dans le résumé disponible, ce qui rend difficile toute comparaison directe avec l'état de l'art publié. La prochaine étape logique serait une validation sur des tâches réelles en extérieur avec des charges plus lourdes.

UELes laboratoires français actifs sur les drones de précision (Alerion, ISAE-SUPAERO, ENAC) pourraient s'appuyer sur cette architecture modulaire pour progresser vers la manipulation aérienne embarquée, mais aucun impact direct n'est établi à ce stade.

RecherchePaper
1 source
EgoMoD : prédire des cartes globales de dynamiques à partir d'observations égocentrées locales
2219arXiv cs.RO 

EgoMoD : prédire des cartes globales de dynamiques à partir d'observations égocentrées locales

EgoMoD (arXiv:2603.00167v2) est une méthode de navigation robotique qui prédit des cartes globales de dynamique de mouvement, appelées Maps of Dynamics (MoDs), depuis de courtes séquences vidéo égocentrées collectées par le robot lui-même. Les MoDs représentent de façon structurée les tendances de mouvement dans un espace donné, offrant un support pour la planification à long terme. L'architecture, conditionnée par la vidéo et la pose du robot, est entraînée par supervision privilégiée : des MoDs calculées depuis des capteurs externes servent de signal d'apprentissage, mais à l'inférence, seuls les capteurs embarqués standards sont requis. Les expériences couvrent de grands environnements simulés, et une validation sur images réelles démontre un transfert zéro-shot sans fine-tuning. L'enjeu pour les robots mobiles autonomes (AMR) déployés dans des environnements peuplés est concret : la navigation réactive, limitée au champ de vision immédiat, contraint la fluidité des déplacements dans des espaces denses comme les entrepôts ou les hôpitaux. Les MoDs permettent une planification préemptive en anticipant la position probable des personnes avant qu'elles n'entrent dans le périmètre de détection. Jusqu'ici, ce type de carte dynamique exigeait une infrastructure fixe (caméras de surveillance, systèmes de suivi centralisés), incompatible avec des déploiements agiles. EgoMoD supprime cette contrainte : la carte prédictive se construit depuis les données d'opération courante, ce qui ouvre la voie à des déploiements sans modifier l'infrastructure existante. Les MoDs s'inscrivent dans un champ de recherche actif sur les représentations dynamiques, au-delà des cartes d'occupation statiques ; les approches antérieures nécessitaient des capteurs fixes sur de longues périodes, ce qui ralentissait le déploiement opérationnel. EgoMoD rejoint une tendance à exploiter des architectures vidéo pour inférer des priors dynamiques, terrain partagé avec des modèles comme Trajectron++ ou Social-LSTM. À noter : les résultats quantitatifs principaux sont issus de simulations ; la validation sur images réelles démontre le transfert zéro-shot mais sans évaluation end-to-end de navigation complète. Aucun partenaire industriel ni calendrier de production n'est mentionné dans la publication, et la disponibilité du code source reste à confirmer.

RecherchePaper
1 source
Apprentissage de la manipulation d'objets depuis zéro par interaction contrastive
2220arXiv cs.RO 

Apprentissage de la manipulation d'objets depuis zéro par interaction contrastive

Une équipe de chercheurs propose sur arXiv (réf. 2606.11525, juin 2025) une méthode baptisée Interaction-weighted Resampling (IWR) pour améliorer l'apprentissage par renforcement contrastif (CRL) appliqué à la manipulation robotique. Le CRL apprend des représentations structurées des dynamiques pour résoudre des tâches conditionnées par objectif, mais peinait à gérer les contacts et les saisies. L'article formalise ce problème en modélisant la dynamique de manipulation comme un processus de Markov lisse par morceaux : les changements de mode induits par les contacts créent des structures d'accessibilité non linéaires que les fonctions d'énergie CRL standard ne représentent pas correctement. L'IWR rééchantillonne de manière pondérée autour des trois phases clés (avant, pendant et après le contact) pour que la représentation apprise préserve ces frontières de mode. En simulation, la méthode améliore de 19,8 % en moyenne les performances par rapport aux méthodes CRL existantes sur plusieurs environnements (contrôle 2D dynamique, manipulation, hockey sur table). En transfert sim-to-real, un agent de hockey sur table conditionné par objectif voit son taux de réussite passer de 25 % à 60 %. Ce résultat est notable pour les équipes qui misent sur le RL pur pour la manipulation, un domaine dominé depuis 2023 par l'imitation learning et les politiques de diffusion comme ACT, Diffusion Policy ou pi-0. Le principal obstacle, la discontinuité dynamique liée aux contacts, était jusqu'ici contourné par des démonstrations humaines ou des curricula manuels ; IWR propose une approche mathématiquement fondée pour l'attaquer sans supervision. La progression de 25 % à 60 % en conditions réelles reste cependant modeste, et le domaine de test (hockey sur table planaire, tâche répétitive et bien contrainte) est éloigné de la dextérité multidimensionnelle requise en milieu industriel. Aucune comparaison directe avec des architectures VLA ou diffusion policy sur des benchmarks communs n'est fournie dans le preprint. Le CRL pour la manipulation avait été porté par des travaux issus de Berkeley et de Google DeepMind (GCRL, QuaSAR), sans jamais franchir le verrou du contact-rich. Ce preprint arXiv de juin 2025, non encore soumis à peer-review, s'inscrit dans un effort académique plus large face à la montée en puissance des VLA comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné ; le projet reste à un stade de recherche fondamentale. Le code et les démonstrations vidéo sont disponibles sur la page projet IWR-arxiv.github.io.

RecherchePaper
1 source
VICX : manipulation robotique généralisable par génération vidéo et réseau d'opérateurs en contexte
2221arXiv cs.RO 

VICX : manipulation robotique généralisable par génération vidéo et réseau d'opérateurs en contexte

Une équipe de chercheurs publie sur arXiv (juin 2026, ref. 2606.12028) VICX, un framework de manipulation robotique généraliste articulé autour d'une architecture découplée en deux blocs : un modèle de génération vidéo figé (non fine-tuné) produit des plans visuels de haut niveau conditionnés par langage naturel, tandis qu'un réseau baptisé V2T-ICON (Video-to-Trajectory In-Context Operator Network) traduit ces plans en trajectoires exécutables pour le robot. La particularité de V2T-ICON réside dans son fonctionnement par apprentissage en contexte : au moment de l'inférence, il récupère des paires image-état préenregistrées et travaille sur des images segmentées du seul bras robotique, permettant un mapping visuel-vers-état sans mise à jour des paramètres. Les expériences sont conduites sur Meta-World, un benchmark de simulation standard, et démontrent la généralisation inter-tâches, la correction en boucle fermée, et le transfert inter-corps (cross-embodiment). L'intérêt de cette approche pour les équipes de R&D réside dans sa modularité : en découplant planification visuelle et exécution motrice, VICX permet théoriquement de substituer l'un des deux blocs de façon indépendante, réduisant le coût d'adaptation à de nouvelles tâches sans réentraînement complet. Le mécanisme d'in-context learning évite de paramétrer le réseau pour chaque tâche inédite, ce qui est pertinent pour des environnements industriels changeants. Cela dit, les résultats restent cantonnés à Meta-World, un environnement de simulation simplifié : aucune validation sur robot physique n'est publiée dans ce preprint, une limite structurelle dans un domaine où le sim-to-real gap demeure l'obstacle central non résolu. VICX s'inscrit dans la vague des Visual Language Action models (VLA) cherchant à dépasser l'imitation learning classique via des représentations visuelles génératives. Les approches concurrentes comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA adoptent des architectures majoritairement end-to-end et ont déjà fait l'objet de déploiements ou démonstrations sur hardware réel, ce qui les positionne en avance sur l'applicabilité industrielle à court terme. VICX constitue une contribution méthodologique solide sur la question de la généralisation, mais son chemin vers un déploiement concret reste entièrement à démontrer.

IA physiqueOpinion
1 source
IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force
2222arXiv cs.RO 

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force

Une équipe de recherche a publié le 12 juin 2026 sur arXiv (référence 2606.10818) IMPACT, un framework d'apprentissage pour la manipulation robotique dite "forceful", c'est-à-dire impliquant des interactions physiques avec l'environnement : utilisation d'outils de masses variables, transport d'objets lourds, nettoyage de surface par contact prolongé. L'architecture découple le problème en deux blocs distincts : un planificateur de tâche de haut niveau, et un contrôleur prédictif basé sur un modèle interne (internal-model predictive control). Les expériences sont menées à la fois en simulation et sur robot réel, avec évaluation sur des objets non vus lors de l'entraînement. Les auteurs ne publient pas encore les métriques quantitatives précises dans l'abstract arXiv disponible, ce qui limite l'analyse indépendante à ce stade. Le verrou technique adressé est réel et sous-estimé dans les pipelines d'imitation learning actuels. Deux stratégies dominent aujourd'hui : la première laisse les forces émerger implicitement via les erreurs de suivi d'un contrôleur d'impédance, ce qui casse la généralisation dès que la masse de l'objet change ; la seconde commande explicitement les efforts via capteur force/couple ou capteur tactile au poignet, ce qui fonctionne mais alourdit l'intégration matérielle et fragilise les déploiements industriels. IMPACT propose une troisième voie en apprenant un modèle interne de la dynamique de contact, permettant au contrôleur prédictif d'anticiper les forces sans capteur dédié ni dégradation de généralisation. Les gains annoncés en taux de succès, sécurité et efficacité énergétique sont cohérents avec l'approche, mais restent à valider sur des benchmarks standardisés comme DROID ou RoboAgent. Ce travail s'inscrit dans un courant actif qui cherche à marier l'apprentissage par imitation avec les garanties du contrôle prédictif (MPC), après des travaux fondateurs comme ILC, DMP, et plus récemment les architectures VLA de type pi0 (Physical Intelligence) ou RoboDiff. Le problème de la manipulation forcée reste un angle mort des démos grand public, qui privilégient les tâches de pick-and-place sur objets légers. Les concurrents directs incluent les approches sim-to-real de CMU (DexVIP, ACT), d'ETH Zurich (ANYmal) et les travaux de Boston Dynamics Research sur la manipulation lourde. Côté européen, aucun acteur n'est directement cité, mais les travaux de Wandercraft et Enchanted Tools sur la dynamique de contact pourraient bénéficier de ce type de framework. La prochaine étape naturelle serait une validation sur manipulateurs industriels (UR, Franka) en conditions de production réelle.

RecherchePaper
1 source
RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement
2223arXiv cs.RO 

RoboNaldo : tirs précis, stables et puissants pour humanoïdes via apprentissage par renforcement à programme progressif guidé par le mouvement

Des chercheurs d'OpenDriveLab ont publié le 13 juin 2026 RoboNaldo (arXiv:2606.11092), un framework d'apprentissage par renforcement en curriculum à trois étapes conçu pour entraîner un humanoïde à tirer au football avec précision et puissance. Déployé sur un Unitree G1 avec perception embarquée, le système atteint une erreur de tir moyenne de 0,73 m depuis 3 m en situation de coup franc (balle stationnaire), et 0,86 m sur balle en mouvement. La vitesse post-contact de la balle atteint 13,10 m/s, soit 59 à 71 % de la vitesse mesurée chez des joueurs professionnels en match ouvert. En simulation, RoboNaldo réduit l'erreur de tir de 48,6 % et multiplie la vélocité de frappe par 2,96 par rapport aux baselines de référence antérieures. L'intérêt technique réside dans la combinaison de deux approches qui s'avèrent complémentaires plutôt qu'opposées : le motion tracking-driven RL (stable mais rigide face à des positions de balle variables) et le task reward-driven RL (flexible mais inefficace à explorer des kicks valides de zéro). RoboNaldo hybride les deux via un curriculum progressif : le robot apprend d'abord un prior de coup de pied corps entier stable à partir d'une seule référence humaine, puis l'adapte à des positions de balle aléatoires, puis à une balle en mouvement via une interface locomotion-commande/kick-trigger. Un planificateur heuristique haut niveau pilote l'entraînement, mais le même policy bas niveau peut être conduit par n'importe quel contrôleur alternatif à l'inférence, ce qui est une propriété utile pour l'intégration dans des systèmes plus larges. Il reste que les résultats présentés s'appuient sur des vidéos et métriques de laboratoire contrôlé, sans terrain irrégulier ni adversaires dynamiques. OpenDriveLab, lab de recherche en autonomie embodied associé à Shanghai AI Lab, se positionne ici dans un espace de plus en plus disputé. Boston Dynamics, Agility Robotics (Figure, Tesla Optimus) concentrent leurs démonstrations sur la manipulation industrielle et la locomotion bipède en entrepôt, tandis que des travaux comme DribbleBot (CMU, 2023) ou les robots footballeurs de l'équipe NimbRo avaient déjà exploré le jeu avec ballon, mais sur des plateformes quadrupèdes ou plus légères. RoboNaldo est présenté comme une démonstration de recherche (preprint non peer-reviewed à ce stade) : aucun pilote industriel ni timeline de commercialisation n'est annoncé. La prochaine étape logique serait l'évaluation en conditions non structurées et l'intégration d'un contrôleur haut niveau appris plutôt qu'heuristique.

RecherchePaper
1 source
Repenser la navigation incarnée grâce au biais inductif relationnel
2224arXiv cs.RO 

Repenser la navigation incarnée grâce au biais inductif relationnel

Une équipe de chercheurs a publié le 10 juin 2026 sur arXiv (référence 2606.10348) DB-Nav, un framework de navigation robotique incarnée conçu pour la tâche ObjectNav : guider un agent autonome vers un objet cible dans un environnement inconnu, en s'appuyant uniquement sur des observations visuelles. La spécificité de DB-Nav est de ne pas se contenter de détecter où chercher, mais d'identifier activement ce à quoi ne pas faire confiance. Le système décompose les relations objet-contexte en deux biais complémentaires : un biais d'activation, qui propage les indices contextuels fiables dans la carte de l'environnement, et un biais d'inhibition, qui supprime les régions trompeuses via deux mécanismes distincts, la confusion perceptuelle (faux positifs issus des détecteurs open-vocabulary) et la falsification par l'action (zones déjà explorées sans succès). Ces deux biais sont unifiés dans un graphe appelé Relational Activation-Inhibition Exploration Graph, qui module dynamiquement les valeurs d'exploration des frontières candidates à partir des observations en ligne et des échecs passés. L'intérêt opérationnel de cette approche réside dans l'identification d'un problème structurel souvent sous-estimé : les modèles de vision-langage (VLM) utilisés en robotique de navigation produisent des biais systématiques, faux positifs récurrents, priors statiques obsolètes, absence de vérification incarnée, qui contaminent la cartographie et la prise de décision. DB-Nav y répond sans recourir à un raisonnement VLM en ligne coûteux, ce qui le rend à la fois léger et interprétable. Sur les benchmarks ObjectNav standards, le framework surpasse significativement les méthodes existantes en taux de succès (SR) et en succès pondéré par la longueur du chemin (SPL), deux métriques de référence dans l'évaluation de la navigation autonome en intérieur. La tâche ObjectNav est un banc d'essai central de la robotique cognitive depuis plusieurs années, avec des contributions majeures issues de laboratoires comme AI2, Meta ou CMU. Les approches dominantes jusqu'ici s'appuient sur des détecteurs open-vocabulary (CLIP, Grounding DINO) ou des VLM comme GPT-4V pour guider l'exploration, au prix d'une latence et d'une dépendance à des modèles lourds. DB-Nav s'inscrit dans un courant de recherche qui cherche à corriger le "reality gap" des VLM en intégrant un retour d'expérience incarné, une piste que suivent également des équipes travaillant sur les architectures Vision-Language-Action (VLA) pour la robotique mobile. Ce travail reste à ce stade une contribution académique sans déploiement annoncé ; son impact dépendra de son intégration dans des pipelines de navigation réels, notamment pour les robots de service en environnements intérieurs non structurés.

RecherchePaper
1 source
MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares
2225arXiv cs.RO 

MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares

Des chercheurs ont publié sur arXiv (2606.10288) MARCH, un cadre d'apprentissage par renforcement assisté par modèles pour la locomotion bipedale sur appuis épars. La méthode repose sur trois étapes : générer une trajectoire de référence sûre à partir de modèles dynamiques simplifiés, entraîner une politique "enseignante" guidée par un reward basé sur une Control Lyapunov Function (CLF), puis distiller cette politique dans une politique "étudiante" visuelle déployable sur robot réel. L'ensemble a été validé en simulation et déployé sur un Unitree G1, humanoïde commercialisé autour de 16 000 dollars, naviguant sur des appuis épars avec contraintes latérales. L'enjeu est de réconcilier deux familles de méthodes historiquement opposées : les approches basées modèle (MPC, optimisation de contact) sont précises mais fragiles face à l'incertitude de terrain, tandis que le RL pur est robuste mais peine à découvrir les mouvements finement contraints nécessaires à la locomotion safety-critical, où une erreur de quelques centimètres peut provoquer une chute. Le reward CLF injecte une connaissance physique dans la boucle d'apprentissage sans curriculum d'entraînement complexe, améliorant l'efficacité d'échantillonnage et produisant une locomotion plus fluide. Les performances sur stepping stones sont déclarées comparables aux baselines RL purs, ce qui suggère que l'hybridation modèle/apprentissage est viable à coût computationnel comparable. Ce travail s'inscrit dans l'axe locomotion perceptive porté par ETH Zurich (parkour RL, 2023), Carnegie Mellon et Berkeley. La distillation teacher-student, popularisée par Agility Robotics et ANYbotics dans leurs pipelines de développement, est ici enrichie d'une contrainte CLF théoriquement fondée. Le Unitree G1 est devenu une plateforme quasi-standard dans les labos de locomotion pour sa documentation et son prix accessible. Il s'agit d'un preprint arXiv non évalué par les pairs, sans déploiement industriel ni timeline commerciale annoncés. Les prochaines étapes naturelles seraient une validation sur terrain extérieur non structuré et une comparaison directe avec les approches MPC de nouvelle génération.

UEImpact marginal : ETH Zurich (Suisse, hors UE) est cité en travaux connexes, mais aucun labo ou industriel européen n'est directement impliqué dans ce preprint.

RecherchePaper
1 source
EM-Fall : détection de chutes jour et nuit par ondes millimétriques embarquées sur robots humanoïdes
2226arXiv cs.RO 

EM-Fall : détection de chutes jour et nuit par ondes millimétriques embarquées sur robots humanoïdes

Des chercheurs ont publié sur arXiv (réf. 2606.11109, juin 2026) un framework baptisé EM-Fall, qui intègre un capteur radar millimétrique (mmWave) directement sur un robot humanoïde mobile pour détecter les chutes de personnes âgées en environnement résidentiel. Contrairement aux installations fixes, le robot se déplace activement pour maintenir la ligne de vue sur la cible, même en cas d'occultation partielle ou de transition entre pièces. Le pipeline de traitement associe une perception centrée sur le corps humain à une modélisation temporelle légère (lightweight temporal modeling) qui analyse l'évolution du mouvement avant, pendant et après la chute, et filtre les interférences classiques des environnements domestiques comme le mouvement d'animaux de compagnie ou les artéfacts de multipath radar. L'évaluation a porté sur huit environnements intérieurs réels avec quatre participants, et les auteurs ont constitué un dataset in-home dédié à la détection de chutes par mmWave. Le modèle de robot utilisé n'est pas précisé dans l'abstract, et aucune métrique chiffrée (précision, rappel, F1) n'y figure, ce qui limite l'interprétation des résultats sans accès au papier complet. L'intérêt de l'approche tient à deux verrous résolus simultanément : la détection radar mmWave fonctionne de nuit comme de jour et n'exige pas le port d'un dispositif par l'utilisateur, là où les wearables souffrent d'une faible compliance chez les personnes âgées et où les caméras sont mises en défaut par l'occultation ou les faibles luminosités. La mobilité du robot répond quant à elle à la limite fondamentale des capteurs fixes, qui nécessitent une densité d'installation élevée pour couvrir un appartement entier. Pour un intégrateur de solutions de maintien à domicile ou un COO de résidence senior, c'est la combinaison des deux qui crée la rupture : un seul noeud de sensing mobile remplace potentiellement un réseau de capteurs statiques. Le secteur du fall detection est déjà adressé par des solutions distinctes : Vayyar Care et Amazon Halo Rise utilisent du mmWave fixe, tandis que des prestataires comme Alarm.com ou Apple (Watch Fall Detection) misent sur le wearable. La piste du robot mobile comme plateforme de sensing "embodied" est moins explorée commercialement, bien que des laboratoires comme le MIT CSAIL et l'Université Carnegie Mellon aient publié des travaux analogues sur la perception radar mobile. Ce papier reste à ce stade une preuve de concept académique sans annonce de déploiement ou partenariat industriel, et sa portée réelle dépendra de la publication des métriques complètes et d'une validation à plus grande échelle.

RecherchePaper
1 source
Latent Diffusion Policy : structurer les espaces latents pour la manipulation robotique par diffusion
2227arXiv cs.RO 

Latent Diffusion Policy : structurer les espaces latents pour la manipulation robotique par diffusion

Une équipe de chercheurs propose dans un preprint arXiv publié en juin 2026 (réf. 2606.08657) une architecture baptisée Latent Diffusion Policy (LDP), conçue pour améliorer les politiques visuomotrices basées sur la diffusion appliquées à la manipulation robotique. LDP fonctionne en deux étapes : un encodeur CVAE (variational autoencoder conditionnel) conditionné par l'observation absorbe d'abord la compréhension de la scène, puis un modèle de flow matching génère les trajectoires dans cet espace latent pré-structuré. Pour gérer les dépendances temporelles entre tokens, les auteurs introduisent un entraînement par diffusion forcing par token et un schéma d'inférence en escalier (staircase inference sampling) pour corriger le décalage de distribution qui en résulte. Ils proposent également la rFID (reconstruction FID) comme métrique proxy légère permettant de prédire le succès d'une tâche à partir des seules statistiques de l'espace latent, sans nécessiter d'évaluation complète en simulation. Sur le benchmark RoboTwin 2.0, LDP surpasse DP3 par une marge qualifiée de "substantielle", et les auteurs rapportent un transfert effectif vers des déploiements réels en manipulation bimanuelle. L'enjeu technique central que LDP cherche à résoudre est réel : les politiques de diffusion opérant directement dans l'espace d'action brut imposent à un seul processus de débruitage de gérer simultanément l'interprétation de la scène et la planification précise de trajectoires, ce qui augmente la complexité d'apprentissage et pénalise notamment les tâches exigeant une coordination temporelle fine entre plusieurs bras. Séparer ces deux responsabilités dans un cadre à deux étages est une approche structurellement cohérente. La rFID, si elle se confirme empiriquement, pourrait réduire significativement le coût d'évaluation des politiques en simulation. Cela dit, l'abstract ne fournit pas de chiffres de performance quantitatifs précis, ce qui rend difficile l'évaluation indépendante de la "marge substantielle" revendiquée face à DP3. Ce travail s'inscrit dans un champ très actif depuis la publication de Diffusion Policy (Chi et al., 2023) et de DP3, qui ont établi la diffusion comme paradigme dominant pour l'imitation de comportements robotiques complexes. Le flow matching, plus efficace que la diffusion classique en nombre d'étapes d'inférence, s'y impose progressivement. Les approches concurrentes incluent ACT, RDT-1B et pi-zero (Physical Intelligence), qui explorent d'autres voies pour combiner compréhension visuelle et contrôle moteur à grande échelle. LDP reste pour l'instant un résultat académique sans annonce de déploiement industriel ou de partenariat commercial, et RoboTwin 2.0 est un benchmark de simulation dont le gap sim-to-réel méritera une validation plus large.

RechercheOpinion
1 source
Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents
2228arXiv cs.RO 

Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.09610v1) une approche par apprentissage par renforcement multi-agents (MARL) pour résoudre un problème concret de robotique collaborative : positionner automatiquement un groupe de robots mobiles sous un objet afin de le transporter de façon stable. La méthode décompose la tâche en trois sous-problèmes couplés, contrôle de formation, navigation coopérative et évitement de collisions, et produit des politiques permettant à la flotte de s'aligner sous l'objet, d'équilibrer son poids malgré une distribution de masse non uniforme, et de naviguer dans des environnements encombrés. Les expériences portent sur des configurations variées (nombre de robots variable, géométries d'objets complexes, scènes avec obstacles) sans que les auteurs précisent le nombre exact de robots testés ni les temps de cycle obtenus. Le principal apport industriel de ces travaux est la généralisation à des objets de forme arbitraire et à masse mal distribuée, ce qui représente la réalité de la plupart des charges en logistique ou en services. Les approches classiques supposent des objets symétriques ou des points de contact prédéfinis manuellement ; ici, la politique apprise s'adapte au vol à la géométrie de la charge. Pour un intégrateur ou un COO industriel, cela signifie potentiellement moins de paramétrage manuel par référence produit. Le paper démontre également une robustesse en environnement encombré, ce qui est un prérequis pour un déploiement en entrepôt réel. Il faut toutefois noter que les résultats présentés restent en simulation : aucune validation hardware n'est rapportée, et le fossé sim-to-real reste l'obstacle non résolu habituel de ce type de travaux. Ce preprint s'inscrit dans un courant actif de recherche MARL appliqué aux systèmes multi-robots physiques, en compétition avec des approches centralisées (planification MPC couplée) ou décentralisées par consensus. Côté industrie, des acteurs comme 6 River Systems, Locus Robotics ou les plateformes AMR d'OTTO Motors adressent des problèmes adjacents mais avec des charges standardisées sur des robots dédiés. Aucun partenariat industriel ni timeline de transfert vers le réel n'est mentionné dans cet article ; il s'agit d'une contribution académique ouvrant la voie à des validations expérimentales futures.

RecherchePaper
1 source
Vers un cycle vertueux de données pour l'IA physique en logistique
2229arXiv cs.RO 

Vers un cycle vertueux de données pour l'IA physique en logistique

Une équipe de chercheurs publie sur arXiv (réf. 2606.05960) un cadre de recherche baptisé "data flywheel" pour l'intelligence incarnée appliquée à la logistique. L'idée centrale : transformer les opérations quotidiennes d'un robot déployé en actifs de données réutilisables pour entraîner et améliorer les politiques de contrôle. La contribution technique principale est WM-DAgger (World Model-based Data Aggregation), une extension de l'algorithme classique DAgger qui exploite un modèle du monde pour synthétiser des données de récupération hors-distribution. En clair, lorsqu'un robot rencontre un colis dans une configuration rare qu'il n'a jamais vue, le modèle du monde génère des trajectoires de correction synthétiques sans nécessiter une nouvelle intervention humaine. Le cadre intègre également trois types de données multimodales : démonstrations humaines étiquetées, vidéos opérationnelles non étiquetées, et journaux système du robot en conditions réelles. L'enjeu industriel est direct. Les pipelines robotiques traditionnels en perception-planification-contrôle, dominants en entrepôt, ne généralisent pas bien aux cas rares, or c'est précisément là que se concentrent les défaillances en conditions réelles. Les systèmes d'apprentissage par imitation promettent plus de flexibilité, mais se heurtent au problème du "long tail" : les configurations atypiques de colis (forme, poids, orientation, emballage dégradé) représentent une fraction infime du volume mais la majorité des erreurs. WM-DAgger s'attaque à ce goulet en générant synthétiquement les données de récupération manquantes, ce qui réduit théoriquement le besoin de collecte terrain coûteuse pour chaque variante. Si le concept tient à l'échelle, il change l'équation économique du déploiement : le robot s'améliore en opérant, sans interrompre la chaîne logistique pour des sessions de collecte dédiées. Sur le plan du contexte, la recherche s'inscrit dans un mouvement plus large d'industrialisation de la manipulation apprenable, porté côté startups par Covariant (racheté par ABB), Dexterity, Nimble Robotics ou encore Pickle Robot aux États-Unis, et en Europe par des acteurs comme Exotec, dont le Skypod reste cependant dans le registre AMR plutôt que manipulation fine. La logistique de colis est devenue le banc d'essai favori de la communauté robotique pour tester le passage du laboratoire au déploiement réel. Ce papier reste pour l'instant un preprint de recherche : WM-DAgger est décrit comme un "résultat initial" et les travaux en cours sont présentés comme exploratoires. Aucun chiffre de performance en conditions industrielles n'est communiqué, et aucun partenaire industriel n'est mentionné. À surveiller pour les résultats de validation à venir.

RecherchePaper
1 source
Apprentissage par imitation sur des variétés riemanniennes via des équations différentielles ordinaires neuronales
2230arXiv cs.RO 

Apprentissage par imitation sur des variétés riemanniennes via des équations différentielles ordinaires neuronales

Une équipe de chercheurs a publié en juin 2026 (arXiv:2606.05422) un cadre d'apprentissage par démonstration (LfD) sur des variétés riemanniennes, en utilisant des équations différentielles ordinaires neuronales (Neural ODEs). Le problème de fond est connu : les approches LfD classiques supposent que l'état du robot évolue dans un espace euclidien plat, ce qui est inexact pour les données d'orientation ; les rotations habitent SO(3), un espace mathématiquement courbe. La méthode proposée encode conjointement position et orientation dans une variété riemannienne, calcule numériquement les chemins géodésiques (les plus courts chemins sur la variété) via un réseau de type Neural ODE, puis décode ces trajectoires dans l'espace de tâche avant déploiement sur le robot. Les résultats présentés proviennent exclusivement de simulations ; aucun déploiement matériel n'est rapporté. L'article est soumis comme "extended abstract", signalant une recherche en phase préliminaire. L'enjeu industriel est réel : quand un système LfD ignore la géométrie courbe de l'espace d'orientation, il risque de produire des trajectoires discontinues ou non naturelles, particulièrement pénalisant pour l'assemblage de précision, la soudure ou toute manipulation fine requérant un contrôle strict de l'orientation de l'effecteur. Les méthodes existantes de calcul géodésique sur variétés riemanniennes sont coûteuses en calcul, un goulot d'étranglement qui freine leur adoption opérationnelle. L'usage de Neural ODEs, qui intègrent numériquement une équation différentielle plutôt que de la résoudre analytiquement, est présenté comme une voie pour réduire ce surcoût. Les auteurs comparent leur approche à d'autres mécanismes de calcul géodésique en simulation, sans pour l'instant de validation sur hardware réel. Ce travail s'inscrit dans une trajectoire de recherche qui part du LfD de Schaal (1999) et des Dynamical Movement Primitives, passe par les GMM riemanniennes de Calinon (IDIAP) et les travaux de Zeestraten et al. (2017), et intègre désormais les Neural ODEs popularisés par Chen et al. à NeurIPS 2018. Les approches concurrentes incluent les réseaux équivariants SE(3), les politiques de diffusion (Diffusion Policy, Chi et al. 2023) et les modèles quaternion-aware. Aucun partenaire industriel, financement ou calendrier de déploiement n'est mentionné ; les auteurs eux-mêmes qualifient les suites de "défis et perspectives", ce qui situe clairement ce travail au stade de la preuve de concept en simulation.

RecherchePaper
1 source
VOLT : segmentation de trajectoires vision-langage pour des politiques plus rapides que la démonstration
2231arXiv cs.RO 

VOLT : segmentation de trajectoires vision-langage pour des politiques plus rapides que la démonstration

Une équipe de recherche publie VOLT (Vision and Language Trajectory Segmentation), une méthode d'apprentissage par imitation conçue pour que les robots exécutent des tâches plus vite que ne le font les humains lors des démonstrations. Le constat de départ est simple : dans les applications industrielles, la vitesse d'un démonstrateur humain est rarement la vitesse optimale du robot. La solution naive, sous-échantillonner uniformément la trajectoire enregistrée pour l'accélérer globalement, pose problème : certaines phases peuvent être accélérées sans risque (mouvements libres en espace non contraint), d'autres exigent une précision millimétrée (saisie d'objet, assemblage, manipulation fine). VOLT exploite des indices visuels et langagiers issus des vidéos de démonstration pour segmenter automatiquement ces deux types de phases, n'accélérer que les segments non critiques, et conserver le rythme original là où la précision compte. Les trajectoires reformatées servent ensuite à entraîner des politiques d'imitation standards, notamment des diffusion policies. L'article démontre que la qualité de la segmentation est le facteur déterminant : les méthodes de référence mal segmentées produisent des politiques soit trop prudentes, soit peu fiables sur les phases délicates. Pour les intégrateurs industriels, cela ouvre concrètement la voie à des robots apprenant depuis des démonstrations humaines tout en atteignant des cadences proches de leurs limites physiques, sans programmation explicite des profils de vitesse. L'approche est compatible avec les architectures d'imitation learning existantes, ce qui facilite l'intégration dans des pipelines déjà déployés. À noter : le papier ne fournit pas de métriques chiffrées précises (taux de succès, gains de temps en secondes), ce qui rend difficile une comparaison quantitative indépendante. VOLT s'inscrit dans la vague actuelle de l'apprentissage par imitation, portée par l'essor des diffusion policies et des modèles vision-langage-action (VLA) comme pi-0 de Physical Intelligence ou les variantes de ACT de Stanford. La méthode est publiée en préprint sur arXiv (2606.06323v1) et n'a pas encore été évaluée par les pairs ni validée en déploiement réel, ce qui interdit de la considérer comme un produit livrable à ce stade. Aucun acteur français ou européen n'est impliqué. Les prochaines étapes naturelles incluent une validation sur des tâches industrielles représentatives et une intégration dans des pipelines de téléopération à grande échelle, où la question de la vitesse d'exécution relative à la démonstration est particulièrement critique.

RechercheOpinion
1 source
Planification du mouvement multi-robots par modèle de diffusion guidé par apprentissage par renforcement multi-agents
2232arXiv cs.RO 

Planification du mouvement multi-robots par modèle de diffusion guidé par apprentissage par renforcement multi-agents

Une équipe de chercheurs propose, dans un préprint arXiv (2606.00933) publié début juin 2026, un cadre de planification de trajectoires pour flottes de robots mobiles combinant modèles de diffusion génératifs et apprentissage par renforcement multi-agents (MARL). Concrètement, chaque robot génère indépendamment des trajectoires candidates via un modèle de diffusion entraîné sur des données mono-agent, puis une fonction de valeur centralisée, apprise par MARL, oriente le processus de débruitage par gradient pour réduire les conflits entre agents. Ce mécanisme dit d'"exponential tilting" pousse la distribution de débruitage vers les trajectoires associées au meilleur retour collectif attendu. Évalué en simulation sur un labyrinthe avec quatre robots mobiles, le système réduit le taux d'interférence inter-agents de 55,4 % à 41,8 %, sans nécessiter de ré-entraînement du modèle génératif ni de planification jointe centralisée. Ce résultat attaque directement le compromis historique entre planification centralisée (précise mais peu scalable à mesure que la flotte grossit) et planification décentralisée (scalable mais aveugle aux autres agents). Le fait que la coordination soit injectée via un signal de guidage externe sans modifier le planificateur diffusion de base ouvre la voie à des architectures modulaires : on entraîne une fois le modèle de trajectoire mono-agent, puis on greffe la coordination selon l'environnement de déploiement. Pour les intégrateurs de systèmes multi-robots en entrepôt ou en manufacture, cela suggère qu'un découplage entre planification locale et coordination globale est techniquement praticable, ce qui simplifierait la mise à l'échelle des flottes hétérogènes sans refonte complète du pipeline. Le domaine est depuis longtemps dominé par des méthodes à base de graphes comme CBS (Conflict-Based Search) ou des approches réactives décentralisées comme ORCA, avec des tentatives d'apprentissage profond restées limitées en conditions réelles. L'application des modèles de diffusion à la génération de trajectoires robotiques constitue un courant émergent, illustré notamment par Diffusion Policy (Chi et al., 2023) en manipulation, mais rarement couplé au MARL pour la coordination de flotte. Ce travail reste pour l'instant une preuve de concept en simulation sur quatre robots dans un environnement simple, et la généralisation à des scènes dynamiques, à des flottes plus larges ou à des robots hétérogènes demeure un défi non adressé. Les prochaines étapes naturelles incluent la validation sur hardware réel et la confrontation aux benchmarks de référence du MAPF (Multi-Agent Path Finding).

RecherchePaper
1 source
Cinématique inverse corps entier par diffusion sur graphe
2233arXiv cs.RO 

Cinématique inverse corps entier par diffusion sur graphe

Une équipe de chercheurs publie sur arXiv (identifiant 2606.00086, daté du 2 juin 2026) GraphDiff-IK, un framework de diffusion sur graphe pour résoudre la cinématique inverse (IK) sur des robots à morphologies variées. L'IK est un problème fondamental : il s'agit de calculer les configurations articulaires permettant à l'effecteur d'atteindre une pose cible dans l'espace. GraphDiff-IK représente le robot comme un graphe cinématique construit directement depuis son fichier URDF, où chaque noeud correspond à une articulation actionnée et chaque arête encode une dépendance cinématique. Sur cette structure, le framework formule l'IK comme un processus de diffusion conditionnelle qui génère directement des configurations articulaires. Il intègre un raisonnement hiérarchique par passage de messages par étapes successives, un conditionnement explicite du torse pour les robots multi-branches, ainsi qu'un retour de cinématique directe bruitée et une supervision dans l'espace des tâches pour renforcer la cohérence géométrique pendant le débruitage. L'approche couvre les bras simples, les systèmes bimanuel et les robots articulés avec torse ou taille. L'intérêt technique est réel : les solveurs IK classiques, qu'ils soient analytiques ou numériques (KDL, trac-IK, OpenRAVE), sont performants mais spécialisés par morphologie et peinent à représenter la nature multi-modale du problème, c'est-à-dire l'existence de plusieurs configurations articulaires valides pour une même pose cible. Cette multi-modalité est précisément ce que la diffusion capture de manière naturelle, ce qui ouvre la voie à des solveurs IK généralisables à une large gamme de plateformes sans ré-entraînement par robot. Pour les systèmes redondants comme les humanoïdes complets, dont le nombre de degrés de liberté dépasse les contraintes de la tâche, cette capacité à explorer l'espace des solutions est particulièrement précieuse. Ce travail s'inscrit dans une vague plus large d'application des modèles de diffusion à la robotique : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les politiques de diffusion pour le contrôle en sont les exemples les plus visibles. Appliquer ce paradigme à l'IK, plutôt qu'aux politiques de haut niveau, est une extension logique mais non triviale. Il convient cependant de noter qu'il s'agit d'un preprint non encore évalué par les pairs, sans validation sur hardware industriel ni déploiement annoncé. Les prochaines étapes naturelles seraient une intégration dans des pipelines de planification de mouvement et des tests sur des plateformes physiques, notamment des humanoïdes commerciaux dont la cinématique whole-body reste un goulot d'étranglement opérationnel.

RecherchePaper
1 source
Mécanisme passif de préhension universelle basé sur une coque en éversion
2234arXiv cs.RO 

Mécanisme passif de préhension universelle basé sur une coque en éversion

Une équipe de chercheurs a soumis sur arXiv (preprint 2606.00470, juin 2026) la conception d'un préhenseur passif monolithique basé sur l'éversion d'une coque bistable élastiquement déformable. Le mécanisme fonctionne sans commande active pendant la saisie : au contact d'un objet, la coque bascule spontanément de son premier état stable vers son second (éversion), forçant des bras composés de segments de poutres flexibles à envelopper l'objet et à former une enceinte fermée. Le système reste verrouillé dans cette configuration jusqu'à une actuation explicite pour libérer l'objet, éliminant ainsi le besoin d'énergie continue en phase de maintien. La charge utile (payload) dépend de la rigidité des bras, la taille maximale préhensible de leurs dimensions. Le mécanisme est conçu pour saisir des objets rigides de forme quelconque, sans adaptation de trajectoire ni paramétrage géométrique préalable. L'intérêt de cette approche tient à sa double propriété : universalité et passivité. La plupart des préhenseurs polyvalents requièrent une actuation active (pneumatique, moteurs, câbles) ou de l'intelligence embarquée pour s'adapter à la géométrie de l'objet. La compliance distribuée des bras, c'est-à-dire la flexibilité répartie sur toute leur longueur plutôt que concentrée en un point, permet à la structure de se conformer à la forme de l'objet sans exercer de force excessive, réduisant le risque d'endommagement de pièces fragiles. Pour un intégrateur industriel, cela représente un préhenseur potentiellement moins coûteux, tolérant aux variations dimensionnelles en production, et ne consommant pas d'énergie pendant la tenue d'objet. L'approche exploite la mécanique des structures bistables, déjà éprouvée dans les micromécanismes MEMS et les structures spatiales déployables, mais son application à la préhension robotique reste entièrement à valider expérimentalement. Les préhenseurs adaptatifs passifs constituent un axe de recherche actif depuis les travaux sur les mains underactuées (Barrett Hand, DLR, Université Laval) dans les années 2000. Les approches concurrentes incluent les doigts souples en silicone (Soft Robotics Inc., Festo Bionic Cobot), le jamming granulaire (Universal Robots, Piab) et les structures compliant issues de l'impression 3D. Ce preprint se distingue par son mécanisme à snap-through bistable, proche des travaux récents sur les actionneurs à énergie stockée en origami et morphing structures. Point important : le résumé publié ne présente ni prototype physique ni résultats expérimentaux, ce qui situe le travail au stade de la conceptualisation théorique. Les prochaines étapes attendues sont la fabrication d'un prototype (élastomère ou impression 3D multi-matériaux) et la caractérisation expérimentale des paramètres de payload et de taille maximale d'objet en fonction de la géométrie des bras.

RecherchePaper
1 source
Gradients de valeur pour la conception de robots à morphologies multiples
2235arXiv cs.RO 

Gradients de valeur pour la conception de robots à morphologies multiples

Des chercheurs ont publié le 2 juin 2026 sur arXiv (référence 2606.00702) une méthode visant à accélérer la conception de robots via ce qu'ils nomment les "value gradients". Le principe consiste à entraîner une unique fonction de valeur issue du reinforcement learning sur un ensemble varié de morphologies robotiques, puis à utiliser cette fonction, une fois gelée, comme proxy différentiable pour optimiser de nouveaux designs sans relancer de cycle d'apprentissage complet. Les expériences portent sur des modèles entraînés sur jusqu'à 50 robots distincts, couvrant des espaces de conception de plus de 1 100 paramètres continus d'embodiment: longueurs de membres, configurations articulaires, propriétés mécaniques. La méthode a été évaluée sur des variantes perturbées d'un même robot mais aussi sur des morphologies entièrement nouvelles appartenant à des classes non vues à l'entraînement, testant ainsi sa capacité de généralisation. Le problème que ce travail adresse est central en co-conception robotique: optimiser conjointement la morphologie d'un robot et son contrôleur nécessite traditionnellement de relancer un cycle complet de reinforcement learning pour chaque design candidat, une opération computationnellement prohibitive qui freine l'exploration de l'espace de conception. En gelant la fonction de valeur après un premier entraînement généralisé, les auteurs la transforment en oracle différentiable, permettant d'optimiser directement les paramètres physiques via descente de gradient, sans resimulation coûteuse. Au-delà de l'optimisation, l'analyse des gradients permet d'identifier quels paramètres de design ou de contrôle limitent les performances, une capacité analytique précieuse pour les ingénieurs souhaitant localiser des goulots d'étranglement avant d'engager des cycles de prototypage physique coûteux. La co-conception robotique est un domaine actif depuis plusieurs années, avec des approches concurrentes allant des algorithmes évolutionnaires aux méthodes de simulation physique différentiable explorées notamment par MIT CSAIL, ETH Zurich ou Google DeepMind. La particularité de cette contribution est de ne pas exiger de simulateur différentiable lors de l'optimisation: seule la fonction de valeur préentraînée suffit, la rendant potentiellement compatible avec des pipelines de simulation standard non différentiables. Les suites naturelles concernent l'extension à des espaces de conception encore plus larges, des tâches multi-objectifs et des morphologies plus complexes comme les manipulateurs industriels ou les humanoïdes. Il s'agit à ce stade d'une contribution purement académique, sans partenariat industriel ni déploiement annoncé.

RecherchePaper
1 source
Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène
2236arXiv cs.RO 

Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01072) une méthode d'apprentissage par imitation qui exploite des graphes de scène dynamiques comme mécanisme de mémoire structurée pour les robots mobiles. Le principe : pendant l'exécution d'une tâche, le robot maintient un graphe de scène mis à jour en continu, qui encode les relations entre objets et leur évolution dans le temps. Plutôt que de traiter uniquement les observations courantes du capteur, le système capitalise sur l'historique accrété de l'environnement pour inférer des politiques d'action. Les validations couvrent deux régimes : manipulation mobile en simulation (environnements à grande échelle spatialement) et manipulation sur table en conditions réelles. Les auteurs rapportent une amélioration substantielle des performances par rapport aux baselines, particulièrement sur des tâches nécessitant un raisonnement à long terme, sans donner de métriques chiffrées précises dans l'abstract. Ce travail s'attaque à deux verrous persistants du déploiement de robots apprenants dans des environnements non-structurés. Le premier est l'observabilité partielle : dans un appartement ou un bureau, le champ de vision d'un robot ne capture qu'une fraction de l'espace pertinent, et les objets manipulés disparaissent régulièrement du cadre. Le second est l'horizon temporel : des tâches comme "ranger la cuisine" enchaînent des dizaines de sous-tâches dont les dépendances ne sont pas localement visibles. En substituant un graphe de scène explicite et structuré à une mémoire implicite (fenêtre d'observations brutes, état caché LSTM), l'approche donne au robot une représentation interprétable et modulaire du contexte. Pour les intégrateurs industriels et les équipes qui déploient des politiques d'imitation dans des environnements semi-structurés, c'est une piste crédible pour réduire le gap entre démo de labo et robustesse opérationnelle, même si les expériences restent pour l'instant confinées à la simulation et au tabletop. L'apprentissage par imitation (behavioral cloning, GAIL, DAgger) a connu un regain d'intérêt majeur avec l'essor des Visual Language Action models (VLA) comme Pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA. Les graphes de scène sont une technique éprouvée en vision par ordinateur et en navigation robotique (travaux de Armeni, Rosinol, Chang notamment), mais leur intégration dans des pipelines d'imitation learning reste peu explorée. Les approches concurrentes pour gérer la mémoire à long terme incluent les transformers avec attention sur un historique d'observations, les représentations de tâches hiérarchiques (task graphs), et les world models latents. Ce preprint n'étant pas encore évalué par les pairs, ses résultats méritent confirmation sur des benchmarks plus larges et des environnements réellement non-structurés avant de pouvoir orienter des décisions d'architecture. Les auteurs n'annoncent pas de code public ni de suite industrielle à ce stade.

RechercheOpinion
1 source
Détection et atténuation proactives-réactives des pannes intermittentes dans les essaims de robots
2237arXiv cs.RO 

Détection et atténuation proactives-réactives des pannes intermittentes dans les essaims de robots

Des chercheurs ont publié sur arXiv (2509.19246v2) une méthode de détection et mitigation des pannes intermittentes dans les essaims de robots. Ces erreurs transitoires et sporadiques (défaillances de capteurs, interférences radio) ont été largement ignorées par la littérature sur la tolérance aux fautes, qui se concentrait sur les pannes permanentes. L'approche exploite le paradigme SoNS (self-organizing nervous systems), permettant à un essaim de maintenir des structures réseau persistantes plutôt que des topologies ad hoc éphémères. Les auteurs proposent une stratégie proactive-réactive : avant toute panne, chaque robot construit dynamiquement des chemins de communication de secours adaptatifs ; en cas d'anomalie, des one-shot likelihood ratio tests sur un réseau multiplex détectent le problème et reroutent la communication de façon auto-organisée jusqu'à résolution. Validée en simulation sur des scénarios de contrôle de formation avec données positionnelles erronées, la méthode atteint une haute précision de détection avec un faible taux de faux positifs, sans perturber la convergence des formations. Ce travail comble un manque réel dans la recherche : les pannes intermittentes sont précisément les plus fréquentes dans les déploiements industriels (erreurs de localisation sporadiques sur AMRs, coupures réseau fugaces, dérives de capteurs), mais leur caractère transitoire les rendait indétectables par les algorithmes classiques basés sur timeout ou silence prolongé. Le fait que la méthode s'appuie sur des topologies réseau persistantes la rend potentiellement applicable à des flottes industrielles semi-supervisées en logistique ou en inspection automatisée, là où les architectures d'essaims purement ad hoc peinent à maintenir la traçabilité des fautes. Le paradigme SoNS a émergé ces dernières années comme alternative aux architectures d'essaims entièrement décentralisées, en introduisant une couche de structure topologique dynamique. Ce preprint (v2, septembre 2025) est vraisemblablement en cours d'évaluation par les pairs. Dans le paysage industriel, les essaims auto-organisés restent majoritairement académiques : des acteurs comme Exotec en AMR de picking ou des frameworks de coordination multi-robots semi-centralisés dominent les déploiements réels. Les auteurs ne citent ni pilotes terrain ni partenaires industriels, et la généralisation à des essaims hétérogènes ou à grande échelle en environnements RF dégradés reste à démontrer.

UELes opérateurs de flottes AMR européens (ex. Exotec en logistique de picking) pourraient à terme bénéficier de cette approche pour la tolérance aux pannes réseau intermittentes, mais aucun pilote ou partenariat européen n'est mentionné dans ce preprint.

RecherchePaper
1 source
Transfert simulation-réel pour robots à actionneurs musculaires via réseaux d'actionneurs généralisés
2238arXiv cs.RO 

Transfert simulation-réel pour robots à actionneurs musculaires via réseaux d'actionneurs généralisés

Une équipe de chercheurs a publié sur arXiv (référence 2604.09487) une méthode de transfert simulation-réel (sim-to-real) pour robots à actionnement musculaire, une classe d'actionneurs rarement intégrée dans les systèmes robotiques industriels malgré leurs avantages théoriques. La méthode, baptisée Generalized Actuator Network (GenAN), a été validée sur PAMY2, un bras robotique à 4 degrés de liberté (DOF) entraîné par tendons et alimenté par des muscles artificiels pneumatiques (PAM). Trois tâches ont été déployées avec succès sur le robot réel à partir de politiques entraînées entièrement en simulation : atteinte de cibles dynamiques, ball-in-a-cup et tennis de table. Les auteurs revendiquent une première mondiale, à savoir le premier transfert sim-to-real réussi pour un bras à actionnement musculaire à 4 DOF. L'obstacle historique aux robots PAM est leur comportement fortement non-linéaire, avec friction et hystérésis, qui rend leur modélisation analytique difficile et a jusqu'ici bloqué l'application des techniques de reinforcement learning en simulation. GenAN contourne ce problème en apprenant un réseau de neurones qui identifie le modèle d'actuation directement depuis des trajectoires de position articulaire, sans capteurs de couple, coûteux et fragiles. Ce modèle appris est ensuite couplé à une simulation rigide classique pour les dynamiques du bras. Cette architecture valide l'hypothèse qu'il est possible de dissocier la modélisation des actionneurs complexes du reste de la chaîne cinématique, et ouvre potentiellement la voie à des robots plus rapides et plus sûrs en interaction humain-robot. Les muscles artificiels pneumatiques sont connus depuis des décennies dans la recherche, mais leur adoption industrielle est restée marginale face aux actionneurs électriques en raison de la difficulté de contrôle. PAMY2 est une plateforme académique, et ce travail est publié sous forme de preprint, non encore soumis à revue par les pairs confirmée. Les acteurs dominants du sim-to-real, Boston Dynamics, Figure ou Unitree, s'appuient sur des actionneurs électriques pour lesquels les outils de simulation sont matures. GenAN se distingue par sa capacité à généraliser le modèle d'actuation à d'autres robots musculaires, ce qui pourrait intéresser des laboratoires explorant des actionneurs hybrides pour l'humanoïde souple. La prochaine étape logique serait une validation sur des tâches plus complexes et une généralisation à d'autres plateformes PAM.

RecherchePaper
1 source
Vers une navigation aérienne VLA précisément alignée sur l'intention via GRPO guidé par des experts
2239arXiv cs.RO 

Vers une navigation aérienne VLA précisément alignée sur l'intention via GRPO guidé par des experts

Une équipe de chercheurs publie aujourd'hui sur arXiv (réf. 2606.02313) un framework d'apprentissage par renforcement destiné à améliorer la navigation aérienne autonome de drones via des modèles Vision-Language-Action (VLA). Le coeur du dispositif, baptisé EG-GRPO (Expert-Guided Group Relative Policy Optimization), combine un entraînement par renforcement en ligne avec un petit ensemble de trajectoires expertes (few-shot). Résultat annoncé : un taux de succès multiplié par 2,13 par rapport à la baseline en fine-tuning supervisé classique (SFT), et une amélioration de 60,9 % sur l'alignement avec les instructions humaines complexes. Le pipeline hétérogène développé en parallèle simulation/inférence réduit le temps de collecte de rollouts de 43,5 %, point critique quand l'entraînement RL doit couvrir un espace de vol tridimensionnel continu. L'enjeu industriel est réel : les modèles VLA, qui mappent directement des instructions en langage naturel vers des actions motrices, peinent jusqu'ici sur les UAV. Contrairement à la manipulation robotique en espace contraint, la navigation aérienne implique un espace d'exploration quasi-infini où le SFT classique souffre de rareté des données et d'une supervision trop grossière pour des intentions fines ("survole le bâtiment, puis pivote à 90° avant la ligne rouge"). EG-GRPO adresse ce problème en guidant l'exploration par quelques démonstrations expertes plutôt qu'en s'appuyant sur une exploration purement aléatoire. Cela représente une avancée potentielle pour les opérateurs de flottes de drones industriels, les intégrateurs en logistique, inspection d'infrastructures ou intervention en zones difficiles. La note de prudence s'impose cependant : les métriques sont issues de simulations, et le gap sim-to-real sur les UAV reste un problème non résolu dans la littérature. Ce travail s'inscrit dans un mouvement plus large d'application des VLA à la robotique physique. GRPO est la méthode d'optimisation popularisée par DeepSeek-R1 pour les LLM raisonneurs ; son adaptation à l'action physique aérienne suit le chemin tracé par des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais ceux-ci ciblent la manipulation en espace clos. Côté drones, les travaux de navigation autonome par langage naturel restent majoritairement académiques. Ce preprint n'annonce ni déploiement, ni partenaire industriel, ni timeline commerciale : c'est une contribution de recherche fondamentale, dont la valeur dépendra des résultats en conditions réelles.

RechercheOpinion
1 source
Ne pas se faire avoir deux fois : s'adapter à l'adversité en conditions réelles grâce au raisonnement par expérience
2240arXiv cs.RO 

Ne pas se faire avoir deux fois : s'adapter à l'adversité en conditions réelles grâce au raisonnement par expérience

Des robots mobiles autonomes déployés en environnements réels accumulent des erreurs qu'ils ne peuvent pas anticiper, et une équipe de chercheurs a publié sur arXiv (réf. 2605.31119) un cadre d'apprentissage continu baptisé "Don't Fool Me Twice" pour traiter ce problème. Le système observe les perturbations subies par le robot, en décrit les effets en langage naturel, puis interroge un VLM (vision-language model) enrichi de contexte visuel pour inférer leurs causes probables. La caractérisation locale de chaque perturbation s'effectue par régression à noyau, permettant une modélisation efficace en très peu d'exemples (few-shot). L'ensemble s'appuie sur un modèle spatial voxélique sémantique qui estime l'incertitude épistémique de chaque zone, permettant au robot de planifier ses trajectoires futures en tenant compte de ce qu'il a appris. Le cadre a été validé en simulation et sur matériel réel, sur plusieurs morphologies robotiques et types d'adversité, autour de quatre hypothèses formalisées dans le papier. Ce travail comble un angle mort des approches actuelles : les VLMs peuvent dresser une liste générique des dangers d'un environnement, mais peinent à anticiper les adversités propres à une morphologie spécifique (les risques d'un robot à roues diffèrent de ceux d'un quadrupède). En basculant vers un apprentissage online post-déploiement, le système réduit l'écart sim-to-real qui handicape encore la plupart des solutions de navigation autonome en milieux ouverts. La modélisation de l'incertitude épistémique permet des comportements de récupération plus nuancés : le robot raisonne sémantiquement sur l'origine du problème, pas seulement sur l'évitement réactif. L'approche s'inscrit dans un contexte de forte activité autour de la navigation AMR en milieux non structurés, où des acteurs comme Boston Dynamics, Clearpath Robotics ou ANYbotics cherchent à réduire la dépendance à une cartographie exhaustive préalable. Les travaux récents sur les VLMs appliqués à la prédiction de dangers, portés notamment par des groupes de CMU, ETH Zurich et Google DeepMind, se concentraient sur la prévention statique plutôt que sur l'adaptation continue après incident. "Don't Fool Me Twice" repositionne le problème sur l'apprentissage incrémental post-déploiement. Ce preprint arXiv ne mentionne ni partenaire industriel ni timeline de transfert technologique, et aucun résultat quantitatif précis n'est disponible dans le résumé soumis.

RecherchePaper
1 source
Trinity : segmentation unifiée de terrain et sémantique en milieux extérieurs non structurés via données synthétiques
2241arXiv cs.RO 

Trinity : segmentation unifiée de terrain et sémantique en milieux extérieurs non structurés via données synthétiques

Des chercheurs ont soumis sur arXiv (arXiv:2605.27644v1) Trinity, une architecture transformer qui effectue simultanément deux tâches de segmentation visuelle pour robots mobiles en extérieur non structuré : la segmentation sémantique classique par classes prédéfinies, et une segmentation de terrain dite "class-agnostic", fondée uniquement sur l'apparence visuelle, sans étiquettes sémantiques ni scores de franchissabilité liés à un robot particulier. Pour entraîner ce réseau à grande échelle, les auteurs ont étendu le simulateur OAISYS et créé RUGDSynth, un dataset synthétique inspiré du benchmark RUGD avec des échantillons de terrain sans annotation de classe. Ils publient également EXTerra, un dataset réel annoté avec les deux types de labels. Les expériences confirment la faisabilité de l'approche en conditions extérieures complexes. Le code et les datasets seront disponibles après la revue par les pairs. Le problème que Trinity cible est la portabilité des systèmes de franchissabilité (traversability estimation). Les méthodes actuelles requièrent des annotations spécifiques au robot ou des mappings de classes liés à ses capacités mécaniques : dès que le robot change de charge utile, de cinématique ou de mode de locomotion, toute l'annotation est à refaire, un coût élevé pour les intégrateurs. En apprenant des priors visuels de terrain indépendants du robot, Trinity vise un module de perception réutilisable entre plateformes, applicable à la planification de mission, à l'odométrie visuelle ou à la classification de zones franchissables, sans réentraînement complet à chaque nouveau déploiement. La traversabilité en extérieur est un défi structurant de la robotique mobile depuis plus d'une décennie : des plateformes comme ANYmal (ANYbotics) ou Spot (Boston Dynamics) se heurtent en permanence à la variabilité des terrains naturels. RUGD, qui a inspiré RUGDSynth, est un benchmark académique sur la navigation tout-terrain largement utilisé dans la communauté. Le recours à des données synthétiques pour pallier le manque d'annotations réelles suit une tendance forte dans le domaine, avec des limites bien documentées sur le domain gap sim-to-real. Ce pré-print étant encore en cours de revue, les résultats présentés restent à confirmer par la communauté scientifique.

RecherchePaper
1 source
Localisation coopérative multimodale sans GNSS, robuste à la dégradation, exploitant des détections de robots par LiDAR
2242arXiv cs.RO 

Localisation coopérative multimodale sans GNSS, robuste à la dégradation, exploitant des détections de robots par LiDAR

Une équipe de chercheurs a publié sur arXiv (identifiant 2510.20480v2) une approche de localisation coopérative multi-robots adaptative pour environnements sans signal GNSS, c'est-à-dire sans accès au GPS ou aux systèmes de navigation par satellite. Le système fusionne trois modalités de capteurs distribués sur une flotte hétérogène composée d'un véhicule terrestre autonome (UGV) et de plusieurs drones (UAV) : la VIO (Visual-Inertial Odometry, odométrie par caméra et centrale inertielle), la LIO (LiDAR-Inertial Odometry, odométrie par lidar et IMU), et des détections inter-robots 3D basées sur le lidar. La fusion s'effectue via une formulation en graphe de facteurs, en couplage lâche (loosely-coupled), ce qui permet d'intégrer des mesures asynchrones issues de plateformes se déplaçant indépendamment. Trois contributions techniques clés sont avancées : un facteur d'interpolation inédit pour gérer la désynchronisation des flux de données, une évaluation des dégradations LIO à partir de l'hessienne approchée du scan-matching, et une pondération des données VIO proportionnelle à la distance de Wasserstein entre sorties consécutives. L'enjeu principal n'est pas la localisation elle-même, mais la résilience en cas de défaillance sensorielle partielle. Charger un seul robot de tous les capteurs disponibles alourdit sa masse, son volume et sa consommation énergétique de façon prohibitive pour beaucoup d'applications opérationnelles. En distribuant les modalités sur plusieurs robots et en permettant à la flotte de s'auto-assister lorsqu'un agent subit une dégradation, l'approche ouvre une voie vers des flottes plus légères et plus robustes. Les résultats sur données réelles montrent des améliorations significatives de précision de localisation en présence de dégradations variées, bien que les chiffres quantitatifs précis ne soient pas détaillés dans le résumé. Le travail apporte aussi une analyse théorique des conditions de dégradation, ce qui est rare dans la littérature sur la localisation coopérative. La localisation en environnement GNSS-refusé est un problème structurant pour les robots déployés en sous-sol, en intérieur, en milieu urbain dense ou en contexte militaire. Des approches concurrentes reposent sur le SLAM centralisé multi-agents ou la relocalisation par carte partagée, mais souffrent souvent de la latence de fusion et de la sensibilité à la qualité des communications. Ce travail se positionne dans la lignée des travaux sur la fusion décentralisée à graphe de facteurs, un paradigme popularisé notamment par les équipes de Carnegie Mellon (GTSAM) et ETH Zurich (OKVIS, VILENS). Aucun partenaire industriel ni calendrier de déploiement n'est mentionné : il s'agit d'une contribution de recherche publiée en preprint, à distinguer d'un produit ou d'un système en production. Les prochaines étapes naturelles seraient une validation à plus grande échelle de flotte et une intégration dans des middlewares robotiques standards comme ROS 2.

UEETH Zurich (OKVIS, VILENS) est cité comme travail de référence, mais le papier n'implique aucune institution française ou européenne et n'a pas de calendrier de déploiement en Europe.

RecherchePaper
1 source
Apprentissage d'une variété de trajectoires kinodynamiques pour l'interception souple d'objets rapides avec gestion de l'impact
2243arXiv cs.RO 

Apprentissage d'une variété de trajectoires kinodynamiques pour l'interception souple d'objets rapides avec gestion de l'impact

Des chercheurs ont déposé sur arXiv (2605.28462) une méthode pour permettre à un bras robotique de rattraper des objets en vol libre à grande vitesse. Le problème cumule trois difficultés : temps de réaction très court, incertitude à l'impact, et contraintes cinédynamiques (cinématiques et dynamiques couplées). L'approche utilise l'apprentissage par renforcement en simulation pour collecter des trajectoires de rattrapage réussies, encodées ensuite dans une variété basse dimension appelée kinodynamic trajectory manifold. À l'exécution, l'état initial estimé de l'objet est mappé directement vers une trajectoire de référence, sans optimisation non linéaire en temps réel. Un contrôle compliant prend le relais près du contact pour absorber les impacts et stabiliser la prise. L'intérêt principal est computationnel : les méthodes classiques de planification exigent une optimisation non linéaire à chaque cycle, trop lente pour des objets rapides. Remplacer ce calcul par un mapping appris réduit la latence décisionnelle de plusieurs ordres de grandeur. Le contrôle compliant au contact, qui relâche la rigidité du contrôleur au bon moment, s'attaque à un problème bien documenté : les chocs rigides provoquent rebonds, ratés de préhension, et contraintes mécaniques excessives sur les actionneurs. Ce travail s'inscrit dans la lignée des recherches RL-sim-to-real appliquées à la manipulation dynamique, domaine actif depuis les travaux sur le jonglage robotique (DeepMind) et le rattrapage en chute libre (ETH Zurich). La limite principale de ce preprint est l'absence de validation sur robot physique : les résultats restent simulés, et le gap sim-to-real pour des trajectoires d'impact n'est pas quantifié. Les prochaines étapes attendues incluent une validation expérimentale pour éprouver la robustesse du manifold appris face aux bruits réels de perception.

RecherchePaper
1 source
Commande à impédance adaptative à sécurité critique via fonctions barrière non lisses sous contraintes d'état et d'entrée
2244arXiv cs.RO 

Commande à impédance adaptative à sécurité critique via fonctions barrière non lisses sous contraintes d'état et d'entrée

Des chercheurs ont publié sur arXiv (référence 2605.28367v1) un framework de contrôle d'impédance adaptatif en ligne conçu pour garantir la sécurité des manipulateurs robotiques lors d'interactions physiques avec des humains ou des environnements contraints. Le système, validé en simulation sur un manipulateur à 7 degrés de liberté (DOF), combine un filtre de sécurité basé sur un programme quadratique (QP) avec une nouvelle fonction de barrière de contrôle non lisse composée (NCBF), permettant d'imposer simultanément les contraintes de position et de vitesse articulaires via une barrière unifiée de degré relatif un. Les dynamiques inconnues sont compensées en ligne par un système de logique floue de type 2 par intervalles (IT2-FLS), les limites de couple actuateur sont gérées par des contraintes souples avec récupération exacte de solutions réalisables, et un observateur de perturbations renforce la robustesse face aux erreurs de modèle et aux forces d'interaction externes. Les simulations incluent une incertitude paramétrique sévère et des torseurs d'interaction externes appliqués simultanément. Le principal apport technique réside dans la formulation NCBF composée, qui unifie en une seule barrière de degré relatif un deux contraintes habituellement traitées séparément : position et vitesse articulaires. En pratique, les approches CBF standard nécessitent des traitements de degré relatif élevé pour les contraintes de position, ce qui complique la synthèse et réduit la robustesse. Ici, l'unification simplifie le problème QP et maintient la faisabilité même sous perturbations fortes. L'analyse Lyapunov composite prouve formellement l'invariance de l'ensemble sûr et la bornitude ultimement uniforme (UUB) de l'erreur de suivi d'impédance, deux garanties essentielles pour envisager une certification dans des contextes industriels ou médicaux. Ces résultats restent toutefois à l'étape simulation uniquement : aucune validation sur matériel réel n'est rapportée. Le contrôle d'impédance est la référence pour la manipulation compliante depuis les travaux de Hogan dans les années 1980, et les fonctions de barrière de contrôle (CBF) ont connu un essor considérable depuis les contributions d'Ames et al. dans la décennie 2010. Les approches concurrentes incluent les méthodes à tanks d'énergie, le contrôle passif basé sur la passivité, et les CBF à degré relatif élevé. Le recours à l'IT2-FLS distingue ce travail des CBF adaptatifs classiques en offrant une meilleure tolérance à l'incertitude que les systèmes flous de type 1. L'étape logique suivante sera la validation expérimentale sur plateforme réelle, notamment dans des scénarios d'assemblage ou de soins à la personne où l'interaction physique imprévue est la norme.

RecherchePaper
1 source
Alignement des représentations maître-élève pour l'apprentissage par imitation guidé par renforcement
2245arXiv cs.RO 

Alignement des représentations maître-élève pour l'apprentissage par imitation guidé par renforcement

Des chercheurs ont publié sur arXiv (2605.28372) un algorithme visant à réduire structurellement l'imitation gap dans les pipelines d'apprentissage par imitation (IL) guidés par reinforcement learning (RL). Ce fossé apparaît lorsqu'un agent teacher, entraîné par RL avec un accès complet à l'état interne de l'environnement (positions exactes, dynamiques simulées complètes), développe une politique qui exploite des informations d'état privilégiées inaccessibles à l'agent student, contraint lui à des observations partielles comme des flux caméra ou des capteurs bruités. La solution proposée construit un espace d'embedding partagé via apprentissage contrastif auto-supervisé (self-supervised contrastive learning), entraîné en parallèle à la politique teacher. Un mécanisme de blocage des gradients empêche l'encodeur de l'agent enseignant d'exploiter ses données privées, rendant la politique teacher imitable par construction et évitant le fine-tuning RL post-imitation habituellement requis. Pour la robotique industrielle, l'enjeu est concret : le pipeline sim-to-real souffre précisément de ce décalage entre un teacher simulé omniscient et un robot réel contraint à ses capteurs physiques. Forcer un fine-tuning RL sur le hardware après la phase d'imitation représente un coût significatif en calcul, en temps machine et en ingénierie. L'approche proposée vise à supprimer cette étape en alignant les représentations à la source. Les évaluations sur plusieurs benchmarks montrent une performance student supérieure aux baselines état-de-l'art avec un imitation gap substantiellement réduit. Ces résultats restent cependant produits exclusivement en simulation, ce qui en limite la portée directe pour des déploiements industriels immédiats. L'approche teacher-student en RL est un paradigme établi depuis DAgger (Ross et al., 2011) et les travaux d'Asymmetric Actor-Critic, où l'imitation gap était traditionnellement corrigé en aval par du fine-tuning plutôt qu'en amont par un alignement des représentations. La tendance actuelle aux architectures Visual Language Action (VLA), comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, aborde ce problème différemment via des modèles de fondation multimodaux qui absorbent directement des observations hétérogènes. Ce preprint, sans affiliation industrielle identifiée ni validation sur hardware réel déclarée, propose une correction structurelle au paradigme classique et ouvre la voie à une validation sur manipulateurs physiques comme prochaine étape naturelle.

RecherchePaper
1 source
MPPI sous contraintes probabilistes, incertitudes d'état et d'objets dynamiques : calibration du risque de collision
2246arXiv cs.RO 

MPPI sous contraintes probabilistes, incertitudes d'état et d'objets dynamiques : calibration du risque de collision

Une équipe de chercheurs publie sur arXiv en mai 2026 (preprint 2505.28330) une contribution en deux volets pour la navigation probabiliste en environnements dynamiques. D'abord, une méthodologie d'évaluation de la calibration des risques de collision en boucle fermée, fondée sur les proper scoring rules, des métriques statistiques qui mesurent si les probabilités de collision annoncées par le système correspondent à ce qui se produit réellement. Ensuite, l'architecture DUCCT-MPPI (Dual-Uncertainty Chance-Constrained Tube Model Predictive Path Integral), conçue pour fonctionner en temps réel: elle intègre simultanément l'incertitude de localisation via une approximation Unscented Transform (UT) à un tube, et l'incertitude de prédiction des obstacles dynamiques via agrégation Monte Carlo. Dans des simulations physiques en environnements très encombrés, DUCCT-MPPI affiche un taux de succès de navigation supérieur de 28 % aux baselines Monte Carlo MPPI classiques, tout en enregistrant les temps de trajet les plus courts et des forces sociales induites minimisées. L'enjeu central est la calibration: les planificateurs à contraintes probabilistes (chance-constrained planners) supposent implicitement que les incertitudes fournies par la localisation et la perception sont statistiquement fiables, ce qui n'est pas garanti en conditions réelles. Une confiance excessive provoque des violations de sécurité systématiques; une confiance insuffisante génère des comportements de gel ou de dilution des probabilités, paralysant le robot dans les situations complexes. En quantifiant formellement cette erreur de calibration en boucle fermée, les auteurs exposent un angle mort critique pour le déploiement d'AMR et de robots mobiles dans des entrepôts, usines ou espaces partagés avec des humains. Le Chance-Constrained MPPI est une évolution du framework MPPI introduit par Grady Williams et al. (Georgia Tech, 2017), qui génère des trajectoires par échantillonnage massif de perturbations de commande pondéré par un critère de coût. Les approches concurrentes dans l'espace incluent le tube MPC stochastique, les méthodes CVaR (Conditional Value-at-Risk) et les planificateurs bayésiens. Ce preprint reste à valider sur hardware réel: l'ensemble des expériences repose sur de la simulation physique, sans déploiement annoncé sur robot ou plateforme spécifique, une limite classique du sim-to-real gap que les auteurs n'adressent pas explicitement.

RecherchePaper
1 source
De la surveillance passive à la défense active : contrôle résilient des manipulateurs face aux cyberattaques
2247arXiv cs.RO 

De la surveillance passive à la défense active : contrôle résilient des manipulateurs face aux cyberattaques

Une équipe de chercheurs a déposé sur arXiv (référence 2603.13003v2) une étude sur la sécurisation des manipulateurs robotiques redondants contre les attaques par injection de fausses données (FDIA, False Data Injection Attacks). Ces attaques corrompent les signaux capteurs d'un système robotique cyber-physique tout en restant sous le seuil de détection des moniteurs passifs standards, notamment le test du chi-deux. Sur un bras planaire à 6 degrés de liberté (6-DOF), les simulations montrent qu'un adversaire peut induire des déviations importantes de l'effecteur terminal sans déclencher d'alarme. La contribution principale est une architecture de défense active complétant la surveillance passive existante (filtre de Kalman en régime permanent combiné à un détecteur chi-deux) : un mécanisme bas-niveau atténue l'entrée de contrôle via une fonction monotone d'un score d'anomalie, calculé par un prédicteur d'état inédit dit "actuation-projected, measurement-free", c'est-à-dire sans recours aux mesures capteurs potentiellement compromises. Ce schéma offre des garanties probabilistes sur la perte d'actionnement nominale tout en préservant la stabilité en boucle fermée ; les auteurs formalisent également l'attaque furtive optimale sous forme d'un programme quadratique convexe à contraintes quadratiques (QCQP) résolvable en une étape. À mesure que bras industriels et chirurgicaux s'intègrent dans des architectures réseau IT/OT, leur surface d'attaque s'élargit et les détecteurs passifs classiques se révèlent contournables de façon formellement démontrée. L'apport de ce travail est de proposer une défense embarquée directement dans la boucle de commande, capable d'atténuer l'effet d'une attaque en cours sans interrompre la tâche nominale. Pour un intégrateur ou un COO industriel, cela implique que la résilience cyber doit désormais descendre jusqu'au niveau du contrôleur bas-niveau, et non plus seulement opérer à la couche réseau ou authentification. Ce papier prolonge un corpus de recherche sur les FDIA initialement développé pour les smart grids, progressivement transposé à la robotique et aux systèmes cyber-physiques. Les manipulateurs redondants sont des cibles privilégiées car leur espace nul, degrés de liberté excédant les contraintes de la tâche, offre à l'adversaire plus de latitude pour agir furtivement. Aucun acteur industriel majeur (ABB, Kuka, Fanuc) ni laboratoire français ou européen n'est impliqué dans ces travaux, qui demeurent un preprint non encore soumis à évaluation par les pairs ; une validation expérimentale sur hardware réel en environnement réseau contrôlé constituerait la prochaine étape crédible.

RechercheOpinion
1 source
L-Learning : une approche basée sur Lyapunov exploitant la mécanique lagrangienne pour un suivi robotique efficace et stable
2248arXiv cs.RO 

L-Learning : une approche basée sur Lyapunov exploitant la mécanique lagrangienne pour un suivi robotique efficace et stable

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.26648) un framework de contrôle baptisé L-Learning, conçu pour améliorer le suivi de trajectoire des robots dans des environnements dynamiques et incertains. L'approche combine deux cadres mathématiques éprouvés : la théorie de stabilité de Lyapunov, qui garantit la convergence d'un système vers un état stable, et la mécanique lagrangienne, qui modélise le comportement physique d'un système à partir de ses fonctions d'énergie. Concrètement, L-Learning apprend cette fonction d'énergie directement depuis les données collectées, puis s'en sert pour calculer des commandes qui assurent à la fois précision de suivi et stabilité en boucle fermée. Les auteurs mettent en avant trois propriétés clés : précision de contrôle supérieure, garanties théoriques de stabilité, et haute efficacité en termes de complexité d'échantillonnage. L'enjeu industriel est réel. Le contrôle robotique moderne est pris en étau entre deux familles de méthodes : les approches classiques (PID, MPC) offrent des garanties formelles de stabilité mais se dégradent dès que le modèle du système est imprécis ou que l'environnement évolue ; à l'inverse, les méthodes data-driven (apprentissage par renforcement, politiques neuronales) s'adaptent mieux mais nécessitent de grands volumes de données d'entraînement et ne proposent aucune garantie formelle, ce qui complique leur certification pour un déploiement industriel. L-Learning prétend combler ce fossé, et si ses performances se confirment expérimentalement, cela pourrait réduire la barrière à la mise en production de contrôleurs appris sur des robots manipulateurs ou mobiles, y compris dans des contextes soumis à certification. Le framework s'inscrit dans un courant de recherche actif autour des fonctions de Lyapunov neuronales, avec des travaux concurrents menés notamment chez DeepMind, MIT CSAIL et Caltech sur l'apprentissage de certificats de stabilité. À noter que cette publication est un preprint arXiv sans revue par les pairs finalisée : l'abstract ne fournit aucun benchmark chiffré sur des plateformes réelles (bras, humanoïdes, AMR), ni de comparaison directe avec des baselines standards comme CLF-QP ou des politiques RL classiques. La valeur concrète de L-Learning restera à confirmer lors d'expériences sur matériel physique, ce qui constitue le prochain test décisif pour cette approche.

RecherchePaper
1 source
Planification de mouvements sûre sous perturbations inconnues, avec garanties formelles
2249arXiv cs.RO 

Planification de mouvements sûre sous perturbations inconnues, avec garanties formelles

Des chercheurs ont publié sur arXiv (arXiv:2605.26625) un algorithme de planification de mouvement par échantillonnage qui garantit formellement la sûreté de systèmes robotiques soumis à des perturbations aléatoires dont la distribution est inconnue. L'approche s'applique aux robots à dynamique linéaire ou linéarisable évoluant dans des environnements encombrés avec des obstacles de forme arbitraire, sous contraintes d'état et de commande. La sûreté est formulée comme des chance-constraints (contraintes probabilistes), et l'algorithme apprend depuis des trajectoires observées un "tube d'ambiguïté de Wasserstein", une séquence d'ensembles d'ambiguïté qui contient, avec haute confiance, la distribution d'état réelle du système. Ce tube est ensuite intégré dans un arbre de planification probabilistiquement complet. Les auteurs introduisent également un vérificateur de validité basé sur les bandits multi-bras qui accélère significativement les performances empiriques sans compromettre la complétude. Les cas d'étude montrent que l'algorithme trouve des trajectoires valides dans des environnements denses sous des seuils de sécurité stricts, surpassant les méthodes de référence actuelles. L'enjeu pratique est considérable pour les intégrateurs de robots industriels et les équipes d'autonomie : la plupart des planificateurs de mouvement existants supposent soit une distribution de bruit connue (hypothèse souvent irréaliste), soit ignorent les perturbations stochastiques au profit de marges de sécurité conservatives et figées. Cette méthode data-driven contourne les deux écueils en apprenant directement l'incertitude depuis des données de trajectoires, sans hypothèse paramétrique forte. La réduction du conservatisme via des tubes d'ambiguïté de faible dimension, plusieurs tubes en basse dimension plutôt qu'un seul en haute dimension, améliore la scalabilité, un obstacle classique des approches distributionally robust appliquées à la robotique. C'est un pas concret vers des robots opérant en production dans des environnements non contrôlés, sans recalibration systématique du modèle de bruit. La planification de mouvement sûre sous incertitude est un champ actif depuis deux décennies, structuré autour de méthodes comme RRT/RRT*, les MPC robustes et les approches de tube invariant. L'utilisation de la distance de Wasserstein pour construire des ensembles d'ambiguïté s'inscrit dans le courant des méthodes distributionally robust optimization (DRO), popularisées en contrôle ces cinq dernières années notamment par les groupes de ETH Zurich, Caltech et MIT. Ce preprint n'est pas encore évalué par les pairs. Les prochaines étapes attendues incluent une validation sur hardware réel (les cas d'étude présentés restent en simulation) et une extension aux dynamiques non linéaires, deux conditions nécessaires avant toute intégration dans des pipelines d'autonomie industrielle.

RecherchePaper
1 source
Couverture ergodique de surface par méthode variationnelle de Stein avec contraintes SE(3)
2250arXiv cs.RO 

Couverture ergodique de surface par méthode variationnelle de Stein avec contraintes SE(3)

Une équipe de recherche a publié sur arXiv (référence 2603.09458, troisième révision) une méthode de planification de trajectoire pour robots manipulateurs chargés de couvrir des surfaces 3D complexes. L'approche, baptisée SVGD préconditionné sur SE(3), s'attaque à deux limites reconnues des méthodes d'optimisation de trajectoires ergodiques existantes : la gestion des nuages de points comme cibles de couverture, et le traitement correct des contraintes SE(3), c'est-à-dire les six degrés de liberté de pose rigide de l'effecteur (trois en translation, trois en rotation). La méthode reformule le problème de couverture ergodique comme un problème d'échantillonnage sur variété, dérive des mises à jour de particules SVGD spécifiques à SE(3), et introduit un préconditionneur pour accélérer la convergence. Les auteurs la valident sur un benchmark de couverture de surfaces par nuage de points 3D et sur des expériences réelles de dessin sur surface avec un robot physique. Aucune métrique chiffrée précise (taux de couverture, temps de calcul absolu) n'est publiée dans l'abstract, ce qui limite l'évaluation indépendante à ce stade. L'enjeu industriel derrière ce travail est concret : ponçage, peinture, inspection par contact, soudage de joints complexes et décontamination de surfaces irrégulières constituent des cas d'usage où un robot doit couvrir une géométrie arbitraire tout en maintenant une orientation d'outil précise. Les méthodes d'optimisation de trajectoires classiques peinent à naviguer les paysages d'optimisation non-convexes que génèrent ces surfaces, et les techniques dites d'échantillonnage-comme-optimisation (SAO) ignoraient jusqu'ici la structure géométrique de SE(3), ce qui produisait des trajectoires mécaniquement incohérentes. Le fait que la méthode proposée identifie systématiquement de meilleurs optima locaux que les baselines tout en restant calculatoirement tractable est une avancée utile pour les intégrateurs cherchant à automatiser des opérations de finition en aéronautique ou en automobile, secteurs où la complétude de couverture est un critère qualité critique. La trajectoire ergodique s'impose progressivement comme cadre théorique de référence pour les tâches d'exploration et de couverture en robotique, au-delà des grilles de déplacement traditionnelles. Le Stein Variational Gradient Descent est lui-même une technique d'inférence variationnelle popularisée depuis 2016 par Liu et Wang, dont l'adaptation aux variétés de Lie comme SE(3) est un problème ouvert actif. Du côté applicatif, des acteurs comme Wandercraft (exosquelettes, France) ou des intégrateurs de cellules de peinture robotisée explorent des contraintes de trajectoire similaires, bien que dans des cadres différents. La prochaine étape logique pour ce travail serait une validation sur des surfaces industrielles réelles à haute courbure et sur des robots à sept axes ou plus, ainsi qu'une comparaison quantitative avec des planificateurs commerciaux comme ceux de ROS MoveIt ou de Hyperthought.

UELes secteurs aéronautique et automobile européens, grands utilisateurs de cellules robotisées de peinture et de ponçage, pourraient à terme bénéficier de cette méthode si elle est intégrée dans des planificateurs commerciaux, mais aucun acteur européen n'est directement impliqué dans ce travail de recherche.

RecherchePaper
1 source