Aller au contenu principal
RecherchearXiv cs.RO 

Diffusion de politique multimodale asynchrone via fusion de guidage sensible à la latence

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 24 juillet un article arXiv (2607.17257v1) présentant LAG-Fusion, un framework de fusion multimodale pour les politiques de diffusion utilisées en apprentissage par imitation robotique. Le problème visé : les architectures multimodales actuelles combinent vision, force et autres capteurs via une fusion synchrone ou des architectures multi-fréquences conçues manuellement, ce qui ralentit le retour haute fréquence ou limite l'ajout de nouvelles modalités. LAG-Fusion permet à chaque politique spécifique à une modalité de tourner à sa propre cadence d'inférence et d'injecter sa guidance de débruitage dès qu'elle est disponible, sans attendre les autres flux. L'innovation technique centrale est une règle de recalage du référentiel pour les variables de diffusion exprimées en représentations d'action relatives, ce qui permet d'aligner une guidance arrivée en retard avant de la fusionner avec le reste. Les chercheurs ont testé l'approche sur une tâche de manipulation à contact riche, en combinant une politique vision basse fréquence avec une politique force haute fréquence. Sous des latences hétérogènes entre modalités, LAG-Fusion améliore la réactivité de la politique et la performance de la tâche par rapport à une fusion synchrone classique et à des bases de référence spécifiquement conçues pour intégrer la force.

Pour l'industrie robotique, ce travail touche un point de friction bien réel dans le déploiement de politiques génératives type diffusion ou VLA sur des bras manipulateurs : dès qu'on ajoute un capteur de force ou tactile pour des tâches d'assemblage ou d'insertion, la cadence de la caméra (souvent 10 à 30 Hz) et celle du capteur de force (potentiellement 100 Hz et plus) imposent des compromis douloureux, soit en bridant le capteur rapide au rythme du plus lent, soit en construisant une architecture ad hoc peu réutilisable. Une méthode générique qui laisse chaque modalité tourner à sa vitesse native, sans repenser l'architecture à chaque nouvelle combinaison de capteurs, s'attaque directement à un frein à l'extensibilité que rencontrent les intégrateurs travaillant sur la manipulation fine (assemblage électronique, insertion de connecteurs, tri fragile). Cela reste toutefois un résultat validé sur une seule paire de modalités et une tâche contrôlée en laboratoire, loin d'une brique prête à industrialiser.

Les politiques de diffusion se sont imposées ces deux dernières années comme l'une des approches dominantes de l'apprentissage par imitation en robotique, aux côtés de modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui fusionnent eux aussi plusieurs signaux capteurs mais généralement à une cadence unique et synchronisée. La fusion asynchrone multi-fréquence reste peu explorée dans la littérature, la plupart des travaux traitant chaque capteur additionnel comme un module séparé nécessitant un réglage manuel. Le résumé ne précise ni publication de code ou de poids, ni application industrielle prévue à court terme ; l'article, encore non révisé par les pairs, ouvre surtout une piste pour de futurs travaux combinant tactile, force et vision sur des tâches à contact riche, un axe stratégique pour les humanoïdes et bras collaboratifs visant l'assemblage fin.

À lire aussi

LAGO Policy : diffusion asynchrone sensible à la latence et planification sans collision pour une manipulation fluide
1arXiv cs.RO 

LAGO Policy : diffusion asynchrone sensible à la latence et planification sans collision pour une manipulation fluide

Une équipe de chercheurs a publié sur arXiv (référence 2606.17982, juin 2026) un cadre algorithmique baptisé LAGO Policy, acronyme de Latency-Aware asynchronous Goal-directed Optimization, destiné à résoudre deux limitations structurelles des politiques visuomotrices à diffusion en manipulation robotique : les discontinuités entre blocs d'actions lors de l'inférence asynchrone, et l'absence de mécanisme natif d'évitement d'obstacles. Le système repose sur trois composantes intégrées : un guidage sans classifieur (classifier-free guidance, CFG) conditionné sur les actions futures pour assurer la cohérence entre segments d'exécution consécutifs ; une prédiction automatique de point d'interaction cible extraite des démonstrations pour orienter la planification ; et une optimisation spatio-temporelle des trajectoires garantissant des mouvements à faible à-coup (low-jerk) et physiquement réalisables. Les auteurs rapportent des expériences en conditions réelles sur des tâches de manipulation présentées comme complexes, avec un taux de succès élevé, bien que l'abstract ne détaille ni les objets testés ni les métriques quantitatives précises. Ce travail s'attaque à un problème concret qui freine le déploiement industriel des politiques à diffusion : ces modèles génèrent des actions de haute qualité, mais leur temps de calcul est incompatible avec une boucle de contrôle synchrone. Les approches asynchrones existantes contournent la latence en découplant inférence et exécution, mais introduisent précisément les à-coups et ruptures de trajectoire que LAGO cherche à corriger. L'intégration de la planification d'évitement d'obstacles directement dans le pipeline de la politique, sans module externe de type MPC ou RRT, représente un changement d'architecture notable pour les intégrateurs qui empilent aujourd'hui ces briques séparément. Les politiques à diffusion pour la manipulation ont été popularisées notamment par les travaux de Shuran Song (Columbia/Stanford) puis par Physical Intelligence avec Pi-0, architecture qui sert de référence dans le domaine. LAGO s'inscrit dans une tendance plus large où la frontière entre apprentissage par imitation et planification classique se réduit, visible aussi dans GR00T N2 de NVIDIA ou les variantes d'ACT développées dans plusieurs laboratoires académiques. Il s'agit pour l'instant d'un preprint sans déploiement commercial annoncé ni partenaire industriel identifié ; la page projet associée (lago-policy.github.io) laisse entendre que des vidéos et du code seront publiés, mais aucune timeline n'est précisée.

RechercheOpinion
1 source
Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé
2arXiv cs.RO 

Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé

Des chercheurs ont publié sur arXiv (2606.25754) une politique de diffusion baptisée SRDP (Stage-Aware and Roughness-Constrained Diffusion Policy) conçue pour le polissage robotique multi-étapes en environnement industriel. Le système cible en priorité l'aérospatiale, secteur où la qualité de surface conditionne directement la tenue mécanique et la fiabilité des pièces. SRDP infère en continu la phase de polissage en cours (ébauche, semi-finition, finition) à partir d'un historique d'observations multimodales, sans nécessiter d'étiquettes de phase fournies manuellement lors de l'exécution. Le générateur d'actions contraint ensuite la vitesse d'avance et la force de contact normale selon les vitesses de broche préréglées par étape, via un échantillonnage de diffusion orienté rugosité. Les expériences ont été menées sur deux scénarios représentatifs : polissage d'un revêtement de cabine de vaisseau spatial et finition de surfaces structurelles en cavité interne, avec validation sur robot réel. L'enjeu industriel est direct : le polissage reste l'une des tâches les plus difficiles à automatiser par apprentissage par imitation, en raison des dépendances temporelles longues, des transitions de phase incertaines et du couplage fort entre paramètres process (force, vitesse, rugosité cible). Les approches existantes échouent précisément parce qu'elles ignorent la nature séquentielle des étapes ou ne peuvent pas réguler les paramètres physiques de manière cohérente. SRDP rompt avec cette limite en conditionnant le processus de débruitage inverse sur la phase inférée, ce qui produit des actions cohérentes avec l'étape courante sans supervision externe. Les résultats montrent une meilleure stabilité lors des transitions de phase, une plus grande consistance des paramètres process et une qualité de surface finale améliorée par rapport aux baselines comparées. Ce travail s'inscrit dans une vague de politiques de diffusion pour la manipulation industrielle fine, portée depuis 2023 par les travaux de Chi et al. sur Diffusion Policy et accélérée par des architectures comme pi0 (Physical Intelligence) ou les politiques de contact de Lerobot. Le polissage était jusqu'ici dominé par des approches de contrôle en force classique ou d'asservissement d'impédance, moins flexibles face à la variété géométrique des pièces. Aucun partenaire industriel ni calendrier de transfert n'est mentionné dans la publication ; il s'agit donc d'un résultat de recherche académique, pas d'un produit commercialisé.

UEImpact indirect pour le secteur aérospatial européen (Airbus, Safran) dont la qualité de surface des pièces conditionne la certification, mais aucun partenaire industriel ni institution européenne n'est impliqué dans ce résultat académique.

RecherchePaper
1 source
Politiques de diffusion multi-agents extensibles pour le contrôle de couverture
3arXiv cs.RO 

Politiques de diffusion multi-agents extensibles pour le contrôle de couverture

Des chercheurs ont publié sur arXiv (identifiant 2509.17244) MADP (Multi-Agent Diffusion Policy), une approche basée sur les modèles de diffusion pour la coordination décentralisée de nuées de robots. Le principe : chaque robot génère ses actions en échantillonnant depuis une distribution jointe haute dimension, en conditionnant sa politique sur une représentation fusionnée de ses propres observations et des embeddings perceptuels reçus de ses pairs via communication locale. L'équipe évalue MADP sur le problème de couverture de terrain (coverage control), un benchmark canonique en robotique multi-agent où un groupe de robots holonomes doit couvrir efficacement un espace selon des fonctions de densité d'importance variables. La politique est entraînée par imitation learning à partir d'un expert omniscient (dit "clairvoyant"), et le processus de diffusion est paramétré par une architecture de transformer spatial permettant l'inférence décentralisée, sans coordinateur central. Les résultats présentés sont exclusivement issus de simulations. L'intérêt technique principal tient à la nature des modèles de diffusion : contrairement aux politiques classiques qui produisent une action déterministe ou une distribution gaussienne unimodale, MADP peut capturer les interdépendances entre les actions de plusieurs agents dans une distribution multi-modale complexe. Les expériences montrent que le modèle généralise à travers des densités d'agents variables et des environnements non vus à l'entraînement, surpassant les baselines état de l'art. Pour un intégrateur ou un décideur industriel, cela signifie en théorie des essaims plus robustes aux variations de flotte, aux défaillances partielles et aux reconfiguration dynamiques, sans retraining complet. La robustesse au nombre d'agents est particulièrement notable : c'est un verrou historique des approches d'apprentissage multi-agent. Le problème de couverture de terrain occupe les équipes de robotique multi-agent depuis les années 2000, avec des solutions allant de l'optimisation par diagrammes de Voronoï aux algorithmes de reinforcement learning décentralisé. L'application des modèles de diffusion aux politiques robotiques est un domaine en essor depuis les travaux sur les diffusion policies (Pearce et al., 2023) et leur extension dans des systèmes comme Pi-0 de Physical Intelligence ou les architectures ACT. MADP en étend la logique au cas multi-agent, encore peu exploré dans la littérature. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans ce preprint ; les prochaines étapes naturelles seraient une validation sur hardware réel et l'extension à des tâches au-delà de la couverture pure.

RecherchePaper
1 source
Attention spatiale : adapter les horizons d'exécution des politiques de diffusion via la sensibilité à l'observation
4arXiv cs.RO 

Attention spatiale : adapter les horizons d'exécution des politiques de diffusion via la sensibilité à l'observation

Les chercheurs à l'origine de ce papier arXiv (2607.04739v1) s'attaquent à un problème central des politiques robotiques par imitation basées sur des modèles génératifs : l'échantillonnage de blocs d'actions ("action chunks") via diffusion. Ces méthodes, aujourd'hui largement utilisées pour l'apprentissage par démonstration, exécutent généralement chaque bloc d'actions pendant un horizon fixe, ce qui oblige à choisir entre réactivité et coût de calcul. Les auteurs proposent une métrique baptisée "Spatial Attention", définie comme la norme carrée attendue du gradient de la log-vraisemblance de l'action par rapport à l'observation. Elle mesure la sensibilité de la distribution d'actions de la politique aux variations de l'observation. Leur résultat théorique montre que, à budget d'échantillonnage fixe, l'horizon d'exécution qui minimise la perte de vraisemblance cumulée causée par des perturbations diminue quand la Spatial Attention augmente. En prévoyant les valeurs futures de cette métrique en parallèle du bloc d'actions, le système ajuste dynamiquement l'horizon : plus court dans les phases sensibles, plus long dans les phases stables. Des tests en simulation et sur robot réel, sur tâches standards et perturbées, montrent une amélioration significative des taux de succès par rapport aux méthodes à horizon fixe, à horizon moyen d'exécution comparable. Pour l'industrie robotique, ce travail cible un compromis très concret rencontré par les architectures VLA et de type Diffusion Policy (ACT, Pi-0, RT-2 et consorts) : plus un bloc d'actions est long, moins le système coûte cher en inférence, mais plus il devient vulnérable aux imprévus entre deux replanifications. Une adaptation automatique de cet horizon, sans capteur supplémentaire ni coût de calcul additionnel notable, pourrait rendre les politiques de diffusion plus robustes en environnement réel, un enjeu clé pour tout déploiement en usine ou en logistique où les perturbations sont fréquentes. Ce papier s'inscrit dans la lignée des travaux sur les Diffusion Policies et l'apprentissage par imitation à base de modèles génératifs, un courant de recherche en forte expansion depuis l'introduction de l'action chunking comme alternative aux politiques réactives image-par-image. L'abstract ne précise ni l'institution ni la plateforme robotique utilisée pour les essais réels, et reste pour l'instant au stade de contribution méthodologique validée expérimentalement, sans annonce de déploiement industriel.

RecherchePaper
1 source