Aller au contenu principal
Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style
RecherchearXiv cs.RO 

Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (preprint 2503.16368, mis à jour en mai 2026) un framework baptisé Style-Conditioned Diffusion Policy (SCDP), conçu pour résoudre un compromis fondamental en collaboration humain-robot : la lisibilité des mouvements face à leur efficacité temporelle et énergétique. Le système s'appuie sur une politique de diffusion pré-entraînée qu'il enrichit via un pipeline post-entraînement léger, ajoutant un encodeur de scène et un prédicteur de conditionnement sans modifier les poids du modèle de base. À l'inférence, un module de détection d'ambiguïté détermine automatiquement si l'objectif du robot est déjà évident pour un observateur humain ; si oui, la trajectoire optimale est maintenue ; sinon, le système bascule vers des mouvements plus expressifs et intentionnels. Les évaluations portent sur des tâches de manipulation et de navigation.

Ce travail adresse un point de friction concret dans le déploiement industriel des bras collaboratifs et des robots mobiles : un robot trop optimal génère des trajectoires difficiles à anticiper pour un opérateur humain, augmentant le risque d'accident et la charge cognitive. À l'inverse, rendre tous les mouvements expressifs coûte du temps de cycle et de l'énergie, ressources critiques en production. SCDP propose un arbitrage automatique et contextuel, ce qui le distingue des approches à style fixe. Le fait que le framework ne nécessite pas de réentraîner la politique de base est l'argument technique le plus fort : cela ouvre la voie à une adaptation post-déploiement sur des modèles existants, un avantage réel pour les intégrateurs qui ne peuvent pas se permettre des cycles de réentraînement complets.

Les Diffusion Policies se sont imposées depuis 2023 comme architecture de référence pour l'imitation de comportements complexes, notamment via les travaux de Chi et al. (Columbia/MIT) et leur intégration dans des systèmes comme pi0 de Physical Intelligence. SCDP s'inscrit dans une vague de recherches visant à rendre ces politiques modulables sans réentraînement, une direction également explorée par des approches de guidance conditionnel et d'adaptateurs de type LoRA appliqués à la robotique. Côté lisibilité robot, les travaux sur la motion legibility remontent aux équipes de Dragan et Srinivasa (Carnegie Mellon, 2013), mais leur intégration dans des politiques génératives modernes reste peu exploitée. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; il s'agit d'une contribution académique dont la robustesse hors conditions contrôlées reste à démontrer.

À lire aussi

DSSP : une politique d'état de diffusion avec encodage de l'historique complet
1arXiv cs.RO 

DSSP : une politique d'état de diffusion avec encodage de l'historique complet

Une équipe de recherche a publié en mai 2026 un préprint sur arXiv (2605.14598) présentant DSSP, Diffusion State Space Policy, une nouvelle architecture de politique robotique pour la manipulation. Le principe central : conditionner la génération d'actions non plus sur une fenêtre courte d'observations récentes, comme le font la majorité des politiques diffusion existantes, mais sur l'intégralité de l'historique d'observations depuis le début de la tâche. L'encodeur d'historique repose sur des State Space Models (SSMs), qui compriment le flux complet d'observations en une représentation contextuelle compacte. Un objectif d'entraînement auxiliaire dit "dynamics-aware" optimise cet encodeur pour préserver les informations pertinentes à l'évolution future de l'état. Ce contexte de haut niveau est ensuite fusionné avec les observations récentes dans un mécanisme de conditionnement hiérarchique, et le backbone diffusion lui-même est également instancié via un SSM pour limiter la mémoire GPU. Les expériences couvrent des benchmarks en simulation et des tâches de manipulation réelles. Le problème que DSSP cherche à résoudre est structurel dans les approches actuelles : les tâches longue durée génèrent des ambiguïtés que seule la mémoire étendue permet de lever. Une pince qui répète la même séquence de sous-tâches ou qui doit adapter son comportement en fonction d'un état vu dix secondes plus tôt ne peut pas le faire si le modèle n'a accès qu'à la dernière frame ou à une fenêtre de deux secondes. Les auteurs rapportent des performances état-de-l'art avec une taille de modèle significativement inférieure aux concurrents, ce qui est un argument industriel non trivial : des modèles plus légers facilitent le déploiement sur du compute embarqué et réduisent les coûts d'inférence. L'utilisation des SSMs plutôt que des Transformers pour l'encodage de séquences longues est cohérente avec des travaux récents (Mamba, Mamba-2) montrant que cette famille d'architectures offre une complexité linéaire en longueur de séquence, là où l'attention quadratique pénalise fortement les historiques longs. Ce travail s'inscrit dans un courant actif depuis la publication de Diffusion Policy (Chi et al., Columbia/MIT, 2023), qui a établi la diffusion comme paradigme dominant pour l'imitation learning en manipulation. Des acteurs comme Physical Intelligence avec pi-0, NVIDIA avec GR00T N2, ou Figure AI avec ses architectures propriétaires ont chacun proposé leurs variantes de politiques diffusion ou VLA (Vision-Language-Action). La question de la mémoire temporelle longue reste ouverte dans l'ensemble de ces systèmes. DSSP est à ce stade un résultat de recherche académique, pas un produit déployé : les expériences réelles décrites sont des validations en laboratoire, non des pilotes industriels. La prochaine étape naturelle serait une intégration dans des frameworks open-source comme Lerobot (HuggingFace) ou une collaboration avec des fabricants pour valider le passage à l'échelle sur des tâches d'assemblage à horizons multiples.

UEImpact indirect potentiel si DSSP est intégré dans Lerobot (HuggingFace, entreprise française basée à Paris), ce qui faciliterait l'adoption par les équipes européennes de recherche en manipulation robotique longue durée.

RechercheOpinion
1 source
Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé
2arXiv cs.RO 

Politique de diffusion sensible aux phases et contrainte par la rugosité pour le polissage robotique multiphasé

Des chercheurs ont publié sur arXiv (2606.25754) une politique de diffusion baptisée SRDP (Stage-Aware and Roughness-Constrained Diffusion Policy) conçue pour le polissage robotique multi-étapes en environnement industriel. Le système cible en priorité l'aérospatiale, secteur où la qualité de surface conditionne directement la tenue mécanique et la fiabilité des pièces. SRDP infère en continu la phase de polissage en cours (ébauche, semi-finition, finition) à partir d'un historique d'observations multimodales, sans nécessiter d'étiquettes de phase fournies manuellement lors de l'exécution. Le générateur d'actions contraint ensuite la vitesse d'avance et la force de contact normale selon les vitesses de broche préréglées par étape, via un échantillonnage de diffusion orienté rugosité. Les expériences ont été menées sur deux scénarios représentatifs : polissage d'un revêtement de cabine de vaisseau spatial et finition de surfaces structurelles en cavité interne, avec validation sur robot réel. L'enjeu industriel est direct : le polissage reste l'une des tâches les plus difficiles à automatiser par apprentissage par imitation, en raison des dépendances temporelles longues, des transitions de phase incertaines et du couplage fort entre paramètres process (force, vitesse, rugosité cible). Les approches existantes échouent précisément parce qu'elles ignorent la nature séquentielle des étapes ou ne peuvent pas réguler les paramètres physiques de manière cohérente. SRDP rompt avec cette limite en conditionnant le processus de débruitage inverse sur la phase inférée, ce qui produit des actions cohérentes avec l'étape courante sans supervision externe. Les résultats montrent une meilleure stabilité lors des transitions de phase, une plus grande consistance des paramètres process et une qualité de surface finale améliorée par rapport aux baselines comparées. Ce travail s'inscrit dans une vague de politiques de diffusion pour la manipulation industrielle fine, portée depuis 2023 par les travaux de Chi et al. sur Diffusion Policy et accélérée par des architectures comme pi0 (Physical Intelligence) ou les politiques de contact de Lerobot. Le polissage était jusqu'ici dominé par des approches de contrôle en force classique ou d'asservissement d'impédance, moins flexibles face à la variété géométrique des pièces. Aucun partenaire industriel ni calendrier de transfert n'est mentionné dans la publication ; il s'agit donc d'un résultat de recherche académique, pas d'un produit commercialisé.

UEImpact indirect pour le secteur aérospatial européen (Airbus, Safran) dont la qualité de surface des pièces conditionne la certification, mais aucun partenaire industriel ni institution européenne n'est impliqué dans ce résultat académique.

RecherchePaper
1 source
ContactDP : politique de diffusion guidée par le contact pour les tâches d'insertion de précision
3arXiv cs.RO 

ContactDP : politique de diffusion guidée par le contact pour les tâches d'insertion de précision

Une équipe de recherche présente ContactDP (Contact-Guided Diffusion Policy), une politique de diffusion conçue pour l'insertion de connecteurs à tolérances serrées, dans un preprint publié sur arXiv (2609.23800v1). Le système fusionne trois flux de perception en temps réel : une caméra RGB montée au poignet pour l'alignement global, des capteurs tactiles au bout des doigts et des mesures de force-couple au poignet, afin d'inférer l'état de contact et de générer des corrections de trajectoire temporellement cohérentes pendant l'insertion. Cette politique apprise pilote un contrôleur hybride position-force en boucle basse, qui assure une interaction compliante lors du contact physique avec le connecteur. Les auteurs l'ont testée sur une série de tâches d'insertion de connecteurs de qualité industrielle, en faisant varier la géométrie des pièces, les conditions de préhension et le désalignement initial de la pince. Le résultat annoncé est un gain net de performance, de fiabilité et de capacité de généralisation par rapport aux politiques de diffusion qui ne s'appuient que sur la vision. Cette approche s'attaque à un point de friction classique de la manipulation fine en robotique : dès que la pince entre en contact avec la pièce, l'occlusion visuelle et l'ambiguïté du contact rendent l'image seule insuffisante pour corriger la trajectoire, ce qui explique une partie de l'écart persistant entre les démonstrations en laboratoire et la fiabilité requise en ligne d'assemblage. En montrant qu'ajouter du tactile et de la force-couple à une politique de diffusion améliore nettement la robustesse sur des connecteurs aux géométries variées, les auteurs apportent un argument concret pour les intégrateurs qui cherchent à automatiser des tâches d'assemblage électronique ou de câblage, un segment où les robots à apprentissage visuel seul échouent encore souvent en production. Le travail s'inscrit dans la lignée des politiques de diffusion pour la manipulation robotique, une famille de méthodes popularisée ces dernières années comme alternative aux politiques de clonage comportemental classiques, et vise spécifiquement le sous-problème de l'insertion contact-rich plutôt que la manipulation générale à la manière des modèles VLA de type Pi-0 ou GR00T. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier de transfert vers un produit industriel : il s'agit à ce stade d'un résultat de recherche évalué en conditions contrôlées, sans déploiement commercial annoncé.

RecherchePaper
1 source
AcousticDiffusion : politique de diffusion guidée par l'audio et conditionnée sémantiquement pour l'aide à la recherche et au sauvetage
4arXiv cs.RO 

AcousticDiffusion : politique de diffusion guidée par l'audio et conditionnée sémantiquement pour l'aide à la recherche et au sauvetage

Une équipe de recherche présente AcousticDiffusion, une politique de navigation par diffusion conditionnée sémantiquement et guidée par l'audio, destinée à diriger un robot vers des personnes en détresse quand le contact visuel est dégradé ou impossible, dans un article publié sur arXiv (2609.21792v1). Le système fait tourner un modèle de reconnaissance audio pré-entraîné et figé sur des fenêtres de 10,24 secondes, avec un filtrage de la parole et une priorisation sensible à la détresse qui convertissent les sorties de reconnaissance en rôles de navigation. Les mesures de direction d'arrivée (DOA) issues d'une antenne de microphones sont intégrées de façon récursive dans une carte de croyance bayésienne centrée sur le robot, tandis qu'une compensation de l'ego-mouvement affine progressivement la position de la source sonore. Un modèle de diffusion génère ensuite des trajectoires en points de passage à partir de cette croyance sémantique, des observations acoustiques récentes et de l'état du robot. Sur un jeu de validation synthétique utilisant de l'audio enregistré, le système atteint une erreur de cap moyenne de 11,20 degrés, avec 91,78% des trajectoires alignées à moins de 30 degrés de l'appelant, un rejet des distracteurs de 89,20% à 98,99%, et une priorisation correcte de l'appelant désigné "HELP" dans 91,07% des cas. Déployé en conditions réelles sur un quadrupède ZSL-1 sans réentraînement supplémentaire, il obtient une erreur de cap moyenne de 64,9 degrés, contre 98,2 degrés pour un planificateur A* et 90,4 degrés pour un RRT, avec un temps de calcul moyen de 6,07 millisecondes, et réduit la distance finale à la source de 3,96 m à 2,48 m par rapport aux planificateurs classiques guidés par ODAS, soit une amélioration de 37,4%. Ce travail illustre que les politiques de diffusion, jusqu'ici surtout utilisées en manipulation robotique, peuvent s'étendre à la planification de trajectoires conditionnée par l'audio et surpasser des planificateurs classiques même avec une localisation acoustique imparfaite, un cas d'usage clé pour les robots de secours opérant dans la fumée, les décombres ou l'obscurité. Le résultat le plus révélateur pour les intégrateurs reste toutefois l'écart entre validation synthétique et déploiement réel: l'erreur de cap est presque multipliée par six lorsque le système quitte le banc d'essai pour tourner sur un quadrupède physique sans réentraînement, un rappel que le fossé entre démonstration et monde réel demeure significatif même pour des méthodes qui battent nettement leurs références. Le temps de calcul de 6 millisecondes suggère malgré tout une compatibilité avec un traitement embarqué en temps réel, un point pertinent pour les concepteurs de robots quadrupèdes et humanoïdes destinés à l'inspection ou à l'intervention en environnement dégradé. Il s'agit d'un travail académique en amont de tout produit commercial, sans acteur industriel identifié dans l'article, qui s'inscrit dans la lignée des politiques de diffusion popularisées en manipulation robotique et de leur extension récente à la navigation multimodale. La comparaison s'appuie sur ODAS (Open embedded Audition System), une brique open source de localisation acoustique déjà utilisée comme référence dans la communauté robotique. Le quadrupède ZSL-1 sert de plateforme d'essai réel, sans que l'article n'annonce de pilote industriel, de partenariat ou de calendrier de déploiement; les prochaines étapes évoquées concernent la poursuite des tests en conditions réelles et l'intégration de cette capacité de navigation acoustique à d'autres fonctions de recherche et sauvetage, comme la cartographie ou la reconnaissance de victimes.

RecherchePaper
1 source