Aller au contenu principal
RecherchearXiv cs.RO 

AcousticDiffusion : politique de diffusion guidée par l'audio et conditionnée sémantiquement pour l'aide à la recherche et au sauvetage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente AcousticDiffusion, une politique de navigation par diffusion conditionnée sémantiquement et guidée par l'audio, destinée à diriger un robot vers des personnes en détresse quand le contact visuel est dégradé ou impossible, dans un article publié sur arXiv (2609.21792v1). Le système fait tourner un modèle de reconnaissance audio pré-entraîné et figé sur des fenêtres de 10,24 secondes, avec un filtrage de la parole et une priorisation sensible à la détresse qui convertissent les sorties de reconnaissance en rôles de navigation. Les mesures de direction d'arrivée (DOA) issues d'une antenne de microphones sont intégrées de façon récursive dans une carte de croyance bayésienne centrée sur le robot, tandis qu'une compensation de l'ego-mouvement affine progressivement la position de la source sonore. Un modèle de diffusion génère ensuite des trajectoires en points de passage à partir de cette croyance sémantique, des observations acoustiques récentes et de l'état du robot. Sur un jeu de validation synthétique utilisant de l'audio enregistré, le système atteint une erreur de cap moyenne de 11,20 degrés, avec 91,78% des trajectoires alignées à moins de 30 degrés de l'appelant, un rejet des distracteurs de 89,20% à 98,99%, et une priorisation correcte de l'appelant désigné "HELP" dans 91,07% des cas. Déployé en conditions réelles sur un quadrupède ZSL-1 sans réentraînement supplémentaire, il obtient une erreur de cap moyenne de 64,9 degrés, contre 98,2 degrés pour un planificateur A* et 90,4 degrés pour un RRT, avec un temps de calcul moyen de 6,07 millisecondes, et réduit la distance finale à la source de 3,96 m à 2,48 m par rapport aux planificateurs classiques guidés par ODAS, soit une amélioration de 37,4%.

Ce travail illustre que les politiques de diffusion, jusqu'ici surtout utilisées en manipulation robotique, peuvent s'étendre à la planification de trajectoires conditionnée par l'audio et surpasser des planificateurs classiques même avec une localisation acoustique imparfaite, un cas d'usage clé pour les robots de secours opérant dans la fumée, les décombres ou l'obscurité. Le résultat le plus révélateur pour les intégrateurs reste toutefois l'écart entre validation synthétique et déploiement réel: l'erreur de cap est presque multipliée par six lorsque le système quitte le banc d'essai pour tourner sur un quadrupède physique sans réentraînement, un rappel que le fossé entre démonstration et monde réel demeure significatif même pour des méthodes qui battent nettement leurs références. Le temps de calcul de 6 millisecondes suggère malgré tout une compatibilité avec un traitement embarqué en temps réel, un point pertinent pour les concepteurs de robots quadrupèdes et humanoïdes destinés à l'inspection ou à l'intervention en environnement dégradé.

Il s'agit d'un travail académique en amont de tout produit commercial, sans acteur industriel identifié dans l'article, qui s'inscrit dans la lignée des politiques de diffusion popularisées en manipulation robotique et de leur extension récente à la navigation multimodale. La comparaison s'appuie sur ODAS (Open embedded Audition System), une brique open source de localisation acoustique déjà utilisée comme référence dans la communauté robotique. Le quadrupède ZSL-1 sert de plateforme d'essai réel, sans que l'article n'annonce de pilote industriel, de partenariat ou de calendrier de déploiement; les prochaines étapes évoquées concernent la poursuite des tests en conditions réelles et l'intégration de cette capacité de navigation acoustique à d'autres fonctions de recherche et sauvetage, comme la cartographie ou la reconnaissance de victimes.

À lire aussi

Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style
1arXiv cs.RO 

Encodage de la prévisibilité et de la lisibilité pour une politique de diffusion conditionnée par le style

Des chercheurs ont publié sur arXiv (preprint 2503.16368, mis à jour en mai 2026) un framework baptisé Style-Conditioned Diffusion Policy (SCDP), conçu pour résoudre un compromis fondamental en collaboration humain-robot : la lisibilité des mouvements face à leur efficacité temporelle et énergétique. Le système s'appuie sur une politique de diffusion pré-entraînée qu'il enrichit via un pipeline post-entraînement léger, ajoutant un encodeur de scène et un prédicteur de conditionnement sans modifier les poids du modèle de base. À l'inférence, un module de détection d'ambiguïté détermine automatiquement si l'objectif du robot est déjà évident pour un observateur humain ; si oui, la trajectoire optimale est maintenue ; sinon, le système bascule vers des mouvements plus expressifs et intentionnels. Les évaluations portent sur des tâches de manipulation et de navigation. Ce travail adresse un point de friction concret dans le déploiement industriel des bras collaboratifs et des robots mobiles : un robot trop optimal génère des trajectoires difficiles à anticiper pour un opérateur humain, augmentant le risque d'accident et la charge cognitive. À l'inverse, rendre tous les mouvements expressifs coûte du temps de cycle et de l'énergie, ressources critiques en production. SCDP propose un arbitrage automatique et contextuel, ce qui le distingue des approches à style fixe. Le fait que le framework ne nécessite pas de réentraîner la politique de base est l'argument technique le plus fort : cela ouvre la voie à une adaptation post-déploiement sur des modèles existants, un avantage réel pour les intégrateurs qui ne peuvent pas se permettre des cycles de réentraînement complets. Les Diffusion Policies se sont imposées depuis 2023 comme architecture de référence pour l'imitation de comportements complexes, notamment via les travaux de Chi et al. (Columbia/MIT) et leur intégration dans des systèmes comme pi0 de Physical Intelligence. SCDP s'inscrit dans une vague de recherches visant à rendre ces politiques modulables sans réentraînement, une direction également explorée par des approches de guidance conditionnel et d'adaptateurs de type LoRA appliqués à la robotique. Côté lisibilité robot, les travaux sur la motion legibility remontent aux équipes de Dragan et Srinivasa (Carnegie Mellon, 2013), mais leur intégration dans des politiques génératives modernes reste peu exploitée. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans le preprint ; il s'agit d'une contribution académique dont la robustesse hors conditions contrôlées reste à démontrer.

RecherchePaper
1 source
LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents
2arXiv cs.RO 

LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents

LTLDiff, un cadre combinant logique temporelle linéaire finie (LTLf) et politiques de diffusion pour la manipulation robotique multi-agents, a été présenté dans un article déposé sur arXiv (arXiv:2609.11043v1). Pour chaque tâche, une formule LTLf est apprise à partir d'instructions en langage naturel via un grand modèle de langage, puis convertie en arbre syntaxique abstrait afin de produire un vecteur d'embedding de dimension fixe. Cet embedding conditionne à la fois la génération de démonstrations et l'entraînement de la politique de diffusion, dans le but de forcer des trajectoires respectant l'ordre et la coordination attendus entre agents. Les auteurs rapportent des taux de réussite supérieurs à une base de référence sur leurs tâches de test, sans préciser de chiffres exacts, de nombre de robots impliqués, ni s'il s'agit de simulation ou de matériel réel. L'intérêt tient au problème visé : les politiques de diffusion, efficaces pour imiter des démonstrations isolées, se désynchronisent souvent, inversent l'ordre des actions ou échouent à coordonner plusieurs agents dès qu'une tâche exige une interaction simultanée ou séquentielle stricte. En ajoutant une couche de spécification logique et symbolique à l'apprentissage génératif, LTLDiff s'attaque à une faiblesse connue des approches de bout en bout de type VLA, qui peinent à garantir un séquencement fiable. Pour les intégrateurs qui envisagent des cellules multi-bras ou de la manipulation collaborative en logistique, ce travail illustre un retour des méthodes formelles pour combler les lacunes de fiabilité des modèles purement appris, plutôt que de tout miser sur l'échelle des données. LTLDiff s'inscrit dans une recherche académique qui marie logique temporelle et apprentissage de politiques, à distance de la course commerciale des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, tous fondés sur l'échelle des données plutôt que sur des contraintes symboliques explicites. Contrairement à ces annonces produits, LTLDiff reste une publication scientifique sans partenaire industriel ni déploiement annoncé, et ses résultats se limitent à des comparaisons internes avec une base de référence sur des tâches définies par les auteurs eux-mêmes. Aucun acteur français ou européen n'apparaît dans cette étude. Les suites attendues pour ce type de travaux incluent l'extension à un plus grand nombre d'agents et une validation sur du matériel réel.

RecherchePaper
1 source
Attention-DP3 : politique de diffusion 3D avec conditionnement attentionnel aligné sur la géométrie
3arXiv cs.RO 

Attention-DP3 : politique de diffusion 3D avec conditionnement attentionnel aligné sur la géométrie

Attention-DP3, présenté dans un article publié sur arXiv (2609.13318v1), conserve telle quelle l'architecture de diffusion de DP3 (3D Diffusion Policy), une référence pour l'apprentissage par imitation à partir de nuages de points, et lui ajoute un conditionnement attentionnel objet-centré. Le pipeline segmente d'abord les images RGB en vocabulaire ouvert, projette les masques obtenus en 3D via la géométrie de caméra calibrée pour produire des indices géométriques propres à l'objet visé, puis les injecte via un conditionnement dit "tri-champ" combinant trois cartes: un champ de ciblage pour localiser l'objet, un champ de saillance intra-cible pour isoler sa géométrie utile à la tâche, et un champ d'arrière-plan pour supprimer distracteurs et encombrement. La méthode est testée sur les bancs d'essai simulés Adroit, DexArt et MetaWorld ainsi que sur un bras robotique réel SO101, plateforme low-cost associée à l'écosystème open-source LeRobot. Elle dépasse systématiquement DP3 et atteint l'état de l'art sur l'ensemble des benchmarks, avec un écart grimpant jusqu'à 31% en scène fortement encombrée, là où DP3 voit ses performances chuter nettement dès que le nombre de distracteurs augmente. Le code est publié en accès libre sur GitHub (zhangzhongbo2213/Attention-DP3). Le travail s'attaque à une faiblesse connue des politiques de diffusion 3D: un nuage de points reste ambigu dès qu'un objet est partiellement occlus ou mêlé à des distracteurs visuellement proches, une situation courante en bin picking ou en kitting industriel, loin des scènes épurées des démonstrations académiques. Pour les équipes déjà construites autour de DP3, l'intérêt tient au fait que le gain de robustesse provient d'un module ajouté en amont, sans changer le backbone ni exiger de données d'entraînement supplémentaires, ce qui en ferait une mise à niveau relativement peu coûteuse. Le résultat nuance aussi le narratif dominant autour des modèles VLA en image 2D comme Pi-0 ou GR00T N2, en montrant qu'un ancrage géométrique explicite peut traiter une partie du problème de généralisation en environnement encombré, plutôt que la seule mise à l'échelle des données. La validation reste toutefois académique, limitée à trois simulateurs et un seul bras réel low-cost, sans déploiement industriel annoncé. DP3 s'est imposé ces dernières années comme une base de référence pour l'apprentissage de politiques visuomotrices à partir de nuages de points, en parallèle des modèles VLA fondés sur l'image RGB comme Pi-0, GR00T N2 ou Helix, qui concentrent l'essentiel de l'attention médiatique dans la course humanoïde. Attention-DP3 s'inscrit dans une lignée de travaux cherchant à combler l'écart entre la richesse sémantique de la perception 2D et la pauvreté contextuelle de la géométrie 3D brute, en s'appuyant sur la segmentation ouverte pour ancrer les priors géométriques. Aucun partenaire industriel ni pilote commercial n'est annoncé: les auteurs se limitent à publier le code sur GitHub, laissant aux équipes de recherche et aux intégrateurs le soin de reproduire les résultats et de les valider sur d'autres plateformes que le bras SO101 utilisé pour la démonstration réelle.

RecherchePaper
1 source
Raisonnement par graphe de zones sémantiques pour la recherche multi-robots guidée par le langage
4arXiv cs.RO 

Raisonnement par graphe de zones sémantiques pour la recherche multi-robots guidée par le langage

Une équipe de chercheurs a publié SAGR (Semantic Area Graph Reasoning), un framework hiérarchique permettant à des grands modèles de langage (LLM) de coordonner des essaims multi-robots pour la recherche sémantique en environnement inconnu. Évalué sur 100 scénarios du dataset Habitat-Matterport3D, SAGR affiche jusqu'à 18,8 % de gain d'efficacité sur la recherche de cibles sémantiques dans les grands environnements, tout en restant compétitif avec les méthodes d'exploration state-of-the-art basées sur la couverture de frontières. Le système construit incrémentalement un graphe sémantique de zones à partir d'une carte d'occupation sémantique, encodant instances de pièces, connectivité, frontières disponibles et états des robots dans une représentation compacte transmise au LLM pour le raisonnement de haut niveau. La navigation locale et la planification géométrique restent déterministes. L'apport central est architectural : SAGR résout le problème d'interface entre raisonnement symbolique et coordination géométrique, un point de friction récurrent dans les systèmes multi-robots. Les approches classiques (frontier coverage, information gain) sont aveugles à l'intention de tâche, elles ne savent pas qu'une « cafetière » se trouve probablement dans une cuisine, pas un couloir. SAGR délègue cette inférence contextuelle au LLM via une abstraction topologique structurée, sans exposer le modèle au bruit d'une carte brute. C'est une séparation claire des responsabilités : le LLM raisonne sur la sémantique des pièces, les robots exécutent localement. Pour un intégrateur ou un opérateur d'entrepôt multi-AGV, cela ouvre la voie à des instructions en langage naturel comme « trouve le chariot de nettoyage » sans reconfiguration de la logique de navigation. Ce travail s'inscrit dans une tendance forte de 2024-2025 : l'injection de LLM dans la boucle de planification robotique, aux côtés de travaux comme SayPlan (Rana et al.), NavGPT ou des approches VLA type RT-2 et π₀. SAGR se distingue en ciblant explicitement la coordination multi-agent plutôt que le robot unique, et en validant sur un benchmark standardisé (HM3D) plutôt qu'en démo lab. La prochaine étape logique sera le passage du simulateur au réel, le sim-to-real gap sur la segmentation sémantique restant le principal obstacle non adressé par les auteurs.

RechercheActu
1 source