
Politique de diffusion immiscible : préserver la multimodalité des actions du robot grâce à une affectation du bruit sans étiquettes
Des chercheurs publient sur arXiv (2610.09369, première version) Immiscible Diffusion Policy, un complément d'entraînement pour les politiques de diffusion en robotique. Ils constatent que ces politiques s'effondrent souvent sur une seule modalité d'action, même quand le jeu de données est équilibré entre modalités et que le lot d'entraînement est parfaitement symétrique. Leur analyse désigne l'appariement indépendant entre actions et bruit. Il multiplie les croisements et mélanges entre trajectoires de diffusion, ce qui produit des réponses de débruitage moyennées qui effacent les comportements propres à chaque modalité. La méthode remplace cet appariement par une affectation action-bruit sans étiquette, qui préserve des routes bruit-vers-action relativement distinctes. Elle ne modifie ni l'architecture de la politique ni l'inférence. Les tests couvrent cinq tâches simulées et deux tâches réelles de manipulation humanoïde, avec observations d'état, RGB et nuages de points. La part de la modalité non dominante est multipliée par 6,0 à 14,6 sur trois tâches à deux modalités. Sur les deux tâches à quatre modalités, des modalités totalement absentes des déploiements de la politique de base réapparaissent.
Ce travail s'attaque à une promesse jamais tenue des politiques de diffusion : représenter des distributions d'actions multimodales, par exemple contourner un obstacle par la gauche ou par la droite. Si l'effondrement vers un mode unique est systématique, la diversité des démonstrations humaines est en partie perdue à l'entraînement. C'est un point de vigilance pour les intégrateurs qui collectent des données de téléopération hétérogènes. L'argument d'une correction sans coût à l'inférence est séduisant, car elle s'ajoute à des pipelines existants. Les limites sont claires : le résumé ne donne ni taux de succès absolus, ni nombre d'essais, ni identité des robots, et seules deux tâches sont réelles. Préserver une modalité ne garantit pas non plus que la politique choisisse la bonne.
Les politiques de diffusion se sont imposées comme base de l'apprentissage par imitation depuis 2023, et les modèles généralistes récents (VLA à flow matching comme Pi-0, par exemple) reposent sur des principes voisins. Le nom de la méthode rappelle une technique d'affectation de bruit introduite pour accélérer l'entraînement en génération d'images, ici reprise pour un autre problème. Aucun déploiement industriel ni calendrier n'est annoncé. La suite logique serait une validation sur des politiques à grande échelle et des benchmarks indépendants.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




