Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape
Une publication déposée sur arXiv (référence 2609.21220, catégorie "new") présente INSPO, une méthode pour piloter en temps réel des politiques robotiques génératives sans les réentraîner. Le problème visé est le suivant : les politiques préentraînées de type diffusion ou flow matching génèrent des comportements variés et multimodaux, mais restent difficiles à adapter aux contraintes imposées au moment du déploiement, comme l'évitement de collision ou le maintien d'une orientation donnée, sans repasser par un guidage par gradient coûteux appliqué tout au long d'un processus itératif, trop lent pour du contrôle temps réel. INSPO reformule le problème comme une optimisation de trajectoire dans l'espace du bruit d'entrée de la politique : au lieu de modifier directement les actions générées, l'algorithme optimise le bruit injecté en évaluant les contraintes sur la trajectoire d'état qui en résulte, avec un terme de régularisation qui garde la solution proche de la distribution d'entrée native du modèle, le tout résolu en ligne par optimisation par essaim de particules. Les auteurs testent la méthode sur des politiques spécifiques à une tâche, à base d'état ou d'image, et sur des politiques généralistes vision-langage-action, avec trois bancs d'essai simulés : Push-T, la préhension-dépose de boîtes de conserve (Can pick-and-place) et LIBERO-Spatial.
Pour l'industrie robotique, ce travail cible un verrou concret : les politiques génératives promettent plus de diversité comportementale que les politiques déterministes classiques, mais leur nature stochastique complique la garantie de contraintes de sécurité strictes une fois déployées sur un bras ou un robot mobile réel. Jusqu'ici, imposer ces contraintes passait soit par un rejet coûteux d'échantillons (best-of-N sampling), soit par une projection a posteriori des actions générées, soit par un guidage par gradient trop lent pour le temps réel. INSPO affiche de meilleurs taux de réussite et de respect des contraintes que les deux premières approches, tout en égalant le guidage par gradient avec un temps d'exécution plus faible, ce qui, si cela se confirme sur du matériel physique, réduirait un frein réel à l'usage industriel des politiques VLA génériques du type Pi-0 ou GR00T, où la sécurité à l'inférence limite encore la commercialisation au-delà des démonstrations.
Ce travail s'inscrit dans la vague des politiques robotiques fondées sur la diffusion ou le flow matching, et plus particulièrement dans le virage récent vers des politiques génératives "en une étape", plus rapides à échantillonner que les processus itératifs classiques mais qui rendent obsolètes certaines méthodes de guidage par gradient conçues pour ces derniers. À ce stade, INSPO n'a été validé que sur des bancs d'essai simulés standards de la littérature, sans démonstration sur robot physique ni comparaison avec un système commercial : il s'agit d'une contribution méthodologique amont plutôt que d'un produit ou d'un déploiement annoncé. Aucun acteur français ou européen n'apparaît dans cette publication.
Dans nos dossiers




