
Politique de l'IA : passage à l'action décrite dans une démonstration
Les chercheurs à l'origine de Temporal Policy proposent une nouvelle méthode d'apprentissage par démonstration (Learning from Demonstration) pour les robots, publiée en préprint sur arXiv (2607.29482) et dont le code est disponible sur GitHub (dmiller12/TemporalPolicy). Contrairement aux modèles de diffusion et de flow matching classiques, qui partent d'un bruit gaussien non informatif et doivent apprendre des trajectoires complexes et coûteuses pour atteindre l'espace des actions physiques, Temporal Policy initialise directement le flux génératif à partir de l'historique récent du robot. Cette méthode, basée sur des interpolants stochastiques, couple explicitement les états passés aux séquences d'actions futures, ce qui réduit le coût de transport et produit des champs vectoriels plus directs. Les auteurs ont validé leur approche sur des bancs d'essai de simulation visuomotrice ainsi que sur une plateforme physique de téléopération Barrett WAM à deux bras de 7 degrés de liberté (DOF) chacun. Résultat chiffré: une réduction du coût de transport d'un facteur proche de dix par rapport aux méthodes initialisées par bruit, avec une latence d'inférence de 19,1 millisecondes sur une carte graphique NVIDIA RTX 4080, tout en conservant des taux de réussite comparables aux méthodes de référence.
Ce gain de vitesse s'attaque à un goulot d'étranglement concret pour les politiques robotiques génératives: le coût d'inférence élevé des modèles de diffusion et de flow matching limite leur usage en contrôle en boucle fermée à haute fréquence, essentiel pour des tâches de manipulation fine ou de téléopération réactive. En démontrant qu'il est possible de conserver la précision des architectures génératives multimodales tout en divisant fortement le temps de calcul, ce travail répond à une critique récurrente adressée aux politiques VLA et diffusion en robotique: leur difficulté à tourner en temps réel sur du matériel embarqué.
Ce travail s'inscrit dans la lignée des politiques de diffusion pour la robotique (Diffusion Policy) et des approches de flow matching à la Pi-0, qui ont gagné en popularité ces dernières années pour capturer des comportements multimodaux à partir de démonstrations humaines. En misant sur les interpolants stochastiques plutôt que sur un bruit gaussien pur, les auteurs proposent une piste architecturale distincte pour accélérer l'inférence sans sacrifier les performances, un axe de recherche que d'autres laboratoires travaillant sur les modèles action-langage-vision à grande échelle pourraient être amenés à explorer.
Dans nos dossiers




