
Pilotage de politique par proxy
Les chercheurs à l'origine de l'article "Proxy Policy Steering" présentent une méthode d'adaptation à l'inférence pour les politiques robotiques généralistes, publiée sur arXiv (arXiv:2609.09148v2). La technique, baptisée PPS, entraîne deux petites politiques proxy en parallèle d'un modèle de base gelé : une "proxy de référence" reproduit le comportement du modèle de base sur les observations de la tâche cible, tandis qu'une "proxy de tâche", initialisée à partir de la première, capture comment ce comportement évolue sous supervision spécifique à la tâche. La différence calibrée entre ces deux proxys, dans l'espace des vitesses, vient orienter le processus de débruitage du modèle de base à chaque étape, sans jamais modifier ses paramètres. Testée sur 8 tâches de manipulation en conditions réelles et 4 en simulation, PPS améliore le taux de réussite du modèle pi-0.5, considéré comme référence actuelle du secteur, de 53 points de pourcentage en moyenne, avec des gains sur des tâches que ce modèle échouait systématiquement auparavant.
Cette approche répond à un problème central pour l'industrie robotique : comment spécialiser un modèle généraliste entraîné sur des données massives à une nouvelle tâche, avec peu de démonstrations, sans dégrader ses capacités générales ni nécessiter un réentraînement complet. Contrairement au fine-tuning LoRA, aux politiques résiduelles ou aux spécialistes entraînés from scratch, PPS ne touche pas aux poids du modèle de base et ne requiert que ses prédictions de vitesse en sortie, ce qui la rend applicable même sans accès à ses paramètres internes, un atout pour des intégrateurs qui déploieraient des modèles propriétaires fermés. Le maintien des comportements de récupération après échec, jamais démontrés explicitement dans les données de spécialisation, illustre que la méthode préserve les priors larges du modèle plutôt que de les écraser, un problème récurrent des méthodes d'adaptation classiques.
Le travail s'inscrit dans la lignée des modèles vision-langage-action (VLA) génériques comme pi-0 et sa version 0.5, GR00T N2 de NVIDIA ou Helix de Figure, tous confrontés au même goulot d'étranglement du déploiement : la généralisation en démonstration ne garantit pas la performance sur une tâche industrielle précise. PPS se positionne comme alternative aux méthodes de steering à l'inférence existantes et au fine-tuning paramétrique, en comparant ses résultats empiriquement contre ces baselines. L'article ne précise pas de partenaire industriel, de calendrier de déploiement ni de coût de licence associé, ce qui situe la contribution au stade de recherche méthodologique plutôt que de produit prêt à l'intégration.
Dans nos dossiers




