
PrefPI : orienter un robot vers des comportements hors distribution grâce aux préférences
Des chercheurs publient PrefPI (Preference-Guided Policy Iteration), un cadre itératif qui oriente des politiques robotiques génératives pré-entraînées à partir de simples préférences relatives entre trajectoires que la politique produit elle-même. Le principe consiste à traiter l'apprentissage par préférences comme de la modélisation générative conditionnelle: les trajectoires préférées définissent une distribution conditionnelle, dont le rapport de densité avec la distribution comportementale plus large fournit un signal de préférence implicite, amplifié par le classifier-free guidance (CFG). L'étape est répétée en boucle, ce qui donne une forme d'itération de politique guidée par les préférences. Les tests couvrent des diffusion policies et le VLA à flow matching PI0.5, en simulation comme sur matériel réel. Résultat phare: la hauteur de transport d'un objet passe de 10,7 cm à 19,8 cm sur robot physique, avec seulement 150 trajectoires annotées par préférence. Il s'agit d'un preprint arXiv (v1), non évalué par les pairs, et l'abstract ne détaille ni la tâche, ni le robot, ni le nombre d'itérations ou d'essais.
L'enjeu est de sortir du simple « affûtage » de modes déjà présents dans la politique, qui limite la plupart des méthodes de préférences existantes. Ici, les auteurs visent des comportements rarement, voire jamais observés sous la politique initiale, par exemple porter un objet plus haut que ce que les démonstrations couvraient. Pour un intégrateur, c'est un levier concret: adapter un VLA générique à une contrainte de site (hauteur de dépose, trajectoire d'évitement, style de manipulation) sans collecter de nouvelles téléopérations, avec un retour humain qui se limite à comparer deux séquences. Le coût d'annotation, 150 comparaisons, reste modeste face à la téléopération. Deux réserves s'imposent: le gain de 9 cm est mesuré sur une métrique unique, et rien n'indique la robustesse, le taux de réussite ou la dégradation sur les tâches initiales après plusieurs itérations.
Le travail s'inscrit dans la montée en puissance des VLA open source, dont PI0.5 de Physical Intelligence est devenu une base de référence, et dans la recherche d'alternatives à l'apprentissage par renforcement, coûteux et risqué sur robot réel, pour affiner ces modèles après pré-entraînement. Il se positionne face aux méthodes de type RLHF/DPO appliquées à la robotique et aux approches de RL résiduel ou de filtrage de trajectoires, qui restent confinées au support initial de la politique. Les suites à surveiller: validation sur des tâches plus variées et de longue durée, publication du code, et test sur d'autres VLA comme GR00T ou Helix. Aucun pilote industriel n'est annoncé à ce stade.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




