
Réglage port-hamiltonien calibré par démonstrations pour les politiques de manipulation
Des chercheurs proposent PHRetune, une méthode hors ligne qui calcule les gains d'un contrôleur d'impédance (raideur et amortissement) pour une politique de manipulation figée, sans aucun rollout d'évaluation ni recherche de gains. Le principe : apprendre à partir de démonstrations un modèle port-Hamiltonien, qui estime l'effort et l'énergie associés aux actions prédites. La politique est ensuite appliquée aux observations enregistrées, et ses prédictions sont comparées à des budgets d'effort et d'énergie dérivés des démonstrations. De cette comparaison ressort un unique facteur d'échelle des gains, obtenu en forme fermée. Sur les suites LIBERO, le taux de succès de Diffusion Policy progresse jusqu'à 9,4 points de pourcentage, et les gains dérivés atteignent les meilleurs taux observés dans des balayages empiriques. Sur quatre tâches réelles, Diffusion Policy « PHRetunée » dépasse la politique nominale, d'autres méthodes de réglage et une base de référence avec réentraînement. Avec SmolVLA et OpenVLA-OFT, le succès augmente sur chaque tâche, et l'accélération comme le jerk diminuent pour les deux architectures.
Le point pratique tient à un angle mort courant du déploiement. Les politiques de diffusion et les VLA (modèles vision-langage-action) pilotent presque toujours le robot via un contrôleur d'impédance en aval, dont les gains sont le plus souvent hérités de la collecte de données plutôt que choisis pour la politique déployée. Les balayages de gains améliorent la performance, mais ils immobilisent un robot et exigent des essais répétés, ce qui coûte cher sur une cellule réelle. Ici, les gains sont fixés avant l'évaluation, sans modèle du manipulateur, sans fonction de récompense, sans réentraînement ni calcul supplémentaire à l'exécution. Pour un intégrateur, cela revient à une étape de calibration peu coûteuse, applicable à des politiques de fournisseurs différents sans toucher à leurs poids. La baisse de l'accélération et du jerk suggère aussi des mouvements plus doux, donc moins d'usure et de contraintes sur les pièces manipulées. Il faut toutefois rester prudent : le gain maximal de 9,4 points concerne un benchmark de simulation, le nombre de tâches réelles est limité à quatre, et le papier ne chiffre pas ici les gains pour les VLA.
Ce travail s'inscrit dans l'essor des politiques généralistes (Diffusion Policy, OpenVLA-OFT, SmolVLA), dont l'effort de recherche porte surtout sur l'architecture, les données et le réentraînement, alors que la couche de contrôle bas niveau reçoit moins d'attention. L'approche port-Hamiltonienne, issue de la commande basée sur l'énergie et la passivité, rapproche ainsi la robotique classique de l'apprentissage imitatif. Il s'agit d'une prépublication arXiv (2610.05755, version 2), non encore évaluée par des pairs, sans code de déploiement industriel ni calendrier annoncé. Les suites logiques seraient des tests sur davantage de robots, de tâches riches en contacts et de contrôleurs, ainsi qu'une extension à des gains variables dans le temps plutôt qu'à un facteur d'échelle unique.
Dans nos dossiers




