Aller au contenu principal
Réglage port-hamiltonien calibré par démonstrations pour les politiques de manipulation
RecherchearXiv cs.RO 

Réglage port-hamiltonien calibré par démonstrations pour les politiques de manipulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent PHRetune, une méthode hors ligne qui calcule les gains d'un contrôleur d'impédance (raideur et amortissement) pour une politique de manipulation figée, sans aucun rollout d'évaluation ni recherche de gains. Le principe : apprendre à partir de démonstrations un modèle port-Hamiltonien, qui estime l'effort et l'énergie associés aux actions prédites. La politique est ensuite appliquée aux observations enregistrées, et ses prédictions sont comparées à des budgets d'effort et d'énergie dérivés des démonstrations. De cette comparaison ressort un unique facteur d'échelle des gains, obtenu en forme fermée. Sur les suites LIBERO, le taux de succès de Diffusion Policy progresse jusqu'à 9,4 points de pourcentage, et les gains dérivés atteignent les meilleurs taux observés dans des balayages empiriques. Sur quatre tâches réelles, Diffusion Policy « PHRetunée » dépasse la politique nominale, d'autres méthodes de réglage et une base de référence avec réentraînement. Avec SmolVLA et OpenVLA-OFT, le succès augmente sur chaque tâche, et l'accélération comme le jerk diminuent pour les deux architectures.

Le point pratique tient à un angle mort courant du déploiement. Les politiques de diffusion et les VLA (modèles vision-langage-action) pilotent presque toujours le robot via un contrôleur d'impédance en aval, dont les gains sont le plus souvent hérités de la collecte de données plutôt que choisis pour la politique déployée. Les balayages de gains améliorent la performance, mais ils immobilisent un robot et exigent des essais répétés, ce qui coûte cher sur une cellule réelle. Ici, les gains sont fixés avant l'évaluation, sans modèle du manipulateur, sans fonction de récompense, sans réentraînement ni calcul supplémentaire à l'exécution. Pour un intégrateur, cela revient à une étape de calibration peu coûteuse, applicable à des politiques de fournisseurs différents sans toucher à leurs poids. La baisse de l'accélération et du jerk suggère aussi des mouvements plus doux, donc moins d'usure et de contraintes sur les pièces manipulées. Il faut toutefois rester prudent : le gain maximal de 9,4 points concerne un benchmark de simulation, le nombre de tâches réelles est limité à quatre, et le papier ne chiffre pas ici les gains pour les VLA.

Ce travail s'inscrit dans l'essor des politiques généralistes (Diffusion Policy, OpenVLA-OFT, SmolVLA), dont l'effort de recherche porte surtout sur l'architecture, les données et le réentraînement, alors que la couche de contrôle bas niveau reçoit moins d'attention. L'approche port-Hamiltonienne, issue de la commande basée sur l'énergie et la passivité, rapproche ainsi la robotique classique de l'apprentissage imitatif. Il s'agit d'une prépublication arXiv (2610.05755, version 2), non encore évaluée par des pairs, sans code de déploiement industriel ni calendrier annoncé. Les suites logiques seraient des tests sur davantage de robots, de tâches riches en contacts et de contrôleurs, ainsi qu'une extension à des gains variables dans le temps plutôt qu'à un facteur d'échelle unique.

À lire aussi

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique
1arXiv cs.RO 

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 CORE (Common Outcome Regularities from Action-Free Visual Demonstrations), un cadre d'apprentissage de politique robotique conçu pour exploiter des vidéos humaines sans annotations de mouvements, afin d'entraîner des robots manipulateurs. La méthode s'appuie sur une observation clé : bien que les trajectoires menant à une même tâche varient, leurs états terminaux partagent des configurations d'objets stables, des relations spatiales et des contraintes de contact reproductibles. CORE entraîne d'abord un encodeur d'état terminal par apprentissage contrastif et objectifs temporels auxiliaires, agrège ensuite les embeddings terminaux réussis en prototypes visuels de but (visual goal prototypes), puis injecte ces prototypes comme conditions globales dans la politique de contrôle du robot. Les gains de taux de succès mesurés sur les benchmarks de référence sont de +3,9 points de pourcentage sur Meta-World, +11,1 pp sur RoboTwin 2.0, et jusqu'à +17,0 pp en manipulation réelle. L'enjeu est direct pour les intégrateurs : collecter des démonstrations robotiques est coûteux en équipement, en opérateurs et en temps de setup, tandis que des millions d'heures de vidéos humaines d'assemblage, de logistique ou de cuisine existent déjà. L'écart morphologique entre la main humaine et un préhenseur robotique a jusqu'ici rendu ces vidéos inutilisables pour l'apprentissage par imitation direct. CORE contourne le problème en ne cherchant pas à transférer les actions elles-mêmes, mais uniquement les régularités des états finaux. Le gain de +17 pp en conditions réelles est particulièrement notable car il indique une réduction du fossé sim-to-real sans contrainte sur la morphologie du robot. En surpassant les variantes conditionnées par texte (architecture VLA classique), CORE suggère que les prototypes visuels de but apportent des contraintes géométriques et physiques plus exploitables que les instructions en langage naturel, une nuance importante pour la calibration de politiques multi-tâches. L'apprentissage par imitation depuis des vidéos humaines est un axe de recherche actif, porté notamment par Google DeepMind avec RT-2, Physical Intelligence avec pi-0, et Meta FAIR. Des méthodes comme R3M ou VIP apprennent des représentations visuelles transférables depuis des vidéos humaines, mais CORE cible spécifiquement les états terminaux plutôt que les représentations d'observation générales, ce qui constitue sa distinction architecturale principale. Les benchmarks retenus, Meta-World et RoboTwin 2.0, sont reconnus sans être universellement adoptés, ce qui limite les comparaisons directes avec les résultats concurrents. Aucun partenariat industriel ni déploiement commercial n'est mentionné : il s'agit d'un preprint arXiv, dont les suites dépendront de réplications indépendantes et d'extensions vers des tâches plus complexes, notamment la manipulation en chaîne longue ou en environnements non structurés.

RechercheOpinion
1 source
DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique
2arXiv cs.RO 

DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25631v1) DynaForge, un framework destiné à générer automatiquement des démonstrations de manipulation dynamique d'objets pour l'entraînement de politiques robotiques par apprentissage par imitation. Le système combine une planification globale à basse fréquence avec une cinématique inverse centrée sur l'objet à haute fréquence, puis applique une politique résiduelle pour corriger les actions au moment critique du contact. Un curriculum implicite regroupe les tentatives par conditions similaires et privilégie les lots à succès mixte, concentrant l'apprentissage par renforcement résiduel sur la frontière de compétence en évolution. Sur les tâches Can et Bottle, DynaForge nécessite 0,73 fois moins d'étapes d'optimisation que l'algorithme GRPO standard pour un budget d'étapes d'environnement identique, avec un taux de succès final supérieur. Sur neuf tâches de simulation, le taux moyen de génération de démonstrations réussies passe de 41,30% avec la seule planification a priori à 78,37% avec DynaForge. Avec 800 démonstrations par tâche, des politiques DP3 entraînées sur ces données atteignent 49,11% de succès moyen, contre 7,07% pour des données générées par la méthode concurrente DOMINO. Sur trois tâches dynamiques réelles, les politiques entraînées avec DynaForge obtiennent entre 30% et 60% de succès, contre 0% à 10% pour celles issues de DOMINO. La manipulation dynamique, lancer, attraper au vol, gestes exigeant une réaction rapide au contact, reste un point faible des pipelines d'apprentissage par imitation, car les démonstrations générées automatiquement échouent souvent près du contact ou simplifient excessivement l'interaction physique, comme le fait le rejeu à la DOMINO. En améliorant nettement le taux de génération de démonstrations exploitables tout en réduisant le coût de calcul par rapport à des méthodes de renforcement classiques comme GRPO, DynaForge s'attaque directement au goulot d'étranglement des données qui freine l'entraînement de politiques à grande échelle, qu'il s'agisse de politiques de diffusion comme DP3 ou de modèles vision-langage-action plus larges. L'écart de 20 à 50 points de succès observé en conditions réelles suggère que ces démonstrations reflètent mieux la dynamique physique que les méthodes précédentes, un enjeu central pour les intégrateurs qui cherchent à transférer des politiques entraînées en simulation vers du matériel réel sans réentraînement coûteux. DynaForge se positionne explicitement face à deux familles de méthodes existantes: les approches purement basées sur la planification, sujettes à l'échec au moment du contact, et DOMINO, qui simplifie les interactions dynamiques au prix du réalisme. Le recours à GRPO, algorithme d'optimisation de politique par groupe popularisé dans l'entraînement de modèles de langage, illustre la porosité croissante entre techniques de renforcement issues du traitement du langage et robotique. Le résumé ne précise ni affiliation institutionnelle ni disponibilité du code, et la validation réelle reste limitée à trois tâches sans détail sur le nombre d'essais, ce qui invite à la prudence avant toute extrapolation à un déploiement industriel.

RecherchePaper
1 source
Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique
3arXiv cs.RO 

Démystifier la conception de l'espace d'action pour les politiques de manipulation robotique

Une étude empirique de grande envergure, publiée sur arXiv (référence 2602.23408), apporte les premières réponses systématiques à une question restée sans réponse rigoureuse dans la communauté de la manipulation robotique : comment concevoir l'espace d'action d'une politique apprise par imitation ? Les chercheurs ont conduit plus de 13 000 déploiements réels sur un robot bimanuel, entraîné et évalué plus de 500 modèles sur quatre scénarios distincts, en examinant deux axes structurants : l'axe temporel (représentations absolues vs. incrémentales, dites "delta") et l'axe spatial (espace articulaire, ou joint-space, vs. espace opérationnel, ou task-space). Le résultat principal est sans ambiguïté : les représentations delta, qui encodent des variations de position plutôt que des positions cibles absolues, améliorent systématiquement les performances d'apprentissage. Sur l'axe spatial, joint-space et task-space révèlent des forces complémentaires : le premier favorise la stabilité du contrôle, le second facilite la généralisation à de nouveaux scénarios. Ces résultats ont une portée directe pour les équipes qui développent des politiques robotiques en production. Jusqu'ici, le choix de l'espace d'action relevait d'heuristiques héritées ou de conventions propres à chaque laboratoire, sans base empirique solide. L'étude montre que ce choix n'est pas accessoire : il conditionne fondamentalement le paysage d'optimisation de l'apprentissage par imitation, bien davantage que ce que supposait la littérature. Pour un intégrateur ou un ingénieur concevant un système de manipulation industrielle, la recommandation est désormais claire : préférer les delta actions par défaut, et arbitrer entre joint-space et task-space selon que la priorité est la stabilité du suivi de trajectoire ou la robustesse face à la variabilité des tâches. Ces conclusions sont directement applicables aux architectures VLA (Vision-Language-Action), qui dominent actuellement la recherche en politiques généralisables. Ce travail intervient dans un contexte où la course à la mise à l'échelle des données et des modèles concentre la majorité des ressources de recherche. Des systèmes comme pi-0 (Physical Intelligence), ACT ou Diffusion Policy ont popularisé l'imitation learning comme voie principale vers la manipulation généraliste, et des acteurs comme Figure AI, 1X ou Apptronik misent sur ces architectures pour leurs déploiements industriels. Pourtant, la conception de l'espace d'action restait guidée par des choix hérités des années 2010, faute d'étude comparative à grande échelle. En comblant ce manque avec une rigueur rare, les auteurs posent une base méthodologique qui devrait informer la prochaine génération de politiques bimanuelle et les benchmarks de comparaison entre systèmes.

RechercheOpinion
1 source
Manipulation robotique dextérique à partir de démonstrations humaines : retargeting ancré sur les contacts et apprentissage de politique résiduelle
4arXiv cs.RO 

Manipulation robotique dextérique à partir de démonstrations humaines : retargeting ancré sur les contacts et apprentissage de politique résiduelle

Un pipeline en trois étapes permet désormais d'entraîner des politiques de manipulation dextre pour robots à partir de simples enregistrements de capture de mouvement humain, sans aucune donnée d'entraînement collectée sur un robot réel, selon un article publié sur arXiv (2609.24093v1). La méthode combine un raffinement physique via une main MANO simulée pour reconstruire les contacts et les forces absents des captures humaines classiques, un retargeting ancré sur la structure de contact plutôt que sur le mouvement articulaire, et une politique résiduelle d'apprentissage par renforcement entraînée une seule fois pour corriger la faisabilité dynamique. Les résultats chiffrés sont substantiels : sur 25 454 trajectoires à une main, le taux de succès passe de 7,3% à 59,3% après application du pipeline ; sur 25 tâches bimanuelles, il grimpe de 16,0% à 62,4%. Le même jeu de données humain, transféré vers quatre mains robotiques de morphologies différentes, gagne 62,4 points de succès en moyenne. Quatre tâches bimanuelles impliquant des contacts complexes ont aussi été exécutées sur du matériel physique réel, toujours sans entraînement préalable sur robot. Pour l'industrie robotique, ce travail s'attaque frontalement au goulot d'étranglement le plus coûteux de la manipulation dextre : les données de téléopération réelle, jugées indispensables mais lentes et chères à collecter à l'échelle. En montrant qu'une seule politique résiduelle générique suffit à rendre exploitables des captures de mouvement humain bon marché et déjà disponibles en masse, l'étude suggère que le sim-to-real pour les mains multi-doigts pourrait devenir moins dépendant de pipelines spécifiques à chaque tâche, une promesse jusqu'ici tenue surtout par les modèles VLA génériques (GR00T, Pi-0, Helix) sur des tâches de préhension plus grossières. Le transfert réussi vers quatre morphologies de main différentes renforce l'idée que la structure de contact, plutôt que la cinématique brute, est la représentation qui généralise. Le constat de départ est que les sources de démonstrations humaines scalables, vidéos ou gants de capture de mouvement, ne capturent jamais les forces de contact qui déterminent la réussite d'une prise. Les approches concurrentes reposaient jusqu'ici sur du retargeting cinématique direct ou de l'apprentissage par renforcement spécifique à chaque tâche en simulation. Le papier reste à ce stade un preprint de recherche, sans partenaire industriel ni déploiement commercial annoncé ; les suites attendues concernent l'extension à davantage de morphologies de mains et de tâches réelles.

RecherchePaper
1 source