Aller au contenu principal
PrefPI : orienter un robot vers des comportements hors distribution grâce aux préférences
RecherchearXiv cs.RO 

PrefPI : orienter un robot vers des comportements hors distribution grâce aux préférences

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient PrefPI (Preference-Guided Policy Iteration), un cadre itératif qui oriente des politiques robotiques génératives pré-entraînées à partir de simples préférences relatives entre trajectoires que la politique produit elle-même. Le principe consiste à traiter l'apprentissage par préférences comme de la modélisation générative conditionnelle: les trajectoires préférées définissent une distribution conditionnelle, dont le rapport de densité avec la distribution comportementale plus large fournit un signal de préférence implicite, amplifié par le classifier-free guidance (CFG). L'étape est répétée en boucle, ce qui donne une forme d'itération de politique guidée par les préférences. Les tests couvrent des diffusion policies et le VLA à flow matching PI0.5, en simulation comme sur matériel réel. Résultat phare: la hauteur de transport d'un objet passe de 10,7 cm à 19,8 cm sur robot physique, avec seulement 150 trajectoires annotées par préférence. Il s'agit d'un preprint arXiv (v1), non évalué par les pairs, et l'abstract ne détaille ni la tâche, ni le robot, ni le nombre d'itérations ou d'essais.

L'enjeu est de sortir du simple « affûtage » de modes déjà présents dans la politique, qui limite la plupart des méthodes de préférences existantes. Ici, les auteurs visent des comportements rarement, voire jamais observés sous la politique initiale, par exemple porter un objet plus haut que ce que les démonstrations couvraient. Pour un intégrateur, c'est un levier concret: adapter un VLA générique à une contrainte de site (hauteur de dépose, trajectoire d'évitement, style de manipulation) sans collecter de nouvelles téléopérations, avec un retour humain qui se limite à comparer deux séquences. Le coût d'annotation, 150 comparaisons, reste modeste face à la téléopération. Deux réserves s'imposent: le gain de 9 cm est mesuré sur une métrique unique, et rien n'indique la robustesse, le taux de réussite ou la dégradation sur les tâches initiales après plusieurs itérations.

Le travail s'inscrit dans la montée en puissance des VLA open source, dont PI0.5 de Physical Intelligence est devenu une base de référence, et dans la recherche d'alternatives à l'apprentissage par renforcement, coûteux et risqué sur robot réel, pour affiner ces modèles après pré-entraînement. Il se positionne face aux méthodes de type RLHF/DPO appliquées à la robotique et aux approches de RL résiduel ou de filtrage de trajectoires, qui restent confinées au support initial de la politique. Les suites à surveiller: validation sur des tâches plus variées et de longue durée, publication du code, et test sur d'autres VLA comme GR00T ou Helix. Aucun pilote industriel n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution
1arXiv cs.RO 

DiSA-IQL : apprentissage par renforcement hors ligne pour un contrôle robuste des robots souples face aux changements de distribution

Les robots serpents mous, capables de se faufiler et de se plier dans des environnements complexes grâce à leur structure flexible, restent difficiles à piloter car leur dynamique est fortement non linéaire et échappe aux modèles simplifiés utilisés par les contrôleurs classiques ou bio-inspirés. Une équipe de recherche propose DiSA-IQL (Distribution-Shift-Aware Implicit Q-Learning), une extension de l'algorithme d'apprentissage par renforcement hors ligne IQL, décrite dans une version révisée d'un article publié sur arXiv (identifiant 2510.00358v2). La méthode ajoute une pénalité sur les paires état-action jugées peu fiables afin de limiter la dégradation de performance causée par le décalage de distribution, un problème classique de l'apprentissage hors ligne où l'agent doit généraliser à partir d'un jeu de données figé sans pouvoir interagir en temps réel avec l'environnement. Les auteurs testent DiSA-IQL sur des tâches d'atteinte d'objectif, en distribution et hors distribution, uniquement en simulation, et rapportent des taux de réussite supérieurs, des trajectoires plus lisses et une robustesse accrue par rapport à trois références : le clonage comportemental (BC), Conservative Q-Learning (CQL) et l'IQL standard. L'enjeu dépasse le seul cas des robots serpents. L'apprentissage en ligne sur du matériel réel est coûteux et risqué pour des structures souples fragiles, ce qui pousse la recherche vers des méthodes hors ligne capables d'exploiter des jeux de données pré-collectés sans dégrader leurs performances face à des situations inédites. Si les résultats se confirment au-delà de la simulation, ils renforceraient la viabilité de pipelines d'apprentissage hors ligne pour des classes de robots à dynamique difficile à modéliser, un enjeu direct pour les intégrateurs qui cherchent à déployer des systèmes souples sans multiplier les essais physiques coûteux. Le travail s'inscrit dans la lignée directe d'IQL et de CQL, deux méthodes de référence en RL hors ligne conservateur, que les auteurs utilisent comme bases de comparaison plutôt que comme simples antécédents théoriques. Il reste à ce stade purement académique et simulé : aucune validation sur robot physique n'est rapportée, et l'article ne mentionne ni partenaire industriel ni calendrier de transfert vers du matériel réel.

RecherchePaper
1 source
Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé
2arXiv cs.RO 

Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé

Une équipe de chercheurs propose Adaptive Humanoid Control (AHC), un framework de contrôle locomoteur pour humanoïdes publié sur arXiv (2511.06371v3). Le problème de départ est structurel : les méthodes dominantes entraînent une politique séparée pour chaque compétence (se relever, marcher, courir, sauter), générant des contrôleurs rigides qui échouent dès que le terrain devient irrégulier. AHC y répond en deux phases : d'abord, plusieurs politiques primaires sont entraînées puis fusionnées par distillation multi-comportements en un contrôleur unique capable de commuter dynamiquement selon le contexte ; ensuite, un affinage par renforcement avec retours en ligne consolide l'adaptabilité sur terrains variés. Le système est validé en simulation et en conditions réelles sur le robot Unitree G1 d'Unitree Robotics. Pour les intégrateurs et les décideurs industriels, la promesse est concrète : un seul contrôleur couvrant l'ensemble des comportements locomoteurs réduit la complexité opérationnelle et supprime les transitions manuelles entre modes. Du côté de la recherche, le résultat le plus notable est que la distillation combinée à un fine-tuning par RL en ligne permet de réduire partiellement le sim-to-real gap sans ré-entraînement complet. La réserve à formuler : le papier ne publie pas de métriques quantitatives détaillées (taux de succès par terrain, fréquence de chute), ce qui rend difficile la comparaison objective avec d'autres approches. Le Unitree G1 (1,27 m, environ 35 kg, 16 000 dollars) est devenu depuis 2024 une plateforme de recherche de référence pour ce type de travaux. AHC s'inscrit dans une compétition internationale où Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure (Helix) et Boston Dynamics cherchent tous à produire des politiques locomotrices généralisables hors environnement contrôlé. L'approche par distillation multi-politiques rappelle les travaux de curriculum learning menés à Berkeley et CMU, et l'affinage par RL en ligne emprunte aux méthodologies RLHF adaptées à la robotique physique. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; le projet en est au stade de la démonstration académique.

RecherchePaper
1 source
Orienter les politiques génératives de robots avec des préférences lexicographiques
3arXiv cs.RO 

Orienter les politiques génératives de robots avec des préférences lexicographiques

Des chercheurs présentent, dans un article publié sur arXiv (2609.15014v1), une méthode pour piloter, au moment de l'inférence et sans modifier leurs poids, des politiques robotiques génératives préentraînées basées sur des modèles de diffusion ou de flow matching, afin qu'elles respectent des préférences de déploiement classées par ordre de priorité lexicographique, par exemple des contraintes de faisabilité liées au robot avant des préférences propres à l'utilisateur. La méthode modifie l'échantillonneur de deux façons: un guidage par barrière dynamique empêche les mises à jour de priorité inférieure de dégrader les coûts de priorité supérieure, et une sélection en cascade filtre les échantillons candidats niveau par niveau. Sur un benchmark de navigation, elle améliore le taux de succès, la traversabilité et la conformité aux préférences par rapport à la politique gelée seule, et dépasse nettement des références à somme pondérée pourtant réglées manuellement. Transférée à une politique de manipulation en flow matching sur le benchmark simulé LIBERO, elle améliore la conformité sans réduire le taux de réussite des tâches, et une étude contrôlée montre qu'elle égale la meilleure performance des poids fixes sur une plage de réglages beaucoup plus large. Cette approche cible un problème concret de déploiement des politiques robotiques génératives de type VLA: un modèle entraîné sur des données générales n'intègre pas nécessairement l'ordre de priorité exigé sur le terrain, où sécurité et faisabilité doivent souvent primer sur les préférences d'un opérateur ou d'un client. Plutôt que de ré-entraîner ou d'affiner le modèle pour chaque cas d'usage, la méthode agit uniquement à l'inférence sur un modèle figé, ce qui intéresse directement les intégrateurs cherchant à adapter une politique généraliste à des contraintes site par site sans cycle de fine-tuning. Elle met aussi en évidence les limites des combinaisons pondérées de coûts, pratique courante mais fragile car elle exige un réglage manuel à chaque nouveau déploiement. Les résultats restent toutefois limités à des benchmarks simulés, navigation et LIBERO, sans validation sur robot physique ni chiffres de déploiement réel. Le travail s'inscrit dans une recherche plus large sur le guidage de modèles génératifs appliqué à la prise de décision sous contraintes, à mesure que diffusion et flow matching remplacent les politiques d'apprentissage par renforcement classiques dans la robotique généraliste. LIBERO, utilisé pour la partie manipulation, est un benchmark de référence pour évaluer les politiques d'imitation et les modèles vision-langage-action en simulation, et le choix de tester les deux familles de modèles reflète leur coexistence actuelle dans le secteur, sans qu'aucun modèle commercial ni entreprise partenaire ne soit cité. Aucun acteur français ou européen n'apparaît dans les travaux. Classé comme nouvelle soumission arXiv, l'article ne précise ni calendrier de suite ni test annoncé sur robot réel, et se présente comme une contribution méthodologique destinée à d'autres équipes de recherche plutôt qu'à un produit ou un pilote commercial.

RecherchePaper
1 source
MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM
4arXiv cs.RO 

MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM

Un preprint arXiv publié fin août 2026 (2608.15549v1) présente MistyPilot, un framework multi-agents à base de LLM pour piloter le robot social Misty à partir d'instructions en langage naturel. Un "Task Router" aiguille chaque instruction vers l'un de deux agents spécialisés : un agent d'interaction physique pour le contrôle déclenché par capteurs et l'invocation directe de compétences, et un agent d'interaction sociale pour la gestion d'état conversationnel et la génération de réponses multimodales contextuelles, qui réutilise les résultats déjà générés quand c'est possible plutôt que de relancer systématiquement une génération complète. Le système a été testé sur cinq suites de composants, avec liaisons capteurs-compétences et invocations de skills exécutées sur un robot Misty physique, ainsi que via une étude utilisateur préliminaire auprès de 12 participants, avec une extensibilité vérifiée jusqu'à 100 compétences et une variance inférieure à celle d'un système mono-agent autrement identique. Le code sera publié via la page du projet. Le problème ciblé est concret pour les intégrateurs de robotique sociale : composer manuellement des API en compétences, lier des événements capteurs à ces compétences et gérer l'état des tâches à l'exécution freine le passage de démonstrations scriptées à des interactions robustes et durables. En séparant le contrôle réactif physique de la gestion sociale à état persistant, MistyPilot répond à une limite fréquente des architectures mono-agent, à savoir une variance et une instabilité plus élevées des réponses, et illustre une voie de production fondée sur l'orchestration de compétences existantes plutôt que sur le réentraînement complet d'un modèle vision-langage-action. L'étude reste toutefois un prototype de recherche à petite échelle, sans mesure d'usage prolongé en conditions réelles. Misty, petit robot social de bureau développé par Misty Robotics, dispose d'un écosystème de compétences programmables via API jusqu'ici assemblées manuellement par les développeurs. MistyPilot s'inscrit dans la vague de travaux visant à faire piloter des robots par des LLM ou des modèles vision-langage-action, un champ largement dominé par des approches orientées manipulation physique comme Pi-0, GR00T N2 ou Helix, dont il se distingue en ciblant spécifiquement l'interaction sociale et conversationnelle plutôt que la locomotion ou la préhension. Aucun calendrier de commercialisation ni partenariat industriel n'est annoncé ; seule la publication du code source via la page du projet est confirmée, ce qui permettra une vérification indépendante des résultats revendiqués sur le routage et l'extensibilité à 100 compétences.

RecherchePaper
1 source