Aller au contenu principal
QuickLAP : apprentissage rapide des préférences langage-action pour systèmes semi-autonomes
RecherchearXiv cs.RO 

QuickLAP : apprentissage rapide des préférences langage-action pour systèmes semi-autonomes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du MIT CLEAR Lab ont publié QuickLAP (Quick Language-Action Preference Learning), un cadre bayésien conçu pour apprendre les préférences d'un utilisateur en combinant deux types de retours : les corrections physiques (gestes, ajustements de trajectoire) et les instructions en langage naturel. L'article, déposé sur arXiv (2511.17855v2), présente des résultats obtenus dans un simulateur de conduite semi-autonome. L'approche utilise un LLM pour extraire, à partir d'énoncés libres, deux signaux distincts : un masque d'attention sur les caractéristiques de la fonction de récompense (quels critères comptent) et un vecteur de déplacement de préférence (dans quelle direction). Ces signaux sont intégrés avec les corrections physiques via une règle de mise à jour en forme fermée, sans nécessiter d'optimisation itérative à chaque cycle.

Les résultats quantitatifs sont notables : QuickLAP réduit l'erreur d'apprentissage de la récompense de plus de 70 % par rapport à des baselines utilisant uniquement le retour physique ou des fusions multimodales heuristiques. Une étude utilisateur menée avec 15 participants confirme que le système est perçu comme plus compréhensible et collaboratif, et que le comportement appris est préféré à celui des baselines. Pour les intégrateurs de systèmes semi-autonomes (robotique d'assistance, véhicules autonomes, cobots industriels), cela pointe vers une voie concrète pour réduire la charge de supervision humaine : au lieu d'imposer des interfaces de correction rigides, le système réconcilie des feedbacks ambigus en temps réel. La combinaison LLM + inférence bayésienne contourne l'ambiguïté classique des corrections gestuelles seules.

Le problème adressé est bien identifié dans la littérature sur l'apprentissage par renforcement interactif (IRL, RLHF, preference learning). Les approches précédentes traitaient soit le langage (via RLHF ou instruction following), soit le retour physique (DAgger, kinesthetic teaching), rarement les deux de façon cohérente. QuickLAP se positionne dans la lignée des travaux sur les VLAs et les reward models multimodaux, avec un angle applicatif sur les systèmes à supervision humaine partielle. Le code est disponible sur GitHub (MIT-CLEAR-Lab/QuickLAP). Les prochaines étapes naturelles seraient une validation sur robot physique et des expériences dans des domaines au-delà de la conduite, comme la manipulation ou la navigation en entrepôt.

Dans nos dossiers

À lire aussi

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique
1arXiv cs.RO 

MAPL : apprentissage des préférences multi-objectifs pour la locomotion robotique

Des chercheurs présentent MAPL (Multi-Objective AI-Informed Preference Learning), un cadre d'apprentissage par renforcement pour la locomotion quadrupède qui remplace les fonctions de récompense manuelles par des préférences générées par LLM. Publié sur arXiv (réf. 2606.25398) en juin 2025, le système soumet des paires de trajectoires à un grand modèle de langage, qui les évalue selon plusieurs critères sémantiques distincts, formulés en langage naturel générique et invariants selon le terrain. Ces préférences par objectif alimentent un modèle de scoring à plusieurs têtes, dont les sorties sont agrégées en récompense scalaire pour l'optimisation de politique. Sur quatre environnements de simulation quadrupède, les auteurs rapportent des performances comparables ou supérieures à des récompenses conçues par des experts du domaine. L'intérêt de MAPL tient à sa décomposition structurée des objectifs, là où les méthodes LLM existantes se limitent à un jugement global entre comportements. En robotique industrielle, la conception de fonctions de récompense reste un goulot d'étranglement reconnu, exigeant de longues itérations entre ingénieurs RL et spécialistes métier. Substituer ce travail par des descriptions en langage naturel, réutilisables sans réécriture d'équations, réduirait le coût d'adaptation à de nouvelles tâches. La décomposition en critères distincts offre aussi une meilleure interprétabilité : il devient possible d'identifier quels objectifs sont en tension, ce qui facilite le débogage comportemental. MAPL s'inscrit dans la vague d'automatisation de la conception de récompenses via LLM, initiée notamment par EUREKA (NVIDIA, 2023), qui générait directement du code de récompense via GPT-4, et par RL-VLM-F, qui exploite des modèles vision-langage pour évaluer les comportements. La locomotion quadrupède est un benchmark standard utilisé par des projets comme ANYmal (ETH Zurich) et les plateformes Unitree. Plusieurs limites méritent d'être signalées : l'article reste un preprint non relu par les pairs, les expériences sont menées uniquement en simulation sans validation physique, et le LLM utilisé pour générer les préférences n'est pas spécifié, ce qui complique la reproductibilité. Les extensions naturelles concernent la validation sur robot réel et l'application à des morphologies plus complexes, comme les humanoïdes, où l'ingénierie de récompense est particulièrement coûteuse.

RecherchePaper
1 source
Repenser les implications du retour humain pour l'apprentissage des préférences dans la collaboration homme-robot
2arXiv cs.RO 

Repenser les implications du retour humain pour l'apprentissage des préférences dans la collaboration homme-robot

Une équipe de recherche en interaction homme-robot publie sur arXiv (2609.13982) une remise en cause de la méthode standard d'apprentissage des préférences pour le comportement des robots collaboratifs. Cette méthode standard fonctionne en trois étapes : le robot collecte un feedback humain direct limité, généralement binaire (positif ou négatif) ; il en déduit ensuite des étiquettes "acceptée" ou "rejetée" pour des actions faisables mais non choisies, via des règles d'implication fixes préétablies ; puis il met à jour son modèle de récompense avec l'ensemble de ces données. Une étude utilisateur menée sur deux environnements de simulation collaboratifs montre que les étiquettes d'implication réellement données par les humains divergent souvent de ce que prédit la règle fixe, et que l'usage des étiquettes humaines réelles améliore nettement l'apprentissage de récompense avec l'algorithme PIE (Preference Learning from Implicit and Explicit Feedback). Les chercheurs proposent en réponse IMPLIED, une méthode qui utilise la règle fixe comme simple point de départ tout en apprenant à inférer et corriger les étiquettes au fil des interactions. Testée sur des trajectoires d'interaction homme-robot enregistrées ainsi que sur une étude avec un robot physique préparant des pizzas, IMPLIED prédit les implications humaines plus fidèlement que la règle fixe et que des références basées sur des LLM, en se rapprochant des performances d'un oracle utilisant directement des étiquettes humaines. Ce résultat questionne une hypothèse implicite largement répandue dans la conception des systèmes de robots collaboratifs : que des règles logiques figées suffisent à extrapoler les préférences humaines au-delà du feedback explicite donné. Pour les concepteurs de robots d'assistance ou de cobots industriels, cela signifie que les modèles de récompense actuels risquent de mal interpréter systématiquement l'intention des opérateurs sur les actions non directement évaluées, ce qui peut se traduire par un comportement robotique perçu comme irrationnel ou mal aligné en situation réelle de collaboration. En réduisant l'erreur d'estimation des préférences, IMPLIED promet des robots capables de s'adapter plus vite et plus fidèlement à un opérateur humain sans multiplier les sollicitations de feedback, un enjeu direct pour l'efficacité des déploiements en environnement partagé homme-robot. Le travail s'inscrit dans la lignée des approches d'apprentissage de préférences par renforcement inverse appliquées à la robotique collaborative, où l'algorithme PIE sert de référence pour combiner feedback explicite et implicite. En comparant IMPLIED à la fois à la règle fixe classique et à des références utilisant des grands modèles de langage, les auteurs positionnent leur méthode comme une alternative apprise et adaptative aux heuristiques statiques du domaine. La validation combine environnements simulés et un cas d'usage physique concret de fabrication culinaire, suggérant une voie vers une intégration future dans des architectures de robots collaboratifs déployés en usine ou en environnement de service.

RecherchePaper
1 source
Contrôle des systèmes autonomes aligné sur la mission et informé par l'apprentissage : formulation et fondements
3arXiv cs.RO 

Contrôle des systèmes autonomes aligné sur la mission et informé par l'apprentissage : formulation et fondements

Une équipe de recherche publie sur arXiv (référence 2507.04356, version 3) un article intitulé "Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations". Le papier propose un cadre formel d'optimisation à deux niveaux pour piloter des agents physiques autonomes: robots industriels et de service, drones, dispositifs de contrôle embarqués. Les auteurs prennent comme cas d'étude stylisé la robotique d'assistance aux soins, domaine où l'approche classique repose sur une procédure d'apprentissage par renforcement (RL) à deux étages, un niveau bas décidant des mouvements physiques et un niveau haut gérant les tâches conceptuelles. Leur contribution consiste à reformuler cette architecture comme un schéma d'optimisation bi-niveau intégrant du contrôle classique au niveau bas et de la planification classique au niveau haut, le tout couplé à une capacité d'apprentissage. Aucun robot, entreprise ni chiffre de déploiement n'est cité: il s'agit d'un travail théorique posant les fondations mathématiques du cadre, sans expérimentation matérielle rapportée. Pour l'industrie robotique, l'intérêt tient moins à une performance chiffrée qu'à la promesse de fiabilité et de sécurité physique dans des systèmes qui restent aujourd'hui largement des boîtes noires. En combinant RL, contrôle et planification symbolique plutôt que du RL de bout en bout, les auteurs visent une architecture plus interprétable, un enjeu direct pour les intégrateurs et les régulateurs devant certifier des robots évoluant près d'humains. Le travail s'inscrit dans un débat plus large du secteur: les politiques d'apprentissage à grande échelle progressent vite en démonstration, mais laissent ouvertes des questions de garantie de sécurité et d'auditabilité des décisions, souvent exigées avant un déploiement industriel réel. Le contexte évoqué est celui d'une hausse rapide des investissements en recherche et en capital vers les agents physiques autonomes, tous secteurs confondus. Historiquement, les architectures hiérarchiques de RL à deux niveaux séparent déjà décisions motrices bas niveau et objectifs haut niveau, mais sans intégration formelle avec des méthodes de contrôle et de planification classiques, plus anciennes et mieux comprises en termes de garanties. En articulant ces trois familles de méthodes dans un seul cadre, l'article se positionne comme un travail de fondation plutôt qu'une preuve de concept appliquée, laissant à des travaux ultérieurs la validation expérimentale sur des plateformes robotiques réelles.

RecherchePaper
1 source
Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)
4arXiv cs.RO 

Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)

Une équipe de recherche présente SPLC (Social Preference Learning for Crowd Robot Navigation), un nouvel algorithme d'apprentissage par renforcement hors ligne conçu pour faire naviguer des robots au milieu de foules de piétons sans avoir à concevoir manuellement une fonction de récompense. Publié sur arXiv le 2 juillet 2026 (arXiv:2607.01925v1), le système introduit un mécanisme de retour de préférences sociales qui génère automatiquement des données de préférence à partir de critères d'évaluation prédéfinis, en tenant compte explicitement de la dynamique complexe des piétons. Les auteurs ont testé SPLC en combinaison avec plusieurs méthodes de RL hors ligne et rapportent des gains constants par rapport aux meilleures références actuelles sur des métriques de performance standard, avant de valider l'approche en conditions réelles sur un robot TurtleBot4. Le code et des démonstrations vidéo sont disponibles sur le dépôt GitHub du projet (sklus949/SPLC). L'enjeu pratique est la conception des récompenses en RL, un goulot d'étranglement bien connu pour déployer des robots mobiles autonomes dans des environnements humains partagés, entrepôts, hôpitaux, espaces commerciaux. Écrire à la main une fonction qui capture des normes sociales floues (garder ses distances, céder le passage, anticiper une trajectoire) introduit des biais et ne généralise pas d'une foule à l'autre. En automatisant la génération de préférences plutôt que la récompense elle-même, SPLC s'attaque directement au problème du "reward hacking" et du décalage entre simulation et réel, un point sensible pour tout intégrateur qui envisage des robots de navigation autonome en zones piétonnes denses. Le passage à un test réel sur TurtleBot4, plutôt qu'une simple démonstration en simulateur, distingue ce travail de nombreuses publications qui restent cantonnées au benchmark. Ce travail s'inscrit dans une lignée de recherches sur le RL hors ligne appliqué à la navigation sociale, un axe où les laboratoires cherchent à réduire la dépendance aux interactions coûteuses en environnement réel pendant l'entraînement. Les approches concurrentes reposent généralement sur du reward shaping manuel ou sur de l'apprentissage par imitation à partir de trajectoires humaines annotées, des méthodes que les auteurs positionnent comme moins robustes face à la variabilité des comportements piétons. Les prochaines étapes annoncées ne sont pas détaillées dans le résumé, mais la mise à disposition du code laisse présager des évaluations comparatives par d'autres équipes, et potentiellement une extension à des plateformes robotiques plus complexes que le TurtleBot4.

RecherchePaper
1 source