Aller au contenu principal
Quand agir, interroger ou apprendre : le pilotage de politique par gestion de l'incertitude
RecherchearXiv cs.RO 

Quand agir, interroger ou apprendre : le pilotage de politique par gestion de l'incertitude

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv (réf. 2602.22474) un cadre nommé UPS (Uncertainty-Aware Policy Steering), conçu pour adapter le comportement d'un robot au moment du déploiement sans nécessiter de réentraînement complet. Le "policy steering" consiste à utiliser un vérificateur appris qui analyse les échantillons d'actions proposés par une politique pré-entraînée (typiquement une diffusion policy) et ne retient que celles jugées conformes à la tâche. UPS utilise un Vision-Language Model (VLM) comme vérificateur général, mais y ajoute une calibration par prédiction conforme (conformal prediction) pour corriger le biais de surconfiance caractéristique de ces modèles. Le système distingue trois régimes de décision : exécuter une action avec haute confiance, demander une clarification en langage naturel si la consigne est ambiguë, ou solliciter une intervention humaine sur l'action lorsque la politique de base est jugée incapable d'exécuter la tâche. Des expériences ont été menées en simulation et sur plateforme physique.

Le problème de la surconfiance des VLMs est concret et rarement traité dans la littérature sur le déploiement robotique. En pratique, un vérificateur qui ne sait pas qu'il ne sait pas valide des actions incorrectes ou bloque des actions valides, dégradant directement la performance opérationnelle. UPS apporte une garantie statistique formelle sur le choix de stratégie, ce qui est significatif pour des intégrateurs industriels qui ont besoin de bornes de fiabilité chiffrées. La composante de residual learning permet au système de progresser à partir des interventions collectées en déploiement, avec un objectif explicite de minimiser le feedback humain coûteux. Cette combinaison calibration plus apprentissage continu différencie UPS des pipelines d'apprentissage actif classiques, qui ne pondèrent pas le coût réel des interruptions.

Le policy steering s'est accéléré avec la disponibilité de politiques pré-entraînées génériques comme la diffusion policy, ACT ou pi-0, et de VLMs capables de raisonnement visuel. Les approches précédentes (SayCan, inner-monologue, RT-2) traitaient généralement la planification de haut niveau et l'exécution de bas niveau comme des modules séparés, sans calibration jointe de l'incertitude. UPS tente de combler ce gap en traitant simultanément l'incertitude sémantique et l'incertitude d'action dans un seul cadre probabiliste avec garanties statistiques. Les concurrents directs incluent les frameworks human-in-the-loop comme TAMER ou les approches de gating robotique d'OpenVLA, qui s'appuient sur des heuristiques moins formelles pour décider quand escalader vers un opérateur. Les travaux sont portés par une équipe académique (site de démonstration : jessie-yuan.github.io/ups) ; aucun partenaire industriel ni calendrier de transfert n'est annoncé à ce stade.

Dans nos dossiers

À lire aussi

RouteRLT : apprendre quand et quel spécialiste RL doit contrôler une politique vision-langage-action
1arXiv cs.RO 

RouteRLT : apprendre quand et quel spécialiste RL doit contrôler une politique vision-langage-action

Des chercheurs ont présenté RouteRLT, un système d'orchestration qui décide en temps réel quand transférer le contrôle d'un modèle vision-langage-action (VLA) généraliste à un spécialiste entraîné par apprentissage par renforcement (RL) pour une phase précise d'une tâche manipulatrice, comme l'insertion de connecteurs ou la gestion de câbles. Le framework combine un sélecteur de phase identifiant le contrôleur actif, un stabilisateur limitant les bascules trop fréquentes, et un gestionnaire de frontières gérant les transitions entre sorties de politiques produites par blocs. Il a été testé sur des tâches multi-objets du simulateur LIBERO et sur une tâche réelle de prise de câble et d'insertion de port. En simulation, le routage appris égale un routage « oracle » disposant des frontières de phase réelles, sans y avoir accès au déploiement ; sur robot réel, il valide automatiquement le basculement vers les spécialistes de prise et d'insertion. Publié sur arXiv (2609.26467), ce travail reste un résultat de recherche, sans partenaire industriel ni calendrier de commercialisation annoncés. Ce travail cible une friction bien connue dans la manipulation robotisée : les modèles VLA généralistes, entraînés par clonage comportemental sur de vastes corpus de démonstrations, excellent en polyvalence mais échouent souvent sur les phases exigeant une précision fine, typiques des tâches industrielles à fort contact comme le câblage électronique. Le remède habituel, un fine-tuning RL du modèle entier, risque de dégrader ce comportement généraliste. En approchant les performances d'un routage oracle sans y accéder en production, RouteRLT esquisse une architecture alternative, généraliste plus spécialistes RL orchestrés, potentiellement plus praticable pour les intégrateurs que le pari d'un modèle unique capable de tout faire avec la même précision. L'approche prolonge les travaux récents associant modèles VLA préentraînés et affinage par renforcement pour combler l'écart entre démonstration et exécution fiable, sans réentraîner l'intégralité du modèle de base. Les auteurs restent prudents sur la portée de leurs résultats : l'évaluation réelle se limite à une seule tâche de câblage à plusieurs étapes, sous un protocole de transfert aligné avec un opérateur humain, et aucun passage à un produit commercial n'est évoqué. La suite logique suggérée serait d'élargir le nombre de spécialistes RL disponibles et la diversité des tâches testées avant d'envisager une intégration dans des pipelines industriels réels.

RechercheOpinion
1 source
Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux
2arXiv cs.RO 

Q-Learning par transport optimal pour le pilotage et l'accélération de politiques de flux

Des chercheurs proposent une nouvelle méthode baptisée Optimal Transport Q-Learning (OTQL), destinée à affiner et accélérer les politiques robotiques basées sur des modèles de diffusion et de flow matching, très utilisées dans les modèles vision-langage-action (VLA). Publiée le 8 juillet sur arXiv, l'étude combine apprentissage par renforcement (RL) post-entraînement et transport optimal conditionné par l'avantage, pour corriger les comportements sous-optimaux de ces politiques sans recourir à la distillation, coûteuse en calcul. Avec un budget d'interaction limité à seulement 50 à 60 épisodes, la méthode fait grimper le taux de succès moyen de politiques mono-tâche de 36 % à 86 %, et celui d'un modèle VLA pré-entraîné de 38 % à 76 %, tout en réduisant de 70 % le nombre d'étapes d'inférence nécessaires pour générer une action. Les tests ont été menés à la fois en simulation et sur des tâches robotiques réelles. Ces résultats s'attaquent à deux limites bien connues des politiques de diffusion et de flow matching pour la robotique: leur dépendance à des démonstrations de haute qualité, souvent rares ou coûteuses à collecter, et leur lenteur d'inférence, qui freine leur déploiement temps réel sur des robots physiques. En démontrant qu'un nombre restreint d'épisodes d'expérience réelle suffit à corriger significativement les échecs sous décalage de distribution, OTQL apporte un début de réponse à l'écart persistant entre démonstrations en laboratoire et performance en conditions réelles, un problème central pour les intégrateurs qui cherchent à fiabiliser des modèles VLA du type de ceux utilisés dans les bras manipulateurs ou les humanoïdes actuels. La réduction de 70 % des étapes d'inférence est également notable pour les décideurs B2B, car elle touche directement au coût de calcul embarqué et à la latence, deux freins concrets à la commercialisation à grande échelle de politiques génératives sur robot. Les politiques de diffusion et de flow matching se sont imposées ces dernières années comme l'approche dominante pour capturer des distributions de trajectoires multimodales dans les tâches de manipulation robotique, notamment dans les architectures VLA. Mais leur adoption industrielle butait jusqu'ici sur deux verrous: l'accélération de l'inférence, généralement traitée par des méthodes de distillation gourmandes en ressources de simulation, et l'amélioration post-déploiement, qui nécessite habituellement de nouvelles données de démonstration coûteuses à produire. OTQL s'inscrit dans une lignée de travaux cherchant à exploiter le RL pour du post-entraînement léger plutôt que du réentraînement complet. Les auteurs ne précisent pas encore de calendrier de transfert vers des plateformes commerciales, mais la méthode ouvre une piste pour que les opérateurs de flottes robotiques affinent leurs politiques directement à partir de l'expérience de terrain, sans dépendre de nouveaux cycles de collecte de données coûteux.

RechercheActu
1 source
Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude
3arXiv cs.RO 

Cadre de politique adaptatif au contexte pour une manipulation robotique robuste et réactive via apprentissage par imitation sensible à l'incertitude

Une nouvelle version (v2) de l'article arXiv:2410.24035 propose un cadre de politique adaptatif au contexte pour la manipulation robotique, combinant robustesse et réactivité. Les auteurs s'appuient sur l'apprentissage par démonstration (Learning from Demonstration, LfD), et plus précisément sur les approches basées sur des systèmes dynamiques (DS), pour apprendre une politique conditionnée à la fois par l'état du robot et par des paramètres de tâche de basse dimension représentant le contexte environnant. Cette politique est ensuite combinée à des politiques additionnelles sensibles à l'incertitude via une formulation de type mélange d'experts (Mixture of Experts, MoE). Le système est validé sur le jeu de données de référence LASA handwriting, utilisé classiquement pour évaluer l'apprentissage de trajectoires, ainsi que sur un robot réel à 7 degrés de liberté (7-DoF), dans trois scénarios concrets : la saisie conditionnée par la force appliquée, la manipulation d'aliments déformables, et la saisie centrée sur l'objet. L'enjeu technique visé est précis : les approches DS de l'état de l'art excellent généralement en robustesse mais restent rigides face aux variations de contexte, car elles ne modulent pas leur comportement selon des variables dépendantes de la tâche. En articulant fusion de politiques et quantification d'incertitude, ce cadre cherche à améliorer le comportement hors distribution (out-of-distribution) et la convergence des trajectoires générées, deux propriétés critiques pour tout déploiement en environnement réel non contrôlé. Pour les intégrateurs robotiques, l'intérêt pratique tient surtout à la manipulation d'objets déformables, un cas d'usage encore mal résolu dans l'industrie (agroalimentaire, logistique), et à la promesse d'une politique réutilisable sans réentraînement complet à chaque changement de tâche ou d'environnement. Sur le plan du contexte scientifique, le LfD via systèmes dynamiques est un axe de recherche établi depuis plusieurs années pour produire des politiques de contrôle réactives en robotique. Ce travail se positionne comme une extension de recherches antérieures sur la fusion de politiques et l'estimation d'incertitude, plutôt que comme une rupture méthodologique. L'abstract ne mentionne ni laboratoire ni entreprise associée, et il s'agit d'une publication académique (statut « replace », donc une révision d'un article déjà soumis) sans indication de déploiement industriel à ce stade.

RecherchePaper
1 source
RAYA : apprendre où et quand intervenir pour la récupération des robots
4arXiv cs.RO 

RAYA : apprendre où et quand intervenir pour la récupération des robots

Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21690) RAYA, un framework hybride combinant apprentissage et contrôle analytique pour la récupération de robots après détection d'un risque de défaillance. Le système place une marge de récupérabilité apprise, calculée sur horizon fini, directement dans un contrôleur optimal à contraintes strictes, couplée à un ordonnanceur appris qui réajuste dynamiquement les priorités de tâche pour faciliter la récupération. Testé sur 7 200 épisodes de simulation par contrôleur, sur des bancs d'essai quadrirotor et véhicule autonome, RAYA transfère ses composants appris sans réentraînement vers des trajectoires, perturbations, changements de dynamique et configurations de friction inédits. Une version embarquée a ensuite été installée sur un drone Crazyflie de 35 grammes: lors de 40 vols réels sous vent, avec soit un décalage aérodynamique non modélisé soit une perte de 40% de la commande moteur, les trois méthodes de référence ont échoué dans tous les essais, tandis que RAYA a complété 10 missions sur 10, chacune de six cycles. Ce résultat s'attaque à un problème connu en robotique de sécurité: un système peut détecter une défaillance imminente sans conserver l'autorité de contrôle nécessaire pour l'éviter, en particulier quand les garde-fous n'interviennent qu'après coup, une fois le plan nominal déjà engagé. En intégrant la récupérabilité comme critère au moment même où l'action est choisie, plutôt qu'en veto tardif, RAYA illustre un déplacement des mécanismes de sécurité vers une logique prédictive intégrée au contrôleur, plutôt que réactive et externe. Pour les intégrateurs de drones et de véhicules autonomes opérant en conditions incertaines (vent, usure moteur, terrain glissant), l'écart mesuré face aux méthodes de référence, un échec total contre une réussite complète, indique que la robustesse aux pannes partielles reste un point faible malgré les progrès récents de l'apprentissage par renforcement appliqué au contrôle. Ce travail s'inscrit dans une recherche visant à unifier apprentissage profond et contrôle optimal sous contraintes dures, plutôt qu'à traiter la sécurité comme un filtre ajouté après coup à la planification, une approche que les auteurs critiquent explicitement. RAYA se positionne ainsi face aux filtres de sécurité classiques et aux barrières de contrôle apprises existantes. Le choix du Crazyflie, plateforme légère largement utilisée en recherche académique pour valider des algorithmes de contrôle, situe cette publication comme une preuve de concept plutôt qu'un produit prêt à l'industrialisation; aucun partenariat industriel ni calendrier commercial n'est mentionné. Le code et les détails du projet sont disponibles sur raya-control.github.io, sans précision sur une éventuelle extension à des plateformes robotiques plus lourdes.

RecherchePaper
1 source