Aller au contenu principal
RecherchearXiv cs.RO 

Trouve ce que tu ne sais pas faire : apprentissage par renforcement en conditions réelles à base d'agents pour des modèles VLA auto-améliorants

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent FIND, un cadre d'apprentissage par renforcement (RL) en conditions réelles qui permet à un modèle vision-langage-action (VLA) de s'améliorer seul à partir de ses propres échecs. Le dispositif repose sur un VLA π0.5 gelé, complété par un RL « off-policy » résiduel, c'est-à-dire une couche de correction apprise sans toucher aux poids du modèle de base. Sur huit tâches de manipulation réelles, le taux de succès, évalué indépendamment par des humains, passe de 55 % à 71,9 %. Une exécution représentative enchaîne 456 épisodes autonomes en 6 heures d'interaction, avec 30 interventions humaines de remise en ordre de la scène et aucune étiquette de récompense fournie par un humain pendant l'apprentissage en ligne. Un site de projet (FIND.github.io) est annoncé. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel.

L'enjeu porte sur deux verrous du RL en monde réel : les remises à zéro manuelles de l'environnement après chaque essai et la supervision du succès par un opérateur. FIND les contourne. Plutôt que de restaurer une scène prédéfinie, un agent vision-langage observe l'état obtenu après chaque essai, choisit dans une bibliothèque prédéfinie les tâches réalisables, privilégie celles au taux de succès récent le plus faible et juge le résultat en comparant les images avant et après exécution. La pratique devient ainsi un problème de sélection de tâches conditionnée par la scène et par la performance. Pour un intégrateur, cela esquisse des VLA qui progressent sur site sans cellule de reset dédiée ni annotation continue. Des réserves s'imposent : le gain reste de 17 points environ, le plafond est inférieur à 72 %, le périmètre se limite à huit tâches d'une bibliothèque fixe, et 30 interventions humaines subsistent. La fiabilité du juge visuel est examinée dans les ablations, ce qui reste le point à vérifier, car une erreur d'évaluation se propage directement à la politique.

Ces travaux s'inscrivent dans la série des modèles π0 puis π0.5 de Physical Intelligence, généralement déployés comme politiques figées après pré-entraînement et affinage supervisé. Le RL en monde réel sur ces modèles, déjà exploré par d'autres équipes, se heurtait aux coûts humains que FIND cherche à réduire. L'approche rejoint les boucles d'auto-amélioration revendiquées par des acteurs comme Physical Intelligence, Figure ou Tesla, sans que leurs résultats soient comparables, faute de protocole commun. Les suites probables sont l'extension à des bibliothèques de tâches ouvertes, la réduction des interventions restantes et des tests sur d'autres VLA ou en conditions de production.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Elastic Queries : apprentissage par renforcement pour l'exécution auto-consciente des politiques dans les modèles VLA
1arXiv cs.RO 

Elastic Queries : apprentissage par renforcement pour l'exécution auto-consciente des politiques dans les modèles VLA

Des chercheurs ont publié sur arXiv (réf. 2606.14375) une nouvelle méthode appelée Elastic Queries Reinforcement Learning (EQRL), conçue pour rendre l'exécution des modèles VLA (Vision-Language-Action) adaptative plutôt que rigide. Dans les systèmes actuels, ces modèles qui pilotent la manipulation robotique s'exécutent selon des plannings d'inférence fixes : même fréquence de requête, même budget de débruitage, même longueur de chunk d'actions, quelle que soit la complexité de l'état courant. EQRL introduit un adaptateur léger qui sélectionne dynamiquement, pour chaque requête, trois paramètres : l'entrée latente, le budget de débruitage, et la longueur du chunk à exécuter en boucle ouverte. La méthode entraîne un critique sur l'espace joint et dérive un signal de difficulté d'état via le désaccord entre un ensemble de critiques (critic ensemble disagreement), guidant le calcul vers les états difficiles sans modifier les poids du modèle VLA sous-jacent. Sur bancs de simulation et en manipulation sur robot réel, les auteurs rapportent une réduction du coût d'inférence amorti avec un taux de succès préservé ou amélioré. L'enjeu concret concerne directement le coût de déploiement des politiques fondées sur des modèles de diffusion, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Ces architectures souffrent d'un goulot d'étranglement identique : le nombre d'évaluations de fonction (NFE) du processus de débruitage est fixe, qu'on soit sur une prise de contact incertaine ou un simple transit en espace libre. EQRL démontre qu'il est possible d'allouer dynamiquement ce budget de calcul selon la difficulté estimée, sans retraining du modèle de base. Pour un intégrateur ou un COO, la promesse est directe : même capacité de manipulation, moins de GPU sur les états faciles, meilleure scalabilité sur flotte. Le travail s'inscrit dans une course à l'efficacité d'inférence pour les VLA, accélérée par la publication de Pi-0 fin 2024 et les modèles de diffusion successifs (Octo, OpenVLA, GR00T N2, Helix de Figure AI). Des approches parallèles comme FAST ou DiT-Policy attaquent le même problème sous d'autres angles : compression de trajectoire, distillation, ou batch adaptatif. EQRL se distingue en opérant au-dessus du modèle sans le modifier et en intégrant un signal de difficulté appris par RL. Les auteurs annoncent des résultats positifs en simulation et sur robot réel, mais les métriques précises et les conditions expérimentales restent à examiner dans le corps du papier : la validité des gains annoncés dépendra de la représentativité des benchmarks choisis.

UELes équipes R&D européennes développant ou déployant des politiques de manipulation sur modèles de diffusion (VLA) pourraient appliquer EQRL pour réduire leurs coûts GPU d'inférence sans retraining, mais aucun acteur français ou européen n'est directement impliqué.

RechercheOpinion
1 source
2arXiv cs.RO 

UniIntervene++ : un agent d'intervention adaptatif pour un apprentissage par renforcement efficace en conditions réelles

UniIntervene++ est un agent d'intervention adaptatif pour l'apprentissage par renforcement (RL) en ligne sur robot réel, décrit dans un preprint arXiv publié en octobre 2026, avec code sur GitHub. Il décide, pendant l'entraînement, de qui contrôle le robot : la politique RL en cours d'apprentissage, une correction de trajectoire, ou une CodePolicy, c'est-à-dire un comportement structuré par la tâche et écrit sous forme de code. Ces trois comportements sont modélisés comme des « options » dans un processus de décision semi-markovien, dont l'agent apprend les valeurs relatives en ligne. Il sonde aussi régulièrement la politique RL en la laissant s'exécuter sans assistance, pour mesurer sa compétence réelle. Sur cinq tâches de manipulation réelles, le taux de succès moyen atteint 89,67 %, soit au moins 6 points de plus que tous les baselines. L'intervention humaine tombe à 0,77 % des pas, une réduction relative d'au moins 94,6 % face au meilleur baseline. Cela implique que celui-ci en demandait environ 14 % ou plus. L'enjeu est le coût du RL en conditions réelles, aujourd'hui dominé par le temps opérateur. Les stratégies existantes reposent sur des estimations hors ligne ou des règles fixes, qui deviennent inadaptées à mesure que la politique progresse. Passer sous 1 % d'intervention, si cela se confirme, rendrait l'amélioration d'une politique sur site beaucoup moins coûteuse pour un intégrateur. Les résultats viennent toutefois d'une seule équipe, sur cinq tâches que l'abstract ne détaille pas. Les baselines ne sont pas nommés non plus, et rien n'indique la robustesse hors de ces tâches ni le coût d'écriture des CodePolicies, qui demandent une connaissance experte de la tâche. Ce travail prolonge les approches de RL avec humain dans la boucle, où l'opérateur reprend la main pour corriger le robot, dont HIL-SERL est l'exemple le plus connu. Ces méthodes laissent l'opérateur décider seul du moment et de la manière d'intervenir, et leur charge reste élevée. UniIntervene++ remplace cette décision par un agent qui apprend quand intervenir, comment, et quand rendre le contrôle. L'expérience gagnée sous assistance sert aussi à améliorer la politique RL, dont les résultats modifient ensuite les décisions d'intervention. Il s'agit d'une recherche académique : aucun déploiement industriel ni calendrier n'est annoncé. La prochaine étape sera de voir si d'autres laboratoires reproduisent les résultats grâce au code publié, notamment sur des tâches plus longues ou des robots différents.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques
3arXiv cs.RO 

BORA : apprentissage par renforcement hors ligne et adaptation résiduelle en ligne pour modèles VLA dextériques

Des chercheurs ont publié sur arXiv (arXiv:2605.30226) BORA, un cadre de post-entraînement mêlant apprentissage par renforcement hors ligne et adaptation résiduelle en ligne, conçu pour les modèles VLA (Vision-Language-Action) appliqués à la manipulation dextre. Le système fonctionne en deux phases: hors ligne, un réseau critique est entraîné en prenant comme entrées les tokens cognitifs du modèle de langage-vision et les chunks d'actions, ce qui lui permet d'évaluer les mouvements de main au-delà du seul contexte visuel. En ligne, le modèle VLA de base est gelé et une couche d'adaptation résiduelle légère de type chunk-wise est introduite, guidée par un mécanisme Human-in-the-Loop (HiL) générant des récompenses à partir d'interventions humaines. Évalué sur cinq tâches réelles de manipulation dextre complexe, BORA affiche une hausse absolue de 33 points de pourcentage du taux de succès moyen face aux baselines standards, et jusqu'à +43 points sur des objets non vus lors de l'entraînement. Ces résultats s'attaquent à l'un des verrous persistants de la robotique dextre: les mains à haute dimensionnalité amplifient les erreurs d'exécution cumulées, rendant l'exploration RL en conditions réelles à la fois inefficace et risquée pour le matériel. L'approche de BORA, qui préserve le modèle pré-entraîné comme prior stable et n'ajoute qu'une couche corrective légère, circonscrit l'espace d'exploration plutôt que de le réouvrir entièrement. Le gain de 43% sur objets non vus suggère une généralisation réelle plutôt qu'un surapprentissage des démonstrations, ce qui distingue ce travail des pipelines d'imitation learning classiques. Pour un intégrateur ou un décideur B2B, cela valide une trajectoire concrète: spécialiser un VLA généraliste pour une tâche dextre sans repartir d'un entraînement complet. Les VLA ont connu une accélération notable depuis Pi-0 de Physical Intelligence, OpenVLA (Berkeley) ou RoboVLMs (Google DeepMind), mais la manipulation fine multi-doigts reste leur point faible documenté. BORA s'inscrit dans un mouvement offline-to-online concurrent d'approches comme RLPD ou Cal-QL, qui cherchent à rendre le RL online moins destructif pour les politiques pré-apprises. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans la publication; il s'agit pour l'instant d'un résultat de recherche sans annonce de commercialisation. La dépendance au HiL en phase online reste par ailleurs une limite pratique non résolue pour un passage à l'échelle industrielle.

RechercheOpinion
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
4arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source