Aller au contenu principal
RecherchearXiv cs.RO 

CAPABLE : adaptation de politique selon les capacités par encodage latent comportemental

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent CAPABLE (Capability-Aware Policy Adaptation via Behavioral Latent Encoding), un cadre d'adaptation destiné aux politiques vision-langage-action (VLA) gelées confrontées à une panne d'articulation. Une VLA suppose l'embodiment sur lequel elle a été entraînée, et peut échouer quand un défaut modifie la manière dont les commandes sont exécutées physiquement. CAPABLE infère en ligne la « capacité » de chaque joint, c'est-à-dire la part du mouvement commandé réellement réalisée et sa contribution au comportement de l'effecteur. Il s'appuie sur l'historique commande-réponse et la cinématique, avec un encodeur temporel partagé entre les joints, un ancrage par la jacobienne, une attention inter-joints et une prédiction physique auto-supervisée. Cette représentation conditionne une politique résiduelle, entraînée par apprentissage par renforcement, qui ajoute des corrections bornées à l'action du bras produite par la VLA, sans étiquette de panne ni identifiant du joint défaillant. Sur 28 tâches LIBERO, le taux de réussite avec un actionneur exclu de l'entraînement aux pannes passe de 24,8 % à 59,3 %. Le gain est de 17,4 points face à une base de référence à historique global de même nombre de paramètres, sans dégrader les performances à l'état sain. Des expériences « leave-one-actuator-out » sur six joints montrent que le transfert ne dépend pas d'un actionneur particulier. Des évaluations complémentaires portent sur des familles de pannes inédites, ainsi qu'une démonstration de récupération sur un Franka Panda réel.

L'intérêt tient à la méthode. La plupart des approches de récupération sur panne exigent un réentraînement par tâche, des étiquettes de défaut, un diagnostic explicite ou des informations privilégiées sur l'embodiment, ce qui les rend peu praticables en exploitation. Ici, la VLA reste figée et seule une couche résiduelle légère s'adapte, ce qui préserve l'investissement dans un modèle de fondation. Pour un intégrateur ou un exploitant de flotte, la dégradation d'un actionneur (usure, jeu, couple réduit) est un cas courant, et une robustesse sans maintenance du modèle serait précieuse. Les résultats appellent toutefois à la prudence. Un taux de 59,3 % reste loin d'une fiabilité industrielle, et le gain est mesuré en simulation sur LIBERO, un banc d'essai de manipulation sur table. La validation physique se limite à une démonstration sur un seul bras, sans statistiques annoncées. Le résultat montre surtout que l'inférence de capacité à partir de l'historique de mouvement généralise entre articulations, pas que le problème est résolu.

Ce travail s'inscrit dans le constat que les VLA actuelles sont entraînées sur un embodiment supposé intact. Elles ont progressé en généralisation sémantique et en tâches, mais restent fragiles face à un changement de dynamique du robot lui-même. Les approches voisines relèvent de l'adaptation en ligne, de l'identification de système et de la randomisation de domaine, souvent avec des étiquettes ou un réentraînement. CAPABLE se positionne comme un adaptateur modulaire, compatible avec une VLA gelée. La suite logique serait de tester d'autres plateformes, des pannes combinées et des tâches longues, avec davantage d'essais réels. Le code et les démonstrations sont annoncés sur la page du projet, capable-vla.github.io. Il s'agit d'un preprint arXiv (v1), non encore évalué par les pairs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement
1arXiv cs.RO 

Bibliothèques de politiques compactes par adaptation de rang faible en apprentissage par renforcement

Des chercheurs ont publié sur arXiv (référence 2606.25700) un article explorant l'application de LoRA (Low-Rank Adaptation) au domaine de la robotique et de l'apprentissage par renforcement (RL). La technique, largement adoptée pour le fine-tuning des grands modèles de langage, est ici appliquée à un algorithme PPO (Proximal Policy Optimization) pour créer des bibliothèques de politiques spécialisées multi-tâches. Les résultats principaux : une réduction mémoire d'un facteur 20 à 160 par rapport au fine-tuning classique de l'ensemble des couches, soit une économie de stockage de 90 à 95 % lors du déploiement d'une bibliothèque de 10 à 50 politiques spécialisées. Point notable : aucune dégradation significative du taux de succès n'est observée entre le fine-tuning complet et la version LoRA sur les tâches testées. L'enjeu concret pour les intégrateurs robotiques est précis : embarquer une bibliothèque complète de politiques spécialisées en RAM ou basculer en swap-memory sur le matériel embarqué représente un seuil opérationnel critique. Sur un robot industriel ou un système d'inspection autonome gérant 20 à 50 tâches distinctes, la différence entre "tout tient en mémoire vive" et "le système pagine" peut conditionner la latence, la fiabilité temps-réel et les coûts matériels. La conservation du taux de succès sans full fine-tuning suggère par ailleurs que les couches basses du réseau de politique encodent déjà des représentations suffisamment généralisables pour être partagées entre tâches, ce qui conforte l'hypothèse d'un transfert de compétences entre politiques spécialisées sans réapprentissage coûteux. LoRA a été formalisée en 2021 par Hu et al. dans le contexte des LLMs, où elle est devenue un standard du fine-tuning sur matériel contraint. Son transfert au RL n'est pas trivial : les dynamiques d'entraînement par essai-erreur diffèrent structurellement de l'apprentissage supervisé sur lequel LoRA a été validée. Ce preprint est une preuve de concept préliminaire, sans institution ni auteurs nommés dans l'abstract, et sans description détaillée des tâches robotiques testées, ce qui limite l'évaluation de la généralisation des résultats. Dans l'écosystème concurrent, des travaux sur la distillation de politiques (policy distillation), la compression de réseaux pour l'embarqué robotique, et les architectures de fondation pour la robotique (pi0 de Physical Intelligence, GR00T N2 de NVIDIA) explorent des pistes parallèles pour réduire l'empreinte computationnelle à l'inférence. La prochaine étape naturelle serait une validation sur des robots physiques avec contraintes mémoire réelles.

RecherchePaper
1 source
Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques
2arXiv cs.RO 

Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques

Une équipe de recherche propose une nouvelle méthode de tokenisation d'action baptisée BAAT, pour Behavior-Aligned Action Tokenization, décrite dans un preprint publié sur arXiv fin septembre 2026 (identifiant 2609.27513v1). Le travail cible un maillon technique précis des politiques robotiques autorégressives, ces systèmes qui apprennent le contrôle continu en prédisant des tokens d'action discrets à partir des observations visuelles: les tokenizers existants n'imposent aucune supervision explicite de la correspondance comportementale entre démonstrations, si bien que des mouvements similaires exécutés à des rythmes différents finissent par occuper des représentations distinctes. BAAT résout ce problème en utilisant le soft dynamic time warping, ou Soft-DTW, pour identifier des segments d'action correspondants entre tâches et aligner leurs coordonnées quantifiées conjointement avec l'objectif de reconstruction. Un décodeur par diffusion conditionné par l'historique reconstruit ensuite des séquences d'action continues à partir de ces tokens, sur lesquelles une politique autorégressive est entraînée en aval. Évaluée sur des tâches sélectionnées issues de trois benchmarks de simulation et sur deux tâches en robot réel, la méthode atteint un taux de succès moyen d'environ 45,2% en simulation, soit 7,2 points de pourcentage au-dessus de la référence OAT. Dans une ablation contrôlée sur le benchmark LIBERO-All, le taux de succès de la politique passe de 70,2% à 79,0% lorsque l'alignement comportemental est activé, au prix d'une légère baisse du succès de rejeu de trajectoire. Pour les équipes qui conçoivent des politiques de manipulation robotique, ce résultat s'attaque à un goulot d'étranglement souvent sous-estimé des architectures vision-langage-action: la qualité de la tokenisation en amont conditionne directement ce qu'une politique autorégressive peut apprendre en aval, indépendamment de la taille du modèle ou du volume de données. En montrant qu'une supervision explicite de la correspondance entre mouvements améliore le transfert entre tâches sans sacrifier la précision d'exécution, les auteurs apportent un argument empirique en faveur d'une meilleure structuration de l'espace de représentation des actions, plutôt que du seul passage à l'échelle des données ou des paramètres. Le gain de neuf points de succès en ablation contrôlée reste toutefois mesuré sur un seul benchmark, et l'écart de 7,2 points face à OAT en simulation, bien réel, ne dit rien de la généralisation à des environnements physiques variés ni à des embarquements industriels. Le point de comparaison retenu, OAT, sert de référence pour situer BAAT dans la lignée des travaux récents sur les tokenizers d'action pour politiques robotiques, un axe de recherche actif depuis l'essor des modèles VLA de type Pi-0 ou GR00T N2, qui reposent tous sur une étape de discrétisation des actions continues. Le papier reste à ce stade un résultat académique en préimpression, validé sur des sous-ensembles de tâches de trois benchmarks de simulation plus deux essais sur robot réel, sans indication de déploiement industriel, de partenariat ou de mise à disposition de code. Les auteurs présentent leurs résultats comme un argument en faveur de la correspondance comportementale comme signal de supervision pour organiser la structure de mouvement partagée dans les tokenizers d'action, une piste que d'autres laboratoires pourraient chercher à répliquer sur des benchmarks plus larges avant toute validation en conditions réelles.

RecherchePaper
1 source
Arbitrage tenant compte des capacités pour le contrôle partagé basé sur l'intention sémantique
3arXiv cs.RO 

Arbitrage tenant compte des capacités pour le contrôle partagé basé sur l'intention sémantique

Un article déposé sur arXiv (2609.25369v1) présente un cadre de contrôle partagé homme-robot conscient des capacités. Un modèle vision-langage (VLM) infère l'intention humaine et produit une confiance sémantique, tandis qu'une politique vision-langage-action (VLA) génère les actions autonomes du robot ; la fiabilité de cette dernière est estimée en ligne à partir de la dispersion et de l'instabilité locale des trajectoires stochastiques qu'elle produit. Un arbitrage non linéaire combine ces deux signaux, filtrés par une approche bayésienne, via une fonction sigmoïde, pour ajuster dynamiquement le niveau d'autorité laissé au robot. Le système a été testé auprès de 12 participants sur des tâches de préhension-dépôt et d'empilement bidirectionnel, en conditions connues et en conditions inédites (hors distribution d'entraînement). La méthode proposée atteint un taux de réussite de 92%, contre 83% en téléopération manuelle pure, 44% pour un arbitrage basé sur la seule intention, et seulement 10% pour un mélange à poids fixes et égaux entre humain et robot. Ce travail cible un défaut connu des systèmes de contrôle partagé actuels : allouer l'autorité au robot sur la seule confiance dans l'intention détectée suppose implicitement que l'exécution autonome sera fiable, ce qui pousse le système à trop aider quand ce n'est pas le cas. En ajoutant une estimation indépendante et continue de la fiabilité réelle de la politique VLA, l'étude s'attaque à un problème central du déploiement de ces modèles en conditions réelles : une confiance élevée affichée par un modèle n'implique pas une exécution correcte, en particulier hors distribution. Pour les intégrateurs qui déploient des architectures VLA en téléopération assistée ou en cobotique industrielle, cette approche fournit une piste concrète pour réduire les échecs silencieux, sans dépendre uniquement de la compréhension du langage par le robot. Cette publication s'inscrit dans la lignée des recherches récentes sur le contrôle partagé appuyé sur des politiques VLA génériques, dans l'esprit de Pi-0, GR00T N2 ou Helix, déployées en téléopération comme en autonomie complète. Contrairement à ces architectures orientées produit, il s'agit ici d'une contribution académique déposée sur arXiv, sans fabricant de robots, partenaire industriel ni acteur français ou européen cité dans le texte, et reposant sur un échantillon modeste de 12 participants, typique de ce stade de recherche en robotique interactive. L'article ne mentionne ni robot cible ni calendrier de transfert vers un produit commercial ; les suites logiques attendues seraient une validation à plus grande échelle et des tests sur des tâches de manipulation plus complexes ou des plateformes robotiques réelles.

RecherchePaper
1 source
Adaptation des politiques génériques de robots par apprentissage par renforcement sémantique
4arXiv cs.RO 

Adaptation des politiques génériques de robots par apprentissage par renforcement sémantique

Les auteurs de ce nouvel article arXiv (2606.31958v1) présentent SARL, pour Semantic Action Reinforcement Learning, une méthode d'apprentissage par renforcement pour adapter des politiques robotiques généralistes déjà pré-entraînées, c'est-à-dire des modèles vision-langage-action (VLA) capables d'un large répertoire de comportements. Au lieu d'optimiser directement l'espace des actions du robot, comme le font les approches RL classiques, SARL agit sur l'espace des prompts en langage naturel envoyés au modèle. Concrètement, l'algorithme apprend en ligne, par interaction avec l'environnement, à moduler les instructions textuelles données à la politique pour faire émerger et combiner des compétences déjà présentes dans son répertoire, plutôt que d'apprendre de nouveaux comportements depuis zéro. Les auteurs rapportent des validations à la fois en conditions réelles et sur des bancs d'essai simulés, avec des performances supérieures aux méthodes existantes d'amélioration de comportement en déploiement. L'intérêt de cette approche tient au problème qu'elle cherche à résoudre : les méthodes RL usuelles appliquées à un modèle généraliste supposent que sa distribution d'actions de départ est déjà proche d'une politique performante, une hypothèse qui s'effondre dès que la tâche est longue, complexe ou sort de la distribution d'entraînement initiale. En déplaçant l'optimisation vers l'espace sémantique des prompts, SARL rend l'exploration plus structurée et l'apprentissage en ligne beaucoup plus efficace en données, un enjeu central pour l'industrie robotique où le fine-tuning par interaction réelle reste coûteux et lent. Si les résultats se confirment à plus grande échelle, cela ouvrirait la voie à une adaptation rapide de robots généralistes à des tâches spécifiques d'un site industriel sans réentraînement lourd. Ce travail s'inscrit dans la lignée des politiques robotiques généralistes de type VLA, entraînées sur de larges corpus de démonstrations, dont l'adaptation post-déploiement est devenue un axe de recherche actif face aux limites du simple zéro-shot. Il rejoint d'autres tentatives d'affinage par renforcement de ces modèles, en proposant une alternative à l'optimisation directe des actions. Les auteurs annoncent vouloir approfondir les validations sur des tâches réelles à horizon plus long, sans toutefois préciser de calendrier de déploiement industriel.

RechercheActu
1 source