Aller au contenu principal
RecherchearXiv cs.RO 

LexiconVLA : apprentissage de codebooks d'actions atomiques réutilisables pour des tâches inédites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent LexiconVLA, une méthode qui construit un « lexique » d'actions atomiques réutilisables pour aider les modèles vision-langage-action (VLA) à généraliser à des tâches jamais vues. Le travail, publié sur arXiv, s'appuie sur un jeu de données maison, AtomAction, qui compte 57 803 segments issus de 69 tâches. Deux codebooks sont appris : l'un, global, capture la structure d'interaction partagée entre tâches (saisir, pousser, insérer), l'autre, de détail, conserve les variations fines d'exécution. Un module d'alignement visuel-action couple la reconstruction de trajectoire à partir des changements d'état visuels et la prédiction du résultat visuel à partir des codes d'action. Un planificateur et un adaptateur sensible à la scène traduisent un nouvel objectif en sous-tâches conditionnées par ces codes, exécutées par une politique unique. Aucun expert spécialisé par compétence ni mise à jour de paramètres au déploiement n'est nécessaire. Sur 26 tâches du benchmark RLBench et cinq architectures de politique, la performance est globalement maintenue sur les 18 tâches vues, et progresse sur les 8 tâches exclues de l'entraînement de la politique. Avec BridgeVLA, le taux de succès sur tâches inédites passe de 16,67 % à 34,17 % (+17,50 points), pour un succès global de 71,08 %, le plus élevé parmi les méthodes ayant publié des résultats.

L'intérêt tient d'abord au diagnostic : les auteurs montrent qu'un VLA peut réussir une tâche sans exécuter de manière cohérente les actions atomiques qui la composent d'un contexte à l'autre. Autrement dit, un taux de succès élevé sur des tâches connues masque une compétence fragmentée, difficile à recomposer face à un objectif nouveau. Pour un intégrateur, c'est un rappel que la généralisation zéro-shot des VLA reste faible : même avec l'amélioration annoncée, deux tâches inédites sur trois échouent encore. L'approche a néanmoins un atout pratique, celle d'ajouter une couche de réutilisation sans réentraîner la politique ni multiplier les experts, ce qui limite le coût de mise à jour en production.

Il faut toutefois relativiser. Les résultats proviennent d'un benchmark simulé, RLBench, sur un échantillon restreint de 8 tâches tenues à l'écart, et la comparaison « meilleur parmi les méthodes rapportant des résultats » exclut celles qui ne publient pas leurs chiffres. Les expériences sur robot réel sont décrites comme démontrant l'exécution pas à pas et la reprise sur échec, sans métriques chiffrées dans le résumé. Le travail s'inscrit dans la course à la composabilité des VLA, aux côtés des approches de type Pi-0, GR00T ou Helix, qui misent plutôt sur l'échelle des données et la couverture. Il s'agit d'une publication de recherche, sans produit ni déploiement annoncé. La suite dépendra de la validation sur davantage de tâches réelles et de la disponibilité du jeu de données et du code.

À lire aussi

Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné
1arXiv cs.RO 

Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné

Des chercheurs ont publié en juin 2026 sur arXiv (2606.15685) un framework appelé SCE (Skill-Compositional Experts), conçu pour permettre à des robots manipulateurs d'apprendre de nouvelles tâches en continu sans effacer les comportements déjà maîtrisés. L'approche repose sur deux blocs : un mécanisme de Compositional Skill Grounding (CSG) qui décompose des démonstrations en primitives réutilisables, puis un système DETE (Dual Execution-and-Transition Experts) à deux branches, l'une assurant l'exécution de chaque skill et l'autre pilotant les transitions entre eux pour produire un comportement cohérent. Les évaluations portent sur les benchmarks LIBERO (manipulation en simulation) ainsi que sur des tâches en environnement réel, avec des gains de rétention et de performance globale par rapport aux méthodes de référence. Le problème visé, le "catastrophic forgetting" en boucle fermée, est nettement plus sévère qu'en continual learning classique : sous contrôle séquentiel, la dérive des représentations internes (feature drift) s'accumule et dégrade progressivement les comportements antérieurs. Pour les industriels déployant des bras robotiques multi-tâches en logistique, assemblage ou alimentation, c'est un verrou réel : introduire une nouvelle tâche risque d'invalider les précédentes, imposant des revalidations coûteuses. SCE propose de structurer explicitement les skills en une base réutilisable, ce qui pourrait, si cela tient à l'échelle, réduire ce surcoût d'intégration. À noter cependant : il s'agit d'un preprint non encore évalué par les pairs, et les résultats en environnement réel restent peu détaillés dans l'abstract. L'Embodied Continual Learning a gagné en visibilité avec l'essor des politiques robotiques généralisables, notamment sous l'influence des Visual Language Action models (VLA) et des travaux de sim-to-real transfer. Les benchmarks LIBERO sont devenus une référence pour évaluer la généralisation des politiques de manipulation. Les approches concurrentes, comme SkillDiffuser ou les méthodes à mémoire épisodique, traitent la même problématique sans structurer explicitement les transitions entre skills, ce qui constitue la contribution centrale de SCE. Les auteurs publient une page projet mais n'annoncent ni partenariat industriel ni timeline de déploiement, ce qui situe ce travail à la frontière entre preuve de concept académique et transfert applicatif.

RecherchePaper
1 source
Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques
2arXiv cs.RO 

Tokenisation d'actions alignée sur le comportement pour l'apprentissage de politiques robotiques

Une équipe de recherche propose une nouvelle méthode de tokenisation d'action baptisée BAAT, pour Behavior-Aligned Action Tokenization, décrite dans un preprint publié sur arXiv fin septembre 2026 (identifiant 2609.27513v1). Le travail cible un maillon technique précis des politiques robotiques autorégressives, ces systèmes qui apprennent le contrôle continu en prédisant des tokens d'action discrets à partir des observations visuelles: les tokenizers existants n'imposent aucune supervision explicite de la correspondance comportementale entre démonstrations, si bien que des mouvements similaires exécutés à des rythmes différents finissent par occuper des représentations distinctes. BAAT résout ce problème en utilisant le soft dynamic time warping, ou Soft-DTW, pour identifier des segments d'action correspondants entre tâches et aligner leurs coordonnées quantifiées conjointement avec l'objectif de reconstruction. Un décodeur par diffusion conditionné par l'historique reconstruit ensuite des séquences d'action continues à partir de ces tokens, sur lesquelles une politique autorégressive est entraînée en aval. Évaluée sur des tâches sélectionnées issues de trois benchmarks de simulation et sur deux tâches en robot réel, la méthode atteint un taux de succès moyen d'environ 45,2% en simulation, soit 7,2 points de pourcentage au-dessus de la référence OAT. Dans une ablation contrôlée sur le benchmark LIBERO-All, le taux de succès de la politique passe de 70,2% à 79,0% lorsque l'alignement comportemental est activé, au prix d'une légère baisse du succès de rejeu de trajectoire. Pour les équipes qui conçoivent des politiques de manipulation robotique, ce résultat s'attaque à un goulot d'étranglement souvent sous-estimé des architectures vision-langage-action: la qualité de la tokenisation en amont conditionne directement ce qu'une politique autorégressive peut apprendre en aval, indépendamment de la taille du modèle ou du volume de données. En montrant qu'une supervision explicite de la correspondance entre mouvements améliore le transfert entre tâches sans sacrifier la précision d'exécution, les auteurs apportent un argument empirique en faveur d'une meilleure structuration de l'espace de représentation des actions, plutôt que du seul passage à l'échelle des données ou des paramètres. Le gain de neuf points de succès en ablation contrôlée reste toutefois mesuré sur un seul benchmark, et l'écart de 7,2 points face à OAT en simulation, bien réel, ne dit rien de la généralisation à des environnements physiques variés ni à des embarquements industriels. Le point de comparaison retenu, OAT, sert de référence pour situer BAAT dans la lignée des travaux récents sur les tokenizers d'action pour politiques robotiques, un axe de recherche actif depuis l'essor des modèles VLA de type Pi-0 ou GR00T N2, qui reposent tous sur une étape de discrétisation des actions continues. Le papier reste à ce stade un résultat académique en préimpression, validé sur des sous-ensembles de tâches de trois benchmarks de simulation plus deux essais sur robot réel, sans indication de déploiement industriel, de partenariat ou de mise à disposition de code. Les auteurs présentent leurs résultats comme un argument en faveur de la correspondance comportementale comme signal de supervision pour organiser la structure de mouvement partagée dans les tokenizers d'action, une piste que d'autres laboratoires pourraient chercher à répliquer sur des benchmarks plus larges avant toute validation en conditions réelles.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
3arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
Ce qui compte pour les actions latentes dans l'apprentissage robotique
4arXiv cs.RO 

Ce qui compte pour les actions latentes dans l'apprentissage robotique

Des chercheurs publient sur arXiv (2608.19613v1, article inédit non encore évalué par les pairs) la première étude empirique systématique consacrée aux Latent Action Models (LAM), une famille de modèles qui permet à l'apprentissage robotique d'exploiter de grands volumes de vidéos non étiquetées en les traduisant en actions latentes, des substituts compacts aux commandes physiques réelles. Les auteurs unifient les méthodes LAM existantes dans un cadre autoencodeur commun, puis testent systématiquement 41 choix de conception répartis en trois axes : les paradigmes de modélisation des actions latentes, les objectifs d'apprentissage et méthodes de régularisation associées, et les stratégies d'intégration de ces actions latentes dans les politiques de contrôle robotique. Ils évaluent également quatre métriques proxy censées juger la qualité des actions latentes, en vérifiant si elles prédisent effectivement la performance en manipulation. Les expériences couvrent trois benchmarks standards du domaine, avec une validation complémentaire sur des tâches de manipulation exécutées par un robot réel. Le résultat principal, le fine-tuning du backbone d'un modèle vision-langage (VLM) avec des actions latentes offre une meilleure initialisation pour l'apprentissage de politiques robotiques en aval qu'une simple utilisation figée du VLM, apporte une base empirique à un pan de recherche jusqu'ici dispersé. Pour les équipes qui développent des modèles VLA (vision-langage-action), ce travail répond à un problème concret : la rareté et le coût des données d'action étiquetées poussent le secteur à préentraîner sur des vidéos non annotées, mais chaque laboratoire testait ses propres choix d'architecture dans des conditions expérimentales différentes, rendant les comparaisons peu fiables. Cette étude fournit des repères de conception réels plutôt que des affirmations marketing sur le préentraînement vidéo. Le contexte est celui d'un champ de recherche fragmenté : les méthodes LAM se sont multipliées ces dernières années sans cadre d'évaluation commun, chaque publication isolant une variable différente. En proposant un cadre unifié et une comparaison à grande échelle de 41 configurations, les auteurs cherchent à combler ce vide méthodologique. Il s'agit d'un travail académique de type ablation étude, pas d'un produit ni d'un déploiement commercial : les suites attendues concernent l'adoption de ces recommandations de conception par les équipes développant des modèles VLA préentraînés sur vidéo à plus grande échelle.

RecherchePaper
1 source