EmbodiedSkills : un cadre unifié pour orchestrer, entraîner et déployer des agents VLA
EmbodiedSkills, un framework présenté sur arXiv en septembre 2026 (arXiv:2609.01281), orchestre, entraîne et déploie des agents robotiques fondés sur des modèles vision-langage-action (VLA). Le système traite chaque décision de compétence comme une proposition d'exécution : une interface de compétences exécutables partagée vérifie les prérequis avant l'action, exécute une politique VLA bornée, puis contrôle le résultat, le tout dans une seule boucle d'agent. Cette interface fixe permet de remplacer les politiques de bas niveau sans la modifier. Les auteurs l'instancient avec le modèle vision-langage Qwen3-VL et la politique d'action pi0.5 de Physical Intelligence, diffusée via OpenPI. L'ensemble est testé en simulation sur RoboTwin 2.0 (50 tâches) et LIBERO (quatre suites), où les politiques adaptées à la tâche atteignent 86,20% et 97,40% de réussite moyenne respectivement. Sur RMBench, quatre tâches exigeant de la mémoire à long terme, ce taux chute à 12,5%.
Cet effondrement sur les tâches à mémoire longue est le résultat le plus significatif : il montre qu'un modèle VLA dépassant 85 à 97% de réussite sur des benchmarks d'action courte ne résout pas pour autant le raisonnement séquentiel sur un état qui évolue dans le temps, un écart largement soupçonné mais rarement chiffré aussi explicitement. Pour les intégrateurs et les équipes de recherche, l'intérêt tient moins à la performance brute qu'à l'architecture : en séparant vérification, planification et exécution, EmbodiedSkills rend auditable la cause d'un échec plutôt que de traiter le VLA comme une boîte noire.
Le travail s'inscrit dans la vague de frameworks agentiques cherchant à combler l'écart entre modèles VLA génériques, tels que pi-0 et pi0.5 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, et des tâches industrielles longues nécessitant coordination et récupération d'erreur ; EmbodiedSkills se positionne comme une couche d'orchestration entraînable au-dessus de ces politiques plutôt que comme un nouveau modèle de fondation concurrent. Il s'agit à ce stade d'une publication de recherche testée uniquement en simulation, sans déploiement matériel ni partenaire industriel annoncé, les auteurs présentant la vérification comme la brique manquante avant l'extension à des tâches à mémoire plus longue et le transfert vers du matériel réel.
Dans nos dossiers




