DyPES-VLA : apprendre des dynamiques partagées et un contrôle spécifique à chaque incarnation pour la manipulation inter-incarnations
Des chercheurs présentent DyPES-VLA, un modèle vision-langage-action (VLA) conçu pour piloter plusieurs types de robots avec une seule politique généraliste plutôt qu'un modèle par robot. L'approche combine deux briques: un objectif de prédiction du futur qui entraîne le modèle vision-langage, sur des données issues de robots hétérogènes, à capturer le mouvement des objets, les contacts et les changements de scène induits par l'interaction; et une tête d'action à mélange d'experts (MoE) propre à chaque robot, qui traduit ces représentations partagées directement dans l'espace de commande natif de chaque machine, sans reformatage manuel préalable des actions. Cette tête MoE partage ses couches d'attention pour les structures temporelles communes aux tâches, tandis que des experts feed-forward dédiés gèrent les contraintes cinématiques propres à chaque embodiment. Résultat annoncé: 98,0% de réussite sur le benchmark LIBERO, 59,25% sur RoboCasa-GR1 et 89,02% sur RoboTwin 2.0, présentés comme état de l'art en simulation comme en conditions réelles.
Le sujet touche un vrai goulot d'étranglement pour les intégrateurs et équipes robotique en entreprise: faire tourner un même modèle VLA sur plusieurs plateformes, bras industriels, robots mobiles ou humanoïdes, exige aujourd'hui un travail manuel lourd pour aligner des espaces d'action hétérogènes, ce qui freine la mutualisation des données d'entraînement et le déploiement à grande échelle. Une politique capable de généraliser nativement entre embodiments réduirait ce coût d'ingénierie par robot et rapprocherait l'objectif, poursuivi aussi par les grands laboratoires du secteur, d'un modèle fondation unique pour la manipulation. Reste que les chiffres avancés sont des scores de benchmark académiques: l'écart classique entre performance en simulation ou en laboratoire contrôlé et robustesse en usine ou en entrepôt n'est pas documenté pour ce modèle en particulier.
DyPES-VLA s'inscrit dans la vague récente des VLA "cross-embodiment", qui cherche à dépasser les politiques entraînées robot par robot popularisées par RT-2 ou OpenVLA, sur le même terrain que des modèles généralistes déjà déployés en pilote comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. Publié comme nouvelle soumission sur arXiv, le papier ne précise ni affiliation industrielle ni calendrier de déploiement sur robot physique au-delà des évaluations réelles mentionnées dans l'étude: il relève pour l'instant de la recherche amont plutôt que d'un produit prêt à l'emploi. La suite logique pour ce type de travaux consiste généralement à valider l'approche sur davantage de plateformes et de tâches manipulatoires longues avant tout transfert vers un cas d'usage industriel.




