Route par cinématique, agir par observation : routage d'experts supervisé par cinématique dans un VLA à experts multiples (MoE)
Le routage d'experts dans les architectures Vision-Language-Action (VLA) augmentées par mixture-of-experts (MoE) échoue souvent car les actions de manipulation présentent une forte hétérogénéité cinématique d'une tâche à l'autre, et parce que le signal cinématique n'est de toute façon pas disponible au moment de l'inférence. Face à ce constat, une équipe de recherche propose KinRT (Kinematics-supervised explicit Routing), qui remplace le routage implicite piloté par l'observation par un dispatching explicite guidé par la cinématique. La méthode regroupe d'abord les trajectoires d'action par clustering cinématique en groupes cohérents, dont les identifiants servent de vérité terrain pour entraîner le routeur ; à l'inférence, ce routeur n'utilise plus que les observations visuo-langagières, via un mécanisme de pont asymétrique qui distille la cinématique apprise pendant l'entraînement dans l'espace des observations. Pour tester la généralisation multi-plateforme de KinRT, les chercheurs ont aussi construit DIYRobot, une plateforme robotique imprimée en 3D coûtant moins de 2 000 dollars. Sur le benchmark RoboTwin, KinRT dépasse les VLA denses comme MoE de plus de 23,26 %, et de 20,27 % sur DIYRobot ; code et plateforme seront open source.
Cette contribution s'attaque à un point de friction connu des architectures MoE appliquées à la robotique manipulatrice : le routeur doit décider quel expert activer sans jamais voir la cinématique réelle du geste, seulement l'image et l'instruction. En prouvant qu'on peut entraîner ce jugement à partir d'un signal cinématique absent au runtime, KinRT répond directement à l'écart entre supervision disponible en entraînement et information disponible en production, un problème central pour tout VLA industriel. Le choix de valider sur une plateforme DIY à moins de 2 000 dollars est aussi un signal fort à destination du secteur académique et des petites équipes robotiques : la généralisation cross-plateforme redevient testable sans budget matériel lourd, ce qui pourrait accélérer la reproductibilité des benchmarks VLA.
Le papier s'inscrit dans la vague de recherche sur les modèles VLA à mixture d'experts, où la spécialisation par expert promet une meilleure scalabilité que les architectures denses, mais où le routage reste le maillon faible en conditions réelles de manipulation. Contrairement à une annonce produit, il s'agit ici d'une contribution scientifique publiée sur arXiv, sans déploiement industriel annoncé : les auteurs prévoient la publication en open source du code et de la plateforme DIYRobot, ce qui ouvrira la porte à des comparaisons indépendantes sur d'autres benchmarks et architectures MoE concurrentes.
Dans nos dossiers



