
Au-delà des VLA : comment les modèles du monde pour l'action transforment la manipulation robotique
Un courant de recherche en robotique met en avant les « World Action Models » (WAM) comme prolongement des modèles Vision-Language-Action (VLA) utilisés pour la manipulation. Le problème central est la généralisation : une politique entraînée par démonstrations réussit dans la scène d'apprentissage mais échoue dès que la forme des objets, leur position ou l'éclairage changent. Généraliser exige que le modèle comprenne la physique sous-jacente de la tâche plutôt que d'imiter les démonstrations, une capacité qui proviendrait du backbone, l'architecture de base du modèle d'action.
Cette reformulation compte pour les intégrateurs et décideurs B2B car elle interroge l'approche dominante depuis deux ans, fondée sur le clonage de comportement à partir de larges jeux de démonstrations. Si la généralisation réelle suppose une compréhension physique plutôt qu'une simple imitation, les architectures purement VLA risquent de buter sur le même écart entre démonstration et déploiement réel déjà observé sur le terrain. Pour un secteur qui vise à industrialiser la manipulation au-delà de scénarios scriptés, cette piste remet en cause l'hypothèse selon laquelle accumuler données et paramètres suffit à résoudre le passage de la simulation au réel.
Les VLA se sont imposés ces dernières années comme paradigme dominant pour piloter bras robotisés et humanoïdes, avec des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. Les World Action Models s'inscrivent en complément ou en alternative, en cherchant à doter les politiques d'un modèle du monde capable d'anticiper les conséquences physiques d'une action avant son exécution. Le contenu disponible ne mentionne ni déploiement, ni pilote industriel, ni calendrier précis, ce qui situe pour l'instant cette approche du côté de la recherche plutôt que du produit livré.
Dans nos dossiers




