
CoWAM : contrats de coordination pour intervention sélective des politiques avec les WAM
Une équipe de recherche publie CoWAM, un article arXiv (2608.02578v1, soumission nouvelle, non encore validée par un comité de lecture) qui propose une couche de contrôle appelée "contrats de coordination" pour les politiques robotiques bimanuelles épaulées par des World Action Models (WAM), ces modèles qui prédisent un futur conditionné à l'action envisagée. Le principe: ne pas remplacer l'action nominale d'un bras robotique juste parce qu'une alternative prédite semble plausible, mais seulement si elle respecte toutes les obligations actives de synchronisation, de compatibilité des rôles et de convergence anti-collision, et apporte un gain net à faible risque. Si l'action nominale est elle-même jugée non admissible, le système bascule vers un repli d'abstention prédéfini plutôt que d'improviser. Sur huit tâches bimanuelles simulées, avec des pools de candidats identiques entre méthodes pour isoler la qualité du sélecteur de celle du générateur, CoWAM améliore la sélection valide de 16,7 points de pourcentage par rapport à une variante "contrats seuls", et augmente le taux de succès en boucle fermée de 9,6 points par rapport à la meilleure référence sélective existante, tout en maintenant les interventions dommageables sous 1%.
L'enjeu dépasse la seule performance brute: pour les intégrateurs de robots à deux bras (logistique, assemblage, préparation de commandes), le vrai risque des WAM n'est pas de mal prédire, mais d'intervenir à tort sur une action déjà correcte parce qu'une alternative "a l'air" meilleure sur le papier. CoWAM répond directement à ce problème de sur-intervention, un frein connu à la mise en production des politiques génératives de type VLA (vision-langage-action) dans des contextes industriels où la sécurité et la prévisibilité priment sur la simple optimisation moyenne.
Le travail s'inscrit dans la lignée des approches de contrôle sélectif conçues pour encadrer des générateurs d'actions puissants mais imprévisibles, dans un paysage où des modèles comme Pi-0, GR00T N2 ou Helix cherchent à généraliser le contrôle robotique à partir de grands modèles pré-entraînés. Les résultats restent pour l'instant cantonnés à la simulation; l'étape suivante, non abordée dans cet article, serait une validation sur du matériel physique bimanuel réel.
Dans nos dossiers




