SplineWAM : des horizons d'action adaptatifs pour les modèles du monde et d'action grâce aux B-splines
Des chercheurs publient SplineWAM (arXiv 2609.39873), une méthode qui change la façon dont les « world action models » (WAM) découpent leurs actions dans le temps. Un WAM est une grande politique robotique qui prédit conjointement la vidéo future et les actions à exécuter, et renvoie à chaque appel d'inférence un segment d'actions de longueur fixe (action chunk). SplineWAM compresse au contraire la trajectoire dans une fenêtre de taille fixe de paramètres de B-splines cubiques, dont les instants de nœuds s'ajustent aux caractéristiques du mouvement. Un même budget de paramètres peut ainsi se décoder en segments de résolution et de durée variables, et la durée exécutée comme l'intervalle avant le prochain appel découlent de la prédiction elle-même. La supervision vidéo est alignée sur les nœuds ajustés de la démonstration plutôt que sur une grille uniforme, ce qui concentre les images supervisées là où la trajectoire est complexe. Pour l'exécution asynchrone, les auteurs introduisent JP-RTC (Jacobian-Pullback Real-Time Chunking), qui impose la continuité sur les actions brutes exécutées par le robot, et non sur les paramètres de la spline. Les paramètres sont corrigés via le décodeur pour que le début du segment coïncide avec les actions déjà engagées. Sur LIBERO-Plus et RoboCasa, le taux de réussite gagne 8,2 et 4,4 points face à un WAM à action chunking classique, avec 22 % et 26 % d'appels de politique en moins par épisode. Sur trois tâches bimanuelles réelles en mode asynchrone, SplineWAM fait mieux ou égale la référence tout en décodant 1,2 à 1,6 fois plus de mouvement exécuté par appel.
L'enjeu est surtout économique et opérationnel. Un WAM uniforme dépense autant de calcul sur un déplacement en espace libre que sur une insertion riche en contacts, ce qui plafonne le débit lorsque la politique tourne dans le cloud, où chaque appel coûte de la latence et du GPU. Moins d'appels pour un succès égal ou supérieur laisse envisager de servir davantage de robots par accélérateur, ou de tolérer des liaisons plus lentes. Le résultat nuance aussi l'idée qu'un horizon d'action fixe est un détail d'implémentation neutre : le choisir de façon adaptative semble améliorer à la fois la qualité et l'efficacité. Des réserves s'imposent toutefois. Les gains en simulation sont modestes, et les résultats réels, limités à trois tâches, indiquent « mène ou égale » la référence, ce qui n'est pas une victoire nette. Le papier ne donne pas, dans son résumé, de mesure de latence de bout en bout ni de coût par tâche.
Le contexte est celui de la montée des WAM, qui prolongent les VLA (vision-langage-action) en ajoutant la prédiction vidéo pour mieux ancrer la physique des tâches. Le problème de la continuité entre segments successifs a été traité jusqu'ici par le real-time chunking, que JP-RTC reprend en l'adaptant à une représentation paramétrique. Les B-splines, courantes en planification de trajectoire, entrent ainsi dans la conception des politiques apprises. Les benchmarks utilisés, LIBERO-Plus et RoboCasa, sont des environnements de simulation de référence, mais leur transfert à des cellules industrielles reste à démontrer. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé : il s'agit d'une préversion de recherche, dont la validité dépendra d'une réplication sur d'autres plateformes et d'une mesure du gain réel en coût de service cloud.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



