Aller au contenu principal
RecherchearXiv cs.RO 

SplineWAM : des horizons d'action adaptatifs pour les modèles du monde et d'action grâce aux B-splines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient SplineWAM (arXiv 2609.39873), une méthode qui change la façon dont les « world action models » (WAM) découpent leurs actions dans le temps. Un WAM est une grande politique robotique qui prédit conjointement la vidéo future et les actions à exécuter, et renvoie à chaque appel d'inférence un segment d'actions de longueur fixe (action chunk). SplineWAM compresse au contraire la trajectoire dans une fenêtre de taille fixe de paramètres de B-splines cubiques, dont les instants de nœuds s'ajustent aux caractéristiques du mouvement. Un même budget de paramètres peut ainsi se décoder en segments de résolution et de durée variables, et la durée exécutée comme l'intervalle avant le prochain appel découlent de la prédiction elle-même. La supervision vidéo est alignée sur les nœuds ajustés de la démonstration plutôt que sur une grille uniforme, ce qui concentre les images supervisées là où la trajectoire est complexe. Pour l'exécution asynchrone, les auteurs introduisent JP-RTC (Jacobian-Pullback Real-Time Chunking), qui impose la continuité sur les actions brutes exécutées par le robot, et non sur les paramètres de la spline. Les paramètres sont corrigés via le décodeur pour que le début du segment coïncide avec les actions déjà engagées. Sur LIBERO-Plus et RoboCasa, le taux de réussite gagne 8,2 et 4,4 points face à un WAM à action chunking classique, avec 22 % et 26 % d'appels de politique en moins par épisode. Sur trois tâches bimanuelles réelles en mode asynchrone, SplineWAM fait mieux ou égale la référence tout en décodant 1,2 à 1,6 fois plus de mouvement exécuté par appel.

L'enjeu est surtout économique et opérationnel. Un WAM uniforme dépense autant de calcul sur un déplacement en espace libre que sur une insertion riche en contacts, ce qui plafonne le débit lorsque la politique tourne dans le cloud, où chaque appel coûte de la latence et du GPU. Moins d'appels pour un succès égal ou supérieur laisse envisager de servir davantage de robots par accélérateur, ou de tolérer des liaisons plus lentes. Le résultat nuance aussi l'idée qu'un horizon d'action fixe est un détail d'implémentation neutre : le choisir de façon adaptative semble améliorer à la fois la qualité et l'efficacité. Des réserves s'imposent toutefois. Les gains en simulation sont modestes, et les résultats réels, limités à trois tâches, indiquent « mène ou égale » la référence, ce qui n'est pas une victoire nette. Le papier ne donne pas, dans son résumé, de mesure de latence de bout en bout ni de coût par tâche.

Le contexte est celui de la montée des WAM, qui prolongent les VLA (vision-langage-action) en ajoutant la prédiction vidéo pour mieux ancrer la physique des tâches. Le problème de la continuité entre segments successifs a été traité jusqu'ici par le real-time chunking, que JP-RTC reprend en l'adaptant à une représentation paramétrique. Les B-splines, courantes en planification de trajectoire, entrent ainsi dans la conception des politiques apprises. Les benchmarks utilisés, LIBERO-Plus et RoboCasa, sont des environnements de simulation de référence, mais leur transfert à des cellules industrielles reste à démontrer. Aucun partenaire industriel ni calendrier de déploiement n'est annoncé : il s'agit d'une préversion de recherche, dont la validité dépendra d'une réplication sur d'autres plateformes et d'une mesure du gain réel en coût de service cloud.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
1arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source
DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
2arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
3arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
4arXiv cs.RO 

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation

Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor. L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé. Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source