Aller au contenu principal
RecherchearXiv cs.RO 

Guidage sensible à l'achèvement pour les modèles du monde et d'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.01559) une méthode baptisée Completion Aware Guidance (CAG), destinée aux World Action Models (WAMs). Ces modèles prédisent à la fois les futurs visuels et les actions du robot. Le travail cible un défaut précis, l'« imagination incomplète » : le modèle produit des prédictions plausibles et cohérentes avec les actions, mais qui omettent la transition nécessaire pour terminer la tâche. CAG est une méthode d'échantillonnage sans entraînement supplémentaire, qui oriente la génération vers l'achèvement de la tâche. Sur plusieurs WAMs représentatifs, le taux de succès passe de 64 % à 70 % sur un sous-ensemble de RoboTwin 2.0, et de 69 % à 75 % en simulation zéro-shot. La part d'imagination incomplète tombe de 79 % à 40 %. Les résultats portent sur des benchmarks simulés. L'article ne mentionne ni test sur robot réel, ni déploiement.

L'intérêt tient d'abord au diagnostic. Selon les auteurs, l'échec ne vient pas de l'architecture du modèle du monde. Il apparaît quand ce modèle est adapté au contrôle par segments courts (short-chunk control). Dans ce régime, le modèle favorise de façon répétée des prolongements locaux plausibles plutôt que les transitions qui achèvent la tâche. Pour les équipes qui construisent des politiques VLA ou des WAMs, cela signale qu'une partie des échecs en manipulation vient de la procédure d'échantillonnage et d'adaptation, pas d'un manque de capacité du modèle de base. Corriger cela à l'inférence, sans réentraînement, est peu coûteux. Il faut toutefois relativiser : un gain de 6 points de succès reste modeste, et le chiffre le plus net, 79 % à 40 %, mesure un défaut défini par les auteurs eux-mêmes. Il ne se traduit pas directement en fiabilité industrielle.

Ce travail s'inscrit dans l'essor des modèles qui apprennent à prédire l'avenir visuel pour guider l'action. L'approche est une alternative aux VLA purement réactifs, comme Pi-0 ou Helix. Elle est aussi un complément aux efforts de modèles du monde généralistes, tels que GR00T. RoboTwin 2.0 sert de banc d'essai standard pour la manipulation bimanuelle en simulation. Il reste donc à voir si le gain tient sur matériel réel, avec ses latences, son bruit de perception et ses contraintes de temps de cycle. Les auteurs n'annoncent pas de calendrier de validation physique. L'article n'évoque aucun acteur français ou européen.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins
1arXiv cs.RO 

AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins

Des chercheurs publient sur arXiv (v2, référence 2609.33299) AquaWAM, présenté comme le premier World Action Model (WAM) conçu pour des agents sous-marins. Un WAM permet à un robot d'anticiper les conséquences d'une action candidate avant de l'exécuter. Les WAM existants prédisent surtout des observations visuelles conditionnées par l'action. AquaWAM prédit à la place des états de navigation compacts. Il modélise la dynamique commandée et la dynamique passive: zone morte des propulseurs, glissement inertiel qui dépasse chaque commande, courants ambiants. Il perçoit via un DVL (capteur de vitesse Doppler), une centrale inertielle (IMU), un capteur de pression et des encodeurs d'articulations. Les caméras ne servent qu'à fournir la sémantique, c'est-à-dire les objectifs et la pose de la cible. Sur le benchmark USIM (20 tâches sous-marines), le modèle atteint 72,6 % de succès. Il décide 2,7 fois plus vite que U0 sur un NVIDIA Jetson AGX Orin. Sans les mesures de vitesse du DVL, il conserve 61,6 % de succès, contre 39,4 % pour U0. Ces résultats visent une hypothèse répandue dans les modèles du monde, selon laquelle prédire des pixels serait la voie générique vers le contrôle. Sous l'eau, l'inertie, la flottabilité, la traînée et la dérive continuent d'agir après la commande. Modéliser directement ces effets, plutôt que la scène, réduit la taille du modèle et le coût de calcul. La vitesse d'inférence sur Jetson AGX Orin, un module embarqué courant, compte pour les intégrateurs d'ROV et d'AUV, dont le calcul et l'énergie sont limités. La robustesse à la perte de capteurs répond à un problème opérationnel: un DVL perd son verrouillage sur le fond, et les eaux turbides dégradent la vision. L'écart entre 61,6 % et 39,4 % suggère une meilleure tolérance à la dégradation, à confirmer hors simulation. Il faut toutefois lire ces chiffres avec prudence. Les résultats proviennent d'un benchmark en simulation, USIM. L'abstract ne mentionne ni essai en bassin ni essai en mer. Il ne dit pas non plus si le comparatif avec U0 est réalisé à budget équivalent. Le résumé ne précise pas non plus l'écart de réalité entre simulation et milieu réel pour des courants variables. Le travail s'inscrit dans l'extension des WAM et des modèles vision-langage-action (VLA) au-delà des manipulateurs terrestres et des humanoïdes, vers des véhicules à dynamique passive marquée. U0 sert ici de référence pour l'embarqué sous-marin. Aucun acteur français ou européen n'est cité dans l'abstract. Les suites probables sont des validations en conditions réelles, l'ouverture éventuelle du code et des tests sur des véhicules physiques. Ce travail reste pour l'instant une publication de recherche, sans produit ni déploiement annoncé.

RecherchePaper
1 source
SG-WAM : guidage sémantique ancré au texte et conscient de l'espace pour les modèles monde-action
2arXiv cs.RO 

SG-WAM : guidage sémantique ancré au texte et conscient de l'espace pour les modèles monde-action

Un article de recherche publié sur arXiv (référence 2608.08839, avril... plutôt août 2026) présente SG-WAM, une méthode de guidage sémantique pour les modèles dits "World-Action Models" (WAM), une famille d'architectures utilisées en manipulation robotique qui prédisent à la fois une vidéo future de la scène et les actions du robot à partir d'une observation visuelle et d'une instruction en langage naturel. Le constat de départ des auteurs est que la plupart des WAM existants s'appuient surtout sur l'image et peu sur le texte, car les encodeurs de texte classiques traitent l'instruction indépendamment de ce que voit le robot. Résultat, la vidéo prédite s'écarte souvent du sens réel de la consigne, ce qui dégrade la précision des actions calculées. Pour corriger cela, SG-WAM ajoute un planificateur basé sur un modèle vision-langage (VLM), entraîné à produire deux types de prévisions sémantiques: une prévision "ancrée dans le texte", qui identifie les bons objets cibles mentionnés dans l'instruction, et une prévision "consciente de l'espace", qui restitue la géométrie de la scène pour une manipulation précise. Ces prévisions sont injectées comme guidage de haut niveau dans le WAM, pour aligner génération vidéo et prédiction d'action sur l'instruction donnée. Les auteurs rapportent des expériences en simulation et en conditions réelles. Sur le fond, ce travail s'attaque à un point de friction classique des architectures VLA et WAM: la tendance des modèles à bien fonctionner en démonstration contrôlée mais à perdre l'instruction de vue dès que la scène contient plusieurs objets similaires ou une ambiguïté spatiale. Pour les équipes qui évaluent des piles de manipulation robotique en entrepôt ou en usine, ce type de contribution touche directement la fiabilité du suivi d'instruction, un critère souvent plus déterminant que la vitesse d'exécution pour la mise en production. Il s'agit toutefois d'une publication académique, testée sur des protocoles expérimentaux et non d'un produit commercialisé ni d'un déploiement industriel chiffré. Le papier s'inscrit dans la lignée des travaux qui cherchent à combler l'écart entre modèles purement vision-action et modèles de "monde" capables d'anticiper les conséquences physiques d'une action avant de l'exécuter. L'abstract ne précise ni les benchmarks utilisés, ni de calendrier de mise à disposition du code, ni de partenariat industriel.

RecherchePaper
1 source
Flash-WAM : distillation sensible aux modalités pour les modèles monde-action
3arXiv cs.RO 

Flash-WAM : distillation sensible aux modalités pour les modèles monde-action

Des chercheurs ont publié Flash-WAM (arXiv:2606.05254v1), une méthode de distillation conçue pour accélérer les "world-action models" (WAMs), des architectures de diffusion qui génèrent simultanément une prédiction vidéo du futur et les commandes robot associées. Le verrou que Flash-WAM tente de lever : ces modèles nécessitent des dizaines de passes de débruitage par chunk d'actions, aboutissant à une latence de 8,1 secondes par chunk sur GPU NVIDIA L40S, ce qui exclut tout contrôle en temps réel. En compressant l'inférence à une seule étape par modalité via une distillation par consistance adaptée, Flash-WAM ramène cette latence à 348 ms, soit un facteur 23x. Appliqué au modèle LingBot-VA, il atteint 85,5% de succès sur le benchmark RoboTwin 2.0, 95,7% sur LIBERO, et 60% en moyenne sur un humanoïde réel Unitree G1. L'originalité de Flash-WAM réside dans le traitement asymétrique des deux modalités. Le flux action et le flux vidéo dans un WAM opèrent sur des schedules de bruit fondamentalement différents (SNR-shifted noise schedules) : appliquer une seule paramétrisation à l'ensemble dégrade les performances de façon sévère, la distillation naïve par consistance chutant à 24% de succès en conditions réelles. Flash-WAM contourne ce problème avec une paramétrisation linéaire à gradient scalé pour le flux action (régime faible bruit) et une paramétrisation variance-preserving pour le flux vidéo (régime fort bruit). Ce résultat valide l'idée qu'un robot peut boucler en temps réel sur ses prédictions de monde sans matériel exotique, à condition d'adapter la distillation à la nature propre de chaque signal. Les WAMs s'inscrivent dans une tendance récente fusionnant prédiction vidéo et politique robot dans un modèle de diffusion unifié, une approche portée par des travaux comme GR00T N2 de NVIDIA, Pi-0.5 de Physical Intelligence, ou les VLAs (vision-language-action models) au sens large. LingBot-VA est l'un de ces modèles joints récents sur lequel Flash-WAM est instancié. Le sim-to-real gap demeure visible dans les résultats (60% en réel contre 85,5% en simulation sur RoboTwin 2.0), mais le gain de 36 points sur la distillation naïve confirme la pertinence de l'approche pour des déploiements futurs sur manipulateurs industriels ou humanoïdes à usage général.

RechercheOpinion
1 source
TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique
4arXiv cs.RO 

TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique

Traduction-résumé de l'article arXiv ci-dessous, format demandé (3 paragraphes, sans titres). --- Des chercheurs présentent TacWAM (Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction), un modèle qui combine prédiction d'état futur et génération d'action pour des robots manipulateurs, en s'appuyant cette fois sur le tactile plutôt que sur la seule vision. Le système repose sur trois briques : un encodeur tactile à fusion spatialement alignée (SAF) qui projette apparence tactile, champs de force denses et flux de déformation dans un espace latent commun, avec reconstruction bilatérale des forces et couples pour préserver l'information de contact globale ; un encodeur d'historique tactile qui donne du contexte temporel à la prédiction future ; et un mécanisme d'attention tri-modal guidé par ancrage (AGT) qui sépare les tokens visuels et tactiles courants, les tokens de prédiction future et les tokens d'action, de façon à ce que la supervision par le tactile futur n'agisse pas comme un raccourci direct pour l'action. Sur quatre tâches réelles de manipulation à contact riche (prise d'objets fragiles, contact de surface soutenu, manipulation dynamique en main), TacWAM atteint un taux de réussite moyen de 75,0 %, soit 37,5 points de plus que la meilleure référence testée. Des ablations montrent une dégradation nette dès que l'historique tactile est retiré ou que l'accès aux cibles de prédiction future est relâché. L'enjeu dépasse la simple mesure de performance : la vision seule peine à fournir un signal utile pour la force, le glissement ou la déformation lors de tâches de contact fin, un angle mort connu des approches de manipulation par apprentissage. En montrant qu'une prédiction tactile future bien conçue, couplée à une architecture qui empêche cette prédiction de devenir une "triche" pour l'action, améliore significativement des tâches réputées difficiles (objets fragiles, contact soutenu), les auteurs apportent un argument concret en faveur de l'intégration native du tactile dans les futurs modèles de type "world action model", au-delà des architectures VLA aujourd'hui dominées par la vision et le langage. Ce travail s'inscrit dans la lignée des World Action Models, qui cherchent à unifier prédiction du monde et politique d'action pour améliorer la robustesse des robots manipulateurs, un axe déjà exploré via la vision par des modèles comme GR00T N2 ou Pi-0. TacWAM reste à ce stade une contribution de recherche publiée sur arXiv, validée sur un nombre restreint de tâches en laboratoire et non un système déployé industriellement ; ses auteurs annoncent vouloir approfondir les ablations et étendre l'évaluation à davantage de scénarios de contact.

RecherchePaper
1 source