Aller au contenu principal
RecherchearXiv cs.RO 

Garder l'effet, supprimer l'acteur : modèles monde-action programmables de l'effet à l'exécution

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent PEWAM, un modèle monde-action de 71,5 millions de paramètres qui part d'une idée simple : une démonstration robotique enregistre à la fois ce qui arrive aux objets et la façon dont un bras précis l'a obtenu, et seul le premier élément devrait être conservé. La démonstration est « compilée » en un programme d'effet : trajectoires de keypoints 3D des objets déplacés, deux points indiquant où chacun a été saisi, et configuration finale de la scène, démonstrateur effacé. PEWAM génère quatre flux (effet, exécution du robot, action, état terminal) avec des temps de flow-matching indépendants. Fixer le programme et échantillonner l'exécution revient à « programmer » le robot, avec une résolution répétée en boucle fermée depuis la scène réelle. Sur les tâches LIBERO-Goal hors entraînement, le programme issu d'une seule démonstration réussit 40 épisodes sur 90, contre 19 au maximum pour le même backbone conditionné par une image-but ou du langage, et pour les méthodes publiées conditionnées par démonstration. Sur Meta-World, il dépasse les meilleurs résultats publiés sur trois classes tenues à l'écart, mais pas sur la moyenne des cinq classes.

L'enjeu pratique tient à la nature du programme : un ensemble de coordonnées, donc modifiable par un opérateur. Décaler l'état terminal déplace le placement, et pivoter les points de contact fait tourner la prise. Le même programme s'exécute sur quatre bras différents sans réentraînement, ce qui touche directement le problème de transfert entre embodiments qui freine les intégrateurs. Après une poussée perturbatrice, la ré-résolution réussit 23 épisodes sur 60, contre 6 pour un simple rejeu de la démonstration, un écart qui illustre la fragilité des approches par rejeu. Sur un bras Franka, affiné sur des démonstrations réelles d'autres tâches, des programmes compilés à partir de vidéos humaines uniques aboutissent à 36 essais sur 40, contre 22 pour le même backbone conditionné par la dernière image de la vidéo. Ces résultats suggèrent qu'apprendre un « quoi » explicite plutôt qu'un « comment » lié à un acteur améliore la généralisation, mais ils proviennent d'une publication préprint, sans évaluation indépendante.

Il faut relativiser la portée : LIBERO et Meta-World sont des benchmarks de simulation, et seule l'expérience Franka touche au réel, sur un nombre limité d'essais (40). Un taux de 40/90 en simulation reste loin d'un seuil de fiabilité industriel. Le travail s'inscrit dans la course aux VLA et modèles monde-action, face à des approches généralistes comme Pi-0 ou GR00T, qui misent sur l'échelle des données plutôt que sur une représentation intermédiaire éditable. Sa taille réduite (71,5M de paramètres, très inférieure aux modèles de ces acteurs) en fait une piste intéressante pour l'imitation à partir d'une seule vidéo humaine. Les prochaines étapes à surveiller sont la validation sur des tâches réelles plus variées, la robustesse de l'extraction de keypoints en environnement encombré et une éventuelle mise à disposition du code. Aucun acteur français ou européen n'est cité dans cette publication.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Guidage sensible à l'achèvement pour les modèles du monde et d'action
1arXiv cs.RO 

Guidage sensible à l'achèvement pour les modèles du monde et d'action

Des chercheurs publient sur arXiv (2610.01559) une méthode baptisée Completion Aware Guidance (CAG), destinée aux World Action Models (WAMs). Ces modèles prédisent à la fois les futurs visuels et les actions du robot. Le travail cible un défaut précis, l'« imagination incomplète » : le modèle produit des prédictions plausibles et cohérentes avec les actions, mais qui omettent la transition nécessaire pour terminer la tâche. CAG est une méthode d'échantillonnage sans entraînement supplémentaire, qui oriente la génération vers l'achèvement de la tâche. Sur plusieurs WAMs représentatifs, le taux de succès passe de 64 % à 70 % sur un sous-ensemble de RoboTwin 2.0, et de 69 % à 75 % en simulation zéro-shot. La part d'imagination incomplète tombe de 79 % à 40 %. Les résultats portent sur des benchmarks simulés. L'article ne mentionne ni test sur robot réel, ni déploiement. L'intérêt tient d'abord au diagnostic. Selon les auteurs, l'échec ne vient pas de l'architecture du modèle du monde. Il apparaît quand ce modèle est adapté au contrôle par segments courts (short-chunk control). Dans ce régime, le modèle favorise de façon répétée des prolongements locaux plausibles plutôt que les transitions qui achèvent la tâche. Pour les équipes qui construisent des politiques VLA ou des WAMs, cela signale qu'une partie des échecs en manipulation vient de la procédure d'échantillonnage et d'adaptation, pas d'un manque de capacité du modèle de base. Corriger cela à l'inférence, sans réentraînement, est peu coûteux. Il faut toutefois relativiser : un gain de 6 points de succès reste modeste, et le chiffre le plus net, 79 % à 40 %, mesure un défaut défini par les auteurs eux-mêmes. Il ne se traduit pas directement en fiabilité industrielle. Ce travail s'inscrit dans l'essor des modèles qui apprennent à prédire l'avenir visuel pour guider l'action. L'approche est une alternative aux VLA purement réactifs, comme Pi-0 ou Helix. Elle est aussi un complément aux efforts de modèles du monde généralistes, tels que GR00T. RoboTwin 2.0 sert de banc d'essai standard pour la manipulation bimanuelle en simulation. Il reste donc à voir si le gain tient sur matériel réel, avec ses latences, son bruit de perception et ses contraintes de temps de cycle. Les auteurs n'annoncent pas de calendrier de validation physique. L'article n'évoque aucun acteur français ou européen.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ContactGuard : surveillance de l'exécution pré-contact par modèles du monde latents conditionnés par l'action
2arXiv cs.RO 

ContactGuard : surveillance de l'exécution pré-contact par modèles du monde latents conditionnés par l'action

Publié sur arXiv (2608.13438v1), un article de recherche présente ContactGuard, un moniteur d'exécution qui détecte les échecs de manipulation robotique avant le contact physique avec l'objet. Pensé pour les politiques visuomotrices « chunked » couplées à des caméras montées au poignet, souvent aveugles à une approche déjà en train de pousser, rater, glisser ou déranger l'objet, le système prédit dans un espace visuel latent compact la conséquence du prochain bloc d'actions planifié par la politique, puis interrompt l'exécution en cas d'échec probable. Son modèle du monde, entraîné sur des trajectoires robotiques non étiquetées sans prédiction vidéo pixel par pixel, s'appuie sur une sonde d'échec légère apprise sur un petit jeu de clips pré-contact étiquetés. Testé sur robot réel, il prédit les échecs plus précisément que des versions simplifiées mises en comparaison, sans modifier la politique existante. Cette approche cible une limite concrète des politiques actuelles de type VLA, qui exécutent des séquences d'actions sur plusieurs pas de temps sans réévaluation intermédiaire, rendant les échecs difficiles à anticiper avant qu'ils ne surviennent physiquement. Sur des tâches contact-riche comme l'insertion, l'assemblage ou la préhension, un échec détecté après coup signifie pièces endommagées ou reprises coûteuses. Pour les intégrateurs, l'intérêt tient à la nature de couche de sécurité externe du système, greffée sur une politique existante sans réentraînement, potentiellement applicable à plusieurs politiques « chunked » déjà déployées. Plutôt que de renforcer la politique de base à la source, ContactGuard ajoute une supervision prédictive en aval, une piste utile pour un secteur où l'écart entre démonstrations en laboratoire et fiabilité en conditions réelles reste un sujet sensible. Il s'agit d'une contribution académique sans lien annoncé avec une entreprise ou un robot commercial précis : aucun fabricant, site de déploiement ni feuille de route commerciale ne figure dans la publication. Le travail s'inscrit dans la lignée des modèles du monde latents en robotique, plus économes en calcul que la prédiction vidéo pixel par pixel, et se positionne en couche de supervision complémentaire aux politiques VLA plutôt qu'en nouvelle architecture de contrôle. La validation repose sur des tâches réelles de manipulation, mais reste un résultat de laboratoire : aucun acteur français ou européen du secteur n'est cité, et les auteurs ne précisent ni calendrier de suite ni partenariat industriel.

RecherchePaper
1 source
UniWAM : modèle unifié du monde et de l'action
3arXiv cs.RO 

UniWAM : modèle unifié du monde et de l'action

UniWAM, présenté sur arXiv (2610.02054, première version), est une architecture unifiée qui combine trois blocs : un « raisonneur physique » issu d'un modèle vision-langage préentraîné, un générateur de monde (vidéo) et un prédicteur d'actions. L'ensemble apprend conjointement la compréhension sémantique du monde physique, la génération visuelle et la prédiction d'actions. Les auteurs ont construit un pipeline de nettoyage et d'annotation pour les données égocentriques humaines et les données robot. Les actions bas niveau sont exprimées en langage naturel, afin de préserver les capacités linguistiques du modèle de base. Le préentraînement répartit les supervisions entre composants : VQA (questions-réponses visuelles), vidéos égocentriques humaines et démonstrations robot. Au post-entraînement, une augmentation par bruit visuel sur le futur réduit la dépendance à des prédictions précises, et un flow matching conditionné par l'historique d'actions initialise la génération d'actions. Selon les auteurs, cela réduit nettement le nombre d'étapes de débruitage sans perte de performance. Ils revendiquent l'état de l'art en performance in-distribution, robustesse, généralisation, suivi d'instructions et tâches longues. Le résumé ne donne ni chiffres ni noms de benchmarks. L'intérêt est de s'attaquer à un compromis connu. Les modèles VLA (vision-langage-action) héritent du raisonnement des VLM, mais une supervision limitée aux actions leur donne peu d'ancrage dans la dynamique physique. À l'inverse, les modèles monde-action, bâtis sur la génération vidéo, captent bien les régularités spatio-temporelles mais comprennent et raisonnent moins bien hors distribution. Unifier les deux dans un seul modèle est une réponse directe à ce problème de robustesse, qui compte pour les intégrateurs confrontés au fossé entre démo et déploiement. La réduction des étapes de débruitage compte aussi pour la latence de contrôle, point faible des approches fondées sur la vidéo. Le résultat le plus transposable est la loi d'échelle log-linéaire du co-entraînement humain-robot. Si elle se confirme, elle soutient l'idée que les vidéos humaines, bien moins chères que la téléopération, peuvent servir de levier de données. Prudence toutefois : il s'agit d'un préprint non évalué par les pairs, sans test annoncé sur robot en production. Ce travail s'inscrit dans la course entre VLA (Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure) et modèles monde-action, qui exploitent la génération vidéo pour la planification. Il prolonge aussi la tendance à exploiter les données égocentriques humaines pour pallier la rareté des démonstrations robot. Le résumé ne cite ni équipe, ni plateforme robotique, ni calendrier de publication du code ou des poids. Il faudra donc attendre le texte complet pour juger du protocole, de la comparaison avec les références et de la validation sur matériel réel.

RecherchePaper
1 source
SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde
4arXiv cs.RO 

SANTS : un planificateur adaptatif à l'état pour les modèles d'action du monde

Des chercheurs proposent SANTS (State-Adaptive Noise Trajectory Scheduler), un scheduler léger pour les politiques de diffusion vidéo-vers-action dans les World Action Models (WAMs). Soumis sur arXiv (2605.27947) le 28 mai 2026, le travail part d'un constat empirique : dans les WAMs pixel-space, débruiter complètement la vidéo future n'optimise pas toujours la qualité de l'action produite. Au-delà d'un seuil dépendant de l'état du robot, le raffinement supplémentaire sature ou dégrade la performance. SANTS lit la représentation vidéo-état courante et le niveau de bruit, prédit un point d'arrêt adaptatif, et est entraîné par post-training avec une récompense sur la qualité finale de l'action (et non sur la fidélité de la vidéo intermédiaire). Résultats annoncés : 94,4 % de succès sur RoboTwin 2.0, 73,1 % sur sept tâches réelles, avec une réduction de latence de 81,7 % et 79,0 % respectivement par rapport au débruitage complet. L'enjeu opérationnel est la fréquence de contrôle : les WAMs souffrent d'une latence d'inférence élevée qui limite leur déploiement dans des boucles de contrôle rapides. Diviser par cinq ce coût d'inférence sans perte majeure de performance valide l'idée que la représentation future n'a pas besoin d'être parfaitement rendue pour conditionner efficacement l'action, une hypothèse implicite des architectures WAM qui n'était pas encore démontrée à cette échelle. Cela dit, le papier reste un preprint non relu par les pairs, et sept tâches réelles constituent un set de validation étroit pour prétendre à une généralisation industrielle. Les WAMs ont émergé comme alternative aux politiques VLA classiques en intégrant une prédiction vidéo du futur pour guider la génération d'actions. SANTS se positionne comme une surcouche d'optimisation compatible avec les designs existants, sans modifier la branche action du modèle de base. Dans l'écosystème actuel, Physical Intelligence (pi0), NVIDIA (GR00T N2) et Figure (Figure 03) développent des politiques de diffusion pour la manipulation, où la réduction de la latence d'inférence devient un facteur de compétitivité commerciale. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges comme DROID ou Open X-Embodiment, et la mise à disposition publique des poids et du code.

RechercheOpinion
1 source