Aller au contenu principal
RecherchearXiv cs.RO 

DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du AIGeeksGroup publient DeltaWAM (Delta World Action Models), une nouvelle architecture pour piloter des bras robotiques bimanuels via l'apprentissage vidéo, détaillée dans un article arXiv (2609.28811v1) diffusé fin septembre 2026, avec code et démonstrations disponibles sur GitHub. Les modèles World-Action (WAM) classiques transfèrent les connaissances visuelles et de mouvement de générateurs vidéo préentraînés vers le contrôle robotique, mais ils prédisent à chaque étape des images futures complètes, ce qui recalcule inutilement du contenu inchangé et ralentit la génération d'actions en temps réel. DeltaWAM sépare le flux en trois composantes, une ancre dense, un delta visuel épars et un flux d'actions, déclinées en trois architectures selon le partage de calcul et de représentation. Le système ajoute une Streaming Delta Memory (SDM) qui met à jour un contexte d'ancrage en cache à partir des seuls changements observés, évitant de repasser par le lourd module vidéo à chaque pas. Sur le benchmark RoboTwin, DeltaWAM avec SDM porte le taux de réussite moyen de 81,3% à 85,4% en conditions standard, et de 75,8% à 83,9% avec randomisation visuelle, par rapport à la référence Fast-WAM. Les trois architectures réduisent le coût de calcul à l'entraînement de 17,78 à 23,77%, tandis que la SDM abaisse la latence d'inférence de 36,57% et le calcul associé de 31,55%.

Pour l'industrie robotique, ce travail cible un goulot d'étranglement concret: les modèles génératifs vidéo, puissants pour transférer des priors de mouvement, restent trop lourds pour du contrôle en quelques pas de temps, un frein direct pour des manipulations bimanuelles réactives en usine ou en logistique. En découplant la dynamique liée à l'action des variations d'apparence parasites, DeltaWAM répond à un doute récurrent sur les architectures VLA à grande échelle: leur capacité à généraliser sans reconstruire l'intégralité de la scène à chaque inférence. Les gains annoncés en conditions réelles restent toutefois évalués par les auteurs eux-mêmes, face à un nombre limité de politiques concurrentes, sans validation indépendante à ce stade.

L'article s'inscrit dans la lignée des WAM apparus pour exploiter les générateurs vidéo comme source de priors physiques, avec Fast-WAM comme point de comparaison direct explicitement cité. Aucun acteur industriel ni équipe européenne n'est mentionné, le travail restant à ce stade une contribution académique avec code ouvert, sans annonce de déploiement matériel ni de partenariat commercial.

Dans nos dossiers

À lire aussi

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes
1arXiv cs.RO 

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes

Des chercheurs présentent DECOWAM (Decoupled Whole-Body World-Action Model), un modèle monde-action conçu pour la manipulation mobile sur robots à pattes équipés d'un bras, décrit dans une prépublication arXiv (2608.20114v1) mise en ligne fin août 2026. Le système part d'un backbone FastWAM adapté et gelé, sur lequel sont entraînés uniquement des adaptateurs résiduels, soit 25,95 millions de paramètres entraînables. L'architecture ajoute un goulot d'étranglement futur équivalent-action distillé à partir d'observations privilégiées, des représentations latentes de la base et du bras séparées de manière adversariale, ainsi qu'un conditionnement par la vitesse de la base pour la prédiction vidéo. Les auteurs introduisent également ARMDOG, un nouveau jeu de données collecté sur robot réel qui synchronise vidéo, état corps entier, actions et instructions en langage naturel. Sur un protocole de rejeu fixe, DECOWAM réduit l'erreur quadratique moyenne de prédiction d'action de 21,7% par rapport à FastWAM. Sur 79 essais en boucle fermée par méthode, il obtient la meilleure coordination corps entier et la meilleure robustesse au déplacement de la base parmi les systèmes comparés, tandis que le taux de complétion des tâches reste comparable au meilleur système de référence, sans amélioration nette sur ce critère précis. L'apport principal tient à la séparation explicite du mouvement propre de la caméra (lié au déplacement de la base) des actions du bras, un problème que les modèles monde-action existants, conçus pour des plateformes à base fixe, ignorent largement. Pour les intégrateurs travaillant sur des robots mobiles à bras (quadrupèdes ou plateformes à roues), cela suggère qu'un modèle de prédiction vidéo pré-entraîné peut être adapté à moindre coût, via peu de paramètres, plutôt que réentraîné intégralement pour gérer un point de vue mobile. Le résultat reste toutefois nuancé: les gains portent sur la coordination et la robustesse mesurées en simulation de rejeu, pas sur un saut de performance en complétion de tâche réelle. Le travail se positionne comme une extension aux plateformes mobiles des modèles monde-action initialement développés pour bras fixes, sans nommer de backbone concurrent autre que FastWAM ni d'entreprise partenaire. Il s'agit d'une contribution académique publiée en prépublication, sans annonce de déploiement commercial ni de calendrier de mise en production; le jeu de données ARMDOG pourrait toutefois servir de futur benchmark pour la manipulation mobile corps entier.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
3arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
JAMB : la diffusion conjointe action-mouvement pour la manipulation bimanuelle
4arXiv cs.RO 

JAMB : la diffusion conjointe action-mouvement pour la manipulation bimanuelle

JAMB (Joint Action-Motion Diffusion for Bimanual Manipulation) est une nouvelle politique de diffusion pour la manipulation robotique à deux bras, décrite dans un article publié le 23 septembre 2026 sur arXiv (2609.25322v1). Sa particularité est de débruiter simultanément, au sein d'un même Transformer partagé, les actions bimanuelles et les trajectoires 3D futures de points de la scène, les deux hypothèses s'informant mutuellement tout au long du processus de débruitage grâce à un système de coordonnées spatiotemporelles commun. L'équipe a testé JAMB sur 16 tâches de manipulation bimanuelle dans le simulateur RoboTwin 2.0 ainsi que sur un robot réel pour 3 tâches. En simulation, JAMB atteint un taux de succès moyen de 83,4 %, soit 23,9 points de pourcentage de plus que la meilleure référence testée. En conditions réelles, il dépasse les politiques n'utilisant que l'action de 50,0 points et les méthodes de prédiction géométrique auxiliaire de 21,2 points. Le site du projet est accessible à jam-bimanual.github.io. L'enjeu identifié par les auteurs est spécifique à la bimanualité : le mouvement d'un bras modifie la scène 3D partagée et affecte donc l'autre bras, un couplage que la plupart des politiques de diffusion ignorent, se contentant de générer des actions sans modéliser leurs conséquences géométriques futures. Les approches prédictives existantes, elles, traitent l'état futur comme une simple supervision auxiliaire ou un conditionnement figé plutôt que comme un élément coévoluant avec l'action. En montrant qu'un couplage bidirectionnel actions/trajectoires améliore nettement la performance et surtout la généralisation à des scènes encombrées et des arrière-plans inédits, ce travail apporte un argument concret en faveur d'une modélisation géométrique explicite pour les politiques de type VLA appliquées à la manipulation à deux bras, un axe suivi de près par les équipes travaillant sur la robotique de manipulation fine. Le papier positionne JAMB face à des politiques action-only et à d'autres approches de prédiction géométrique auxiliaire reposant sur des représentations d'état et des objectifs d'apprentissage différents, en s'appuyant sur RoboTwin 2.0 comme benchmark de référence pour la manipulation bimanuelle simulée. Il s'agit à ce stade d'une contribution de recherche académique, validée en simulation et sur un nombre limité de tâches réelles, sans indication de déploiement industriel ni de partenaire commercial associé.

RecherchePaper
1 source