Aller au contenu principal
RecherchearXiv cs.RO 

EWAM : spécialisation émergente par profondeur dans un modèle incarné unifié, de la compréhension sémantique à l'action via la prévision visuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (identifiant 2609.39973, première version) EWAM, un modèle embodied unifié « centré sur l'action ». Il combine deux familles de politiques robotiques. Les VLA (vision-language-action) privilégient la compréhension sémantique. Les WAM (world-action models) apprennent des représentations prédictives de la dynamique de l'environnement. Selon les auteurs, les systèmes qui exposent une politique à ces deux sources concentrent souvent le calcul d'action sur un seul expert. EWAM s'appuie sur une attention conjointe asymétrique. À chaque couche, les tokens d'action lisent l'information sémantique, la vision courante, les images futures prédites et les autres tokens d'action, tandis que les experts perceptifs gardent leurs rôles distincts. Le modèle est pré-entraîné dans deux régimes séparés : des trajectoires robotiques multi-embodiments, et de la vidéo égocentrique humaine. Il dépasse, en simulation et sur robot réel, les baselines VLA, WAM et hybrides. L'abstract ne donne ni chiffres de performance, ni nom des baselines, ni robots utilisés, ni volume de données.

Le résultat le plus marquant est une spécialisation émergente par profondeur, apparue sans supervision par couche. Les requêtes d'action regardent surtout les features vision-langage dans les couches superficielles, les images futures prédites dans les couches intermédiaires, puis leurs propres tokens dans les couches profondes. Ce schéma se reproduit d'une tâche à l'autre et reste stable au fil des étapes de débruitage. Le suivi de checkpoints et des interventions causales indiquent qu'il est appris et que la génération d'action en dépend. Pour les intégrateurs et les équipes R&D, l'enjeu est de savoir si la prédiction visuelle est réellement utilisée par la politique ou ne sert que d'objectif auxiliaire : ici, elle l'est apparemment. Les données humaines égocentriques améliorent le transfert entre embodiments et la robustesse sur robot réel, et la supervision par phases de sous-tâches améliore l'achèvement des tâches longues. Ces points restent des affirmations de preprint, non évaluées par des pairs et sans chiffres publics dans le résumé. Aucune preuve de déploiement industriel n'est avancée.

Le travail s'inscrit dans la convergence entre VLA (de type Pi-0, GR00T) et modèles du monde générant de la vidéo prédictive, avec en toile de fond l'usage croissant de la vidéo humaine pour contourner le coût de la téléopération. Ce que les auteurs appellent une progression ordonnée « de la compréhension sémantique à la prévision visuelle puis à l'action » est une interprétation fondée sur l'analyse de l'attention, pas une garantie de performance en production. Les suites logiques sont la publication des chiffres complets, du code et des poids, puis une réplication sur d'autres architectures et des tâches plus longues. C'est à ce stade que l'on pourra juger si l'avantage tient hors du banc d'essai des auteurs.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

CogWAM : aligner la cognition sémantique et la modélisation du monde et de l'action via des interfaces événementielles
1arXiv cs.RO 

CogWAM : aligner la cognition sémantique et la modélisation du monde et de l'action via des interfaces événementielles

CogWAM, un modèle « monde-action » (world-action model) guidé par la cognition, est décrit dans un preprint arXiv (2609.37721v1). Son principe est de placer entre le raisonnement sur la tâche et l'apprentissage monde-action une interface sémantique explicite, appelée Semantic State. Cet état persistant mémorise les événements de la tâche déjà accomplis et la sous-tâche active. Il n'est mis à jour que lorsque les observations signalent une transition sémantique, si bien que le contexte de tâche survit à plusieurs séquences d'actions (action chunks). Deux familles de requêtes conditionnées par la progression, WORLD et ACTION, extraient l'information utile à la prédiction du futur et à la génération des commandes. À l'entraînement, le Semantic State fournit un contexte de progression commun aux deux branches. À l'inférence, la branche de prédiction est supprimée et les actions sont produites directement à partir des observations et de l'état maintenu. Sans pré-entraînement supplémentaire sur des actions de robot, le modèle atteint 15,56 de score et 11,70 % de taux de succès sur RoboDojo, et revendique l'état de l'art sur BiCoord. Les essais réels portent sur de la manipulation bimanuelle en boucle fermée, avec 16,4 régénérations du Semantic State en moins qu'une mise à jour à chaque pas de temps. Le texte ne précise ni la base de comparaison de ce chiffre, ni le nombre d'essais, ni les tâches réelles. L'intérêt tient à un problème connu des politiques robotiques récentes : additionner raisonnement sémantique et prédiction du monde futur ne garantit pas que les prédictions locales et les actions restent cohérentes avec l'avancement de la tâche. En rendant la progression explicite et en ne la recalculant que sur événements, CogWAM vise aussi le coût de calcul, puisque retirer la branche de prédiction à l'inférence allège le déploiement. Pour un intégrateur, la persistance du contexte sur des tâches longues à deux bras est le vrai sujet, plus que le score. Il faut cependant relativiser. Un taux de succès de 11,70 % sur RoboDojo reste très bas en valeur absolue, et ce type de benchmark simulé ne dit rien de la fiabilité en production. Aucun temps de cycle, aucune plateforme matérielle ni aucun taux de succès réel ne sont fournis. On reste au stade de la recherche académique, pas d'un produit ni d'un déploiement. Ce travail s'inscrit dans la convergence entre modèles vision-langage-action (VLA), tels que Pi-0, GR00T ou Helix, et modèles du monde qui prédisent les observations futures. Le premier ensemble apporte la généralisation sémantique. Le second apporte une représentation de la dynamique physique. La difficulté est de les faire coopérer sur des horizons longs. CogWAM propose une réponse par une mémoire d'événements structurée, là où d'autres approches s'appuient sur des planificateurs hiérarchiques ou sur des contextes visuels longs. Le preprint ne mentionne aucun pilote, aucune diffusion de code ni aucun calendrier. Les prochaines étapes à surveiller sont une évaluation sur davantage de tâches réelles, des comparaisons directes avec les VLA de référence et une éventuelle publication des poids.

RecherchePaper
1 source
AtomEgo : intégration de la vision égocentrique dans le pré-entraînement des modèles fondation pour l'IA incarnée
2arXiv cs.RO 

AtomEgo : intégration de la vision égocentrique dans le pré-entraînement des modèles fondation pour l'IA incarnée

Une équipe de recherche présente AtomEgo, une étude systématique sur l'entraînement conjoint de modèles fondation robotiques à partir de vidéo égocentrique humaine et de démonstrations robotiques, déposée sur arXiv sous la référence 2609.21461. Le corpus assemblé représente environ 2 659 heures de vidéo égocentrique, traitées via un pipeline de données conçu pour passer à l'échelle. Les auteurs testent trois paradigmes sur des architectures vision-langage-action (VLA) et des modèles monde-action : co-entraînement conjoint avec des têtes d'action spécifiques par domaine, transfert progressif ego-vers-robot par alignement d'embodiment, et modélisation conjointe vidéo-action. Ces approches sont évaluées par des expériences multi-tâches sur robots réels et par une analyse de représentation cross-embodiment conditionnée par le langage. Le résultat central tient en une formule simple : le gain de capacité résulte de l'échelle des données multipliée par la qualité de leur alignement. Les données humaines égocentriques améliorent la généralisation des robots, mais seulement si leur intégration est alignée avec l'espace d'action robotique, pas par simple accumulation de volume. Ce constat tempère une hypothèse répandue dans le secteur, celle qui veut que les modèles VLA, à l'image de Pi-0, GR00T N2 ou Helix, comblent le manque de démonstrations robotiques réelles en aspirant des volumes massifs de vidéo humaine issue d'internet. Pour les intégrateurs et laboratoires qui bâtissent des pipelines de pretraining, le message est opérationnel : la méthode d'alignement compte davantage que le volume brut de vidéo, ce qui questionne le narratif du scaling pur comme solution suffisante au problème des données. Ce travail s'inscrit dans la course des laboratoires et industriels de la robotique humanoïde et manipulatrice à exploiter des sources de données alternatives face à la rareté des démonstrations robotiques réelles, coûteuses et lentes à collecter comparées aux corpus vidéo humains disponibles à grande échelle. AtomEgo reste à ce stade une publication de recherche non encore revue par les pairs, et non un produit ou pipeline commercial déployé, ce qui la distingue des annonces d'entreprises comme celles associées à Figure 03, Optimus ou aux modèles GR00T N2 de Nvidia. Les auteurs présentent leur pipeline et leurs trois paradigmes comme un cadre reproductible destiné à guider les prochains efforts de pretraining ego-robot à grande échelle, sans annoncer de calendrier de déploiement industriel ni de partenariat avec un fabricant de robots.

RecherchePaper
1 source
AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins
3arXiv cs.RO 

AquaWAM : un modèle du monde et d'action sensible à la dynamique pour agents incarnés sous-marins

Des chercheurs publient sur arXiv (v2, référence 2609.33299) AquaWAM, présenté comme le premier World Action Model (WAM) conçu pour des agents sous-marins. Un WAM permet à un robot d'anticiper les conséquences d'une action candidate avant de l'exécuter. Les WAM existants prédisent surtout des observations visuelles conditionnées par l'action. AquaWAM prédit à la place des états de navigation compacts. Il modélise la dynamique commandée et la dynamique passive: zone morte des propulseurs, glissement inertiel qui dépasse chaque commande, courants ambiants. Il perçoit via un DVL (capteur de vitesse Doppler), une centrale inertielle (IMU), un capteur de pression et des encodeurs d'articulations. Les caméras ne servent qu'à fournir la sémantique, c'est-à-dire les objectifs et la pose de la cible. Sur le benchmark USIM (20 tâches sous-marines), le modèle atteint 72,6 % de succès. Il décide 2,7 fois plus vite que U0 sur un NVIDIA Jetson AGX Orin. Sans les mesures de vitesse du DVL, il conserve 61,6 % de succès, contre 39,4 % pour U0. Ces résultats visent une hypothèse répandue dans les modèles du monde, selon laquelle prédire des pixels serait la voie générique vers le contrôle. Sous l'eau, l'inertie, la flottabilité, la traînée et la dérive continuent d'agir après la commande. Modéliser directement ces effets, plutôt que la scène, réduit la taille du modèle et le coût de calcul. La vitesse d'inférence sur Jetson AGX Orin, un module embarqué courant, compte pour les intégrateurs d'ROV et d'AUV, dont le calcul et l'énergie sont limités. La robustesse à la perte de capteurs répond à un problème opérationnel: un DVL perd son verrouillage sur le fond, et les eaux turbides dégradent la vision. L'écart entre 61,6 % et 39,4 % suggère une meilleure tolérance à la dégradation, à confirmer hors simulation. Il faut toutefois lire ces chiffres avec prudence. Les résultats proviennent d'un benchmark en simulation, USIM. L'abstract ne mentionne ni essai en bassin ni essai en mer. Il ne dit pas non plus si le comparatif avec U0 est réalisé à budget équivalent. Le résumé ne précise pas non plus l'écart de réalité entre simulation et milieu réel pour des courants variables. Le travail s'inscrit dans l'extension des WAM et des modèles vision-langage-action (VLA) au-delà des manipulateurs terrestres et des humanoïdes, vers des véhicules à dynamique passive marquée. U0 sert ici de référence pour l'embarqué sous-marin. Aucun acteur français ou européen n'est cité dans l'abstract. Les suites probables sont des validations en conditions réelles, l'ouverture éventuelle du code et des tests sur des véhicules physiques. Ce travail reste pour l'instant une publication de recherche, sans produit ni déploiement annoncé.

RecherchePaper
1 source
IA incarnée : une méthode multimodale intégrant la perception de profondeur pour la compréhension référentielle
4arXiv cs.RO 

IA incarnée : une méthode multimodale intégrant la perception de profondeur pour la compréhension référentielle

Des chercheurs ont publié sur arXiv (référence 2510.08278, troisième révision) un framework baptisé ERU (Embodied Reference Understanding) conçu pour qu'un robot identifie avec précision un objet cible dans une scène visuelle, en combinant deux types d'instructions : des commandes en langage naturel et des gestes de pointage humain. Le système repose sur trois composants intégrés : une augmentation de données pilotée par LLM, une modalité de carte de profondeur (depth map), et un module de décision depth-aware. Les évaluations sur deux jeux de données distincts montrent des performances supérieures aux baselines existantes sur la tâche de détection de référent, sans que les auteurs publient de métriques chiffrées précises dans le résumé accessible. Le problème que cette recherche cible est concret et bien documenté dans l'industrie : lorsqu'un opérateur pointe du doigt "ce carton" dans un entrepôt encombré où plusieurs cartons similaires sont présents, les systèmes actuels de détection open-vocabulary échouent fréquemment à désambiguïser la cible. Intégrer la profondeur comme modalité supplémentaire permet de différencier des objets coplanaires ou superposés que la seule vision 2D confond. Pour les intégrateurs développant des interfaces homme-robot (HRI) en environnement industriel ou logistique, c'est une brique utile : réduire le taux d'erreur de saisie sur instruction mixte gestuelle/verbale diminue directement les interventions humaines correctives sur les lignes de picking. Sur le plan académique, ce travail s'inscrit dans la continuité des VLA (Vision-Language-Action models) et des architectures open-vocabulary comme GLIP, GDINO ou OWL-ViT, en y ajoutant l'ancrage spatial via depth sensing. Aucun acteur industriel nommé n'est associé à cette publication, qui reste une contribution de recherche fondamentale sans déploiement annoncé. Les concurrents directs sur la tâche ERU incluent des travaux issus de Stanford, CMU et des laboratoires chinois actifs sur la manipulation guidée par langage. Les prochaines étapes naturelles seraient une validation sur robot physique et une intégration dans des pipelines de manipulation temps réel, domaine où des acteurs comme Physical Intelligence (pi) ou 1X Technologies testent déjà des approches VLA proches.

RecherchePaper
1 source