Aller au contenu principal
RecherchearXiv cs.RO 

Un parmi l'infini : transformer les futurs d'un modèle du monde préentraîné en actions de robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent RoboActualizer, une architecture qui transforme un modèle de monde vidéo préentraîné en politique robotique exécutable sans ré-entraîner son lourd backbone. Le principe, baptisé « actualisation », consiste à geler l'encodeur du modèle de monde et à n'entraîner par-dessus qu'un module léger, chargé de sélectionner, parmi les futurs plausibles qu'encode le modèle, celui qui correspond à la tâche demandée, puis d'en extraire les actions. L'actualiseur repose sur deux experts DiT (diffusion transformers) légers qui prédisent conjointement les latents futurs et les actions par flow matching. Il compte à partir de 60 millions de paramètres, s'entraîne sur un seul GPU avec 32 Go de mémoire au pic, et affiche une latence de 39 ms, compatible avec le contrôle temps réel. Les auteurs revendiquent jusqu'à 100 fois moins de paramètres entraînables que les modèles monde-action (WAM) et les VLA existants. Les résultats portent sur les benchmarks de simulation LIBERO, LIBERO-Plus et RoboTwin 2.0, ainsi que sur cinq tâches réelles menées sur deux plateformes. L'abstract ne chiffre pas les taux de réussite et ne nomme ni les plateformes ni les modèles comparés.

L'enjeu est d'abord économique. Les approches actuelles adaptent le backbone entier d'un modèle de monde avec de grands jeux de données robotiques et de gros budgets de calcul, ce qui réserve ce type de recherche aux laboratoires les mieux dotés. Si l'hypothèse des auteurs tient, à savoir que le coût principal a déjà été payé lors du préentraînement vidéo, un intégrateur ou une équipe universitaire pourrait spécialiser une politique sur une seule carte graphique, sans infrastructure de cluster. Ce serait un argument sérieux pour les VLA à backbone gelé et pour la réutilisation de modèles de monde comme socle commun. Il faut toutefois rester prudent : l'évaluation réelle se limite à cinq tâches, LIBERO est un benchmark proche de la saturation, et l'expression « gréât performance » ne dit rien de l'écart avec les meilleurs modèles entièrement affinés. La robustesse hors distribution et la généralisation à des tâches longues restent à démontrer.

Ce travail s'inscrit dans la convergence entre modèles de monde vidéo et politiques robotiques, où des approches WAM et des VLA comme Pi-0 ou GR00T ont montré que le préentraînement sur vidéo transfère des connaissances physiques utiles. Ces méthodes ont cependant tendance à croître en taille, ce qui pose des problèmes de latence et de coût de déploiement. RoboActualizer prend le contre-pied en visant l'efficacité, un critère central pour le contrôle embarqué. Il s'agit ici d'un préprint (arXiv, version 1) non évalué par les pairs, sans produit ni déploiement industriel annoncés. Les prochaines étapes à surveiller sont la publication du code et des poids, des comparaisons directes avec des VLA de référence à budget de calcul égal, et des tests sur des plateformes et des tâches plus variées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ProtoAct : transformer les protocoles de laboratoire humide en actions robotiques incarnées
1arXiv cs.RO 

ProtoAct : transformer les protocoles de laboratoire humide en actions robotiques incarnées

Les protocoles de laboratoire biologique sont rédigés pour des chercheurs formés et laissent souvent implicites les opérations de routine, les conditions dépendantes de l'état du système et les paramètres contextuels, ce qui les rend difficiles à traduire en actions exécutables par un robot. Des chercheurs présentent ProtoAct, un framework structuré qui convertit des procédures biologiques en texte libre en séquences d'actions adaptées à l'exécution robotique. Le système combine trois modules : ProtoRAG, qui récupère des exemples annotés manuellement pour un parsing sensible au contexte, RefineChecker, qui détecte et corrige les étapes manquantes ou incohérentes, et ActSchema, qui transforme la procédure raffinée en séquences JSON contraintes de fonctions exécutables. Pour évaluer l'approche, les auteurs ont constitué BioP2E, un jeu de données comprenant 22 protocoles de culture cellulaire annotés manuellement, décomposés en 258 conditions de surveillance, 910 sous-tâches exécutables et 962 appels d'action ancrés dans le monde physique. Les tests couvrent sept grands modèles de langage différents comme backbone. Cette publication cible un problème concret pour l'automatisation en biotechnologie : la majorité des protocoles de laboratoire existants ne sont tout simplement pas lisibles par une machine sans réécriture manuelle coûteuse, ce qui freine le déploiement de robots dans les laboratoires humides (wet labs). En démontrant qu'un pipeline de parsing structuré peut produire des sous-tâches exploitables pour entraîner des modèles vision-langage-action (VLA) et obtenir une exécution réussie à la fois en simulation et sur robot réel, ProtoAct apporte une preuve de concept que l'automatisation de laboratoire peut s'appuyer sur les protocoles existants plutôt que sur des réécritures ad hoc, un enjeu pertinent pour la recherche pharmaceutique et l'automatisation scientifique. Les auteurs situent leur contribution dans la lignée des travaux combinant génération augmentée par récupération (RAG) et modèles de langage pour le raisonnement procédural, appliqués ici à un domaine peu couvert jusqu'ici : la biologie expérimentale. Les ablations menées montrent que la récupération contextuelle, la vérification a posteriori et les contraintes de schéma apportent chacune une contribution complémentaire, sans qu'aucun de ces éléments seul ne suffise. Le papier ouvre la voie à une intégration plus large avec des systèmes de collecte de démonstrations pour l'entraînement de modèles VLA en laboratoire.

RecherchePaper
1 source
JailWAM : pirater les modèles d'action du monde dans le contrôle robotique
2arXiv cs.RO 

JailWAM : pirater les modèles d'action du monde dans le contrôle robotique

Des chercheurs ont publié JailWAM, premier framework d'évaluation de jailbreak conçu spécifiquement pour les World Action Models (WAM), ces modèles qui pilotent directement des robots manipulateurs à partir d'instructions en langage naturel. Décrit dans un article déposé sur arXiv (identifiant 2604.05498, version 2), le système repose sur trois composants. Le premier, Visual-Trajectory Mapping, convertit les sorties d'action hétérogènes de différentes architectures de WAM en une représentation de trajectoire visuelle commune, ce qui permet de comparer des modèles différents sur une même base. Le deuxième, un Risk Discriminator, classe les résultats selon trois niveaux de gravité physique croissante : conformité de sécurité, échec de mouvement, et risque catastrophique. Le troisième, une Dual-Path Verification Strategy, combine un tri rapide des candidats d'attaque avec une simulation physique en boucle fermée réservée aux cas jugés dangereux, afin de réduire le coût de calcul. Testé dans l'environnement de simulation RoboTwin, JailWAM atteint un taux de réussite d'attaque de 84,2 % contre le modèle LingBot-VA. Ce résultat illustre concrètement que les WAM, censés traduire fidèlement des consignes en gestes physiques sûrs, restent vulnérables à des instructions adversariales capables de provoquer des comportements dangereux du bras ou du robot. Pour les intégrateurs industriels et les décideurs qui envisagent de déployer ces modèles vision-langage-action en usine ou en entrepôt, l'étude rappelle qu'aucun garde-fou standardisé n'existe encore contre ce type d'attaque, contrairement au red-teaming déjà bien établi pour les grands modèles de langage textuels. Le chiffre de 84,2 % a toutefois été obtenu en simulation, pas sur du matériel physique réel, ce qui laisse ouverte la question d'un éventuel écart sim-to-real ; la tendance qu'il révèle sur la fragilité de l'alignement sécuritaire des WAM reste néanmoins significative. Ce travail s'inscrit dans la vague de recherche sur les modèles vision-langage-action qui équipent la nouvelle génération de robots humanoïdes et de bras manipulateurs, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix. JailWAM transpose au monde physique des méthodologies de jailbreak déjà développées pour les modèles de langage textuels. Les auteurs appellent explicitement à davantage de recherche sur l'évaluation de sécurité et l'alignement des systèmes robotiques embarqués, signe d'un besoin encore naissant de standards de certification avant tout déploiement industriel à grande échelle. Aucun acteur français ou européen du secteur n'apparaît dans cette étude.

RechercheActu
1 source
Robot mobile-manipulateur unifié : ABot-M0.5 présente un modèle d'action du monde
3arXiv cs.RO 

Robot mobile-manipulateur unifié : ABot-M0.5 présente un modèle d'action du monde

Des chercheurs présentent ABot-M0.5, un nouveau "World Action Model" (WAM) conçu pour la manipulation mobile, cette capacité qui combine navigation et manipulation d'objets chez un robot généraliste. Publié sur arXiv début juillet 2026, l'article part d'un constat : les politiques VLA actuelles restent réactives et sans modélisation explicite du monde, tandis que les WAM existants sont mal adaptés à la manipulation mobile car ils traitent des séquences vidéo trop grossières, mélangent les actions de navigation et de manipulation, et entraînent leur dynamique inverse avec une supervision qui ne correspond pas aux conditions réelles d'inférence autorégressive. Pour y remédier, ABot-M0.5 introduit des "actions latentes intermédiaires" qui capturent les transitions visuelles locales et servent de pont entre les représentations vidéo et les commandes propres à chaque robot. Le modèle repose aussi sur une architecture de type Mixture-of-Transformers à deux niveaux, séparant les modalités et les sous-espaces d'action hétérogènes (déplacement de la base d'un côté, manipulation du bras de l'autre). Enfin, une stratégie d'entraînement baptisée "dream-forcing" entraîne progressivement la dynamique inverse sur des vidéos générées par le modèle lui-même plutôt que sur les seules trajectoires réelles, ce qui rapproche les conditions d'entraînement et de test. Les auteurs revendiquent des résultats état de l'art sur des benchmarks de manipulation mobile et de manipulation fine, tant sur le taux de réussite des tâches longues que sur la précision de contrôle. Pour l'industrie robotique, ce travail s'attaque à un problème connu et bloquant : l'accumulation d'erreurs lors des déplacements longs, causée par un décalage entre l'entraînement (sur trajectoires vérité terrain) et l'exécution réelle, où le robot doit composer avec ses propres erreurs qui s'accumulent. Si la méthode tient ses promesses au-delà des benchmarks internes, elle constituerait une avancée utile pour les intégrateurs visant des robots mobiles capables d'enchaîner navigation, saisie et dépose sur plusieurs étapes, un scénario bien plus exigeant que la simple manipulation statique sur table. Il s'agit toutefois d'un préprint arXiv non encore relu par les pairs, sans institution ni entreprise clairement identifiée dans le résumé, et les métriques de "état de l'art" reposent sur des comparaisons choisies par les auteurs eux-mêmes. Une réplication indépendante sera nécessaire avant de juger de la portée réelle de cette approche face aux autres travaux sur les modèles monde appliqués à la robotique.

RechercheActu
1 source
Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement
4arXiv cs.RO 

Transformer Transformer : un modèle unifié pour la co-conception de robots conditionnée par le mouvement

Une équipe de recherche publie sur arXiv (2607.25798v1) un nouveau modèle baptisé Transformer Transformer, conçu pour la co-conception de robots conditionnée par le mouvement. L'idée : générer automatiquement des architectures robotiques complètes capables de suivre des trajectoires d'effecteur cibles issues de démonstrations humaines, tout en optimisant des fonctions de récompense définies par l'utilisateur. Le système repose sur les RoboTokens, une tokenisation unifiée des morphologies, états et actions des robots, qui permet à une seule architecture de diffusion transformer de fonctionner sur des espaces d'embodiment très différents : robots bimanuels à roues, quadrupèdes, humanoïdes. Plutôt que d'optimiser pour une récompense unique, le modèle agit comme un modèle de dynamique générique, dont les prédictions d'état et d'action servent ensuite à calculer des valeurs spécifiques à chaque objectif, via une procédure nommée Dynamics Self-Guidance qui guide la diffusion vers des designs à haute valeur. Preuve concrète : les chercheurs ont fabriqué une version optimisée de la plateforme ALOHA, réduisant l'erreur de suivi de trajectoire de plus de 70 % par rapport au design d'origine. L'intérêt pour le secteur tient à ce que la conception mécanique des robots reste largement découplée du contrôle et de l'apprentissage, alors que la performance en manipulation dépend fortement de l'embodiment. Un modèle capable d'optimiser en zero-shot pour des récompenses et trajectoires jamais vues, plus rapidement qu'une baseline évolutionniste, ouvre la voie à des cycles de co-conception matériel-logiciel beaucoup plus rapides pour les intégrateurs et les fabricants de bras ou de plateformes bimanuelles. C'est un signal supplémentaire que les architectures de type transformer/diffusion, déjà dominantes pour les politiques VLA, s'étendent maintenant à la conception physique elle-même, et pas seulement au contrôle. Le travail s'inscrit dans la lignée de la recherche sur la co-conception robotique, historiquement dominée par des algorithmes évolutionnistes coûteux en calcul et spécifiques à une seule récompense. ALOHA, plateforme bimanuelle open source popularisée par les travaux de Stanford et Google, sert ici de banc d'essai matériel concret plutôt que de simple simulation. Le papier ne précise pas de calendrier de déploiement industriel ni de partenaire, il s'agit à ce stade d'un résultat de recherche fraîchement publié, dont la portée reste à confirmer sur des espaces de conception plus larges.

RecherchePaper
1 source