
LM-X : modélisation explicable des actions par prédiction de progression, d'événements et d'incertitude pour la manipulation robotique généraliste
Un nouveau preprint arXiv (2608.25757, aout 2026) présente LM-X, un modèle vision-langage-action (VLA) pour la manipulation robotique généraliste. Contrairement aux politiques VLA classiques qui ne prédisent que l'action a court terme, LM-X génère en continu trois signaux explicites pendant l'exécution: le "return-to-go" (RTG), qui mesure la progression visible de la tache, l'"évent-to-go" (ETG), qui anticipe la prochaine transition sémantique, et un flux d'action heteroscedastique, qui estime la fiabilité locale via une variance propagée. Avant de lancer un preentrainement couteux de 20 jours sur 64 GPU Nvidia B200, les auteurs ont valide l'architecture sur un test contrôle a cinq taches: le modèle complet améliore le taux de réussite de 16,0 points par rapport a un backbone action seule, et de 10,8 points par rapport a la meilleure variante a une seule tête de prédiction. Le modèle final a ensuite été entraine sur plus de 20 000 heures de trajectoires robot réelles, dont plus de 1 000 heures d'échecs de politiques antérieures. Sur 50 taches durcies et randomisées du benchmark RoboTwin2.0, LM-X atteint 74,1% de réussite contre 55,4% pour GR00T N1.7 de Nvidia, et 68,6% contre 50,7% sur sept taches exécutées en robot réel.
L'intérêt ne tient pas qu'au score brut face a GR00T N1.7: LM-X expose des états internes normalement caches dans les politiques VLA, ou une seule cible d'action doit implicitement porter la progression, l'intention et la fiabilité du geste. Le RTG suit la progression sémantique et détecte les régressions visibles, tandis que la variance grimpe pendant les hésitations ou les oscillations de commande. Pour un intégrateur ou un responsable fiabilité, ce type de signal pourrait permettre de détecter un échec avant qu'il ne se produise plutôt que de le constater après coup, un argument concret pour la supervision et la sécurité en environnement industriel.
Le travail s'inscrit dans la compétition croissante autour des politiques de manipulation généralistes, aux cotes de familles comme GR00T de Nvidia, Pi-0 de Physical Intelligence ou Helix de Figure. L'abstract ne précise ni l'institution ni l'entreprise porteuse du projet, et il s'agit a ce stade d'un preprint de recherche, sans produit commercialise ni déploiement industriel annonce: la comparaison reste limitée a GR00T N1.7 et aux benchmarks présentes par les auteurs eux-mêmes, ce qui appelle une lecture prudente en attendant une évaluation indépendante.




