MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon
Des chercheurs publient MobiAgent, un framework agentique à double boucle pour la manipulation mobile longue durée, c'est-à-dire des tâches en plusieurs étapes où un robot doit combiner déplacement et usage du bras. La boucle interne, active au déploiement, sépare le raisonnement de haut niveau du contrôle bas niveau grâce à des compétences atomiques composables. Des modèles vision-langage assurent une planification à horizon glissant et une « réflexion visuelle » sur l'état de la scène, afin de recomposer les compétences et de rattraper les erreurs. Ces compétences sont exécutées par des experts à flow-matching qui partagent un même backbone VLM. La boucle externe segmente et vérifie automatiquement les rollouts de déploiement, les regroupe par clustering pour découvrir de nouvelles compétences atomiques, puis affine la bibliothèque sans annotation humaine. Sur BEHAVIOR-1K, MobiAgent dépasse de 22,5 points de pourcentage la baseline π0.5-TA. Par recyclage autonome des données, le taux de succès passe de 7,5 % à 27,5 % sur RoboCasa, et de 32,5 % à 57,5 % sur le robot Astribot S1 en conditions réelles.
L'intérêt tient à deux verrous que les modèles VLA actuels n'ont pas levés. Ces modèles sont performants sur des tâches courtes, mais les erreurs d'exécution s'accumulent sur les séquences longues. La locomotion et le contrôle du bras entrent aussi en interférence de capacité lorsqu'une même politique doit tout apprendre. Les experts spécialisés sur backbone commun répondent à cette seconde difficulté tout en conservant la réutilisabilité. Le résultat le plus parlant pour un intégrateur est la boucle d'amélioration sans annotation : un système qui exploite ses propres échecs et succès de terrain réduit le coût de la collecte de démonstrations, premier poste de dépense des déploiements de manipulation. Les chiffres appellent toutefois à la prudence. Un passage à 27,5 % sur RoboCasa signifie que trois tâches sur quatre échouent encore. Les 57,5 % sur Astribot S1 viennent d'un seul robot et d'un jeu de tâches limité, dont la taille n'est pas précisée dans le résumé. On est donc face à un résultat de recherche, pas à un produit ni à un déploiement industriel.
Ce travail s'inscrit dans la montée des architectures hiérarchiques qui tentent de pallier les limites des VLA monolithiques comme π0.5 de Physical Intelligence. Il rejoint les approches à double système popularisées par Helix de Figure ou GR00T de NVIDIA, avec une différence : l'accent mis sur l'apprentissage continu en boucle fermée plutôt que sur une architecture figée. Les benchmarks choisis, RoboCasa et BEHAVIOR-1K, restent des environnements de simulation de tâches domestiques, et la transposition à des cadences industrielles reste à démontrer. La suite logique est une validation sur plus de robots, de tâches et d'environnements, avec des mesures de robustesse sur de longues périodes. Aucun pilote commercial ni calendrier n'est annoncé. L'article, publié sur arXiv sous la référence 2610.03476, est une préimpression qui n'a pas encore été évaluée par des pairs.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




