Aller au contenu principal
RecherchearXiv cs.RO 

MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient MobiAgent, un framework agentique à double boucle pour la manipulation mobile longue durée, c'est-à-dire des tâches en plusieurs étapes où un robot doit combiner déplacement et usage du bras. La boucle interne, active au déploiement, sépare le raisonnement de haut niveau du contrôle bas niveau grâce à des compétences atomiques composables. Des modèles vision-langage assurent une planification à horizon glissant et une « réflexion visuelle » sur l'état de la scène, afin de recomposer les compétences et de rattraper les erreurs. Ces compétences sont exécutées par des experts à flow-matching qui partagent un même backbone VLM. La boucle externe segmente et vérifie automatiquement les rollouts de déploiement, les regroupe par clustering pour découvrir de nouvelles compétences atomiques, puis affine la bibliothèque sans annotation humaine. Sur BEHAVIOR-1K, MobiAgent dépasse de 22,5 points de pourcentage la baseline π0.5-TA. Par recyclage autonome des données, le taux de succès passe de 7,5 % à 27,5 % sur RoboCasa, et de 32,5 % à 57,5 % sur le robot Astribot S1 en conditions réelles.

L'intérêt tient à deux verrous que les modèles VLA actuels n'ont pas levés. Ces modèles sont performants sur des tâches courtes, mais les erreurs d'exécution s'accumulent sur les séquences longues. La locomotion et le contrôle du bras entrent aussi en interférence de capacité lorsqu'une même politique doit tout apprendre. Les experts spécialisés sur backbone commun répondent à cette seconde difficulté tout en conservant la réutilisabilité. Le résultat le plus parlant pour un intégrateur est la boucle d'amélioration sans annotation : un système qui exploite ses propres échecs et succès de terrain réduit le coût de la collecte de démonstrations, premier poste de dépense des déploiements de manipulation. Les chiffres appellent toutefois à la prudence. Un passage à 27,5 % sur RoboCasa signifie que trois tâches sur quatre échouent encore. Les 57,5 % sur Astribot S1 viennent d'un seul robot et d'un jeu de tâches limité, dont la taille n'est pas précisée dans le résumé. On est donc face à un résultat de recherche, pas à un produit ni à un déploiement industriel.

Ce travail s'inscrit dans la montée des architectures hiérarchiques qui tentent de pallier les limites des VLA monolithiques comme π0.5 de Physical Intelligence. Il rejoint les approches à double système popularisées par Helix de Figure ou GR00T de NVIDIA, avec une différence : l'accent mis sur l'apprentissage continu en boucle fermée plutôt que sur une architecture figée. Les benchmarks choisis, RoboCasa et BEHAVIOR-1K, restent des environnements de simulation de tâches domestiques, et la transposition à des cadences industrielles reste à démontrer. La suite logique est une validation sur plus de robots, de tâches et d'environnements, avec des mesures de robustesse sur de longues périodes. Aucun pilote commercial ni calendrier n'est annoncé. L'article, publié sur arXiv sous la référence 2610.03476, est une préimpression qui n'a pas encore été évaluée par des pairs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon
1arXiv cs.RO 

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon

Une équipe de recherche a publié une version révisée (v2) sur arXiv (2503.22122) présentant REMAC, un framework de planification multi-robots pour des tâches de manipulation longues et complexes, piloté par des modèles vision-langage. Le système combine deux modules: une auto-réflexion qui vérifie les conditions avant et après chaque action pour détecter les erreurs de plan, et une auto-évolution qui adapte la stratégie selon le contexte réel de la scène, sans prompt spécifique à la tâche. Les auteurs ont bâti un environnement de test basé sur RoboCasa, avec 4 catégories de tâches, 27 variantes et plus de 50 objets, puis évalué REMAC avec quatre modèles de raisonnement comme moteurs de décision: DeepSeek-R1, o3-mini, QwQ et Grok3. Résultat revendiqué: +40% de taux de réussite moyen et +52,7% d'efficacité d'exécution face à une baseline à robot unique. L'enjeu visé est concret pour les intégrateurs: les approches actuelles reposent souvent sur une connaissance préalable de l'environnement ou des prompts taillés sur mesure, ce qui les rend fragiles dès qu'un imprévu survient, par exemple un robot chargé de poser une carotte dans un micro-ondes qui découvre que la porte est fermée. En permettant à un robot d'en solliciter un autre pour paralléliser les tâches après plusieurs cycles de réflexion, REMAC pointe vers une robotique multi-agents plus tolérante aux aléas de scène, un axe clé pour dépasser les démonstrations scénarisées et réduire le travail d'ingénierie de prompt lors du déploiement de flottes sur des tâches longues. Le travail s'inscrit dans la recherche sur la planification robotique assistée par grands modèles, aux côtés d'approches comme Pi-0 ou GR00T N2, mais REMAC mise sur un raisonnement multi-agents itératif plutôt que sur un modèle action de bout en bout, en s'appuyant sur des modèles de raisonnement généralistes existants plutôt qu'un modèle propriétaire dédié. Il s'agit pour l'instant d'un travail académique validé en simulation, sans déploiement matériel réel ni partenariat industriel annoncé; la publication de cette seconde version suggère une itération continue sur la méthode, sans calendrier communiqué pour un transfert vers des robots physiques.

RecherchePaper
1 source
SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
2arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon
3arXiv cs.RO 

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon

Publiée le 11 septembre 2026 sur arXiv sous la référence 2609.11308, une nouvelle architecture baptisée 2AM propose une autre méthode pour la manipulation robotique à long horizon, ces tâches multi-étapes qui exigent de se souvenir de ce qui a déjà été fait. Le système sépare strictement deux rôles : un agent multimodal conserve seul la mémoire de la tâche et traduit l'historique des interactions en instructions de sous-tâches en langage naturel, complétées par des indices optionnels en 2D (points de préhension, de dépose et de déplacement) ; un modèle d'action unique, basé uniquement sur des images RGB et sans état interne entre les épisodes, exécute le mouvement. Pour le rendre pilotable, les auteurs ont enrichi les démonstrations d'étiquettes d'indices structurées et entraîné le modèle avec abandon aléatoire de conditions, bruit spatial et décalage temporel, afin qu'il tolère des instructions imparfaites. Testé sur le benchmark LIBERO-Mem, sans profondeur, sans géométrie calculée en ligne ni déplacement d'objets planifié, 2AM atteint un taux de complétion moyen de 76,3 %, contre 14,8 % pour la meilleure référence publiée à ce jour, soit un gain de 61,5 points, avec 63,0 % de réussite au sens large et 11,8 % au sens strict. Ce résultat vise un problème méthodologique récurrent des systèmes agentiques actuels, qui combinent souvent des modèles vision-langage-action (VLA) avec planificateurs et outils géométriques, parfois appuyés par de la profondeur ou une géométrie calibrée : il devient difficile de savoir si les gains viennent d'observations plus riches, d'outils moteurs alternatifs ou de la politique elle-même, et si les échecs viennent de la politique ou d'une interface langagière mal spécifiée. En réduisant volontairement la panoplie d'outils au profit d'une interface à plus haute bande passante entre agent et modèle d'action, 2AM isole la variable de précision du pilotage. Le résultat suggère que la mémoire de tâche peut rester entièrement côté agent, sans être intégrée dans la politique d'action, un choix opposé à la tendance qui consiste à faire porter mémoire et raisonnement par un seul grand modèle entraîné de bout en bout. Pour les équipes qui développent des modèles d'action génératifs comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, ce travail introduit une hypothèse alternative : la capacité effective d'un modèle dépendrait autant de la précision avec laquelle il est piloté que de ce qu'il a appris à l'entraînement, ce qui interroge la course actuelle aux VLA toujours plus massifs. Le travail s'inscrit dans la lignée des benchmarks LIBERO, largement utilisés en apprentissage de politiques robotiques, dont LIBERO-Mem constitue une extension dédiée aux tâches à mémoire longue. Il se positionne en creux face aux architectures dominantes du secteur, qui empilent VLA, planificateurs symboliques et perception 3D pour gérer des séquences de manipulation complexes, une approche que la publication critique implicitement pour son opacité dans l'attribution des performances. Aucun déploiement matériel réel n'est mentionné : les résultats restent circonscrits à la simulation et au benchmark, sans validation sur robot physique ni pilote industriel annoncé. L'affiliation institutionnelle des auteurs et un calendrier de suite ne sont pas précisés, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit ou d'un partenariat commercial.

RechercheActu
1 source
DexPIE : amélioration stable des politiques de manipulation à partir de données réelles
4arXiv cs.RO 

DexPIE : amélioration stable des politiques de manipulation à partir de données réelles

Une équipe de chercheurs a publié DexPIE (Dexterous Policy Improvement from Experience), un framework de post-entraînement conçu pour améliorer les politiques de manipulation dextre après déploiement en conditions réelles. Présenté sur arXiv (2606.09615), le système atteint une amélioration de 37 % du taux de succès par rapport à la politique de référence entraînée par imitation pure, sur trois tâches de manipulation dextre à fort contact testées sur des mains robotiques réelles. L'approche combine trois mécanismes : un système d'intervention adapté aux mains dextres avec collecte multi-étapes de type DAgger (Dataset Aggregation), une inférence asynchrone dans l'espace d'action relatif pour réduire le bruit temporel entre les séquences de post-entraînement et les données de démonstration, et un indicateur de qualité continu qui conditionne la politique sur la qualité des données collectées en déploiement. Le verrou que DexPIE cherche à lever est structurel : les politiques entraînées uniquement par imitation accumulent des erreurs à chaque étape (compounding errors), et nécessitent des volumes considérables de données expertes pour être fiables. En permettant à la politique de s'améliorer à partir de ses propres rollouts en environnement réel, sans dépendre exclusivement d'un humain expert, DexPIE réduit ce goulot d'étranglement. L'introduction de l'espace d'action relatif couplé à l'inférence asynchrone est particulièrement notable : elle stabilise l'apprentissage du critique (value function) en alignant mieux les données collectées avec le comportement démontré, ce qui est non trivial sur des systèmes à haute dimensionnalité comme les mains multi-doigts. La manipulation dextre reste l'un des problèmes ouverts les plus difficiles de la robotique physique, loin derrière la locomotion en termes de maturité. Côté concurrents directs, les travaux récents de Physical Intelligence (pi0, Pi-0.5) et de Google DeepMind explorent également le fine-tuning de VLA (Vision-Language-Action models) sur données réelles, mais DexPIE cible spécifiquement les mains dextres, un segment où les acteurs comme Dexterous AI, Shadow Robot ou LEAP Hand fournissent le matériel mais où les frameworks d'amélioration post-déploiement restent rares. Le code source et le dataset seront rendus publics, ce qui facilitera la reproductibilité et pourrait accélérer l'adoption par d'autres équipes de recherche travaillant sur la manipulation fine.

RechercheOpinion
1 source