Aller au contenu principal
ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot
RecherchearXiv cs.RO 

ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (arXiv:2607.04162v1) ACE, pour Agentic Control for Embodied Manipulation, un cadre de raisonnement en zero-shot destiné à la manipulation d'objets sur table à partir d'instructions en langage naturel. Plutôt que de faire correspondre directement le langage à des actions motrices bas niveau, comme le font la plupart des politiques VLA de bout en bout, ACE orchestre un raisonnement de type workflow agentique couplé à deux compétences robotiques réutilisables : une interface de repérage visuel et une primitive générique de saisie-dépose. Le sous-objectif actif est traduit en un masque visuel qui désigne à la fois l'objet cible et sa destination, masque qui est suivi dans le temps, exposé à la vérification humaine, puis transmis à une politique d'exécution indépendante de la tâche. Le système fonctionne en boucle fermée grâce à une mémoire multi-échelle temporelle qui vérifie après chaque action si le sous-objectif a réussi, avant de décider de poursuivre, réessayer, corriger ou replanifier. Sur des tâches longues et logiquement complexes, comme la formation d'équations avec des cubes numérotés ou la récupération d'objets sous contrainte, ACE atteint 50% de réussite pour la formation d'équations et 70% pour la récupération sous contrainte, quand les approches de bout en bout classiques échouent largement sur ces mêmes tâches.

Ce résultat cible un point de friction précis du secteur : la capacité d'un système à généraliser à des scènes et contraintes sémantiques inédites sans réentraînement spécifique à la tâche, ce qui reste l'un des principaux écarts entre les démonstrations en laboratoire et un déploiement robuste en environnement réel. En montrant qu'un raisonnement explicite par étapes, combiné à un contrôle médié par masque, surpasse des politiques end-to-end sur des tâches à horizon long, ACE apporte un argument concret pour les intégrateurs et équipes de R&D qui cherchent des architectures de manipulation capables de gérer l'échec d'exécution et la correction humaine en cours de tâche, plutôt que de miser uniquement sur l'échelle des données d'entraînement.

ACE s'inscrit dans la lignée des travaux récents sur les architectures agentiques pour la robotique, qui cherchent à combiner les capacités de raisonnement des grands modèles de langage avec des compétences robotiques modulaires et vérifiables, en alternative aux politiques VLA monolithiques comme Pi-0 ou GR00T. Les auteurs positionnent explicitement leur approche contre des baselines de bout en bout sur les mêmes bancs d'essai, mais l'évaluation reste limitée à des scénarios de manipulation tabletop en conditions contrôlées, sans indication de déploiement industriel ni de partenariat annoncé à ce stade.

Dans nos dossiers

À lire aussi

ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel
1arXiv cs.RO 

ProAct : génération de mouvement en flux continu et raisonnement à base d'agents pour l'interaction sociale incarnée en temps réel

Une preprint arXiv révisée (2602.14048v2) présente ProAct, un framework a double système pour l'interaction sociale incarnée en temps réel, déployé sur un robot humanoïde. L'architecture associe un « Systeme Comportemental » a faible latence, qui génère en continu parole, gestes et mouvements, a un « Systeme Cognitif » plus lent, dote d'une mémoire et d'un module de prédiction de la motivation de l'utilisateur, qui analyse dialogue et contexte visuel pour décider quand prendre l'initiative plutôt que réagir. Le mouvement est produit par un modèle en flow-matching conditionne par l'intention, avec une branche ControlNet découplée qui traduit les décisions cognitives en gestes non verbaux sans casser la fluidité de l'interaction. Le framework a été valide par des études utilisateurs réelles, des benchmarks de mouvement et un nouveau benchmark dédié, ProActBench, mais le résume ne fournit aucun chiffre de performance précis. L'enjeu dépasse la démonstration : la plupart des agents conversationnels et robots sociaux restent réactifs, incapables de décider seuls du bon moment pour intervenir, ce qui limite leur naturel pour l'assistance a domicile, l'accueil ou le service client. En couplant raisonnement lent et génération de mouvement rapide, ProAct rejoint une tendance déjà visible chez d'autres acteurs de la robotique incarnée, comme les architectures a deux systèmes de Figure (Helix) ou de NVIDIA (GR00T N1). La validation sur robot physique et utilisateurs réels, plutôt qu'en simulation, va dans le sens d'un rapprochement entre démonstration et usage concret, même si l'absence de métriques chiffrées invite a la prudence sur l'ampleur réelle des gains. Le papier s'inscrit dans un mouvement de recherche plus large sur les architectures cognition-action a deux vitesses, popularisées par les modèles vision-langage-action récents comme Pi-0 ou GR00T N2, ici transposées de la manipulation d'objets vers l'interaction sociale. Aucune entreprise ni laboratoire n'est nomme dans le résume, et aucun calendrier de commercialisation n'est mentionne : il s'agit d'une contribution académique publiée sur arXiv, dont l'apport tient autant au framework ProAct qu'a la création de ProActBench, appelé a devenir une référence pour comparer la proactivité des futurs agents sociaux. Les prochaines étapes attendues relèvent donc de l'adoption par la communauté de recherche plutôt que d'un déploiement commercial immédiat.

RecherchePaper
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
2arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
De l'exécution passive à l'exploration active : la manipulation incarnée à base d'agents en environnements réalistes
3arXiv cs.RO 

De l'exécution passive à l'exploration active : la manipulation incarnée à base d'agents en environnements réalistes

Une équipe de recherche publie sur arXiv (référence 2609.29091, catégorie "new", soumission datée du 29 septembre 2026 selon le numéro d'article) un framework agentique de manipulation robotique baptisé approche d'exploration active, conçu pour dépasser les limites des systèmes actuels qui exécutent passivement des instructions prédéfinies. L'architecture repose sur trois modules collaboratifs : un module de planification pour le raisonnement de tâche à haut niveau, un module de perception pour la compréhension de la scène visuelle, et un module d'exécution pour la manipulation bas niveau. Les auteurs y ajoutent une stratégie d'entrelacement fin entre perception et exécution, qui couple étroitement le retour visuel à l'exécution des compétences motrices pour renforcer la robustesse de l'exploration. Le système est testé sur une tâche appelée Find-and-Place dans un environnement qualifié de réaliste, où l'objet cible n'est pas visible au départ et doit être activement localisé avant d'être saisi et déposé, en présence de distracteurs et d'indices sémantiques textuels. L'abstract ne fournit ni chiffres de performance, ni comparaison quantitative avec des méthodes concurrentes, ni détails matériels comme le payload ou les degrés de liberté du bras utilisé : il s'agit à ce stade d'une publication de recherche, pas d'un produit ou d'un déploiement commercial. L'intérêt pour l'industrie robotique tient au problème ciblé plus qu'aux résultats chiffrés. La plupart des architectures agentiques embarquées actuelles, y compris certains modèles vision-langage-action déployés en usine ou en entrepôt, restent conçues pour exécuter des instructions dans un environnement largement observable dès le départ. Ce travail pointe une limite réelle et documentée du secteur : dès qu'une cible est cachée, mélangée à des distracteurs ou seulement décrite par du texte, ces systèmes échouent faute de stratégie d'exploration active. Pour les intégrateurs qui visent des cas d'usage domestiques ou logistiques avec désordre et occlusions partielles, ce type de recherche indique que le sujet de l'autonomie perceptive sous observabilité partielle reste ouvert, contrairement à l'idée reçue que les pipelines VLA actuels suffiraient à généraliser à toute scène réelle. Ce papier s'inscrit dans la lignée des travaux récents sur les systèmes agentiques à long horizon pour la manipulation, un axe de recherche actif depuis l'essor des modèles vision-langage-action capables de planification multi-étapes. Il ne cite pas d'acteur industriel ni de robot commercial précis, se positionnant comme une contribution méthodologique plutôt qu'une annonce produit. Aucun calendrier de transfert vers un système déployé, ni partenariat industriel, n'est mentionné à ce stade ; les suites logiques attendues seraient une extension à d'autres tâches de manipulation et une évaluation comparative face aux frameworks agentiques existants.

RecherchePaper
1 source
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
4arXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches. Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement. Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

RechercheActu
1 source