Aller au contenu principal
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
RecherchearXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches.

Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement.

Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

À lire aussi

ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon
1arXiv cs.RO 

ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon

Une équipe de recherche présente ChainVLA, une politique vision-langage-action (VLA) de 1,2 milliard de paramètres conçue pour la manipulation robotique à long horizon. Le système introduit un "Progress Context", combinant un état de travail récurrent et une mémoire d'événements éparse pour suivre la progression de la tâche à partir des observations, ainsi qu'un "Motion Tail" qui réinjecte la portion non exécutée de la prédiction précédente dans la génération de l'action suivante. Ces deux composants conditionnent un décodeur qui régénère chaque horizon d'action à partir de la dernière observation, permettant à l'état porté de guider la prédiction suivante sans la figer. Sur le benchmark RMBench, ChainVLA atteint 62,8% de réussite moyenne, et 98,8% sur les quatre suites LIBERO. Les ablations montrent l'importance critique de chaque composant : retirer le Motion Tail fait chuter le score RMBench à 11,2%, et retirer le Progress Context à seulement 3,0%. Ce travail cible un problème structurel connu des politiques VLA actuelles à découpage par blocs d'actions ("action-chunked") : à chaque nouvelle requête, le modèle replanifie depuis zéro à partir de l'entrée courante, perdant la continuité entre ce qui a déjà été accompli et ce qui reste à faire. Les approches existantes ne couvrent qu'une partie du problème, soit en préservant la mémoire de tâche à long terme, soit la continuité de mouvement à court terme via la réutilisation ou l'ensembling d'actions, mais pas les deux simultanément. Pour les intégrateurs et chercheurs en robotique manipulatrice, cette lacune du "handoff" entre requêtes successives est directement liée à l'échec des tâches longues et multi-étapes, un point de friction majeur pour le déploiement de VLA en conditions réelles au-delà des démonstrations en laboratoire. L'ampleur des écarts de performance observés dans les ablations suggère que la continuité de mouvement joue un rôle clé pour préserver le flux d'observations dont dépend l'inférence de progression, un mécanisme jusqu'ici sous-exploré. Le papier, publié sur arXiv (2608.02326v1) début août 2026, s'inscrit dans la lignée des travaux récents sur les politiques VLA à grande échelle comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à améliorer la robustesse des robots manipulateurs sur des tâches complexes et prolongées. ChainVLA se positionne comme une réponse ciblée à la limite du replanning répété à chaque requête, un défaut partagé par de nombreuses architectures action-chunked actuelles. Les benchmarks utilisés, RMBench et LIBERO, sont des références standard du domaine pour évaluer la manipulation robotique, ce qui permet une comparaison directe avec les approches concurrentes. Le document ne précise pas de calendrier de déploiement matériel ni de partenariat industriel identifié à ce stade ; il s'agit pour l'instant d'un travail de recherche évalué en simulation et sur benchmarks standardisés, sans validation annoncée sur robot physique en conditions réelles de production.

RechercheActu
1 source
Vers un raisonnement procédural neuro-symbolique pour la manipulation VLA à long horizon
2arXiv cs.RO 

Vers un raisonnement procédural neuro-symbolique pour la manipulation VLA à long horizon

Un article publié sur arXiv (référence 2609.05369) début septembre 2026 présente un cadre neuro-symbolique destiné à corriger la fragilité des modèles vision-langage-action (VLA) sur les manipulations longues. Ces modèles exécutent bien des compétences courtes et isolées, mais peinent à maintenir un état de tâche persistant, à raisonner sur les dépendances entre actions et à gérer des décisions conditionnelles sur des séquences étendues. La méthode associe un contrôle VLA appris à des graphes de tâches explicites, qui encodent dépendances d'actions, transitions valides et conditions de branchement, ainsi qu'une mémoire procédurale multimodale qui suit l'étape active, les actions déjà accomplies, le contexte textuel et les preuves visuelles pertinentes. Des indices de regard humain, annotés en pseudo-regard sur des vidéos de téléopération vue robot, guident ensuite le fine-tuning et l'inférence du VLA. Deux domaines de test sont retenus: le débarrassage d'un espace de travail et la manipulation d'instruments chirurgicaux, évalués sur la sélection correcte d'objet et de destination, la complétion des sous-tâches et le taux de réussite complet de la procédure. Ce travail s'attaque à un angle mort du secteur: les modèles VLA de bout en bout, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, généralisent bien sur des tâches courtes grâce au volume de données d'entraînement, mais leur fiabilité chute nettement sur des procédures longues et structurées, un écart entre démonstration et usage réel rarement exposé publiquement. En réintroduisant une couche symbolique explicite plutôt qu'en misant uniquement sur davantage de données et de paramètres, l'étude suggère que la fiabilité recherchée par l'industrie et la chirurgie assistée passera par des architectures hybrides, pas seulement par le scaling des réseaux de neurones. C'est un signal utile pour les intégrateurs qui évaluent la maturité réelle des VLA au-delà des vidéos de démonstration soigneusement sélectionnées. Il s'agit d'une étude de recherche exploratoire, pas d'un produit déployé. Pour isoler l'effet du guidage visuel sur l'apprentissage de la politique, les auteurs contournent volontairement, dans cette première phase, le transfert de regard entre vue humaine et vue robot, une simplification méthodologique qu'ils assument eux-mêmes. Aucun partenaire industriel, site pilote ni calendrier de commercialisation n'est mentionné dans le document. Les auteurs indiquent vouloir étendre l'approche au transfert de regard inter-vues comme prochaine étape, afin de généraliser ce guidage à des démonstrations non téléopérées et de renforcer la robustesse du raisonnement procédural sur des tâches encore plus longues.

RecherchePaper
1 source
2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon
3arXiv cs.RO 

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon

Publiée le 11 septembre 2026 sur arXiv sous la référence 2609.11308, une nouvelle architecture baptisée 2AM propose une autre méthode pour la manipulation robotique à long horizon, ces tâches multi-étapes qui exigent de se souvenir de ce qui a déjà été fait. Le système sépare strictement deux rôles : un agent multimodal conserve seul la mémoire de la tâche et traduit l'historique des interactions en instructions de sous-tâches en langage naturel, complétées par des indices optionnels en 2D (points de préhension, de dépose et de déplacement) ; un modèle d'action unique, basé uniquement sur des images RGB et sans état interne entre les épisodes, exécute le mouvement. Pour le rendre pilotable, les auteurs ont enrichi les démonstrations d'étiquettes d'indices structurées et entraîné le modèle avec abandon aléatoire de conditions, bruit spatial et décalage temporel, afin qu'il tolère des instructions imparfaites. Testé sur le benchmark LIBERO-Mem, sans profondeur, sans géométrie calculée en ligne ni déplacement d'objets planifié, 2AM atteint un taux de complétion moyen de 76,3 %, contre 14,8 % pour la meilleure référence publiée à ce jour, soit un gain de 61,5 points, avec 63,0 % de réussite au sens large et 11,8 % au sens strict. Ce résultat vise un problème méthodologique récurrent des systèmes agentiques actuels, qui combinent souvent des modèles vision-langage-action (VLA) avec planificateurs et outils géométriques, parfois appuyés par de la profondeur ou une géométrie calibrée : il devient difficile de savoir si les gains viennent d'observations plus riches, d'outils moteurs alternatifs ou de la politique elle-même, et si les échecs viennent de la politique ou d'une interface langagière mal spécifiée. En réduisant volontairement la panoplie d'outils au profit d'une interface à plus haute bande passante entre agent et modèle d'action, 2AM isole la variable de précision du pilotage. Le résultat suggère que la mémoire de tâche peut rester entièrement côté agent, sans être intégrée dans la politique d'action, un choix opposé à la tendance qui consiste à faire porter mémoire et raisonnement par un seul grand modèle entraîné de bout en bout. Pour les équipes qui développent des modèles d'action génératifs comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, ce travail introduit une hypothèse alternative : la capacité effective d'un modèle dépendrait autant de la précision avec laquelle il est piloté que de ce qu'il a appris à l'entraînement, ce qui interroge la course actuelle aux VLA toujours plus massifs. Le travail s'inscrit dans la lignée des benchmarks LIBERO, largement utilisés en apprentissage de politiques robotiques, dont LIBERO-Mem constitue une extension dédiée aux tâches à mémoire longue. Il se positionne en creux face aux architectures dominantes du secteur, qui empilent VLA, planificateurs symboliques et perception 3D pour gérer des séquences de manipulation complexes, une approche que la publication critique implicitement pour son opacité dans l'attribution des performances. Aucun déploiement matériel réel n'est mentionné : les résultats restent circonscrits à la simulation et au benchmark, sans validation sur robot physique ni pilote industriel annoncé. L'affiliation institutionnelle des auteurs et un calendrier de suite ne sont pas précisés, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit ou d'un partenariat commercial.

RechercheActu
1 source
ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot
4arXiv cs.RO 

ACE : contrôle à base d'agents pour la manipulation incarnée via raisonnement de flux de travail zéro-shot

Une équipe de recherche publie sur arXiv (arXiv:2607.04162v1) ACE, pour Agentic Control for Embodied Manipulation, un cadre de raisonnement en zero-shot destiné à la manipulation d'objets sur table à partir d'instructions en langage naturel. Plutôt que de faire correspondre directement le langage à des actions motrices bas niveau, comme le font la plupart des politiques VLA de bout en bout, ACE orchestre un raisonnement de type workflow agentique couplé à deux compétences robotiques réutilisables : une interface de repérage visuel et une primitive générique de saisie-dépose. Le sous-objectif actif est traduit en un masque visuel qui désigne à la fois l'objet cible et sa destination, masque qui est suivi dans le temps, exposé à la vérification humaine, puis transmis à une politique d'exécution indépendante de la tâche. Le système fonctionne en boucle fermée grâce à une mémoire multi-échelle temporelle qui vérifie après chaque action si le sous-objectif a réussi, avant de décider de poursuivre, réessayer, corriger ou replanifier. Sur des tâches longues et logiquement complexes, comme la formation d'équations avec des cubes numérotés ou la récupération d'objets sous contrainte, ACE atteint 50% de réussite pour la formation d'équations et 70% pour la récupération sous contrainte, quand les approches de bout en bout classiques échouent largement sur ces mêmes tâches. Ce résultat cible un point de friction précis du secteur : la capacité d'un système à généraliser à des scènes et contraintes sémantiques inédites sans réentraînement spécifique à la tâche, ce qui reste l'un des principaux écarts entre les démonstrations en laboratoire et un déploiement robuste en environnement réel. En montrant qu'un raisonnement explicite par étapes, combiné à un contrôle médié par masque, surpasse des politiques end-to-end sur des tâches à horizon long, ACE apporte un argument concret pour les intégrateurs et équipes de R&D qui cherchent des architectures de manipulation capables de gérer l'échec d'exécution et la correction humaine en cours de tâche, plutôt que de miser uniquement sur l'échelle des données d'entraînement. ACE s'inscrit dans la lignée des travaux récents sur les architectures agentiques pour la robotique, qui cherchent à combiner les capacités de raisonnement des grands modèles de langage avec des compétences robotiques modulaires et vérifiables, en alternative aux politiques VLA monolithiques comme Pi-0 ou GR00T. Les auteurs positionnent explicitement leur approche contre des baselines de bout en bout sur les mêmes bancs d'essai, mais l'évaluation reste limitée à des scénarios de manipulation tabletop en conditions contrôlées, sans indication de déploiement industriel ni de partenariat annoncé à ce stade.

RecherchePaper
1 source