Aller au contenu principal
RecherchearXiv cs.RO 

EmbodiedSWE : agents de codage pour la robotique dextre à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente EmbodiedSWE, un système qui exploite des agents de codage pour résoudre des tâches de robotique dextre à long horizon, avant de transformer leurs solutions en données d'entraînement pour des politiques robotiques générales. Les auteurs introduisent EmbodiedSWE-Bench, un benchmark de simulation couvrant la manipulation à contact riche, les objets déformables et des tâches longues exigeant jusqu'à trente minutes d'interaction continue. Les agents de codage de pointe testés résolvent ces tâches et transfèrent leurs solutions d'une tâche à l'autre, voire d'un robot à un autre, au prix de nombreuses itérations et d'une forte spécialisation. EmbodiedSWE-Gen démultiplie ensuite une solution unique en de nombreuses trajectoires diversifiées pour entraîner un modèle vision-langage-action (VLA), qui, entraîné uniquement sur ces démonstrations simulées, exécute avec succès une tâche longue sur un robot réel, sans donnée de téléopération humaine.

Ce résultat s'attaque au principal goulot d'étranglement de l'apprentissage robotique : la collecte de démonstrations, aujourd'hui dominée par la téléopération humaine, lente et coûteuse. En montrant qu'un agent de codage capable d'itérer en simulation peut se substituer à l'opérateur humain pour produire des trajectoires exploitables, l'étude ouvre une piste de supervision scalable pour les politiques VLA, la même famille de modèles que des systèmes connus du secteur comme GR00T N2, Pi-0 ou Helix. Pour les intégrateurs et décideurs industriels, l'enjeu est de réduire le coût et le délai nécessaires pour doter un robot de nouvelles compétences sans dépendre de flottes dédiées à la collecte de données. Le transfert réussi vers un robot réel, même limité à une seule tâche démontrée, suggère que l'écart sim-to-real peut être comblé par une diversification algorithmique des trajectoires plutôt que par un volume massif de données réelles.

L'approche s'inscrit dans la tendance qui consiste à détourner les agents de codage, conçus pour l'ingénierie logicielle, vers des problèmes de contrôle physique, en écho aux efforts des laboratoires développant des modèles VLA pour réduire leur dépendance à la téléopération humaine. Publiée en prépublication sur arXiv (2609.27308), la recherche ne mentionne aucun déploiement industriel : la validation sur robot réel reste limitée à une seule tâche, le reste se déroulant en simulation.

À lire aussi

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon
1arXiv cs.RO 

REMAC : collaboration multi-agents auto-réflexive et auto-évolutive pour la manipulation robotique à long horizon

Une équipe de recherche a publié une version révisée (v2) sur arXiv (2503.22122) présentant REMAC, un framework de planification multi-robots pour des tâches de manipulation longues et complexes, piloté par des modèles vision-langage. Le système combine deux modules: une auto-réflexion qui vérifie les conditions avant et après chaque action pour détecter les erreurs de plan, et une auto-évolution qui adapte la stratégie selon le contexte réel de la scène, sans prompt spécifique à la tâche. Les auteurs ont bâti un environnement de test basé sur RoboCasa, avec 4 catégories de tâches, 27 variantes et plus de 50 objets, puis évalué REMAC avec quatre modèles de raisonnement comme moteurs de décision: DeepSeek-R1, o3-mini, QwQ et Grok3. Résultat revendiqué: +40% de taux de réussite moyen et +52,7% d'efficacité d'exécution face à une baseline à robot unique. L'enjeu visé est concret pour les intégrateurs: les approches actuelles reposent souvent sur une connaissance préalable de l'environnement ou des prompts taillés sur mesure, ce qui les rend fragiles dès qu'un imprévu survient, par exemple un robot chargé de poser une carotte dans un micro-ondes qui découvre que la porte est fermée. En permettant à un robot d'en solliciter un autre pour paralléliser les tâches après plusieurs cycles de réflexion, REMAC pointe vers une robotique multi-agents plus tolérante aux aléas de scène, un axe clé pour dépasser les démonstrations scénarisées et réduire le travail d'ingénierie de prompt lors du déploiement de flottes sur des tâches longues. Le travail s'inscrit dans la recherche sur la planification robotique assistée par grands modèles, aux côtés d'approches comme Pi-0 ou GR00T N2, mais REMAC mise sur un raisonnement multi-agents itératif plutôt que sur un modèle action de bout en bout, en s'appuyant sur des modèles de raisonnement généralistes existants plutôt qu'un modèle propriétaire dédié. Il s'agit pour l'instant d'un travail académique validé en simulation, sans déploiement matériel réel ni partenariat industriel annoncé; la publication de cette seconde version suggère une itération continue sur la méthode, sans calendrier communiqué pour un transfert vers des robots physiques.

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
2arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
3arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
4arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source