Aller au contenu principal
RecherchearXiv cs.RO 

Machines de Turing incarnées : du code avec état pour l'auto-amélioration récursive des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent de retirer tout modèle de la boucle de contrôle d'un robot et de confier chaque décision à du code classique. Leur papier, publié sur arXiv (2610.12369), introduit le paradigme Code-Only-as-Policy (COAP). Le code mesure et suit en continu l'état du robot, de l'environnement et de la tâche à partir des images caméra et de la proprioception, puis prend chaque décision à partir de cet état. La même bibliothèque s'applique d'un épisode à l'autre, et plusieurs tâches la partagent, sans VLA (modèle vision-langage-action) ni VLM interrogé à l'exécution. Sur RoboDojo, un banc de 42 tâches bimanuelles, la bibliothèque produite atteint 70,24 % de réussite sans aucun modèle au moment du test. Le papier ne détaille pas, dans son résumé, le matériel, les temps de cycle ni les conditions de test, et il s'agit pour l'instant d'un résultat de recherche et non d'un produit.

Le cadre théorique est celui d'une « machine de Turing incarnée » : le ruban correspond à l'état du robot et de son environnement, et les règles correspondent à la politique. Si cet état est représenté avec précision, la décision peut s'écrire entièrement en code. Les auteurs mettent en avant trois avantages face aux VLA et aux « Agent Harness » (Agent-as-Policy, Harness VLA), où un VLM est sollicité en ligne. Premièrement, l'état est explicite et stockable dans le code. Deuxièmement, l'exécution est contrôlable, récupère les échecs de façon flexible et tourne vite et à bas coût. Troisièmement, les nouvelles tâches réutilisent, héritent ou étendent la bibliothèque commune, ce qui permet de cumuler les capacités.

L'intérêt pour l'industrie est double. Pour un intégrateur ou un COO, une politique déterministe, auditable et sans appel à un modèle distant répond à des exigences de latence, de coût d'inférence et de traçabilité que les VLA remplissent mal. Chaque modification du code est explicite et vérifiable, à l'inverse d'un réentraînement opaque. Ensuite, le papier propose ce qu'il appelle l'auto-amélioration récursive : des agents de code développent la bibliothèque en boucle fermée. Reste à nuancer : 70,24 % signifie près de 30 % d'échecs, ce qui reste loin des seuils de production, et les auteurs admettent que le plafond dépend de la précision de l'estimation d'état et de la robustesse de la logique. La perception reste donc le goulot d'étranglement, et la généralisation hors benchmark n'est pas démontrée.

Ce travail s'inscrit dans le débat entre politiques apprises de bout en bout (famille Pi-0, GR00T, Helix) et architectures d'agents où un VLM planifie à l'exécution. COAP revient à une approche proche de la robotique classique, mais avec des agents de code qui écrivent et font évoluer la bibliothèque. Les auteurs suggèrent aussi d'utiliser COAP comme moteur de génération de données pour entraîner des VLA et alimenter des Agent Harness, ce qui en ferait un complément plutôt qu'un concurrent. Aucun calendrier de déploiement ni partenaire industriel n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

EmbodiRSI : l'auto-amélioration récursive pour une adaptation des robots économe en données
1arXiv cs.RO 

EmbodiRSI : l'auto-amélioration récursive pour une adaptation des robots économe en données

Des chercheurs publient sur arXiv EmbodiRSI, un système « agentique » d'auto-amélioration récursive (RSI) pour adapter des politiques de manipulation robotique à de nouvelles tâches et environnements. Le principe repose sur une boucle « real-to-sim-to-real » : une simulation spécifique à la tâche est construite à partir du scénario de déploiement cible, puis sert d'environnement peu coûteux pour améliorer la politique par itérations avant son retour sur le robot physique. Deux mécanismes ferment la boucle. La Collaborative Error Correction génère, avec l'aide d'un agent, des trajectoires correctives à partir des états que la politique a réellement atteints. L'Adaptive Data Collection oriente la génération de démonstrations expertes vers les faiblesses actuelles de la politique. Sur trois environnements de table et 14 sous-tâches, le taux de réussite autonome en simulation, équilibré par scène, passe de 50,4 % à 83,5 % en deux mises à jour RSI. Avec 400 trajectoires simulées adaptatives et seulement dix trajectoires réelles de raffinement par sous-tâche, le système atteint 83,1 % de réussite réelle, contre 75,0 % pour une adaptation à partir de 200 démonstrations réelles par sous-tâche. L'enjeu est le coût de la donnée, principal goulot d'étranglement du déploiement de politiques de type VLA ou d'imitation chez les intégrateurs. Ici, le volume de données réelles est divisé par vingt (10 contre 200 démonstrations par sous-tâche) pour un résultat supérieur de plus de huit points. Si ce résultat se confirme, la simulation spécifique au site cesse d'être un simple banc d'essai et devient un espace de travail réutilisable pour le préchauffage, l'évaluation répétable, le diagnostic des échecs et la génération ciblée de données. Cela réduit la dépendance à la téléopération, coûteuse en main-d'œuvre. Le résultat nuance aussi l'idée que le sim-to-real exige une simulation généraliste : une simulation étroite, construite pour un seul déploiement, peut suffire. Des réserves s'imposent toutefois. Les tâches sont de la manipulation sur table, le nombre de sous-tâches est limité, la fidélité de la reconstruction de scène n'est pas détaillée dans le résumé, et aucun temps de cycle, taux de panne ni coût de construction de la simulation n'est donné. Le travail reste une prépublication, sans pilote industriel annoncé. Ce travail s'inscrit dans la poussée actuelle vers l'adaptation efficace en données des politiques généralistes, alors que le fine-tuning post-entraînement par démonstrations réelles reste la pratique dominante. Il rejoint les approches de reconstruction de scènes pour la simulation (real-to-sim), de génération de données synthétiques et de boucles d'amélioration pilotées par des agents, explorées par les grands laboratoires et les équipes derrière des modèles comme Pi-0 ou GR00T. L'originalité tient au pilotage de la collecte par les échecs observés de la politique, plutôt qu'à une génération de données uniforme. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues et sur des objets déformables ou en contact riche, la réplication par des tiers, la publication du code et des benchmarks, et surtout un test en conditions industrielles, où la variabilité des scènes dépasse largement celle d'un plateau de laboratoire.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon
2arXiv cs.RO 

MobiAgent : auto-amélioration récursive de la politique à double boucle pour la manipulation mobile à long horizon

Des chercheurs publient MobiAgent, un framework agentique à double boucle pour la manipulation mobile longue durée, c'est-à-dire des tâches en plusieurs étapes où un robot doit combiner déplacement et usage du bras. La boucle interne, active au déploiement, sépare le raisonnement de haut niveau du contrôle bas niveau grâce à des compétences atomiques composables. Des modèles vision-langage assurent une planification à horizon glissant et une « réflexion visuelle » sur l'état de la scène, afin de recomposer les compétences et de rattraper les erreurs. Ces compétences sont exécutées par des experts à flow-matching qui partagent un même backbone VLM. La boucle externe segmente et vérifie automatiquement les rollouts de déploiement, les regroupe par clustering pour découvrir de nouvelles compétences atomiques, puis affine la bibliothèque sans annotation humaine. Sur BEHAVIOR-1K, MobiAgent dépasse de 22,5 points de pourcentage la baseline π0.5-TA. Par recyclage autonome des données, le taux de succès passe de 7,5 % à 27,5 % sur RoboCasa, et de 32,5 % à 57,5 % sur le robot Astribot S1 en conditions réelles. L'intérêt tient à deux verrous que les modèles VLA actuels n'ont pas levés. Ces modèles sont performants sur des tâches courtes, mais les erreurs d'exécution s'accumulent sur les séquences longues. La locomotion et le contrôle du bras entrent aussi en interférence de capacité lorsqu'une même politique doit tout apprendre. Les experts spécialisés sur backbone commun répondent à cette seconde difficulté tout en conservant la réutilisabilité. Le résultat le plus parlant pour un intégrateur est la boucle d'amélioration sans annotation : un système qui exploite ses propres échecs et succès de terrain réduit le coût de la collecte de démonstrations, premier poste de dépense des déploiements de manipulation. Les chiffres appellent toutefois à la prudence. Un passage à 27,5 % sur RoboCasa signifie que trois tâches sur quatre échouent encore. Les 57,5 % sur Astribot S1 viennent d'un seul robot et d'un jeu de tâches limité, dont la taille n'est pas précisée dans le résumé. On est donc face à un résultat de recherche, pas à un produit ni à un déploiement industriel. Ce travail s'inscrit dans la montée des architectures hiérarchiques qui tentent de pallier les limites des VLA monolithiques comme π0.5 de Physical Intelligence. Il rejoint les approches à double système popularisées par Helix de Figure ou GR00T de NVIDIA, avec une différence : l'accent mis sur l'apprentissage continu en boucle fermée plutôt que sur une architecture figée. Les benchmarks choisis, RoboCasa et BEHAVIOR-1K, restent des environnements de simulation de tâches domestiques, et la transposition à des cadences industrielles reste à démontrer. La suite logique est une validation sur plus de robots, de tâches et d'environnements, avec des mesures de robustesse sur de longues périodes. Aucun pilote commercial ni calendrier n'est annoncé. L'article, publié sur arXiv sous la référence 2610.03476, est une préimpression qui n'a pas encore été évaluée par des pairs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Génération de code adaptative pour le contrôle de robots
3arXiv cs.RO 

Génération de code adaptative pour le contrôle de robots

Des chercheurs proposent, dans un preprint arXiv (2610.09588v1), une architecture de contrôle robotique à double IA pour piloter des robots dans des environnements inconnus et dynamiques à partir d'intentions formulées en langage naturel. Un grand modèle de langage (LLM) traduit des objectifs de haut niveau en code exécutable. Ce code est limité à une bibliothèque robotique formelle et contraint par une syntaxe vérifiable. Un modèle vision-langage (VLM) assure l'ancrage sémantique, c'est-à-dire le lien entre les mots et ce que le robot perçoit, grâce à un processus de distillation. Le système ajoute des déclencheurs de replanification pilotés par l'environnement, fondés sur des seuils géométriques et sémantiques. Il intègre aussi une surveillance continue à l'exécution et une boucle de planification adaptative. Les auteurs l'ont évalué sur plusieurs modèles de pointe. Le résumé ne donne ni DOF, ni temps de cycle, ni taux de réussite chiffré, ni plateforme robotique, ni site de déploiement. Il s'agit d'une contribution de recherche, sans produit ni déploiement. L'enjeu porte sur la façon d'utiliser les LLM en robotique. L'approche n'est pas celle des modèles vision-langage-action (VLA) de bout en bout, qui produisent directement des actions. Elle génère du code contraint à une bibliothèque de primitives, donc auditable, vérifiable avant exécution et borné par ce que le robot sait faire. Pour un intégrateur ou un responsable industriel, cette propriété compte dans les contextes où la traçabilité et la sécurité priment. Le travail cible trois verrous : l'écart de formalisation entre une intention floue et une action exécutable, l'écart de taxonomie quand l'environnement présente des objets ou situations imprévus, et le suivi de l'état et de la progression dans le temps. Il soutient que ancrer l'IA générative dans une boucle réactive et contrainte permet de remplir des intentions complexes malgré l'incertitude. La prudence s'impose pourtant. Le résumé ne chiffre rien, et un benchmark sur modèles de pointe ne dit pas comment le système tient face aux latences, aux erreurs de perception ou aux pannes matérielles d'un site réel. Cette publication prolonge la ligne de travaux qui font écrire du code aux LLM pour commander des robots, popularisée par des approches comme Code as Policies, et qui s'oppose aux politiques apprises de bout en bout de type Pi-0, Helix ou GR00T. Les auteurs inscrivent leur démarche dans la vision de robots comme systèmes adaptatifs complexes, passant de bibliothèques de commandes rigides à une autonomie fondée sur l'intention. Le texte ne cite pas de partenaire industriel, de calendrier ni d'étape suivante. Les prochains jalons à surveiller sont la publication des résultats détaillés, d'éventuels essais sur robot physique et la comparaison directe avec les VLA sur des tâches longues en environnement ouvert.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques
4arXiv cs.RO 

Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques

Une équipe de chercheurs publie sur arXiv (v1, septembre 2026) une méthode baptisée « skill-space shooting », conçue pour permettre à un robot déployé de corriger seul les échecs de sa politique de contrôle, sans que l'humain ait à démontrer chaque correction. Le principe repose sur un modèle de fondation, qui guide l'exploration de corrections à travers des compétences courtes et réutilisables (les « skills »). Ces comportements récurrents d'une tâche à l'autre, comme saisir, pousser ou repositionner un objet, sont choisis par le modèle à partir de la scène observée. Les essais réussis sont ensuite convertis en supervision corrective pour réentraîner la politique. Les auteurs affirment que des expériences en conditions réelles montrent une amélioration répétée de politiques agissant de manière autonome, et que les skills peuvent être partagés entre tâches pour réduire l'effort d'enseignement sur de nouvelles tâches. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni plateforme robotique, ni gain chiffré. Ces éléments devront être vérifiés dans le papier complet et sur la page de résultats vidéo associée. L'enjeu est un goulot d'étranglement bien connu du déploiement de robots : l'amélioration après mise en service dépend encore largement de téléopérateurs qui produisent des démonstrations correctives. Les systèmes dits agentiques, où un modèle de fondation compose des comportements appris pour finir une tâche, contournent l'humain, mais ne rendent pas la politique elle-même meilleure. Elle échouera de nouveau au même endroit. Le travail cherche à combler cet écart en transformant les succès obtenus par composition de skills en données d'apprentissage. Si le résultat tient à l'échelle, il réduirait le coût marginal de chaque correction, un poste critique pour les intégrateurs qui exploitent des flottes de robots. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, et les vidéos publiées par les auteurs sont généralement sélectionnées. La généralisation entre tâches reste à démontrer sur des cas plus variés que ceux d'un laboratoire. Ce travail s'inscrit dans la course aux politiques vision-langage-action (VLA), comme Pi-0 ou GR00T, qui sont pré-entraînées sur de grands volumes de démonstrations, puis affinées, souvent avec de la téléopération humaine. Il rejoint aussi les recherches sur l'apprentissage par renforcement et l'auto-amélioration en conditions réelles, qui butent sur le coût des essais physiques et sur la conception des récompenses. L'usage de skills comme espace de recherche restreint l'exploration et la rend plus sûre et plus efficace que des actions brutes. La suite dépendra de la publication du code, des comparaisons avec les approches d'amélioration existantes et d'éventuels tests sur des robots industriels. Aucun pilote commercial n'est annoncé à ce stade.

RecherchePaper
1 source