Machines de Turing incarnées : du code avec état pour l'auto-amélioration récursive des robots
Des chercheurs proposent de retirer tout modèle de la boucle de contrôle d'un robot et de confier chaque décision à du code classique. Leur papier, publié sur arXiv (2610.12369), introduit le paradigme Code-Only-as-Policy (COAP). Le code mesure et suit en continu l'état du robot, de l'environnement et de la tâche à partir des images caméra et de la proprioception, puis prend chaque décision à partir de cet état. La même bibliothèque s'applique d'un épisode à l'autre, et plusieurs tâches la partagent, sans VLA (modèle vision-langage-action) ni VLM interrogé à l'exécution. Sur RoboDojo, un banc de 42 tâches bimanuelles, la bibliothèque produite atteint 70,24 % de réussite sans aucun modèle au moment du test. Le papier ne détaille pas, dans son résumé, le matériel, les temps de cycle ni les conditions de test, et il s'agit pour l'instant d'un résultat de recherche et non d'un produit.
Le cadre théorique est celui d'une « machine de Turing incarnée » : le ruban correspond à l'état du robot et de son environnement, et les règles correspondent à la politique. Si cet état est représenté avec précision, la décision peut s'écrire entièrement en code. Les auteurs mettent en avant trois avantages face aux VLA et aux « Agent Harness » (Agent-as-Policy, Harness VLA), où un VLM est sollicité en ligne. Premièrement, l'état est explicite et stockable dans le code. Deuxièmement, l'exécution est contrôlable, récupère les échecs de façon flexible et tourne vite et à bas coût. Troisièmement, les nouvelles tâches réutilisent, héritent ou étendent la bibliothèque commune, ce qui permet de cumuler les capacités.
L'intérêt pour l'industrie est double. Pour un intégrateur ou un COO, une politique déterministe, auditable et sans appel à un modèle distant répond à des exigences de latence, de coût d'inférence et de traçabilité que les VLA remplissent mal. Chaque modification du code est explicite et vérifiable, à l'inverse d'un réentraînement opaque. Ensuite, le papier propose ce qu'il appelle l'auto-amélioration récursive : des agents de code développent la bibliothèque en boucle fermée. Reste à nuancer : 70,24 % signifie près de 30 % d'échecs, ce qui reste loin des seuils de production, et les auteurs admettent que le plafond dépend de la précision de l'estimation d'état et de la robustesse de la logique. La perception reste donc le goulot d'étranglement, et la généralisation hors benchmark n'est pas démontrée.
Ce travail s'inscrit dans le débat entre politiques apprises de bout en bout (famille Pi-0, GR00T, Helix) et architectures d'agents où un VLM planifie à l'exécution. COAP revient à une approche proche de la robotique classique, mais avec des agents de code qui écrivent et font évoluer la bibliothèque. Les auteurs suggèrent aussi d'utiliser COAP comme moteur de génération de données pour entraîner des VLA et alimenter des Agent Harness, ce qui en ferait un complément plutôt qu'un concurrent. Aucun calendrier de déploiement ni partenaire industriel n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




