RoboAware : apprendre à coordonner des compétences d'IA incarnée à partir de résultats contrefactuels
RoboAware, un framework décrit dans l'article arXiv 2610.11480, apprend à un agent de code embarqué à choisir quelle famille de politiques mobiliser selon l'état physique courant. Il ne réentraîne ni l'agent de code ni les politiques de bas niveau, qui restent figés. Seul un coordinateur de « responsabilité », conditionné par l'état, est appris. Les compétences du robot, qu'il s'agisse de modules classiques ou de politiques end-to-end gelées (type VLA), sont organisées dans un schéma baptisé P^5, qui les range en cinq étapes sémantiques communes pour les rendre comparables. Pour pallier l'absence de résultats contrefactuels dans les travaux existants, les auteurs introduisent le State-Locked Counterfactual Branching (SCB). Cette méthode restaure le même état d'entraînement, génère et exécute un bloc de code pour chaque famille admissible, et révèle ainsi ce qui se serait passé avec les branches non choisies. L'Execution-Aware Learning (EAL) combine ensuite recherche arborescente Monte Carlo et Q-learning pour distiller ces issues en valeurs conditionnées par la famille. Au déploiement, le coordinateur choisit la famille d'après le contexte observable, puis l'agent de code figé écrit le prochain bloc local. Sur 100 tâches, en évaluation à épisode unique, le système atteint 77,0 % de succès global, avec des moyennes annoncées comme state of the art de 90,0 % sur RoboSuite, 73,8 % sur les clusters LIBERO-Pro et 90,0 % sur les tâches bimanuelles RoboTwin.
L'intérêt pour l'industrie tient à un problème que les intégrateurs connaissent bien : combiner des briques modulaires fiables et des politiques VLA plus généralistes, sans savoir à l'avance laquelle réussira dans une situation donnée. Le papier propose de traiter ce choix comme un problème d'apprentissage explicite plutôt que comme une heuristique codée à la main ou un jugement laissé au modèle de langage. L'approche est peu coûteuse, puisqu'elle laisse intacts les composants déjà validés, ce qui séduit dans un contexte où requalifier une politique est lourd. Elle suggère aussi que les gains de la composition viennent autant de l'aiguillage que des politiques elles-mêmes. Il faut toutefois rester prudent : tous les résultats sont obtenus en simulation (RoboSuite, LIBERO-Pro, RoboTwin), aucun test sur robot physique n'est mentionné, et le coût du branching contrefactuel, qui multiplie les exécutions par famille de politiques, n'est pas chiffré. Le score global de 77,0 % montre aussi qu'environ une tâche sur quatre échoue encore, et la comparaison porte sur des baselines choisies par les auteurs, sans validation indépendante.
Ce travail s'inscrit dans la lignée des approches « code-as-policy », où un modèle de langage écrit du code appelant des primitives robotiques, et des harnais autour de VLA comme Pi-0. Les auteurs s'inspirent du succès des boucles REPL pour les agents de code, en les étendant à l'embodiment. Les concurrents directs sont ces deux familles, jugées trop dépendantes d'un choix de politique non informé par l'état physique. Il s'agit d'un préprint arXiv sans relecture par les pairs, sans annonce de code ni de pilote industriel à ce stade. La suite logique serait une validation sur matériel réel, avec des contraintes de temps de cycle et de sécurité que la simulation ne reproduit pas.
Dans nos dossiers




