Enseigner et grandir : une architecture centrée agent pour l'apprentissage général des robots
Des chercheurs ont publié sur arXiv (référence 2608.17209v1) une architecture baptisée Teach-and-Grow Learning (TGL), conçue pour l'apprentissage général de robots. Le système repose sur un agent multimodal qui transforme quelques démonstrations réussies en « Skill Blocks », des comportements en boucle fermée couvrant des sous-objectifs précis, stockés dans une Skill Library. Une Experience Memory structurée conserve en parallèle les succès, les échecs et les corrections associées. Face à une nouvelle scène, l'agent sélectionne et combine ces blocs, choisit des outils appris ou géométriques, observe le résultat physique de son action, puis ajuste sa trajectoire si l'exécution s'écarte de l'intention initiale. Sur le benchmark de simulation LIBERO, largement utilisé pour évaluer les politiques robotiques, TGL revendique des résultats à l'état de l'art, avec des études contrôlées montrant l'induction de nouvelles compétences, leur réutilisation persistante et une adaptation pilotée par l'agent, sans réentraînement de politique spécifique à chaque tâche.
L'enjeu vise directement ce que les auteurs nomment la « taxe de réentraînement » : dans les modèles VLA (vision-language-action) et les modèles monde-action classiques, dès qu'un objet, un capteur, une morphologie ou un type de contact sort du périmètre validé, corriger l'échec exige de nouvelles données robotiques, une mise à jour de politique et une campagne de tests de non-régression, un cycle coûteux puisque, contrairement au texte, les données robotiques doivent le plus souvent être générées en opérant physiquement des machines. En proposant d'acquérir de nouvelles tâches par composition de compétences réutilisables plutôt que par réentraînement, TGL questionne l'hypothèse dominante selon laquelle la généralisation passe uniquement par des modèles VLA toujours plus gros nourris de plus de données. C'est un signal utile pour les intégrateurs et décideurs qui évaluent le coût réel de déploiement de politiques robotiques. Il faut néanmoins noter que la validation reste cantonnée au benchmark simulé LIBERO, sans déploiement documenté sur robot physique à ce stade.
Ce travail s'inscrit dans la vague plus large des modèles fondation pour la robotique, qui inclut des approches VLA de bout en bout comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, conçues pour généraliser directement à partir de données massives sans couche agentique intermédiaire. TGL se positionne en alternative complémentaire, misant sur un agent explicite plutôt que sur l'échelle brute du modèle. Les auteurs avancent aussi une hypothèse de loi d'échelle propre : à mesure que le volume d'expérience réutilisable augmente, l'erreur sur les tâches futures et l'effort d'enseignement nécessaire devraient décroître selon une loi de puissance vers un plancher irréductible, traitant le déploiement comme une période d'apprentissage continu où chaque tâche accomplie facilite la suivante. Aucune date de disponibilité, partenariat industriel ou pilote n'est mentionné, ce travail restant une contribution de recherche publiée en preprint.
Dans nos dossiers




