
LabEvolver : évolution d'expérience sans entraînement pour des agents de laboratoire humide sûrs et ancrés
Des chercheurs ont présenté LabEvolver, un framework sans entraînement (training-free) qui dote les agents robotiques de laboratoire d'une mémoire épisodique construite à partir de leur propre expérience d'exécution. Le système combine une boucle interne ancrée dans l'état, chargée de la perception adaptative, de la planification en ligne et de la validation de sécurité, avec une boucle externe d'évolution qui distille les trajectoires complétées en compétences, stratégies et connaissances de sécurité réutilisables. Sur des tâches robotiques de préparation de solutions en laboratoire, LabEvolver réduit de 48,2% le temps nécessaire à la régulation du pH et de 60,0% le nombre d'interventions des garde-fous de sécurité par rapport à une méthode de référence. Sur le benchmark ALFWorld, qui teste des agents dans des environnements domestiques simulés, le taux de succès cumulé sur 20 étapes passe de 76,2% avec la méthode ReAct à 91,4%, résultat obtenu sur 500 tâches continues, ce qui montre que l'approche généralise au-delà du seul contexte du laboratoire. Le code du projet est disponible sur GitHub, sous le compte AndyGao6186.
Pour l'automatisation de laboratoire, ce résultat s'attaque à un problème central: la plupart des agents pilotés par des modèles de langage échouent à progresser durablement parce qu'ils repartent de zéro à chaque tâche, sans capitaliser sur leurs erreurs passées. En évitant tout réentraînement du modèle et en s'appuyant sur une mémoire d'expérience accumulée, LabEvolver propose une voie moins coûteuse et plus rapide à déployer que le fine-tuning classique, un argument qui compte pour les intégrateurs de robotique de laboratoire où les cycles de test sont longs et les erreurs coûteuses en réactifs ou en sécurité. La baisse marquée des interceptions de sécurité est le chiffre le plus significatif pour les décideurs industriels: elle suggère que le système apprend à anticiper les situations à risque plutôt que de simplement se faire bloquer par des garde-fous statiques, ce qui va dans le sens d'une automatisation scientifique en boucle fermée, où le robot ajuste son comportement sans supervision humaine constante.
LabEvolver s'inscrit dans la lignée des travaux récents sur les agents LLM dotés de mémoire épisodique pour la robotique, une alternative à l'apprentissage par renforcement classique jugée trop gourmande en données et en calcul pour des tâches de laboratoire à faible marge d'erreur. La comparaison avec ReAct, méthode de référence pour le raisonnement et l'action séquentielle des agents LLM, positionne LabEvolver comme une amélioration incrémentale plutôt qu'une rupture méthodologique, la boucle d'évolution externe étant l'apport principal par rapport aux architectures agent-plus-outils existantes. Les auteurs présentent leurs résultats comme une preuve de faisabilité plutôt qu'un système prêt pour un déploiement industriel généralisé: les tests restent limités à la préparation de solutions et n'abordent pas encore la diversité des protocoles d'un vrai laboratoire de recherche. La publication sur arXiv fin juillet 2026 et l'ouverture du code laissent présager des extensions à d'autres tâches de laboratoire dans les prochains mois.
Dans nos dossiers




