RoboHarn-Evo : évolution de connaissances physiques hiérarchiques pour une manipulation robotique qui s'auto-améliore
Des chercheurs publient sur arXiv RoboHarn-Evo, un « harnais » à double boucle qui fait évoluer une base de connaissances physiques hiérarchiques (HPK, Hierarchical Physical Knowledge) à partir de l'expérience d'interaction, sans jamais mettre à jour les poids du modèle de base. La HPK comporte deux niveaux. La connaissance de tâche indique quelle sous-tâche exécuter et quand elle est achevée. La connaissance d'action décrit des stratégies géométriques relatives à l'objet et leurs effets physiques. À l'exécution, l'agent récupère l'entrée pertinente au niveau de décision concerné, puis l'adapte à la scène courante et à l'objectif. D'un épisode à l'autre, le retour physique sert à réviser les entrées anciennes, à ajuster leur domaine d'applicabilité et à réorganiser la base pour les récupérations suivantes. Sur le benchmark RMBench, le gain moyen de succès atteint 24,2 points selon les modèles d'agent. Avec 80 déroulés d'interaction, le succès sur tâches hors entraînement passe de 48,3 % à 75,0 % pour GPT-5.5 et de 70,0 % à 88,3 % pour GPT-6. Le système corrige plus de 83 % des erreurs de connaissance historiques tout en conservant 95,8 % des connaissances valides. En transfert zéro-shot de RMBench vers RoboDojo, il gagne 35,0 et 25,0 points selon les configurations.
L'intérêt tient à la place de l'amélioration. Les modèles vision-langage pilotent bien la planification longue durée, mais la réussite dépend de l'effet réel des interactions locales : saisie, insertion, alignement. Ici, le progrès vient d'une mémoire externe, lisible et révisable, et non d'un réentraînement ou d'un fine-tuning. Pour un intégrateur, cela suggère une piste d'adaptation sur site moins coûteuse, avec des connaissances auditables, corrigeables et potentiellement transférables d'une cellule à l'autre. Le taux de conservation de 95,8 % répond au risque classique des mémoires d'agents, qui accumulent des règles erronées ou obsolètes. Deux réserves s'imposent toutefois. Les résultats portent sur des benchmarks, très probablement simulés, avec des échantillons de test réduits : les pas de 1,7 point suggèrent une soixantaine de tâches ou d'épisodes hors entraînement, donc des marges d'incertitude notables. Rien n'est dit non plus des temps de cycle, du coût d'inférence ni de la robustesse sur du matériel réel. Le transfert zéro-shot reste par ailleurs un test entre deux environnements de simulation, pas une preuve de généralisation au monde physique.
Ce travail s'inscrit dans la tendance des agents « auto-améliorants » par mémoire et bibliothèques de compétences, transposée à la manipulation. Il se place face aux approches qui passent par l'apprentissage des poids, comme les modèles VLA (vision-langage-action) de type Pi-0, GR00T ou Helix, qui exigent des données de téléopération et du calcul d'entraînement. Il s'appuie sur des modèles de fondation généralistes pour la planification et laisse l'expérience physique enrichir la connaissance externe. La suite logique serait une validation sur robots réels, avec bruit de perception et contacts non modélisés, puis une comparaison directe avec des VLA affinés à budget d'interaction équivalent. Aucun pilote industriel ni calendrier n'est annoncé à ce stade.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




