Aller au contenu principal
RecherchearXiv cs.RO 

RoboHarn-Evo : évolution de connaissances physiques hiérarchiques pour une manipulation robotique qui s'auto-améliore

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv RoboHarn-Evo, un « harnais » à double boucle qui fait évoluer une base de connaissances physiques hiérarchiques (HPK, Hierarchical Physical Knowledge) à partir de l'expérience d'interaction, sans jamais mettre à jour les poids du modèle de base. La HPK comporte deux niveaux. La connaissance de tâche indique quelle sous-tâche exécuter et quand elle est achevée. La connaissance d'action décrit des stratégies géométriques relatives à l'objet et leurs effets physiques. À l'exécution, l'agent récupère l'entrée pertinente au niveau de décision concerné, puis l'adapte à la scène courante et à l'objectif. D'un épisode à l'autre, le retour physique sert à réviser les entrées anciennes, à ajuster leur domaine d'applicabilité et à réorganiser la base pour les récupérations suivantes. Sur le benchmark RMBench, le gain moyen de succès atteint 24,2 points selon les modèles d'agent. Avec 80 déroulés d'interaction, le succès sur tâches hors entraînement passe de 48,3 % à 75,0 % pour GPT-5.5 et de 70,0 % à 88,3 % pour GPT-6. Le système corrige plus de 83 % des erreurs de connaissance historiques tout en conservant 95,8 % des connaissances valides. En transfert zéro-shot de RMBench vers RoboDojo, il gagne 35,0 et 25,0 points selon les configurations.

L'intérêt tient à la place de l'amélioration. Les modèles vision-langage pilotent bien la planification longue durée, mais la réussite dépend de l'effet réel des interactions locales : saisie, insertion, alignement. Ici, le progrès vient d'une mémoire externe, lisible et révisable, et non d'un réentraînement ou d'un fine-tuning. Pour un intégrateur, cela suggère une piste d'adaptation sur site moins coûteuse, avec des connaissances auditables, corrigeables et potentiellement transférables d'une cellule à l'autre. Le taux de conservation de 95,8 % répond au risque classique des mémoires d'agents, qui accumulent des règles erronées ou obsolètes. Deux réserves s'imposent toutefois. Les résultats portent sur des benchmarks, très probablement simulés, avec des échantillons de test réduits : les pas de 1,7 point suggèrent une soixantaine de tâches ou d'épisodes hors entraînement, donc des marges d'incertitude notables. Rien n'est dit non plus des temps de cycle, du coût d'inférence ni de la robustesse sur du matériel réel. Le transfert zéro-shot reste par ailleurs un test entre deux environnements de simulation, pas une preuve de généralisation au monde physique.

Ce travail s'inscrit dans la tendance des agents « auto-améliorants » par mémoire et bibliothèques de compétences, transposée à la manipulation. Il se place face aux approches qui passent par l'apprentissage des poids, comme les modèles VLA (vision-langage-action) de type Pi-0, GR00T ou Helix, qui exigent des données de téléopération et du calcul d'entraînement. Il s'appuie sur des modèles de fondation généralistes pour la planification et laisse l'expérience physique enrichir la connaissance externe. La suite logique serait une validation sur robots réels, avec bruit de perception et contacts non modélisés, puis une comparaison directe avec des VLA affinés à budget d'interaction équivalent. Aucun pilote industriel ni calendrier n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
1arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre
2arXiv cs.RO 

Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre

Une étude publiée sur arXiv (2609.20822, 18 septembre 2026) évalue la sécurité des "coding agents", ces systèmes où un modèle de langage écrit directement le code du contrôleur robotique, sans entraînement spécifique au robot. Testés sur des tâches associant un objectif de manipulation à un obstacle interdit de contact, ces agents le heurtent dans la majorité des cas, alors même que leurs traces de raisonnement mentionnent l'obstacle et que le prompt en interdit explicitement le contact: ni la perception ni la consigne ne sont en cause, c'est la planification qui échoue à prioriser la contrainte de sécurité. En décomposant la manipulation en une phase de trajet et un moment de contact, les auteurs identifient deux manques: aucune notion de route dégagée ni de replanification pendant le trajet, aucune prise en compte de la contrainte pendant le geste de contact lui-même. Leur solution, SafeHarness, ajoute une planification de trajet par boîtes englobantes et séquences de points de passage vérifiées avant exécution, plus un choix de position de contact évitant l'obstacle. Résultat: 71,9% de réussite de tâche et 87,5% d'évitement de collision, soit respectivement 6,5 et 27,0 points de plus que le précédent état de l'art, et 2,3 et 1,5 fois les scores du même agent sans ces harnais. Ce résultat nuance l'idée qu'un modèle capable de verbaliser une contrainte de sécurité et de recevoir une consigne explicite s'y conforme automatiquement lors de l'exécution, une hypothèse implicite chez les promoteurs des coding agents comme voie rapide vers des robots généralistes sans données spécifiques. Pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par LLM en environnement partagé avec des humains, l'étude montre qu'un bon prompt ne suffit pas: il faut séparer explicitement planification de trajectoire et exécution du contact dans l'architecture. Elle rappelle aussi qu'un taux de réussite de tâche élevé peut masquer un comportement dangereux tant que le taux de collision n'est pas mesuré séparément. Ces travaux s'inscrivent dans la lignée des approches "code as policy", où un LLM génère un programme de contrôle plutôt que d'être entraîné de bout en bout sur des données robotiques, une piste prisée car elle évite la collecte de données propre à chaque robot. SafeHarness se positionne face à un état de l'art antérieur non nommé dans le résumé, qu'il dépasse nettement sur les deux métriques de sécurité et de performance. Publiée le 18 septembre 2026, l'étude reste un travail de recherche évalué sur des tâches de benchmark, sans plateforme robotique commerciale ni déploiement pilote mentionnés, ni calendrier annoncé pour une éventuelle mise en œuvre au-delà du laboratoire.

RecherchePaper
1 source
DeformSmith : génération hiérarchique d'objets déformables guidée par harnais physique pour la manipulation robotique
3arXiv cs.RO 

DeformSmith : génération hiérarchique d'objets déformables guidée par harnais physique pour la manipulation robotique

Un framework baptisé DeformSmith, décrit dans un article publié sur arXiv en septembre 2026 (arXiv:2609.18620v1) avec une page projet dédiée, automatise la création d'objets déformables physiquement crédibles pour la manipulation robotique, à partir d'un texte ou d'une seule image. Le système combine une construction agentique hiérarchique et un harnais physique partagé : il construit, teste puis affine la géométrie, le modèle physique, le comportement des matériaux et l'interaction avec un bras robotique, jusqu'à obtenir un asset prêt pour la simulation. La boucle se referme via un retour d'interaction robotique, les essais générant des données rejouables qui corrigent l'objet. Les auteurs comparent leur méthode à trois références, PhysGen3D, PhysGM et PhysX-Omni, revendiquant une meilleure qualité visuelle et physique, sans chiffres précis à l'appui. L'enjeu dépasse la démonstration académique. La manipulation d'objets déformables (tissus, câbles, emballages souples, aliments) reste un angle mort des politiques de manipulation robotique actuelles, entraînées surtout sur des objets rigides faute d'assets simulés en nombre et en qualité suffisants. En automatisant leur génération et en bouclant la construction avec un retour d'interaction simulé, DeformSmith cible le goulot d'étranglement des données plus que celui des algorithmes. Pour les laboratoires et intégrateurs qui veulent entraîner des politiques capables de plier, saisir ou déformer des objets mous, un tel outil pourrait réduire la dépendance à la capture de données réelles, coûteuse et difficile à mettre à l'échelle, sans garantir pour autant un transfert direct au monde réel. Le travail s'inscrit dans une lignée de générateurs d'assets physiques pour la simulation robotique, dont PhysGen3D, PhysGM et PhysX-Omni sont les références directes de comparaison. Ces outils partagent le même constat : les moteurs de simulation modernes manquent moins de puissance de calcul que de contenu physiquement cohérent, surtout pour les corps mous. DeformSmith se distingue par son traitement couplé, plutôt que séquentiel, de la géométrie, de la physique et de l'interaction. À ce stade, il s'agit d'une publication de recherche sans déploiement industriel ni partenaire annoncé ; aucun calendrier de validation sur bras robotiques physiques n'est précisé, ce qui reste l'étape suivante logique pour confirmer l'intérêt de la méthode hors simulation.

RecherchePaper
1 source
Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique
4arXiv cs.RO 

Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique

Un preprint publié sur arXiv (2608.05999v1) présente HiRoC (Hierarchical Robotic Control), un cadre de post-entraînement hiérarchique pour les modèles vision-langage-action (VLA) en manipulation robotique. Le principe : séparer la planification de haut niveau de l'exécution des actions. Un module planificateur décompose une tâche complexe en sous-objectifs exécutables, tandis qu'un module exécuteur affine en continu la génération d'actions conditionnées à ces sous-objectifs par apprentissage par renforcement (RL). Avant cette phase de RL, les auteurs alignent d'abord l'exécuteur sur les sous-objectifs du planificateur, pour corriger le désalignement de distribution qui apparaît habituellement entre planification et exécution. Testé sur plusieurs benchmarks de manipulation, HiRoC surpasse de façon constante les méthodes de référence. Le problème est concret : la plupart des méthodes de post-entraînement traitent les VLA comme des politiques plates, ce qui limite la modélisation de la progression d'une tâche et la robustesse sur des manipulations à long horizon. Les approches hiérarchiques existantes reposaient surtout sur de l'apprentissage supervisé à partir de démonstrations hors ligne, sans capacité à s'améliorer par interaction en ligne. En combinant hiérarchie et RL, HiRoC permet au comportement du robot de continuer à s'affiner après l'entraînement initial plutôt que de rester figé aux données de démonstration. Pour les équipes de recherche et les intégrateurs, cela touche une question centrale du secteur : la capacité réelle des VLA à tenir des tâches multi-étapes sans dérive, point faible connu des politiques de bout en bout entraînées uniquement par imitation. Ce travail s'inscrit dans la vague des modèles VLA qui s'appuient sur des modèles vision-langage pré-entraînés pour piloter des bras ou des robots, une approche qui a gagné du terrain ces deux dernières années face aux politiques de contrôle entraînées de zéro. L'article ne mentionne ni déploiement sur robot physique hors simulation, ni partenariat industriel, ni concurrent commercial nommé : il s'agit d'une contribution méthodologique côté recherche. La suite logique passe généralement, pour ce type de méthode, par une validation sur des plateformes robotiques réelles et une comparaison directe avec les cadres hiérarchiques concurrents déjà publiés, un exercice que ce préprint ne couvre pas encore.

RechercheOpinion
1 source