Aller au contenu principal
Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement
RecherchearXiv cs.RO 

Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2608.11350v1, catégorie "cross-listing", 13 août 2026) présente SHAPER, un cadre pour l'adaptation sans entraînement d'agents incarnés (embodied agents) construits autour de modèles de fondation. Le principe : les poids du modèle restent figés, et c'est la couche non paramétrique autour de lui, compétences réutilisables et "harnais" de contexte-code, qui évolue via des essais répétés (rollouts) dans l'environnement cible. Le même modèle figé joue à la fois le rôle de planificateur et d'optimiseur, affinant ses compétences externes sans aucune mise à jour de paramètres. Les auteurs évaluent SHAPER sur deux bancs d'essai, VLABench et ESI-Bench, qui couvrent des agents disposant d'interfaces d'action bas niveau différentes, et comparent les résultats à l'exécution pure, au fine-tuning supervisé (SFT) et à des méthodes de mise à l'échelle au moment du test comme la sélection sans vérificateur et le vote.

L'enjeu pour l'industrie robotique est concret. Le fine-tuning supervisé et l'apprentissage par renforcement exigent des données, des fonctions de récompense et des cycles d'entraînement coûteux ; à l'inverse, les approches sans entraînement centrées sur le code s'appuient d'ordinaire sur des API robotiques programmables, souvent absentes des systèmes à interface fixe. SHAPER propose une troisième voie, faire évoluer les compétences et le harnais logiciel plutôt que le modèle lui-même, ce qui intéresserait particulièrement les intégrateurs qui ne peuvent pas se permettre de réentraîner un modèle à chaque nouvel environnement de déploiement. Les résultats restent toutefois issus de bancs d'essai simulés, pas de déploiements sur robots physiques : c'est une preuve de concept méthodologique, pas encore une validation terrain.

Ce travail s'inscrit dans une tendance plus large où la performance des agents incarnés dépend autant du harnais d'exécution, compétences, contexte, interfaces d'action, que des poids du modèle sous-jacent. Il se positionne explicitement entre deux familles d'approches existantes : le fine-tuning et le RL d'un côté, gourmands en données et en calcul, et les approches code-centric sans entraînement de l'autre, limitées par leur dépendance à des API robotiques programmables. L'article ne mentionne ni partenariat industriel ni plateforme robotique commerciale associée ; la suite logique serait une validation sur robots réels pour vérifier si les gains observés sur VLABench et ESI-Bench se transposent hors simulation.

Dans nos dossiers

À lire aussi

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique
1arXiv cs.RO 

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique

Des chercheurs ont publié sur arXiv (identifiant 2606.05395) un framework nommé VASO, pour "Verification-guided Self-evolution of LLM-generated robot skill contracts", qui vise à rendre les compétences robotiques générées par des grands modèles de langage à la fois réutilisables et formellement vérifiables. L'idée centrale : chaque compétence n'est plus un simple script exécutable mais un contrat sémantique à double interface, une interface formelle qui aligne états du robot, observations et commandes de contrôle avec des propositions logiques pour le model checking, et une interface orientée planificateur qui guide la génération de comportements exécutables. Lorsqu'un plan généré échoue à la vérification, VASO traduit la trace de contre-exemple en un gradient textuel qui met à jour le contrat de compétence réutilisable, sans toucher aux poids du modèle de fondation. Sur des plateformes Clearpath Jackal et PX4 (quadrocoptère), le framework atteint 97,2 % de conformité aux spécifications temporelles formelles en moins de 100 échantillons d'optimisation, surpassant les baselines de feedback d'exécution, d'optimisation de prompt et de fine-tuning. Le problème adressé est précis et rarement traité : les boucles d'évolution de compétences existantes, retour d'exécution, tests unitaires, récompenses d'environnement, auto-critique LLM, ne fournissent que des preuves au niveau de la trace. Elles montrent qu'une compétence a fonctionné sur des exécutions échantillonnées, pas qu'elle satisfait des contrats de sécurité temporelle dans des conditions non testées. Pour un intégrateur ou un COO industriel, c'est la différence entre une démo convaincante en lab et un déploiement certifiable en production. Le fait que VASO maintienne les poids du modèle gelés est également notable sur le plan économique : pas de fine-tuning, pas de GPU dédié à la mise à jour du modèle. Ce travail s'inscrit dans la tendance des "physical AI agents" où les LLM orchestrent des comportements robotiques à long horizon depuis des instructions en langage naturel. Les compétences réutilisables sont devenues les unités de base de ces architectures, mais leur fiabilité formelle reste un angle mort notable. Des approches concurrentes comme les VLA (Vision-Language-Action models) ou les frameworks d'optimisation de prompts comme OPRO ne ferment pas cette boucle vérification-évolution. VASO affirme être le premier à le faire explicitement. Il s'agit néanmoins d'un preprint sans validation industrielle publiée, et les résultats obtenus sur deux plateformes relativement simples devront être confirmés sur des environnements plus complexes et des chaînes de compétences plus longues avant d'envisager un déploiement en conditions réelles.

RecherchePaper
1 source
OceanGym : un environnement de référence pour les agents incarnés sous-marins
2arXiv cs.RO 

OceanGym : un environnement de référence pour les agents incarnés sous-marins

Des chercheurs du projet OceanGPT ont publié en septembre 2025 sur arXiv (article 2509.26536, version 3) OceanGym, présenté comme le premier benchmark complet pour les agents incarnés évoluant en environnement océanique sous-marin. La plateforme couvre huit domaines de tâches réalistes et repose sur un framework d'agent unifié piloté par des modèles de langage multimodaux de grande taille (MLLM), combinant perception, mémoire et prise de décision séquentielle. Les agents testés doivent interpréter à la fois des données optiques et sonar, explorer de façon autonome des environnements complexes et mener à bien des objectifs à long horizon, dans des conditions marquées par une faible visibilité et des courants océaniques dynamiques. Le code et les données du benchmark sont mis à disposition sur GitHub, sous l'organisation OceanGPT. Les expériences menées par les auteurs montrent un écart substantiel entre les agents MLLM les plus avancés et des experts humains sur les tâches de perception, de planification et d'adaptation en milieu sous-marin, un constat qui tranche avec le discours ambiant sur la maturité des agents vision-langage-action. Pour l'industrie des véhicules sous-marins autonomes (AUV) et des ROV, ce résultat confirme que l'environnement océanique reste nettement plus exigeant que les domaines terrestre ou aérien, où des benchmarks d'agents incarnés existent déjà depuis plusieurs années. OceanGym fournit ainsi aux équipes de recherche et aux intégrateurs un outil d'évaluation standardisé pour mesurer les progrès réels des agents avant tout déploiement physique, plutôt que de se fier à des démonstrations isolées. Le milieu sous-marin figure, selon les auteurs, parmi les dernières frontières inexplorées de la Terre. Jusqu'ici, l'essentiel des benchmarks d'IA incarnée portait sur des environnements terrestres ou aériens, structurés et bien cartographiés, laissant un vide pour les usages océaniques. OceanGym s'inscrit dans la continuité du projet OceanGPT, dont l'équipe avait déjà développé des modèles de langage dédiés aux sciences océaniques, et prolonge cette démarche vers l'évaluation d'agents capables d'agir physiquement sous l'eau. Les auteurs présentent ce travail comme une étape vers le transfert de ces capacités à de véritables véhicules sous-marins autonomes déployés en conditions réelles, sans toutefois communiquer de calendrier de pilote ni de partenariat industriel à ce stade: le projet reste pour l'instant au niveau de la recherche académique en accès ouvert plutôt que du produit commercial.

RecherchePaper
1 source
De l'exécution passive à l'exploration active : la manipulation incarnée à base d'agents en environnements réalistes
3arXiv cs.RO 

De l'exécution passive à l'exploration active : la manipulation incarnée à base d'agents en environnements réalistes

Une équipe de recherche publie sur arXiv (référence 2609.29091, catégorie "new", soumission datée du 29 septembre 2026 selon le numéro d'article) un framework agentique de manipulation robotique baptisé approche d'exploration active, conçu pour dépasser les limites des systèmes actuels qui exécutent passivement des instructions prédéfinies. L'architecture repose sur trois modules collaboratifs : un module de planification pour le raisonnement de tâche à haut niveau, un module de perception pour la compréhension de la scène visuelle, et un module d'exécution pour la manipulation bas niveau. Les auteurs y ajoutent une stratégie d'entrelacement fin entre perception et exécution, qui couple étroitement le retour visuel à l'exécution des compétences motrices pour renforcer la robustesse de l'exploration. Le système est testé sur une tâche appelée Find-and-Place dans un environnement qualifié de réaliste, où l'objet cible n'est pas visible au départ et doit être activement localisé avant d'être saisi et déposé, en présence de distracteurs et d'indices sémantiques textuels. L'abstract ne fournit ni chiffres de performance, ni comparaison quantitative avec des méthodes concurrentes, ni détails matériels comme le payload ou les degrés de liberté du bras utilisé : il s'agit à ce stade d'une publication de recherche, pas d'un produit ou d'un déploiement commercial. L'intérêt pour l'industrie robotique tient au problème ciblé plus qu'aux résultats chiffrés. La plupart des architectures agentiques embarquées actuelles, y compris certains modèles vision-langage-action déployés en usine ou en entrepôt, restent conçues pour exécuter des instructions dans un environnement largement observable dès le départ. Ce travail pointe une limite réelle et documentée du secteur : dès qu'une cible est cachée, mélangée à des distracteurs ou seulement décrite par du texte, ces systèmes échouent faute de stratégie d'exploration active. Pour les intégrateurs qui visent des cas d'usage domestiques ou logistiques avec désordre et occlusions partielles, ce type de recherche indique que le sujet de l'autonomie perceptive sous observabilité partielle reste ouvert, contrairement à l'idée reçue que les pipelines VLA actuels suffiraient à généraliser à toute scène réelle. Ce papier s'inscrit dans la lignée des travaux récents sur les systèmes agentiques à long horizon pour la manipulation, un axe de recherche actif depuis l'essor des modèles vision-langage-action capables de planification multi-étapes. Il ne cite pas d'acteur industriel ni de robot commercial précis, se positionnant comme une contribution méthodologique plutôt qu'une annonce produit. Aucun calendrier de transfert vers un système déployé, ni partenariat industriel, n'est mentionné à ce stade ; les suites logiques attendues seraient une extension à d'autres tâches de manipulation et une évaluation comparative face aux frameworks agentiques existants.

RecherchePaper
1 source
Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique
4arXiv cs.RO 

Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique

Un preprint publié sur arXiv (2608.05999v1) présente HiRoC (Hierarchical Robotic Control), un cadre de post-entraînement hiérarchique pour les modèles vision-langage-action (VLA) en manipulation robotique. Le principe : séparer la planification de haut niveau de l'exécution des actions. Un module planificateur décompose une tâche complexe en sous-objectifs exécutables, tandis qu'un module exécuteur affine en continu la génération d'actions conditionnées à ces sous-objectifs par apprentissage par renforcement (RL). Avant cette phase de RL, les auteurs alignent d'abord l'exécuteur sur les sous-objectifs du planificateur, pour corriger le désalignement de distribution qui apparaît habituellement entre planification et exécution. Testé sur plusieurs benchmarks de manipulation, HiRoC surpasse de façon constante les méthodes de référence. Le problème est concret : la plupart des méthodes de post-entraînement traitent les VLA comme des politiques plates, ce qui limite la modélisation de la progression d'une tâche et la robustesse sur des manipulations à long horizon. Les approches hiérarchiques existantes reposaient surtout sur de l'apprentissage supervisé à partir de démonstrations hors ligne, sans capacité à s'améliorer par interaction en ligne. En combinant hiérarchie et RL, HiRoC permet au comportement du robot de continuer à s'affiner après l'entraînement initial plutôt que de rester figé aux données de démonstration. Pour les équipes de recherche et les intégrateurs, cela touche une question centrale du secteur : la capacité réelle des VLA à tenir des tâches multi-étapes sans dérive, point faible connu des politiques de bout en bout entraînées uniquement par imitation. Ce travail s'inscrit dans la vague des modèles VLA qui s'appuient sur des modèles vision-langage pré-entraînés pour piloter des bras ou des robots, une approche qui a gagné du terrain ces deux dernières années face aux politiques de contrôle entraînées de zéro. L'article ne mentionne ni déploiement sur robot physique hors simulation, ni partenariat industriel, ni concurrent commercial nommé : il s'agit d'une contribution méthodologique côté recherche. La suite logique passe généralement, pour ce type de méthode, par une validation sur des plateformes robotiques réelles et une comparaison directe avec les cadres hiérarchiques concurrents déjà publiés, un exercice que ce préprint ne couvre pas encore.

RechercheOpinion
1 source