Aller au contenu principal
RecherchearXiv cs.RO 

RoboRSI : auto-évolution stable, efficace et réutilisable des robots dans des environnements réels complexes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient RoboRSI, un système d'auto-amélioration pour robots généralistes, décrit dans l'article arXiv 2610.12424. L'idée de départ est que les agents robotiques qui agissent par code savent déjà corriger leurs programmes à partir du retour d'exécution. Le problème, resté ouvert, est d'organiser cette expérience autour de la structure de la tâche. Chaque correction doit être attribuée à la capacité réellement responsable, appuyée sur des preuves d'exécution et validée avant d'être réutilisée. RoboRSI repose sur le Top-Down Skill Refinement (TSR). Cette méthode décompose les tâches en compétences composées, atomiques et de base, chacune avec un périmètre de responsabilité et un contrat explicite d'entrées et de sorties. Le résultat de chaque exécution est imputé à la branche fautive, et la révision reste confinée à cette branche. Quatre rôles se coordonnent: un Manager, un Planner, un Engineer et un Reviewer. Ils gèrent la planification, l'exécution, le diagnostic et la publication validée des nouvelles compétences. Les humains pilotent le processus par des objectifs et des corrections, et les séquences stables de compétences sont consolidées en compétences composées réutilisables.

Les résultats portent sur deux terrains. Sur un manipulateur mobile, le système développe une tâche de rangement ménager multi-objets en 104 rounds d'amélioration. En simulation, il obtient le meilleur taux de réussite sur LIBERO, LIBERO-PRO, LIBERO-Plus et RoboTwin, devant la meilleure référence avec un écart de 2,7 à 11,0 points de pourcentage. Le résumé ne précise ni le matériel utilisé, ni le taux de réussite final en conditions réelles, ni l'identité des références comparées. L'essai réel ressemble donc à une démonstration sur une seule tâche domestique, et on ne sait pas encore s'il généralise.

Pour les intégrateurs et les responsables industriels, l'intérêt est la traçabilité. Une architecture où une erreur est rattachée à une compétence précise, corrigée localement puis validée avant diffusion répond à un frein bien connu du déploiement: les régressions silencieuses après chaque mise à jour. Les politiques VLA de bout en bout sont difficiles à auditer, alors qu'un code modulaire avec contrats d'entrées et de sorties se prête mieux à la certification et à la maintenance. Le travail suggère aussi que l'amélioration continue peut passer par la capitalisation de compétences plutôt que par le réentraînement de gros modèles. Les gains en simulation, de 2,7 à 11,0 points, restent modestes selon le benchmark. LIBERO et RoboTwin sont par ailleurs des environnements très étudiés, dont les scores ne garantissent pas la robustesse sur site.

Ce travail s'inscrit dans la montée des agents robotiques générant du code, qui utilisent des modèles de langage pour composer des primitives, face aux approches VLA comme Pi-0 ou GR00T, qui apprennent directement des actions. Les benchmarks LIBERO-PRO et LIBERO-Plus ont été conçus pour mesurer la robustesse de ces politiques, et leur usage ici place RoboRSI dans cette comparaison. Il s'agit d'une publication de recherche sur arXiv, sans produit, client ni calendrier de déploiement annoncés. Les prochaines étapes à surveiller sont la publication du code et des compétences, des tests sur d'autres plateformes et des essais hors laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes
1arXiv cs.RO 

Au-delà de la géométrie : navigation topologique efficace dans des environnements 3D complexes

Des chercheurs ont publié sur arXiv (réf. 2605.17302) un framework de planification de trajectoire pour robots mobiles terrestres opérant dans des environnements intérieurs 3D complexes. Le système extrait automatiquement depuis un nuage de points 3D un espace d'états réduit composé uniquement des positions physiquement atteignables par le robot, en appliquant trois contraintes successives : support au sol vérifié, dégagement vertical suffisant pour la hauteur du robot, et connectivité sémantique via propagation par graine (seed-based). Évalué sur cinq scènes issues du dataset Matterport3D et trois scènes du benchmark PCT, le framework atteint une réduction de l'espace d'états supérieure à 80 % par rapport au voxel space brut, avec des temps de recherche A* inférieurs à la milliseconde sur les scènes Matterport3D. Le taux de succès de planification est de 100 % sur 300 requêtes testées. L'enjeu technique central que ce travail adresse est l'ambiguïté géométrique : dans un environnement intérieur dense, les surfaces de meubles (tables, étagères) partagent localement les mêmes propriétés géométriques que le sol navigable. Les approches purement géométriques confondent fréquemment ces surfaces, générant des trajectoires invalides ou des blocages de planification. En imposant une contrainte topologique explicite plutôt que de s'appuyer uniquement sur la courbure ou la normale de surface, le framework sépare structurellement le sol du reste. Pour les intégrateurs de flottes AMR ou AGV en entrepôt ou milieu hospitalier, cette distinction fiable entre navigable et non-navigable sans calibrage manuel représente un gain opérationnel direct, en particulier dans des espaces reconfigurés fréquemment. Ce type d'approche s'inscrit dans un mouvement plus large visant à dépasser les représentations voxel denses, trop coûteuses pour la planification temps-réel embarquée. Des travaux concurrents explorent les champs de distance neuronaux (NeRF-based planning), les graphes de visibilité sur maillages 3D, ou les approches d'apprentissage par renforcement simulé (sim-to-real). Le recours à des datasets standardisés comme Matterport3D et PCT facilite la comparaison reproductible, même si les scènes testées restent des environnements statiques sans agents dynamiques. Les auteurs n'annoncent pas de déploiement matériel, ce qui positionne ce travail comme une contribution algorithmique amont, dont l'intégration dans des stacks robotiques industriels (ROS 2, Nav2) reste à démontrer sur robot physique.

RecherchePaper
1 source
Robots évitant les collisions en temps réel dans des environnements dynamiques
2arXiv cs.RO 

Robots évitant les collisions en temps réel dans des environnements dynamiques

Des chercheurs publient une méthode qui convertit n'importe quel chemin géométrique, c'est-à-dire une simple séquence d'états produite par un planificateur de mouvement quelconque (échantillonné comme RRT ou PRM, ou basé sur la recherche comme ARA*), en une trajectoire réellement exécutable par un robot : cinématiquement faisable et à jerk limité. L'algorithme génère une suite de splines quintiques ou quartiques, discrétisées à une fréquence de contrôle choisie par l'utilisateur, puis diffusées directement vers le contrôleur bas niveau. Il peut être réinvoqué à tout instant pour recalculer une nouvelle trajectoire depuis l'état courant du robot vers une cible ou une séquence de cibles, avec adaptation en temps réel aux changements de l'environnement. Sous l'hypothèse que la vitesse des obstacles reste bornée, la méthode offre des garanties conditionnelles d'arrêt sécurisé sur un intervalle de temps fini, tout en tolérant une déviation géométrique limitée par rapport au chemin d'origine. Les contraintes cinématiques, jerk compris, sont traitées explicitement. En simulation comparative face à une méthode concurrente, les auteurs rapportent un meilleur lissage, un temps de calcul plus faible et de meilleures performances temps réel, en particulier lors de changements fréquents de cible, jusqu'à 1 kHz. Des expériences sur robot réel valident l'approche, y compris dans des scénarios où un humain fait office d'obstacle. Pour les intégrateurs, ce travail cible un problème très concret : la plupart des planificateurs de mouvement produisent des chemins géométriques, pas des trajectoires exécutables respectant les limites physiques du robot en vitesse, accélération et jerk. Combler ce fossé en temps réel, avec des garanties de sécurité formelles même quand des obstacles se déplacent, fait défaut à de nombreuses piles de navigation actuelles destinées aux environnements partagés avec des humains, entrepôts, usines ou bras collaboratifs. La capacité à replanifier jusqu'à 1 kHz sans dégrader la fluidité du mouvement représente un vrai gain pour les systèmes confrontés à des changements rapides de l'environnement, sans imposer le compromis habituel entre réactivité et stabilité. Le domaine de la planification de mouvement reste tiraillé entre planificateurs globaux, qui trouvent un chemin, et méthodes locales, chargées de le rendre exécutable en douceur : les chemins issus d'échantillonnage sont typiquement irréguliers et nécessitent un post-traitement. Les approches existantes de lissage gèrent souvent mal les obstacles dynamiques ou la replanification à haute fréquence, ce qui constitue la référence à laquelle ce travail se compare. La méthode s'appuie sur la génération de trajectoires par splines, technique classique en robotique pour le mouvement à jerk limité, en y ajoutant une gestion explicite des obstacles dynamiques et des garanties formelles d'arrêt sécurisé. Publiée en version révisée sur arXiv, elle ouvre la voie à des validations plus larges sur d'autres plateformes robotiques.

RecherchePaper
1 source
Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement
3arXiv cs.RO 

Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement

Un article publié sur arXiv (2608.11350v1, catégorie "cross-listing", 13 août 2026) présente SHAPER, un cadre pour l'adaptation sans entraînement d'agents incarnés (embodied agents) construits autour de modèles de fondation. Le principe : les poids du modèle restent figés, et c'est la couche non paramétrique autour de lui, compétences réutilisables et "harnais" de contexte-code, qui évolue via des essais répétés (rollouts) dans l'environnement cible. Le même modèle figé joue à la fois le rôle de planificateur et d'optimiseur, affinant ses compétences externes sans aucune mise à jour de paramètres. Les auteurs évaluent SHAPER sur deux bancs d'essai, VLABench et ESI-Bench, qui couvrent des agents disposant d'interfaces d'action bas niveau différentes, et comparent les résultats à l'exécution pure, au fine-tuning supervisé (SFT) et à des méthodes de mise à l'échelle au moment du test comme la sélection sans vérificateur et le vote. L'enjeu pour l'industrie robotique est concret. Le fine-tuning supervisé et l'apprentissage par renforcement exigent des données, des fonctions de récompense et des cycles d'entraînement coûteux ; à l'inverse, les approches sans entraînement centrées sur le code s'appuient d'ordinaire sur des API robotiques programmables, souvent absentes des systèmes à interface fixe. SHAPER propose une troisième voie, faire évoluer les compétences et le harnais logiciel plutôt que le modèle lui-même, ce qui intéresserait particulièrement les intégrateurs qui ne peuvent pas se permettre de réentraîner un modèle à chaque nouvel environnement de déploiement. Les résultats restent toutefois issus de bancs d'essai simulés, pas de déploiements sur robots physiques : c'est une preuve de concept méthodologique, pas encore une validation terrain. Ce travail s'inscrit dans une tendance plus large où la performance des agents incarnés dépend autant du harnais d'exécution, compétences, contexte, interfaces d'action, que des poids du modèle sous-jacent. Il se positionne explicitement entre deux familles d'approches existantes : le fine-tuning et le RL d'un côté, gourmands en données et en calcul, et les approches code-centric sans entraînement de l'autre, limitées par leur dépendance à des API robotiques programmables. L'article ne mentionne ni partenariat industriel ni plateforme robotique commerciale associée ; la suite logique serait une validation sur robots réels pour vérifier si les gains observés sur VLABench et ESI-Bench se transposent hors simulation.

RecherchePaper
1 source
EvoNav-Bench : évaluer la navigation continue dans des environnements évolutifs
4arXiv cs.RO 

EvoNav-Bench : évaluer la navigation continue dans des environnements évolutifs

Des chercheurs présentent EvoNav-Bench, un banc d'essai conçu pour évaluer la navigation "lifelong" (LN) des agents robotiques dans des environnements qui changent au fil du temps, détaillé dans une version révisée déposée sur arXiv (identifiant 2609.08292v2). Construit sur le framework de génération procédurale ProcTHOR et étendant le format GOAT-Bench devenu la référence pour ce type de tâche, ce benchmark introduit des modifications de l'environnement entre les sous-tâches de navigation qu'un même agent doit résoudre séquentiellement dans un lieu donné. Les auteurs y testent trois méthodes récentes qui construisent et réutilisent des représentations persistantes de scène, comme des graphes de scène ou des captures visuelles, pour éviter de ré-explorer un lieu déjà visité. Ils comparent aussi trois stratégies heuristiques de gestion du changement : Frontier-Update, Fail-then-Update et Stage-Reset. Résultat principal : les méthodes existantes se révèlent fragiles dès que l'environnement évolue entre deux tâches. L'enjeu dépasse le simple exercice académique. La plupart des systèmes de navigation "lifelong" actuels supposent un environnement statique, alors que dans un entrepôt, un hôpital ou un domicile, des objets sont déplacés, des portes ouvertes ou fermées, des meubles réarrangés par l'activité humaine. Les benchmarks existants ne révélaient pas ce mode de défaillance : un agent peut fusionner sans discernement des observations obsolètes avec de nouvelles données, dégradant sa fiabilité sans que rien ne l'alerte. Pour les intégrateurs travaillant sur des robots de service ou de logistique s'appuyant sur des mémoires de scène persistantes, ce travail suggère que la simple accumulation d'expérience ne suffit pas : il faut des mécanismes explicites de détection et de mise à jour des changements, sous peine de dégrader la navigation au lieu de l'améliorer. Ce banc d'essai s'inscrit dans la continuité des travaux sur la navigation "goal-oriented" en environnements intérieurs simulés, où ProcTHOR et GOAT-Bench servent de fondations standards à la communauté de recherche en robotique embarquée. Aucun acteur commercial ni robot physique n'est impliqué ici : il s'agit d'un outil d'évaluation destiné aux laboratoires développant des agents de navigation. Les stratégies heuristiques proposées, plutôt que des solutions abouties, offrent une base de comparaison pour de futurs agents dotés de mécanismes d'adaptation plus sophistiqués aux changements de scène.

RecherchePaper
1 source