Aller au contenu principal
RecherchearXiv cs.RO 

Verti-WM : un modèle du monde extéroceptif assisté par la physique pour l'apprentissage par renforcement tout-terrain

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Verti-WM, un modèle de monde physique et extéroceptif destiné à l'apprentissage par renforcement en navigation tout-terrain, a été présenté dans un article déposé sur arXiv sous la référence 2609.23118. Le système fusionne de façon récurrente un Transformer figé, dédié aux terrains rigides, et un modèle neuro-symbolique de terramécanique pour les terrains déformables, en interrogeant à chaque pose prédite une carte fournie pour en extraire l'élévation et la sémantique du sol, ce qui permet des simulations à six degrés de liberté sans accès supplémentaire à un simulateur. Cette approche réduit l'erreur de prédiction de 34,6% par rapport à une base purement data-driven et de 21,7% par rapport à une base purement physique. Des politiques entraînées uniquement dans Verti-WM atteignent des taux de réussite comparables à celles entraînées dans un simulateur haute-fidélité, tout en réduisant le temps de calcul d'un facteur 23,6. Les auteurs valident enfin l'approche sur des données réelles: une politique optimisée dans une dynamique apprise à partir du monde réel atteint 80% de réussite sur la plateforme robotique Verti-4-Wheeler, contre 40% pour un transfert sim-to-real direct.

Ce travail cible une limite connue des world models utilisés en RL: la seule proprioception ne suffit pas à anticiper les interactions roue-sol en tout-terrain, où la nature du sol change radicalement la dynamique du véhicule. En combinant un module data-driven efficace sur sols rigides avec un modèle physique adapté aux sols déformables, Verti-WM atténue le compromis habituel entre fidélité physique et coût de collecte de données en simulation haute-fidélité. Pour les équipes robotiques travaillant sur des véhicules autonomes tout-terrain, agricoles, de défense ou d'exploration, la division par plus de 23 du temps de calcul change l'économie de l'entraînement de politiques, et l'écart entre 80% et 40% de réussite en conditions réelles constitue une indication chiffrée, bien que limitée à une seule plateforme, de réduction du fossé sim-to-real.

Le travail s'inscrit dans la continuité des recherches sur les world models pour la RL, transposées ici au véhicule tout-terrain, domaine historiquement partagé entre approches data-driven et modèles physiques de terramécanique que Verti-WM cherche à combiner. La validation s'appuie sur la plateforme Verti-4-Wheeler, déjà utilisée dans des travaux antérieurs du même laboratoire sur la navigation verticale tout-terrain. L'article ne mentionne aucun partenaire industriel ni plan de déploiement commercial: il s'agit à ce stade d'une contribution académique, dont les suites attendues porteraient sur l'extension à d'autres plateformes, d'autres types de terrains déformables et une validation à plus grande échelle du transfert sim-to-real.

Dans nos dossiers

À lire aussi

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
1arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source
WOMBET : transfert d'expérience par modèle du monde pour un apprentissage par renforcement robuste et efficace
2arXiv cs.RO 

WOMBET : transfert d'expérience par modèle du monde pour un apprentissage par renforcement robuste et efficace

Une équipe de chercheurs présente WOMBET (World Model-Based Experience Transfer), un cadre d'apprentissage par renforcement (RL) publié sur arXiv sous la référence 2604.08958 (troisième version, indiquant un travail en révision active). Le constat de départ est simple : en robotique, collecter des données d'entraînement est coûteux et potentiellement risqué, ce qui freine l'adoption du RL réel. WOMBET répond à ce problème en deux temps. D'abord, un modèle du monde (world model) est appris sur une tâche source, et sert à générer synthétiquement un jeu de données hors-ligne via une planification pénalisée par l'incertitude épistémique. Les trajectoires générées sont ensuite filtrées selon deux critères : rendement cumulé élevé et faible incertitude. Ensuite, un agent s'affine en ligne sur la tâche cible, avec un échantillonnage adaptatif qui équilibre progressivement données offline (issues du world model) et données online (issues de l'environnement réel), assurant une transition stable. Les auteurs formalisent également que l'objectif pénalisé constitue une borne inférieure du rendement vrai, et décomposent l'erreur finie en termes de décalage de distribution et d'erreur d'approximation. Le gain pratique est réel : WOMBET améliore la vitesse de convergence et les performances finales sur des benchmarks de contrôle continu (probablement DeepMind Control Suite ou MuJoCo, non précisés dans l'abstract) par rapport à des baselines solides. Pour la robotique industrielle, où chaque heure de collecte sur robot physique se paie cher, la capacité à générer des données fiables via un modèle appris, tout en contrôlant leur qualité par l'incertitude, est un levier concret. La double garantie -- théorique et empirique -- est rare dans ce domaine et renforce la crédibilité de l'approche au-delà d'un simple résultat expérimental. Ce travail s'inscrit dans un courant actif qui associe world models et RL offline-to-online, où des systèmes comme DreamerV3 ou TD-MPC2 font référence. WOMBET se distingue en ciblant explicitement le problème du transfert inter-tâche, là où la majorité des approches existantes supposent un jeu de données fixe et pré-collecté. Aucune entreprise ni partenariat industriel n'est mentionné ; il s'agit de recherche académique à stade préprint. Trois versions déposées suggèrent des révisions significatives en cours, possiblement vers une soumission en conférence (NeurIPS, ICML, CoRL). Les prochaines étapes naturelles seraient une validation sur hardware réel et une comparaison avec des méthodes de sim-to-real transfer plus classiques.

RecherchePaper
1 source
Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques
3arXiv cs.RO 

Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques

Des chercheurs proposent VLAJS (Vision-Language-Action Jump-Starting), une méthode publiée sur arXiv (réf. 2604.13733v2) visant à accélérer l'apprentissage par renforcement (RL) en manipulation robotique. Le principe repose sur l'utilisation d'un modèle VLA comme guide transitoire en début d'entraînement, sans imitation stricte ni démonstrations humaines. VLAJS augmente l'algorithme PPO (Proximal Policy Optimization) d'une régularisation directionnelle qui aligne progressivement les actions de l'agent RL avec les suggestions du VLA, avant d'annuler cette contrainte à mesure que l'agent gagne en compétence. La méthode a été évaluée sur six tâches simulées (levée d'objet, pick-and-place, réorientation et insertion de cheville, poking, pushing), dont un sous-ensemble validé sur un bras Franka Panda réel. Elle réduit de plus de 50 % le nombre d'interactions d'entraînement nécessaires par rapport à PPO seul ou aux baselines de distillation, et démontre un transfert sim-to-real zero-shot robuste face à des encombrements, variations d'objets et perturbations externes. Ce résultat répond à une tension structurelle bien connue du domaine: les modèles VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) excellent dans le raisonnement à l'échelle de la tâche grâce à leur préentraînement multimodal massif, mais restent trop lents pour le contrôle en boucle fermée à haute fréquence. Inversement, le RL classique assure cette précision mais explore de façon inefficace sur des tâches longues avec récompenses éparses. VLAJS prouve qu'un VLA peut être utile sans être interrogé en continu, réduisant potentiellement les coûts d'entraînement pour des applications de manipulation industrielle et validant l'hypothèse qu'un modèle généraliste peut servir d'amorce dans des pipelines RL orientés production. VLAJS émerge dans un contexte de convergence entre fondations VLA et contrôle temps-réel, où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Google DeepMind (RT-2) s'affrontent sur la généralisation pendant que le RL pur domine en précision. Cette contribution reste académique: validée sur le Franka Panda à 7 degrés de liberté, elle n'est pas encore un produit déployé ni industrialisé, et la réduction de 50 % des interactions porte sur des tâches relativement courtes en simulation. Les suites naturelles incluent l'extension à des morphologies plus complexes (humanoïdes, systèmes bimanuels) et l'intégration dans des frameworks d'entraînement open-source comme Isaac Lab ou ManiSkill.

RechercheOpinion
1 source
ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique
4arXiv cs.RO 

ReActor : apprentissage par renforcement pour le reciblage de mouvement avec physique

Une équipe de chercheurs a publié ReActor (arXiv:2605.06593, mai 2026), un cadre d'optimisation bilevel qui résout simultanément le retargeting cinématique et l'entraînement de la politique de suivi par apprentissage par renforcement. Le problème est connu : transposer une séquence de mouvement humaine capturée sur un robot aux articulations différentes génère systématiquement des artefacts physiques rédhibitoires, glissement de pieds, auto-collisions ou trajectoires dynamiquement infaisables, qui dégradent l'imitation learning en aval. ReActor élimine ces pathologies en intégrant directement le retargeting dans la simulation physique, avec un gradient approximé pour le niveau supérieur de l'optimisation et un ensemble sparse de correspondances sémantiques entre corps rigides. Aucun réglage manuel n'est requis. Le framework a été validé en simulation et sur hardware réel, notamment sur un quadrupède, morphologie particulièrement éloignée du référentiel humain. Ce résultat cible un goulet d'étranglement concret dans les pipelines d'imitation learning : la majorité des démonstrations actuelles reposent sur des données de mouvement nettoyées à la main ou des trajectoires synthétiques, deux approches coûteuses qui freinent le passage à l'échelle. En garantissant la cohérence physique dès le retargeting, ReActor produit des données directement exploitables sans post-traitement, réduisant le cycle de production de policies. L'absence de tuning manuel est stratégique pour les intégrateurs : le même framework peut s'appliquer à des morphologies très différentes sans réingénierie spécifique. La validation hardware sur quadrupède renforce la crédibilité face à des travaux restés confinés au sim-to-sim. Ce champ de recherche s'est intensifié avec l'essor des modèles d'action visuels (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui exigent de larges corpus de démonstrations physiquement cohérentes pour généraliser. ReActor se positionne face à des approches comme PHC ou MoCapAct en se distinguant par son couplage natif à la simulation physique plutôt qu'une correction post-hoc. Il s'agit pour l'instant d'un preprint académique sans partenariat industriel annoncé. La prochaine étape logique serait une validation sur robot humanoïde complet, où les contraintes dynamiques et les degrés de liberté supplémentaires rendent le problème encore plus sévère.

RecherchePaper
1 source