Aller au contenu principal
SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot
RecherchearXiv cs.RO 

SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du MIT ont publié SOLE-R1 (Self-Observing LEarner), un modèle de raisonnement vidéo-langage conçu pour fonctionner comme signal de récompense exclusif dans l'apprentissage par renforcement (RL) en robotique, sans aucun accès à des récompenses terrain, indicateurs de succès, démonstrations ou réglages spécifiques à la tâche. Soumis sur arXiv (2503.28730v2), le système prend en entrée uniquement des observations vidéo brutes et un objectif en langage naturel, puis génère à chaque pas de temps un raisonnement spatiotemporel de type chain-of-thought (CoT) pour estimer de façon dense la progression de la tâche. Entraîné sur un pipeline de synthèse massif de trajectoires vidéo annotées temporellement, SOLE-R1 combine fine-tuning supervisé et RL depuis des récompenses vérifiables. Évalué sur quatre environnements de simulation distincts et en setting réel, il réussit 24 tâches de manipulation inédites en apprentissage zéro-shot depuis une initialisation aléatoire.

L'enjeu central que résout SOLE-R1 est celui du reward hacking : aujourd'hui, utiliser un VLM généraliste comme évaluateur RL expose le système à des erreurs perceptuelles sous observabilité partielle ou changement de distribution, que la politique apprenante exploite rapidement au lieu de résoudre réellement la tâche. SOLE-R1 surpasse nettement des comparatifs forts - Robometer, RoboReward, ReWiND, mais aussi GPT-5 et Gemini-3-Pro - sur la robustesse à ce phénomène. Pour les intégrateurs et ingénieurs robotique, c'est un signal concret que le goulot d'étranglement du RL sur robot réel (définir une fonction de récompense dense et fiable) peut être délégué à un modèle de raisonnement vidéo entraîné spécifiquement, sans instrumentation matérielle supplémentaire.

SOLE-R1 s'inscrit dans un courant actif qui cherche à remplacer les récompenses codées à la main par des superviseurs fondationnels (EUREKA d'NVIDIA, VLM-RM, SuSIE). La différence revendiquée ici est le raisonnement CoT temporel explicite par pas de temps, contre des évaluations épisodiques ou des scores scalaires instantanés. Le projet est encore au stade preprint sans déploiement industriel annoncé, mais les modèles, données et code sont publiés en open access sur la page anonyme du MIT. Les prochaines étapes naturelles seraient la validation sur des plateformes commerciales (Figure, Unitree, Boston Dynamics Spot) et l'extension à des tâches longue-horizon en environnement non structuré, deux gaps que l'article ne comble pas encore.

À lire aussi

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision
1arXiv cs.RO 

Comparaison des espaces d'action en apprentissage par renforcement pour la manipulation robotique basée sur la vision

Des chercheurs ont publié le 23 juin 2026 une étude comparative systématique (arXiv:2606.18594) évaluant quatre types d'espaces d'action en apprentissage par renforcement (RL) pour la manipulation robotique visuelle : l'incrément de pose, la vitesse de pose, l'incrément de position articulaire, et la vitesse articulaire. Les politiques ont été entraînées en simulation puis déployées sur robot réel via transfert sim-to-réel, sur deux tâches benchmark : la saisie d'objet et la poussée d'objet. Résultat principal : l'espace d'action en vitesse articulaire (joint velocity) surpasse les trois autres alternatives, aussi bien en fluidité de mouvement qu'en performance finale sur les deux tâches testées. Ce résultat a une portée pratique directe pour les ingénieurs qui conçoivent des systèmes de manipulation autonome. Le choix de l'espace d'action est une décision d'architecture souvent sous-documentée dans la littérature RL appliquée, et les praticiens se retrouvent fréquemment à tâtonner empiriquement. En démontrant que la vitesse articulaire favorise à la fois la sécurité (mouvements plus lisses, moins de à-coups) et la performance sur des tâches visuelles, l'étude fournit une recommandation actionnable. Elle confirme aussi que le gap sim-to-réel dépend non seulement de la politique apprise, mais de la représentation même des actions, un levier souvent négligé dans les pipelines de transfert. Pour les intégrateurs travaillant avec des bras industriels ou des cobots, cette granularité de contrôle peut directement influer sur la durée de vie mécanique et la robustesse opérationnelle. L'étude s'inscrit dans un courant de recherche croissant sur la robustesse du transfert sim-to-réel pour la manipulation visuelle, aux côtés de travaux sur les politiques visuomotrices à base de transformeurs (VLA) comme pi-0 de Physical Intelligence ou les approches diffusion-policy popularisées par Columbia et Toyota Research Institute. Contrairement à ces méthodes qui s'intéressent à l'architecture du modèle, ce papier intervient en amont, au niveau du signal de commande lui-même. Les auteurs annoncent des recommandations pratiques pour le choix d'espace d'action selon le contexte (simulation seule ou déploiement réel), ce qui en fait une référence méthodologique utile pour les équipes démarrant un projet RL sur hardware.

RecherchePaper
1 source
Stabilité de la récompense par transition d'étapes pour l'apprentissage par renforcement
2arXiv cs.RO 

Stabilité de la récompense par transition d'étapes pour l'apprentissage par renforcement

Une équipe de recherche présente STDR (Stage-Transition Dense Reward), un framework qui transforme des vidéos de démonstration non structurées en récompenses denses pour entraîner des agents d'apprentissage par renforcement (RL) sur des tâches de manipulation robotique à long horizon, sans design manuel de fonction de récompense. Le système infère automatiquement la structure en étapes d'une tâche à partir des démonstrations, puis fournit deux signaux complémentaires pendant l'entraînement en ligne : une récompense orientée objectif à chaque transition d'étape, et un signal de progression fine à l'intérieur de chaque étape. Un mécanisme de détection hors distribution (OOD) et un module de régulation de la préhension ont été ajoutés pour éviter le "reward hacking", ce biais classique où l'agent exploite des failles de la fonction de récompense plutôt que d'accomplir réellement la tâche. Les tests couvrent 14 tâches de manipulation réparties sur trois bancs d'essai standards du domaine, MetaWorld, ManiSkill et Franka Kitchen, avec des validations complémentaires sur robot réel. L'enjeu dépasse la seule performance académique. Concevoir des récompenses denses à la main reste l'un des goulots d'étranglement majeurs du RL appliqué à la robotique industrielle : chaque nouvelle tâche, chaque nouvelle configuration d'objets impose de retravailler manuellement le signal d'apprentissage, ce qui freine le déploiement à grande échelle chez les intégrateurs. En montrant que STDR égale voire dépasse les récompenses handcrafted sur plusieurs tâches complexes, tout en gagnant en efficacité d'échantillonnage, l'étude appuie l'hypothèse selon laquelle l'apprentissage par vidéos de démonstration peut remplacer l'ingénierie de récompense ad hoc, un argument déterminant pour accélérer l'entraînement de bras robotiques ou de mains manipulatrices en environnement réel plutôt qu'en simulation pure. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage de récompenses par vision (reward learning from video), un axe actif face aux limites du reward shaping manuel et aux coûts d'annotation. Les résultats sur robot réel, où STDR assigne des récompenses stables et bien calibrées sur les exécutions réussies tout en pénalisant correctement les échecs, suggèrent une robustesse au bruit visuel qui manquait souvent aux approches précédentes. Les prochaines étapes attendues porteront sur l'extension à des tâches encore plus longues et sur l'intégration avec des politiques de type VLA (vision-language-action) pour la généralisation multi-tâches.

RecherchePaper
1 source
R³ : entraîner des robots à raisonner en langage naturel par apprentissage par renforcement
3arXiv cs.RO 

R³ : entraîner des robots à raisonner en langage naturel par apprentissage par renforcement

Des chercheurs présentent R³ (R-cubed), une méthode de post-entraînement qui transforme des modèles vision-langage (VLM) génériques en « raisonneurs robotiques » capables de guider des politiques de manipulation bas niveau. La recette se déroule en deux temps : un VLM est d'abord entraîné (mid-training) sur des traces de raisonnement générées par des experts pour installer un style de raisonnement adapté, puis affiné par apprentissage par renforcement à un pas, fondé sur des grilles d'évaluation (rubric-based RL), à partir de données d'action hors ligne. L'équipe a testé R³ sur deux bancs d'essai contrôlés : Language Table et une tâche simulée d'emballage de courses à deux bras (bimanual grocery packing). Sur ces deux benchmarks, R³ améliore l'exploration et la généralisation vers des tâches non vues à l'entraînement, et surpasse nettement des références d'apprentissage par imitation guidées uniquement par instruction. Le travail est publié en préprint sur arXiv (2608.26053, août 2026) et une page de projet est disponible à robotic-reasoner.github.io. La particularité de R³ tient à la nature du raisonnement produit : contrairement aux méthodes robotiques antérieures, qui utilisent des traces structurées comme simple supervision auxiliaire à l'entraînement, R³ entraîne le modèle à produire un raisonnement en langage libre qui sert directement de guidage au moment de l'exécution, pour piloter des politiques bas niveau souvent bruyantes. L'enjeu dépasse l'exercice académique : les tâches robotiques à long horizon exigent de suivre une progression partielle, de raisonner sur les relations entre objets et de détecter puis corriger des erreurs, des compétences que l'apprentissage par imitation pure peine à capturer. Ces résultats apportent un signal utile au débat en cours dans le secteur des modèles vision-langage-action (VLA), où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à doter bras manipulateurs et robots humanoïdes d'un raisonnement transférable de la simulation au monde réel. R³ suggère que le raisonnement en langage libre, popularisé par les modèles de type o1 sur des problèmes textuels complexes, peut aussi fonctionner comme mécanisme de calcul au moment du test pour la manipulation robotique. Ce travail s'inscrit dans une tendance plus large visant à transférer aux robots les gains obtenus par les modèles de fondation lorsqu'ils « réfléchissent » avant d'agir, capacité qui a déjà transformé les performances des grands modèles de langage sur les problèmes nécessitant décomposition et anticipation des conséquences. Jusqu'ici, les approches de raisonnement robotique se contentaient le plus souvent d'un signal auxiliaire sans que ce raisonnement pilote réellement l'action finale, ce que R³ cherche précisément à corriger. Les résultats publiés restent toutefois circonscrits à des environnements contrôlés et largement simulés, sans démonstration sur un déploiement réel à grande échelle ni comparaison directe avec des systèmes commerciaux déjà en service. Les auteurs ne précisent pas de calendrier de portage vers des robots physiques ou de tests sur des tâches industrielles plus complexes, ce qui situe R³ comme une contribution de recherche amont plutôt qu'un produit prêt à l'intégration.

RecherchePaper
1 source
Vers une navigation socialement conforme en apprentissage par renforcement profond via une récompense basée sur la proxémique
4arXiv cs.RO 

Vers une navigation socialement conforme en apprentissage par renforcement profond via une récompense basée sur la proxémique

Des chercheurs ont publié le 14 août 2026 sur arXiv (arXiv:2608.12917v1) un article intitulé "Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling", proposant une nouvelle fonction de récompense pour l'apprentissage par renforcement profond (DRL) appliqué à la navigation robotique en environnement peuplé. Le système modélise l'espace personnel de chaque humain comme un champ gaussien radial multi-composantes, dérivé de la théorie des proxémies d'Edward Hall, et calcule un coût local centré sur le robot à partir de son champ de vision. Cette récompense a été intégrée à plusieurs méthodes de navigation DRL existantes et testée en simulation sur divers scénarios de foule, densités de population et fonctions de récompense de référence, en mesurant à la fois des métriques de navigation et des métriques sociales. Les résultats montrent une amélioration constante des métriques sociales tout en maintenant des performances de navigation comparables aux modèles concurrents, mais l'ensemble des expériences reste confiné à la simulation, sans déploiement matériel réel. Cette contribution cible un point de friction majeur pour les robots mobiles autonomes (AMR) et robots de service appelés à opérer parmi des humains, en entrepôt, hôpital, aéroport ou bureau: la plupart des méthodes DRL actuelles optimisent avant tout l'atteinte rapide d'un objectif, au détriment du confort social, produisant des trajectoires perçues comme intrusives ou imprévisibles. En rendant le signal social dense et interprétable plutôt que binaire ou épars, l'approche cherche à corriger un angle mort connu de la recherche en navigation sociale, où le compromis entre efficacité de tâche et conformité sociale reste mal résolu. Pour les intégrateurs et décideurs B2B, l'intérêt est direct: des robots respectant des distances sociales cohérentes réduisent les frictions d'acceptation en environnement partagé, un frein régulièrement cité au déploiement à grande échelle. Le résultat reste toutefois un travail de simulation, pas une validation terrain: l'écart classique entre démonstration en simulateur et comportement réel n'est pas comblé par ces travaux. L'approche s'appuie sur la théorie des proxémies formulée par l'anthropologue Edward Hall dans les années 1960, qui catégorise les distances interpersonnelles selon le contexte social et culturel. Le champ de la navigation sociale par renforcement s'est construit autour de plusieurs modèles de récompense concurrents, utilisés ici comme lignes de base de comparaison, sans qu'aucune entreprise ni robot commercial ne soit associé à ces travaux, purement académiques. Contrairement aux annonces récentes de robots humanoïdes industriels, cet article ne présente ni matériel, ni déploiement, ni partenariat commercial: il s'agit d'une contribution méthodologique pour la communauté recherche en robotique et en apprentissage par renforcement, sans calendrier annoncé pour une validation sur plateforme physique réelle.

RecherchePaper
1 source