
R³ : entraîner des robots à raisonner en langage naturel par apprentissage par renforcement
Des chercheurs présentent R³ (R-cubed), une méthode de post-entraînement qui transforme des modèles vision-langage (VLM) génériques en « raisonneurs robotiques » capables de guider des politiques de manipulation bas niveau. La recette se déroule en deux temps : un VLM est d'abord entraîné (mid-training) sur des traces de raisonnement générées par des experts pour installer un style de raisonnement adapté, puis affiné par apprentissage par renforcement à un pas, fondé sur des grilles d'évaluation (rubric-based RL), à partir de données d'action hors ligne. L'équipe a testé R³ sur deux bancs d'essai contrôlés : Language Table et une tâche simulée d'emballage de courses à deux bras (bimanual grocery packing). Sur ces deux benchmarks, R³ améliore l'exploration et la généralisation vers des tâches non vues à l'entraînement, et surpasse nettement des références d'apprentissage par imitation guidées uniquement par instruction. Le travail est publié en préprint sur arXiv (2608.26053, août 2026) et une page de projet est disponible à robotic-reasoner.github.io.
La particularité de R³ tient à la nature du raisonnement produit : contrairement aux méthodes robotiques antérieures, qui utilisent des traces structurées comme simple supervision auxiliaire à l'entraînement, R³ entraîne le modèle à produire un raisonnement en langage libre qui sert directement de guidage au moment de l'exécution, pour piloter des politiques bas niveau souvent bruyantes. L'enjeu dépasse l'exercice académique : les tâches robotiques à long horizon exigent de suivre une progression partielle, de raisonner sur les relations entre objets et de détecter puis corriger des erreurs, des compétences que l'apprentissage par imitation pure peine à capturer. Ces résultats apportent un signal utile au débat en cours dans le secteur des modèles vision-langage-action (VLA), où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à doter bras manipulateurs et robots humanoïdes d'un raisonnement transférable de la simulation au monde réel. R³ suggère que le raisonnement en langage libre, popularisé par les modèles de type o1 sur des problèmes textuels complexes, peut aussi fonctionner comme mécanisme de calcul au moment du test pour la manipulation robotique.
Ce travail s'inscrit dans une tendance plus large visant à transférer aux robots les gains obtenus par les modèles de fondation lorsqu'ils « réfléchissent » avant d'agir, capacité qui a déjà transformé les performances des grands modèles de langage sur les problèmes nécessitant décomposition et anticipation des conséquences. Jusqu'ici, les approches de raisonnement robotique se contentaient le plus souvent d'un signal auxiliaire sans que ce raisonnement pilote réellement l'action finale, ce que R³ cherche précisément à corriger. Les résultats publiés restent toutefois circonscrits à des environnements contrôlés et largement simulés, sans démonstration sur un déploiement réel à grande échelle ni comparaison directe avec des systèmes commerciaux déjà en service. Les auteurs ne précisent pas de calendrier de portage vers des robots physiques ou de tests sur des tâches industrielles plus complexes, ce qui situe R³ comme une contribution de recherche amont plutôt qu'un produit prêt à l'intégration.




