πR²: politiques de flux réactives en temps réel
Des chercheurs présentent πR² (Reactive Real-time Flow Policies), une méthode qui rend les politiques de manipulation robotique par flow matching capables de réagir en temps réel aux données sensorielles, sans sacrifier la taille des modèles ni la prédiction multi-actions. Le problème identifié : les politiques actuelles à base d'"action chunking" (comme GR00T ou Pi-0) génèrent des séquences d'actions en boucle ouverte via de multiples étapes de débruitage sur de gros backbones, ce qui les rend trop lentes pour replanifier fréquemment ; les actions engagées deviennent obsolètes avant d'être exécutées. πR² s'appuie sur le "diffusion forcing" à échéancier de bruit par position et introduit deux mécanismes : un canal rapide de proprioception rafraîchi à chaque tick, découplé d'un canal lent de features vision-langage mis à jour de façon asynchrone, et un échéancier de flow adaptatif à la latence qui traite les actions en cours comme contrainte d'inpainting et n'émet qu'une seule étape de débruitage par appel. Appliqué par fine-tuning à GR00T-N1.7 sur une plateforme réelle xArm6 avec main XHand, πR² replanifie environ 4 fois plus vite que la politique de base, à environ 25Hz sur un GPU A5000, avec une observation fraîche prise en compte toutes les 40 millisecondes. Les auteurs rapportent des gains de taux de réussite allant jusqu'à 23% en simulation et 30% en conditions réelles face à la meilleure référence testée.
Pour l'industrie de la manipulation robotique, ce travail s'attaque à un angle mort connu des politiques VLA (vision-language-action) génératives : la démonstration en environnement contrôlé masque souvent une latence de contrôle incompatible avec des tâches dynamiques (objets en mouvement, contacts imprévus, correction de trajectoire). En dissociant la fréquence de mise à jour proprioceptive de celle, plus coûteuse, de la perception visuo-langagière, πR² propose une piste concrète pour combler l'écart entre boucle ouverte et contrôle réactif sans reconstruire les backbones existants ni renoncer à leur expressivité. C'est un signal utile pour les intégrateurs qui évaluent des plateformes comme GR00T pour des applications nécessitant du contact fin ou de la réactivité, un terrain où les chunks figés posent problème.
Le travail s'inscrit dans la lignée du diffusion forcing, une technique de génération séquentielle par bruitage différencié selon la position, ici adaptée au contrôle robotique. Il se positionne face aux grandes familles de politiques VLA actuelles telles que GR00T N1.7 de NVIDIA (utilisé comme base pour les expériences), Pi-0 de Physical Intelligence ou Helix de Figure, toutes construites sur le même compromis entre taille de backbone et latence. Les auteurs présentent πR² comme une modification légère, applicable par fine-tuning à une politique déjà entraînée plutôt que par un réentraînement complet, ce qui en facilite l'adoption potentielle. Le papier, publié en préprint sur arXiv, reste à ce stade une contribution de recherche testée en laboratoire sur un bras xArm6 et une main XHand, sans indication de déploiement industriel ni de partenaire commercial annoncé.




