Rho : une base pour des modèles VLA facilement adaptables
Rho, une famille de modèles VLA (vision-langage-action) à poids ouverts pour la manipulation bimanuelle, fait l'objet d'un rapport technique publié sur arXiv. Elle est conçue pour s'adapter à de nouvelles tâches avec peu de données, sur trois plateformes à deux bras représentatives des laboratoires et de l'industrie : YAM Box, UR AI Trainer et FR3 Duo. Les auteurs ont testé l'architecture de l'« action expert » et la recette d'entraînement par ablations, en simulation contrôlée puis sur robots physiques. Ils rapportent que les variantes Rho pour chaque plateforme égalent ou dépassent les VLA à poids ouverts existants, avec les meilleures performances globales sur les tâches, plateformes et références évaluées dans le rapport. Le modèle de base et les checkpoints spécifiques à chaque plateforme sont publiés. Le rapport intègre aussi un mécanisme d'adaptation en ligne : une politique latente interne apprend à partir de corrections humaines à choisir des entrées de bruit, conditionnées par l'observation, pour l'action expert figé, basé sur le flow matching. Avec 15 épisodes corrigés seulement, ce module léger permet au modèle de gérer des situations situées à la périphérie de sa distribution de fine-tuning hors ligne.
L'apport principal tient à la méthode, davantage qu'à un score. Le « midtraining » par plateforme, une étape intermédiaire entre le préentraînement général et le fine-tuning de la tâche, améliore l'adaptation en aval. Cela va dans le sens d'une hypothèse répandue dans le secteur : le goulot d'étranglement des VLA est le coût de déploiement sur un nouveau robot ou une nouvelle tâche, pas la capacité brute du modèle. Pour un intégrateur, la promesse est concrète : le nombre de démonstrations à collecter pèse directement sur le coût d'un projet. Le choix de plateformes commerciales déjà présentes en laboratoire et en usine (Universal Robots, Franka) rend l'approche plus transférable qu'un modèle lié à un humanoïde propriétaire. Des réserves s'imposent toutefois. Les comparaisons sont faites par les auteurs eux-mêmes, sur un ensemble de tâches qu'ils ont choisi, et le rapport ne donne aucun chiffre de taux de succès dans son résumé. Quant à l'adaptation en ligne, la démonstration porte sur des situations « en bordure » de distribution, ce qui reste loin d'une robustesse générale en production.
Rho s'inscrit dans la course aux modèles fondation robotiques à poids ouverts, face à des références comme Pi-0 de Physical Intelligence ou GR00T de NVIDIA, tandis que des acteurs fermés comme Figure (Helix) misent sur des modèles propriétaires liés à leur matériel. Le rapport se positionne comme un point d'appui pour la recherche et pour des usages industriels, sans annoncer de pilote client, de calendrier ni de prix. La suite dépendra de la reproduction indépendante des résultats par d'autres équipes, et de la capacité des checkpoints publiés à tenir sur des tâches d'atelier réelles. Le rapport n'évoque aucun acteur européen dans son résumé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




