
Les politiques robotiques compactes exigent des représentations visuelles fines
Des chercheurs proposent CoRP (Compressed Representation Policy), une politique de manipulation multi-tâches volontairement compacte: 48,9 millions de paramètres, sans modèle vision-langage ni prior génératif vidéo. Elle sépare un extracteur de représentation d'un générateur d'actions par flow matching. Elle atteint 97,0 % de réussite sur LIBERO et 75,78 % (Clean) et 73,36 % (Randomized) sur RoboTwin 2.0, soit des scores comparables à ceux de systèmes 40,9 à 163,6 fois plus gros. Il s'agit de résultats de benchmarks en simulation, publiés sous forme de préprint arXiv, sans déploiement réel annoncé. Les auteurs fixent ensuite le générateur d'actions et font varier une seule propriété de l'extracteur à la fois. Un ViT-S/14 initialisé aléatoirement tombe à 78,1 % sur LIBERO, un ResNet-34 pré-entraîné sur ImageNet à 74,5 %, et geler l'encodeur coûte 19,8 points. Rééchantillonner chaque vue à 48 tokens bat le passage de tous les tokens de patchs (97,0 % contre 83,2 %).
Le résultat remet en cause une lecture courante du secteur: les gains des VLA (vision-language-action) viendraient surtout de l'échelle ou des priors génératifs. Faute de comparaisons contrôlées, les publications mélangent architecture, taille et pré-entraînement, et ne permettent pas d'isoler ce qui compte. Ici, la représentation visuelle serait le facteur dominant: pré-entraînée, adaptée à la tâche et compressée. Pour un intégrateur ou un décideur, la portée est pratique: une politique de moins de 50 M de paramètres peut tourner sur du matériel embarqué modeste, avec une latence et un coût d'inférence bien plus faibles que des modèles de plusieurs milliards de paramètres. Deux résultats nuancent toutefois cette idée. Un goulot d'information variationnel est pire qu'un budget dur de tokens: il fait chuter LIBERO-Goal de 95,8 % à 33,0 %, car il supprime la sélection de tokens dépendante de l'instruction. Le langage n'aide que si l'observation laisse le but ambigu (LIBERO-Goal passe de 9,2 % à 95,8 %), alors que sur RoboTwin 2.0 sa suppression améliore légèrement le succès.
Ce travail s'inscrit dans la course aux grands VLA (Pi-0, GR00T, Helix, entre autres), qui misent sur des backbones vision-langage massifs ou des priors vidéo. CoRP défend la voie inverse, celle de la politique frugale, et ajoute un argument d'ablation à un débat encore ouvert. Les limites sont claires: LIBERO est déjà proche de la saturation, RoboTwin 2.0 reste simulé, et rien ne dit que ces conclusions tiennent sur des tâches longues, du matériel varié ou des environnements industriels non structurés. La suite logique est une validation sur robots réels et la comparaison avec des modèles de grande taille dans les mêmes conditions. Une page projet est disponible à l'adresse corp-policy.github.io.
Une politique de manipulation de moins de 50 M de paramètres, validée uniquement en simulation, pourrait à terme permettre aux intégrateurs européens de robots industriels (KUKA, ABB, Universal Robots, Festo) d'embarquer l'IA sur du matériel modeste avec un coût d'inférence réduit, mais sans déploiement réel annoncé l'impact reste prospectif.
Dans nos dossiers




