
RoboIRS : orientation des représentations internes à l'inférence pour les politiques robotiques généralistes
Une équipe de chercheurs publie RoboIRS, une méthode de pilotage des représentations internes appliquée à l'inférence. Elle vise les politiques robotiques généralistes de type vision-langage-action (VLA) et les modèles monde-action (WAM). L'équipe collecte des déroulés réussis et échoués, puis entraîne des classifieurs linéaires pour repérer les emplacements du réseau liés au résultat. Elle en déduit, pour chaque tâche, une direction de pilotage injectée dans les activations, sans mise à jour des poids. Sur 15 tâches simulées avec une politique π0.5 gelée, le taux de succès moyen passe de 44,4 % à 66,2 %. La méthode dépasse d'autres interventions à l'inférence, pour un surcoût de calcul que les auteurs qualifient de faible sans le chiffrer dans le résumé. Ils ajoutent une validation en manipulation réelle avec le même π0.5. Ils l'appliquent aussi à Cosmos Policy, un WAM, dont le taux moyen passe de 35,4 % à 55,4 %.
Les VLA se dégradent souvent dès que la tâche s'écarte de la distribution d'entraînement, alors qu'ils conservent une partie de leur capacité. Ces résultats suggèrent qu'une part de cette compétence reste présente dans les représentations internes et peut être réactivée sans fine-tuning. Pour un intégrateur, cela évite de collecter de nouvelles démonstrations et de réentraîner le modèle à chaque variation de site ou de pièce. Le gain, environ 20 points sur les deux familles de modèles, est net. Il faut toutefois le lire avec prudence. Un taux de 66 % ou de 55 % reste loin d'un seuil de production. La direction de pilotage est propre à chaque tâche et exige des rollouts étiquetés succès ou échec, donc une supervision de résultat. Le résumé ne donne pas de chiffres pour les essais réels. Il s'agit enfin d'un preprint, dont les résultats n'ont pas été évalués par des pairs.
π0.5 est la politique généraliste de Physical Intelligence. Elle côtoie Helix de Figure et la famille GR00T de NVIDIA parmi les références du secteur. L'adaptation à de nouvelles conditions passe aujourd'hui surtout par le fine-tuning, l'apprentissage par renforcement ou l'accumulation de données. RoboIRS transpose à la robotique l'idée de « steering » d'activations, déjà explorée sur les grands modèles de langage. La suite logique serait de la tester sur davantage de plateformes et de tâches longues, et de mesurer le surcoût de latence dans des conditions de déploiement. Aucun pilote industriel ni calendrier n'est annoncé. Un site de projet accompagne la publication.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




