Vers des modèles de manipulation robotique efficaces grâce à l'élagage auto-récursif
Des chercheurs proposent LCAM (Loss-Conditioned Activation-Moment pruning), une méthode d'élagage non structuré, sans réentraînement, pour des politiques de manipulation robotique déjà pré-entraînées. Le travail, publié sur arXiv (2610.08555), classe les connexions du réseau selon trois signaux : la contribution des poids normalisée par ligne, les moments d'activation mesurés sur des démonstrations de calibration, et la sensibilité des directions de sortie à la perte de prédiction d'action. Une procédure récursive du grossier au fin recalibre l'importance après chaque étape d'élagage grossier. Une fois passé un « genou » de sparsité, un budget fin est alloué selon la distorsion d'action hors ligne sur des données de validation. Testée sur trois suites LIBERO avec plusieurs politiques robotiques et sur OpenVLA, la méthode atteint 84,0 % de réussite sur LIBERO-Object avec OpenVLA à 50 % d'élagage non structuré, soit plus de 90 % du taux de succès de la politique dense. Les auteurs ajoutent un test réel sur une tâche de ping-pong robotisé, dont ils ne détaillent pas les chiffres dans le résumé.
L'enjeu est le déploiement embarqué de modèles VLA (vision-langage-action), dont la taille pèse sur la latence, la mémoire et la consommation. Les critères d'élagage classiques sont conçus pour la classification d'images ou la vraisemblance des modèles de langage, et dégradent le comportement en boucle fermée. En ciblant directement la perte d'action et en évitant à la fois le réentraînement de récupération et les rollouts en simulateur, LCAM abaisse le coût de compression pour un intégrateur qui souhaite faire tourner une politique sur un calculateur contraint. Il faut toutefois rester prudent. L'élagage non structuré produit des matrices creuses qui n'accélèrent pas automatiquement l'inférence sur GPU ou sur les puces embarquées courantes, sauf support matériel dédié. Les gains annoncés portent sur le taux de succès, pas sur la latence mesurée. Le résultat à 84,0 % concerne une seule suite, LIBERO-Object, un benchmark de simulation relativement favorable, et le ping-pong réel reste une démonstration unique sans statistiques publiées.
Ces travaux s'inscrivent dans le mouvement de compression des modèles VLA, après la montée en puissance d'OpenVLA, de Pi-0 et des approches de distillation, de quantification ou de réduction de couches. Ils prolongent des méthodes d'élagage générales comme Wanda ou SparseGPT, conçues pour les modèles de langage et ici adaptées à l'action. Les suites logiques seraient une validation sur des politiques plus grandes, un élagage structuré compatible avec les accélérateurs, et des mesures de latence sur matériel embarqué, ainsi que des tests sur des tâches de manipulation plus longues et plus variées que LIBERO. Aucun acteur européen n'est cité dans le résumé, et aucun calendrier de diffusion du code ou d'application industrielle n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




