LIBERO-MAX : les politiques robotiques s'adaptent-elles quand le monde change ?
LIBERO-MAX est un nouveau benchmark de simulation, présenté sur arXiv, qui teste ce que les politiques robotiques font lorsque la scène change en plein milieu d'une tâche. Il comprend 8 000 cas appariés couvrant huit types de changements: géométrie, observations, apparence, encombrement et trajectoires. Chaque paire compare l'exécution d'une même tâche avec et sans événement en cours de route, en gardant identiques la tâche, l'état initial, la graine de la politique et la séquence d'actions précédant l'événement. Quatorze politiques récentes ont été évaluées, de type VLA (vision-langage-action), hybrides et « world-action ». L'événement fait chuter leur taux de succès de 11,0 à 25,7 points de pourcentage. Les auteurs testent aussi des contrôles de caméra et une variation de la cadence de requête à la politique, et aucun des deux ne supprime l'écart.
Le protocole apparié isole les régressions réellement causées par l'événement des échecs qui existeraient de toute façon sans changement. Pour un intégrateur ou un responsable industriel, c'est un point de méthode important. Beaucoup de benchmarks de robustesse en simulation fixent les conditions externes au moment du reset, alors qu'en atelier une cible se déplace, une caméra est décalée ou un obstacle apparaît pendant l'exécution. Les résultats montrent des vulnérabilités communes face aux changements de géométrie et d'observation, tandis que les classements par famille de politiques s'entremêlent. Aucune architecture ne domine donc clairement. Les contrôles de caméra indiquent que la robustesse dépend à la fois de la compétence dans les nouvelles conditions et de la trajectoire suivie jusque-là, puisque les actions déjà engagées reflètent l'ancienne scène. Réduire l'intervalle entre les requêtes ne règle pas le problème. Il s'agit d'un résultat en simulation uniquement, sans validation sur robot réel, et les valeurs par modèle ne figurent pas dans le résumé.
LIBERO-MAX prolonge la famille de benchmarks LIBERO, devenue une référence pour comparer les VLA en manipulation. Ces benchmarks évaluent le plus souvent des scènes statiques après le reset, et les scores élevés qui en résultent peuvent masquer une fragilité temporelle. Le travail s'inscrit dans un mouvement plus large de mesure de la robustesse des modèles de type Pi-0, GR00T ou Helix, dont les démonstrations sont rarement accompagnées de perturbations en cours de tâche. Les auteurs le présentent comme un banc d'essai reproductible pour diagnostiquer ces échecs et mesurer les progrès. La suite logique sera son adoption par d'autres laboratoires, puis des versions physiques ou des entraînements ciblés sur ces perturbations, mais aucune échéance n'est annoncée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




