Panne d'image ou gel d'image : analyse des modes de défaillance physiques des modèles VLA face aux défauts de caméra
Des chercheurs publient sur arXiv une analyse des modes de défaillance physique des modèles vision-langage-action (VLA) lorsque leurs caméras tombent en panne. L'étude porte sur π0.5 et GR00T, soumis à deux types de fautes d'entrée : le « blackout » (image noire) et le « freeze » (image figée). Les auteurs observent que, même quand le taux de réussite des tâches est aussi bas dans les deux cas, les comportements physiques diffèrent nettement. Le gel d'image produit des mouvements articulaires plus extrêmes. Le blackout survenant après la fermeture de la pince provoque davantage de chutes d'objets, surtout quand le modèle n'a pas accès à la proprioception, c'est-à-dire à l'état courant du robot. Des expériences d'intervention sélective montrent que la proprioception compense en partie l'absence de représentation visuelle du robot et réduit les contacts avec des objets non ciblés. Elle ne suffit cependant pas à rétablir la réussite de la tâche lorsque l'information sur l'objet issue de la caméra poignet disparaît, même avec l'aide de la vue de scène restante. Deux parades sont testées : un entraînement avec coupures de caméra et le remplacement, sans réentraînement, des embeddings visuels défaillants. Des essais sur robot réel complètent le travail.
Ces résultats déplacent la question de la robustesse des VLA. Le taux de succès, métrique dominante dans les démonstrations et les benchmarks, masque la nature de l'échec : deux pannes qui donnent le même score peuvent avoir des conséquences physiques très différentes, entre un bras qui s'emballe et un objet qui tombe. Pour un intégrateur ou un responsable sécurité, c'est un point de conception critique, car un cobot ou un humanoïde piloté par VLA ne peut pas se contenter d'un indicateur de réussite pour être jugé sûr en atelier ou en entrepôt. L'étude montre aussi que les deux mitigations, si elles améliorent le succès dans certaines conditions, peuvent augmenter les contacts non désirés ou les perturbations des objets voisins. Les essais réels confirment qu'une tâche menée à bien sous caméra défaillante peut impliquer des interactions physiques non prévues. Un bon résultat peut donc cacher un comportement dangereux.
Le travail s'inscrit dans la montée en puissance de politiques généralistes comme π0.5 et GR00T, désormais évaluées au-delà de la seule performance nominale. Les pannes de capteurs, fréquentes en production (câble, poussière, saturation, latence), restent peu étudiées au regard de leur poids dans un déploiement réel. Les auteurs plaident pour des politiques qui exploitent l'information encore disponible, état du robot et vues restantes, afin de limiter les mouvements dangereux. Il s'agit d'un preprint, sans revue par les pairs à ce stade, et ses conclusions portent sur deux modèles et des conditions de test précises. Elles appellent à être reproduites sur d'autres architectures avant d'en tirer des règles générales de certification.
Pas d\'impact direct sur la France/UE




