SocialVLA : une passerelle de perception sociale pour détecter et corriger les échecs de manipulation VLA à partir des réactions humaines
Des chercheurs publient SocialVLA, une passerelle de perception sociale locale et indépendante de la politique de contrôle, qui transforme les réactions spontanées d'un humain en signaux d'interruption pour les politiques vision-langage-action (VLA) de manipulation. Le système combine quatre briques : détection paralinguistique causale dans l'audio (cris, soupirs, exclamations), reconnaissance de réactions visuelles, détection de phrases d'arrêt explicites et estimation de la pertinence robot, qui vérifie que la réaction concerne bien le robot. Une fusion asynchrone « premier événement » déclenche une pause du VLA dès le premier signal assez fiable. Un canal vocal distinct recueille les corrections verbales pour reprendre, relancer ou réviser l'instruction. L'évaluation a eu lieu sur un Unitree G1 physique avec 15 participants : 238 épisodes annotés justifiant une intervention et 1,038 heure de comportement sans intervention. En rejeu hors ligne figé, le système atteint 54,6 % de rappel et 69,5 % de précision, la fusion audio-vidéo non filtrée montant à 64,3 % de rappel. Sur un 16e participant inédit, en déploiement prospectif, il obtient 59,5 % de rappel et 91,7 % de précision. La latence médiane détecteur-fusion est de 47,9 ms, celle entre la porte VLA et l'arrêt physique de 336 ms, et celle entre le début de la réaction et l'arrêt de 1,021 s.
L'intérêt est de traiter un angle mort des VLA : ces politiques échouent souvent sans reconnaître leurs propres erreurs, et les détecteurs d'échec internes restent peu fiables hors distribution. Utiliser l'humain présent comme capteur d'anomalie, sans micro-gestes ni interface dédiée, ouvre une voie de supervision peu coûteuse pour les cellules collaboratives et les robots de service. Le filtre de pertinence est le résultat le plus concret : il fait passer les épisodes de faux arrêts de 100 à 57 et la précision de 60,5 % à 69,8 %. Pour un exploitant, c'est ce qui sépare un robot qui s'arrête au moindre éclat de voix d'un robot utilisable. Les limites sont nettes. Avec un rappel d'environ 55 à 60 %, plus de 40 % des épisodes à risque échappent au système. Une latence d'environ une seconde entre la réaction et l'arrêt reste longue pour des objets lourds ou tranchants. Les 91,7 % de précision reposent sur un seul participant, ce qui n'a pas de valeur statistique. Ce n'est donc pas une fonction de sécurité, mais une couche de supervision complémentaire.
Le travail s'inscrit dans l'essor des politiques VLA généralistes (Pi-0, GR00T, Helix) et de leurs variantes de détection d'échec et de récupération. Il se place aussi dans la lignée de l'interaction humain-robot, qui exploite depuis longtemps les signaux sociaux implicites. Le choix d'un fonctionnement entièrement local, sans cloud, répond aux contraintes de latence et de confidentialité des déploiements en milieu humain. La plateforme G1 d'Unitree, peu coûteuse, en fait un banc d'essai reproductible. Le système est indépendant de la politique, donc testable en principe sur d'autres VLA. L'étape suivante serait de le valider sur plus de participants, des tâches plus variées et des environnements bruyants, puis de mesurer s'il améliore réellement le taux de réussite des tâches, point que les résultats annoncés ne tranchent pas.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




