Vers le paradigme vision-son-langage-action : le framework HEAR pour la manipulation centrée sur le son
Une équipe de recherche a publié sur arXiv (2603.16086v2) une version révisée de l'article "Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation", qui formalise le paradigme Vision-Sound-Language-Action (VSLA), étendant les modèles Vision-Language-Action (VLA) avec un flux audio continu, en plus de la vision, du langage et de la proprioception. L'instanciation HEAR combine quatre modules: un Historizer qui maintient un contexte audio causal compact malgré les interruptions d'exécution, un Envisioner dérivé de modèles de fondation omni-modaux, un Advancer qui prédit les codes audio à court terme pour modéliser la dynamique temporelle, et un Realizer, une politique par flow-matching générant les chunks d'action. Les auteurs publient aussi OpenX-Sound pour le pré-entraînement et HEAR-Bench, premier benchmark de manipulation centré sur le son. Code et vidéos sont disponibles sur hear.irmv.top.
Les modèles VLA actuels traitent le son comme une instruction ponctuelle donnée avant l'exécution ou se limitent à la parole humaine, restant aveugles aux sons transitoires de l'environnement pendant la tâche, alors qu'un objet qui glisse, un liquide qui déborde ou une pièce mal vissée constituent souvent le seul signal de vérification d'état disponible en temps réel. Le papier nomme ce trou le "Blind Execution Interval": le chunking d'actions en boucle ouverte, largement utilisé pour la fluidité des mouvements, rend le robot sourd aux événements sonores survenant entre deux fenêtres d'observation audio. Pour les intégrateurs et chercheurs en manipulation robotique, ce travail montre que la perception "vision plus langage" ne suffit pas quand le retour sonore prime sur le visuel, et qu'il faut traiter l'audio comme un problème d'apprentissage temporel à part entière, pas comme un simple capteur additionnel.
Ce travail s'inscrit dans la généralisation des VLA comme standard du contrôle robotique de bout en bout, où l'ajout de modalités comme le tactile, la force et désormais l'audio continu devient un axe de différenciation académique une fois l'architecture vision-langage-action stabilisée. Contrairement à une annonce produit, HEAR reste à ce stade un résultat de recherche publié sur arXiv, accompagné de code et de bancs d'essai ouverts, sans déploiement industriel ni partenariat robotique annoncé. Les auteurs le présentent comme une étape pratique vers des modèles de fondation multi-sensoriels pour les agents incarnés. La suite logique est l'adoption de HEAR-Bench et d'OpenX-Sound comme références par d'autres équipes pour comparer de futures architectures intégrant un canal audio continu, avant une éventuelle intégration chez des fabricants de robots manipulateurs.
Dans nos dossiers




