Aller au contenu principal
RecherchearXiv cs.RO 

Vers le paradigme vision-son-langage-action : le framework HEAR pour la manipulation centrée sur le son

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié sur arXiv (2603.16086v2) une version révisée de l'article "Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation", qui formalise le paradigme Vision-Sound-Language-Action (VSLA), étendant les modèles Vision-Language-Action (VLA) avec un flux audio continu, en plus de la vision, du langage et de la proprioception. L'instanciation HEAR combine quatre modules: un Historizer qui maintient un contexte audio causal compact malgré les interruptions d'exécution, un Envisioner dérivé de modèles de fondation omni-modaux, un Advancer qui prédit les codes audio à court terme pour modéliser la dynamique temporelle, et un Realizer, une politique par flow-matching générant les chunks d'action. Les auteurs publient aussi OpenX-Sound pour le pré-entraînement et HEAR-Bench, premier benchmark de manipulation centré sur le son. Code et vidéos sont disponibles sur hear.irmv.top.

Les modèles VLA actuels traitent le son comme une instruction ponctuelle donnée avant l'exécution ou se limitent à la parole humaine, restant aveugles aux sons transitoires de l'environnement pendant la tâche, alors qu'un objet qui glisse, un liquide qui déborde ou une pièce mal vissée constituent souvent le seul signal de vérification d'état disponible en temps réel. Le papier nomme ce trou le "Blind Execution Interval": le chunking d'actions en boucle ouverte, largement utilisé pour la fluidité des mouvements, rend le robot sourd aux événements sonores survenant entre deux fenêtres d'observation audio. Pour les intégrateurs et chercheurs en manipulation robotique, ce travail montre que la perception "vision plus langage" ne suffit pas quand le retour sonore prime sur le visuel, et qu'il faut traiter l'audio comme un problème d'apprentissage temporel à part entière, pas comme un simple capteur additionnel.

Ce travail s'inscrit dans la généralisation des VLA comme standard du contrôle robotique de bout en bout, où l'ajout de modalités comme le tactile, la force et désormais l'audio continu devient un axe de différenciation académique une fois l'architecture vision-langage-action stabilisée. Contrairement à une annonce produit, HEAR reste à ce stade un résultat de recherche publié sur arXiv, accompagné de code et de bancs d'essai ouverts, sans déploiement industriel ni partenariat robotique annoncé. Les auteurs le présentent comme une étape pratique vers des modèles de fondation multi-sensoriels pour les agents incarnés. La suite logique est l'adoption de HEAR-Bench et d'OpenX-Sound comme références par d'autres équipes pour comparer de futures architectures intégrant un canal audio continu, avant une éventuelle intégration chez des fabricants de robots manipulateurs.

À lire aussi

ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum
1arXiv cs.RO 

ManiSoft : vers la manipulation vision-langage pour la robotique souple à continuum

Des chercheurs du laboratoire CoLa de l'université BUAA (Beijing University of Aeronautics and Astronautics) ont publié ManiSoft, un benchmark conçu pour évaluer la manipulation vision-langage sur des bras robotiques souples à continuum. Le jeu de données comprend 6 300 scènes générées automatiquement avec leurs trajectoires expertes correspondantes, réparties en quatre tâches progressives allant de la coordination basique de l'effecteur terminal jusqu'à l'évitement d'obstacles dans des environnements encombrés. Le simulateur développé pour l'occasion couple une dynamique de corps déformables réaliste avec des interactions riches en contact, grâce à une contrainte de force élastique. Le pipeline de génération de trajectoires fonctionne en deux étages : un planificateur de haut niveau décompose chaque tâche en séquences de waypoints, puis une politique d'apprentissage par renforcement de bas niveau génère les commandes de couple pour suivre ces waypoints. ManiSoft s'attaque à un angle mort réel de la recherche en manipulation robotique : la quasi-totalité des travaux sur les modèles vision-langage (VLA) cible des bras rigides à morphologie fixe, qui montrent leurs limites dans les espaces confinés ou encombrés. Les bras souples offrent une déformabilité naturellement adaptée à ces contextes, mais ils posent deux problèmes fondamentaux que le benchmark met en évidence : la proprioception peu fiable (le robot ne sait pas précisément où se trouve son propre corps) et l'actuation distribuée à bas niveau, incompatible avec les abstractions classiques des VLA. Les trois architectures de politiques évaluées obtiennent des résultats corrects en scènes propres, mais accusent une chute de performance significative dès que la randomisation des scènes augmente, ce qui souligne que le sim-to-real gap reste ouvert pour cette catégorie de robots. La robotique souple à continuum reste un domaine de recherche académique, loin des déploiements industriels à grande échelle qu'occupent les bras rigides de Fanuc, KUKA ou Universal Robots. Du côté des acteurs émergents, des startups comme Festo (avec ses bionics) ou des laboratoires européens explorent ces morphologies pour des applications chirurgicales et d'inspection en milieux contraints. ManiSoft ne vise pas pour l'instant à combler directement ce fossé industriel, mais à fournir une base d'évaluation reproductible pour comparer les approches. Le code et les données sont disponibles publiquement, ce qui devrait faciliter l'adoption par la communauté académique. Les prochaines étapes logiques seraient un transfert sim-to-real sur hardware physique et l'intégration de retour haptique pour corriger les dérives proprioceptives identifiées.

RechercheActu
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
2arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée
3arXiv cs.RO 

Modèle vision-langage-action pour la manipulation robuste multi-robot en boucle fermée

Un article publié le 9 juillet 2026 sur arXiv (référence 2607.06990) présente un nouveau système multi-agent destiné à fiabiliser la manipulation robotique lorsque plusieurs robots doivent coopérer. Les chercheurs proposent une architecture hiérarchique et bouclée reposant sur trois agents pilotés par un grand modèle de langage (LLM) : un agent de planification qui décompose une instruction globale en sous-tâches réparties entre les robots, un agent de manipulation propre à chaque robot qui exécute les actions en mobilisant dynamiquement des outils adaptés, et un agent de vérification qui observe les résultats physiques réels et renvoie des corrections sémantiques en cas d'échec ou d'écart. Le système a été testé lors d'expériences réelles, sans que l'article ne précise pour l'instant de chiffres exacts (taux de succès, nombre de robots, temps de cycle) au-delà de l'affirmation d'une performance supérieure aux approches existantes, aussi bien sur des tâches limitées à un seul poste de travail que sur des tâches réparties entre plusieurs espaces de travail distincts. L'intérêt de ce travail tient au problème qu'il cible directement : la plupart des approches actuelles combinant LLM et robotique se cantonnent soit à un seul bras manipulateur, où la prise en compte du contact physique est robuste mais sans coordination multi-robot possible, soit à une planification multi-robot de haut niveau qui traite la manipulation comme une brique idéalisée, ignorant les aléas réels d'exécution (glissement, échec de préhension, erreur de perception). En bouclant la boucle perception-action-vérification à l'échelle du système multi-robot, cette architecture s'attaque à un angle mort connu du secteur : la difficulté à faire passer un plan LLM cohérent en langage naturel vers une exécution physique fiable quand plusieurs machines doivent se synchroniser sur des tâches à long horizon. Ce travail s'inscrit dans une tendance de recherche plus large qui cherche à doter les architectures VLA (vision-language-action) et les systèmes agentiques d'un mécanisme de rétroaction correctif, plutôt que de se reposer uniquement sur des plans ouverts non révisables. Il concurrence conceptuellement les approches de planification hiérarchique pure et les méthodes de manipulation mono-robot type Pi-0 ou GR00T N2, en visant explicitement le passage à l'échelle vers des ateliers ou des cellules industrielles à plusieurs robots. L'article, encore un simple dépôt arXiv à ce stade, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial.

RechercheActu
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
4arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source