Aller au contenu principal
RecherchearXiv cs.RO 

Interprétation robotique du guqin phrase par phrase : planification bimanuelle et surveillance audio-tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente un système robotique bimanuel hétérogène capable d'interpréter de manière autonome des phrases musicales au guqin, une cithare chinoise à sept cordes sans frettes réputée pour son espacement millimétrique entre cordes et la difficulté de ses techniques de jeu. Décrit dans un article publié sur arXiv le 22 septembre 2026, le système formule l'exécution musicale comme un problème hybride discret-continu et s'appuie sur un cadre de planification hiérarchique qui coordonne l'attribution des doigts actifs, la continuité de configuration des bras, l'évitement d'obstacles et la synchronisation fine des contacts entre les deux mains. Il combine localisation de l'instrument par vision, surveillance tactile des contacts harmoniques de la main gauche et calibration des paramètres de pincement de la main droite guidée par retour auditif. Lors d'essais réels sur une phrase de 25 événements musicaux comprenant des séquences de cordes à vide et d'harmoniques au septième hui, le système atteint des taux de justesse d'événements de 93,6% et 96,8% sur plusieurs répétitions.

Ce résultat dépasse le cadre habituel de la manipulation robotique de préhension pour s'attaquer à une tâche exigeant un timing de contact précis et une coordination bimanuelle asymétrique sur un instrument physique réel, sans frettes ni repères mécaniques pour guider le geste. Pour l'industrie robotique, ce type de benchmark musical sert de test de stress pour la précision multimodale (vision, toucher, audition combinés) plutôt que pour la mobilité ou la force brute. Il faut toutefois noter que la démonstration reste limitée à une phrase de test contrôlée de 25 événements, loin d'une interprétation musicale complète et spontanée.

Le travail s'inscrit dans une lignée de recherches sur la manipulation fine par bras robotiques appliquée à la musique, domaine déjà exploré via le piano ou la guitare, mais le guqin ajoute une contrainte inédite avec l'absence totale de frettes. L'abstract ne précise ni l'institution porteuse ni de suites programmées, le travail se présentant comme une preuve de concept technique plutôt qu'un produit destiné à un déploiement.

À lire aussi

Planification robotique et gestion de situations par perception active
1arXiv cs.RO 

Planification robotique et gestion de situations par perception active

Des chercheurs présentent dans un preprint arXiv (réf. 2604.26988, mai 2026) un cadre logiciel baptisé VAP-TAMP, pour Vision-language model-based Active Perception for Task And Motion Planning, conçu pour doter les robots d'une capacité de détection et de gestion des situations imprévues en cours d'exécution de tâches. Le système cible des perturbations concrètes : une porte coincée, un objet tombé au sol, une modification de l'environnement due à une activité humaine. VAP-TAMP exploite une base de connaissances sur les actions du robot pour formuler dynamiquement des requêtes vers des modèles vision-langage (VLA/VLM), sélectionner activement des points de vue pertinents, puis évaluer la situation. En parallèle, il construit et interroge des graphes de scène pour assurer la planification intégrée des tâches et des mouvements. Le framework a été évalué sur des tâches de service en simulation et sur une plateforme réelle de manipulation mobile. L'enjeu est structurant pour toute démarche d'autonomie longue durée en robotique de service ou industrielle. L'un des verrous majeurs identifiés par les intégrateurs et les équipes R&D n'est pas la planification initiale, les planificateurs TAMP existants s'en sortent bien, mais la résilience à l'exécution : un robot qui échoue silencieusement ou se bloque face à un impondérable n'est pas déployable en production. VAP-TAMP propose une réponse architecturale à ce point de friction en couplant perception active (choix du meilleur angle de vue pour comprendre la situation) et raisonnement symbolique via graphes de scène, deux approches généralement traitées séparément. Si les résultats se confirment sur des scénarios plus variés, cela allège significativement la charge d'ingénierie pour les équipes qui construisent des pipelines de manipulation autonome. Le travail s'inscrit dans une dynamique de recherche intense autour de l'intégration VLM-TAMP, un champ qui a explosé depuis 2023 avec les travaux de Google DeepMind sur SayCan, de Physical Intelligence (Pi-0) et des équipes de Carnegie Mellon sur la planification par LLM. VAP-TAMP se positionne sur le maillon "récupération d'erreur" plutôt que sur la génération de plan initiale, ce qui le différencie d'approches comme Code-as-Policies ou Inner Monologue. Le preprint ne mentionne pas de partenariat industriel ni de calendrier de transfert technologique : il s'agit à ce stade d'une contribution académique, sans déploiement annoncé. Les prochaines étapes naturelles seraient une validation sur un spectre plus large de perturbations et une comparaison quantitative avec des baselines de récupération existantes.

RecherchePaper
1 source
Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon
2arXiv cs.RO 

Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon

Le laboratoire de recherche Omron Sinic X a publié une version mise à jour sur arXiv d'un article présentant ViLaIn-TAMP, un système hybride de planification pour robots bimanuels. Le framework combine trois briques : un interpréteur vision-langage (ViLaIn, dérivé d'un travail antérieur) qui convertit des entrées multimodales en spécifications structurées au format PDDL, un moteur de planification tâche-et-mouvement (TAMP) qui transforme ces spécifications en séquences de trajectoires concrètes en vérifiant leur faisabilité géométrique et symbolique avant exécution, et un module de planification corrective (CP) qui récupère les retours d'échec moteur et les réinjecte comme contraintes pour affiner la spécification initiale. Les chercheurs ont conçu des tâches de manipulation bimanuelle complexes dans un contexte de cuisine pour évaluer le système. Résultat : ViLaIn-TAMP dépasse de 17,5 points le taux de réussite moyen d'une approche de référence où un modèle vision-langage sert directement de planificateur, et le module correctif ajoute 32,9 points supplémentaires. Le framework a aussi été testé sur un robot physique à deux bras. L'enjeu dépasse la simple performance chiffrée. La quasi-totalité des travaux existants sur la planification pilotée par le langage se limite à des tâches de préhension-dépose à un seul bras, laissant la manipulation bimanuelle, où les sous-tâches sont étroitement interdépendantes et où les collisions inter-bras doivent être gérées explicitement, largement inexplorée. Les modèles vision-langage seuls agissent en boîte noire, sans garanties de sécurité vérifiables, tandis que les planificateurs symboliques classiques offrent ces garanties mais exigent une expertise poussée pour être configurés. En combinant les deux, ViLaIn-TAMP vise à répondre à un besoin concret pour les intégrateurs industriels : obtenir un comportement robotique interprétable et vérifiable avant déploiement, plutôt qu'une démonstration qui échoue silencieusement en conditions réelles. Le travail s'inscrit dans la continuité d'un ViLaIn antérieur, adapté ici pour la planification tâche-et-mouvement complète plutôt que la seule interprétation de scène. Il se positionne explicitement contre les approches où un modèle vision-langage fait office de planificateur de bout en bout, une tendance qui gagne du terrain mais que ces résultats questionnent en matière de fiabilité sur tâches longues et bimanuelles. Le code et les démonstrations sont disponibles sur la page du projet hébergée par Omron Sinic X.

RecherchePaper
1 source
Planification séquentielle par points d'ancrage pour la robotique
3arXiv cs.RO 

Planification séquentielle par points d'ancrage pour la robotique

Des chercheurs de la Case Western Reserve University ont publié SPARK (Sequential Planning via Anchored Robotic Keypoints), un système neurosymbolique de manipulation robotique sans entraînement supplémentaire. Sur LIBERO-PRO, benchmark évaluant la robustesse face aux changements de position et de tâche, SPARK atteint 43,7 % sur six configurations, soit plus du double de CaP-Agent0 (18,2 %) et des baselines Vision-Language-Action. L'architecture repose sur deux appels Gemini : le premier génère un arbre de comportement (behavior tree) typé composé de primitives précodées intégrant le contrôle bas niveau (mouvement, préhension, géométrie de profondeur) ; le second propose trois formulations textuelles alternatives par objet, que SAM3 évalue pour retenir la détection la plus confiante. Un mécanisme de récupération relance toute primitive échouée sur des objets re-détectés, sans nouvel appel LLM. Le système a été validé sur trois familles de robots (UR10e, Franka FR3, Franka bimanuels) pour neuf tâches à vingt essais chacune, avec une moyenne de 68 %. Le résultat central est architectural : SPARK identifie la perception comme le principal point de rupture des pipelines de manipulation, non la planification. Les formulations alternatives par objet apportent +27,7 points sur les tâches spatiales et +10,0 sur la suite objet ; la boucle de récupération ajoute +5,0 points globalement. Là où CaP-Agent0 re-interroge un LLM en repartant de zéro à chaque échec, SPARK ne replanifie que la détection, réduisant significativement le coût computationnel. Point stratégique : chaque essai produit automatiquement une trajectoire vérifiée et étiquetée, permettant à un planificateur training-free de générer les données dont les VLAs ont besoin sans téleopération humaine. SPARK s'inscrit dans le débat entre architectures VLA end-to-end (pi-0 de Physical Intelligence, RT-2 de Google DeepMind, OpenVLA de Berkeley) et approches hybrides symboliques. Les VLAs misent sur la généralisation apprise de données massives mais restent fragiles aux distributions non vues à l'entraînement, précisément ce que LIBERO-PRO mesure. SPARK démontre qu'une conception neurosymbolique rigoureuse peut surpasser des modèles foundation sur des configurations difficiles. La validation reste limitée à neuf tâches sur trois plateformes, sans timeline de déploiement industriel annoncée. La modularité du système -- détecteur, planificateur et contrôleur remplaçables indépendamment -- ouvre la voie à des intégrations sur de nouvelles plateformes sans réentraînement.

RecherchePaper
1 source
Codage tactile temporel et compliance pour la remise bimanuelle robot-humain sensible à l'intention
4arXiv cs.RO 

Codage tactile temporel et compliance pour la remise bimanuelle robot-humain sensible à l'intention

Un article soumis sur arXiv le 7 septembre 2026 (2609.05282v1) décrit un système de remise bimanuelle d'objets du robot vers l'humain combinant un modèle VLA affiné par démonstrations humaines et un contrôleur de compliance réduisant les forces d'interaction. L'entrée associe images RGB, signal tactile encodé temporellement et proprioception, pour distinguer une prise volontaire d'un simple contact, d'une prise faible ou d'une force mal orientée. Testé lors d'une étude avec sujets humains contre deux références, sans tactile puis avec tactile sans compliance, le système complet se montre nettement supérieur selon des métriques objectives et un questionnaire. Code et données seront publiés après acceptation de l'article. Le résultat cible un point de friction concret pour la robotique collaborative et humanoïde : la vision seule peine à distinguer une intention claire de prise d'un simple frôlement, provoquant des lâchers d'objet trop tôt, trop tard ou inconfortables. En traitant la remise comme un problème intrinsèquement multimodal, l'étude suggère que les VLA généralistes gagnent en fiabilité en intégrant tactile temporel et contrôle de force en boucle fermée, plutôt qu'en s'appuyant sur la seule caméra. Pour les intégrateurs en logistique, assistance à la personne ou cobotique industrielle, cette brique conditionne directement la sécurité et l'acceptabilité des interactions main-à-main homme-robot, un maillon encore peu résolu malgré les progrès des modèles de manipulation généralistes. Ce travail s'inscrit dans la vague de modèles VLA de manipulation apparue avec des systèmes comme Pi-0 ou GR00T N2, conçus surtout pour la préhension et le déplacement d'objets plutôt que pour l'interaction physique directe avec un humain. La remise d'objet main-à-main reste un sous-problème peu traité, alors que la course aux robots humanoïdes généralistes multiplie les démonstrations de manipulation fine sans toujours documenter la robustesse ni le confort de ces transferts pour la personne réceptrice. L'article ne mentionne aucune affiliation industrielle ni calendrier de déploiement : il s'agit d'une contribution de recherche académique, dont la publication annoncée du code et des données, après acceptation, permettra d'en vérifier les résultats.

RecherchePaper
1 source