Aller au contenu principal
DuetHOI : génération de mouvements bimanuels main-objet guidée par le langage, avec planification d'articulation et raffinement des contacts
RecherchearXiv cs.RO 

DuetHOI : génération de mouvements bimanuels main-objet guidée par le langage, avec planification d'articulation et raffinement des contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche intitulé DuetHOI, publié en version 3 sur arXiv (2603.08390), propose un nouveau cadre pour générer automatiquement des mouvements de mains bimanuels interagissant avec des objets articulés, comme l'ouverture d'un tiroir ou la manipulation d'un objet à deux charnières, à partir d'une simple instruction en langage naturel. Le système repose sur quatre modules assemblés en pipeline. ContactVAE prédit d'abord, à partir du texte et de la géométrie de l'objet, où les mains doivent entrer en contact avec sa surface. ArtPlanner utilise cette intention spatiale pour établir une trajectoire d'articulation de référence, c'est à dire comment l'objet doit s'ouvrir ou se déplacer au fil du temps. DualFormer génère ensuite le mouvement global en combinant l'état de l'objet, la position des mains par rapport à celui-ci, et des jetons compacts de pose de main appris par un second module, ManiVAE. Enfin, ProxiRefine corrige localement la trajectoire des deux mains, sans toucher à celle de l'objet, en s'appuyant sur la proximité main-objet mesurée à ce stade pour affiner l'alignement de surface.

L'enjeu dépasse la simple animation graphique. La génération de mouvements main-objet réalistes et cohérents en contact sert de données d'entraînement pour l'apprentissage par imitation en robotique, notamment pour les modèles vision-langage-action qui doivent apprendre à manipuler des objets à deux mains, une tâche nettement plus complexe que la préhension à une main sur objet rigide, faute de coordination bimanuelle et de suivi de l'évolution de l'articulation. Les résultats rapportés montrent que DuetHOI dépasse trois méthodes de référence adaptées sur la plupart des métriques de contact et de cohérence main-objet, avec un avantage particulièrement marqué sur les scénarios bimanuels avec objets articulés, précisément le cas le plus difficile.

Le papier s'inscrit dans un courant de recherche en génération de mouvements humains conditionnée par le langage, où la modélisation d'objets rigides à une main est déjà relativement mature mais où la coordination bimanuelle sur objets articulés reste peu traitée par les architectures existantes, qui encodent objet et mains dans une séquence unique de haute dimension mal adaptée aux échelles différentes du problème. Aucune date de disponibilité de code ni application robotique concrète n'est mentionnée dans l'abstract, ce qui situe pour l'instant ces travaux au stade de la recherche méthodologique plutôt que du déploiement.

À lire aussi

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
1arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
Planification rapide et coordonnée de mouvements bimanuels sous contraintes strictes
2arXiv cs.RO 

Planification rapide et coordonnée de mouvements bimanuels sous contraintes strictes

Une équipe de chercheurs publie sur arXiv (référence 2608.20946v1) un nouveau pipeline de planification de mouvement rapide pour la manipulation bimanuelle sous contraintes rigides. Le problème traité est le suivant : quand deux bras robotiques déplacent un même objet rigide, la transformation relative entre leurs deux effecteurs terminaux doit rester fixe tout au long du mouvement, ce qui constitue une contrainte d'égalité non linéaire réduisant l'espace des configurations valides à une variété de mesure nulle, difficile à gérer pour les planificateurs classiques. La méthode proposée repose sur une paramétrisation "leader-suiveur" : la configuration du bras leader est traitée comme variable libre, celle du bras suiveur étant calculée par cinématique inverse pour satisfaire la contrainte en continu sur toute la trajectoire. En simulation, sur des environnements, contraintes et plateformes bimanuelles variés, la méthode planifie 19,4 fois plus vite que les approches précédentes, tout en garantissant le respect continu de la contrainte. Des essais réels sur un système bimanuel à deux bras Kinova Gen3, pour du transport de plateau et la manipulation d'objets allongés, confirment le transfert direct des trajectoires planifiées vers le matériel physique. Pour les intégrateurs et les équipes de R&D robotique, ce résultat cible un vrai goulot d'étranglement : le nombre élevé de degrés de liberté combinés des deux bras, associé à la contrainte de rigidité, rend la planification coordonnée coûteuse en calcul et freine son usage en temps réel pour des tâches comme le transport d'objets fragiles ou encombrants et l'assemblage. Un gain de vitesse proche de 20x, sans perte de garantie sur le respect de la contrainte géométrique, rapprocherait la manipulation bimanuelle coordonnée d'un fonctionnement temps réel viable en usine ou en logistique, un point sensible pour la sécurité des opérations impliquant deux bras synchronisés. Le résultat reste toutefois académique, validé sur une seule plateforme matérielle et deux tâches de démonstration, loin d'un produit industriel prêt à déployer. Ce travail s'inscrit dans la recherche sur la planification sous contraintes de fermeture cinématique, un problème classique de la robotique bimanuelle où les méthodes existantes s'appuient souvent sur un échantillonnage ou une projection coûteux sur la variété de contrainte, ce qui explique l'écart de performance revendiqué face aux "travaux précédents", non détaillés dans le résumé. Les bras Kinova Gen3 utilisés pour la validation matérielle constituent une plateforme courante dans la recherche en manipulation bimanuelle, ce qui facilite la comparaison avec d'autres travaux du domaine. Classé comme nouvelle soumission arXiv, le papier ne fait état d'aucun partenariat industriel ni de calendrier de commercialisation ; la suite logique pour ce type de recherche est une extension à d'autres plateformes et types d'objets, avec une possible intégration dans des piles logicielles de planification plus larges destinées aux intégrateurs.

RecherchePaper
1 source
Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage
3arXiv cs.RO 

Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage

Des chercheurs ont publié sur arXiv (référence 2606.22471) une approche systématique pour générer automatiquement, via apprentissage par renforcement (RL), des données d'entraînement synthétiques destinées à la manipulation bimane et dextre conditionnée par le langage. Le pipeline proposé combine trois briques : une conception de récompenses généralisables (non spécifiques à une tâche), une randomisation de domaine pour combler l'écart simulation-réel (sim-to-real gap), et des annotations de tâches exprimées en langage naturel. Les expériences portent sur trois tâches de manipulation représentatives ; les auteurs concluent à une amélioration significative de la généralisation par rapport aux baselines, sans toutefois publier de métriques quantitatives précises dans le résumé disponible. Le principal verrou qu'adresse ce travail est le manque de données massives et de qualité pour entraîner des politiques généralistes sur des manipulateurs bimanes à haute dextérité. La télé-opération humaine, standard actuel pour collecter des démonstrations (méthode utilisée par des projets comme ACT, Diffusion Policy, ou les datasets de Aloha), souffre de limitations structurelles : faible diversité de tâches, inadéquation morphologique entre la main humaine et l'effecteur robot, et absence des actions robot dans les vidéos brutes. Le RL surmonte ces obstacles mais exige traditionnellement des fonctions de récompense artisanales, tâche par tâche. En proposant une conception de récompenses généralisables, les auteurs visent à rendre le pipeline scalable sans surcoût d'ingénierie par tâche, ce qui est le vrai défi industriel pour quiconque cherche à déployer des politiques multi-tâches sur des lignes d'assemblage ou de conditionnement. Ce travail s'inscrit dans une tendance de fond : face à la rareté des données robotiques réelles, la synthèse en simulation devient une voie centrale, portée par des frameworks comme Isaac Lab (NVIDIA), MuJoCo Playground, ou Genesis. Il dialogue directement avec des approches comme RoboGen, RoboCasa ou GROOT, qui cherchent également à automatiser la génération de tâches et de données. Les politiques VLA (Vision-Language-Action) telles que pi0 de Physical Intelligence ou OpenVLA nécessitent des corpus variés que la télé-opération seule ne peut pas alimenter à l'échelle requise. Les prochaines étapes naturelles seront la validation sur hardware réel et la comparaison quantitative avec des datasets de référence comme RoboSet ou Open X-Embodiment.

RecherchePaper
1 source
G-MAPP : planification et perception multi-agents accélérées par GPU pour la génération de mouvement réactif
4arXiv cs.RO 

G-MAPP : planification et perception multi-agents accélérées par GPU pour la génération de mouvement réactif

G-MAPP (GPU-accelerated Multi-Agent Planning and Perception) est un framework de génération de mouvement réactif présenté dans un preprint arXiv (2606.12579) publié en juin 2026. Le système cible un problème persistant en robotique manipulatrice : produire des trajectoires sans collision en temps réel dans des environnements non structurés et dynamiques. L'architecture repose sur deux composants GPU : un moteur de modélisation du monde alimenté par des capteurs de profondeur grand public, et un planificateur par champs vectoriels permettant une exploration parallèle quasi-globale des états. Validé sur un bras Franka Emika 7 axes (7-DoF), le système affiche un gain de vitesse mesuré jusqu'à 5x par rapport à la version CPU équivalente, avec des évitements de collision réussis dans des configurations physiques simples et complexes. Le point dur que G-MAPP tente de résoudre est double : la charge de calcul pour planifier sur des représentations haute fidélité du monde, et le délai d'intégration entre la perception et le planificateur. Historiquement, les architectures existantes choisissaient entre planification globale (précise mais lente, réservée aux environnements statiques) et planification locale conservative (rapide mais myope). En fusionnant les deux boucles sur GPU, G-MAPP vise à éliminer ce compromis. Pour un intégrateur industriel ou un COO de ligne d'assemblage, cela ouvre la voie à des cellules robotiques reconfigurables sans reprogrammation manuelle, avec des bras capables de coexister avec des opérateurs humains en mouvement, à condition que les performances tiennent sur des géométries de charge plus représentatives. La génération de mouvement réactif mobilise depuis plusieurs années des approches concurrentes : planificateurs neuronaux (MPINETS, MotionBenchMaker), champs de potentiel riemanniens (RMP-Flow, STORM), et méthodes MPC sur horizon glissant. G-MAPP se positionne dans la lignée des planificateurs par champs vectoriels accélérés, avec la particularité de traiter la perception et la planification dans le même pipeline GPU. Le Franka Emika reste une plateforme académique standard, et aucun partenariat industriel ni roadmap de commercialisation n'est mentionné dans le preprint : il s'agit d'une contribution de recherche à confirmer sur des bras à charge utile plus élevée, des vitesses d'obstacles plus importantes, et des environnements multi-agents. Les prolongements naturels incluent les architectures multi-bras et l'intégration avec des pipelines de perception sémantique.

RecherchePaper
1 source