Aller au contenu principal
Interface cinématique pour le terrain : capture bimanuelle modulaire de loco-manipulation via caméras 360° uniquement
RecherchearXiv cs.RO 

Interface cinématique pour le terrain : capture bimanuelle modulaire de loco-manipulation via caméras 360° uniquement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un système de capture baptisé KIWI (Kinematic Interface for the Wild), décrit dans une prépublication arXiv datée du 22 septembre 2026 (arXiv:2609.22809v1), propose de collecter des données de manipulation bimanuelle sans instrumenter ni l'opérateur ni la pièce. Le dispositif repose uniquement sur des caméras 360 degrés disponibles dans le commerce, fixées via une plaque à dégagement rapide sur des pinces à baguettes, des pinces parallèles, des montages poignet-main ou directement sur les brides d'un bras robotique. L'objectif est de répartir deux tâches entre les deux objectifs de la caméra : l'objectif arrière construit une carte métrique partagée de la pièce pour localiser les deux mains (et une caméra de tête optionnelle) dans un même référentiel, tandis que l'objectif avant filme le geste de manipulation, une fusion IMU réalisée hors ligne comblant les pertes de suivi frontal. Sur six enregistrements bimanuels testés, la combinaison des deux objectifs n'a échoué à localiser que 0,1% des images, contre 24,8% d'échec pour un alignement basé uniquement sur l'objectif avant, qui a même perdu un enregistrement entier ; l'erreur de localisation mesurée contre des marqueurs de référence reste sous 4,5 mm.

Cette approche s'attaque à un vrai goulot d'étranglement pour l'apprentissage par imitation en robotique : entraîner des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix nécessite des volumes massifs de démonstrations bimanuelles, et les méthodes existantes obligent soit à porter du matériel de capture de mouvement dédié, soit à instrumenter toute la pièce avec des caméras externes. Un kit léger, purement optique et sans électronique propriétaire abaisserait significativement le coût de collecte de données à grande échelle pour les intégrateurs et laboratoires travaillant sur la manipulation à deux bras. Il faut toutefois noter que les chiffres avancés proviennent d'une évaluation restreinte à six enregistrements, sans validation à grande échelle ni revue par les pairs à ce stade.

KIWI s'inscrit dans la lignée des dispositifs de type UMI (Universal Manipulation Interface), qui utilisent des caméras montées au poignet pour collecter des démonstrations sans robot physique, en alternative aux combinaisons de capture de mouvement ou aux téléopérations en réalité virtuelle. La contribution reste à ce stade une démonstration académique publiée en prépublication, sans indication d'un acteur industriel ni de calendrier de déploiement commercial.

À lire aussi

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés
1arXiv cs.RO 

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés

Des chercheurs présentent KAI (Kinematic-Aware Articulation Interface), une nouvelle représentation intermédiaire structurée conçue pour l'apprentissage de politiques de manipulation d'objets articulés par des robots, comme des tiroirs, des portes ou des charnières. Contrairement aux approches qui tentent d'apprendre la structure cinématique uniquement à partir de démonstrations robotiques, KAI intègre directement des a priori géométriques et cinématiques interprétables dans le processus d'apprentissage. Testée sur six tâches de simulation, la méthode atteint un taux de réussite moyen de 82,9%, égalant voire dépassant les performances des méthodes de référence tout en n'utilisant que la moitié des données de démonstration nécessaires. Le système, entraîné dans un environnement unique et non encombré, démontre également une capacité de généralisation vers des arrière-plans inédits et des scènes réelles encombrées de distracteurs visuels. En combinant l'entraînement avec des vidéos d'interactions humaines, grâce à sa conception indépendante de l'action ("action-agnostic"), le taux de réussite moyen dépasse 70% même face à des perturbations visuelles diverses. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement bien identifié: l'apprentissage par démonstration coûte cher en temps d'annotation et de téléopération, en particulier pour les objets articulés dont la cinématique varie fortement d'un instance à l'autre. Diviser par deux le volume de démonstrations nécessaires, si le résultat se confirme au-delà de la simulation, représenterait un gain d'efficacité concret pour les intégrateurs travaillant sur la manipulation domestique ou industrielle (portes d'armoires, électroménager, machines-outils). La possibilité de co-entraîner avec des vidéos humaines, sans capture de données robotiques dédiées, ouvre aussi une piste pour réduire davantage le coût de collecte, un enjeu central alors que les approches VLA (vision-language-action) peinent encore à passer l'échelle sans volumes massifs de données. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans nom d'institution ni de laboratoire précisé dans le résumé, et les résultats restent principalement validés en simulation, avec un transfert vers le réel limité à des scènes encombrées plutôt qu'à un déploiement en conditions industrielles. Le travail s'inscrit dans un courant de recherche plus large visant à injecter des priors structurels explicites dans les politiques d'apprentissage, en contraste avec les approches purement end-to-end de type GR00T N2 ou Pi-0, et pourrait alimenter les futures générations de modèles de manipulation généralistes si sa robustesse se confirme sur du matériel physique.

RecherchePaper
1 source
YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle
2arXiv cs.RO 

YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle

Des chercheurs ont publié le 10 juin 2026 YUBI (Yielding Universal Bidigital Interface), un préhenseur bi-digital conçu pour la collecte de données bimanuelle dextère à grande échelle. Contrairement aux systèmes pistol-grip comme l'UMI (Universal Manipulation Interface), YUBI adopte un principe d'actionnement dit "yielding" : les mouvements des doigts de l'opérateur sont transcrits directement en mouvement des mâchoires du préhenseur, sans intermédiaire mécanique rigide. Le système intègre un tracking 6 DOF basé sur la réalité virtuelle pour une acquisition de trajectoires haute fidélité. L'équipe a constitué un dataset d'une ampleur inédite dans la littérature : 8 434 heures de démonstrations, 1,20 million d'épisodes répartis sur 119 tâches. Un politique unique entraîné sur ce corpus a été validée sur trois plateformes robotiques bimanuelle distinctes : UR, Franka et ELEY, via simple montage du préhenseur. Ce résultat a une portée directe pour quiconque travaille sur les fondation models robotiques : le bottleneck historique n'est plus le modèle mais la donnée, et YUBI apporte une réponse concrète sur la scalabilité de la collecte. Le fait qu'une seule politique transfère sur trois robots hétérogènes confirme que l'interface impose une représentation suffisamment générique pour servir de supervision directe, sans fine-tuning plateforme-spécifique. C'est un argument fort en faveur de l'approche "data-centric" face aux pipelines sim-to-real, souvent coûteux à valider en conditions industrielles. L'ergonomie améliorée réduit aussi la fatigue opérateur sur les tâches fines, un point non-trivial pour des sessions de collecte longues et répétitives que les démonstrateurs UMI rendaient problématiques. L'UMI, développé à l'Université de Columbia et largement adopté pour sa simplicité et son coût, reste la référence low-cost pour la collecte de données manipulation, mais son grip pistolet montrait ses limites sur les tâches bimanuelle complexes. YUBI s'inscrit dans un mouvement plus large visant à démocratiser la collecte de données pour les robot foundation models, en parallèle d'initiatives comme ACT, Diffusion Policy ou les efforts open-data de Physical Intelligence (Pi-0). L'ensemble du stack est publié en open source : hardware du préhenseur, logiciel de collecte, et dataset complet, ce qui représente une contribution substantielle pour les laboratoires ne disposant pas des moyens de Unitree, Figure AI ou Boston Dynamics pour constituer leurs propres corpus propriétaires. Les prochaines étapes probables incluent l'extension du dataset et l'intégration avec des architectures VLA plus récentes.

UELes laboratoires européens (INRIA, CEA-List, universités) et PME robotiques peuvent directement exploiter le dataset open-source YUBI (8 434 h, 1,2M épisodes) et l'interface hardware pour entraîner des politiques de manipulation sans constituer de corpus propriétaire, avec validation native sur Franka (allemand) et UR (danois).

RechercheOpinion
1 source
Suivi de main par vision pour la manipulation robotique via cinématique inverse
3arXiv cs.RO 

Suivi de main par vision pour la manipulation robotique via cinématique inverse

Des chercheurs ont publié sur arXiv (réf. 2603.11383) une pipeline de télé-opération bas coût pour bras manipulateurs, baptisée hand-shadowing : une caméra RGB-D égocentrique montée sur des lunettes imprimées en 3D capte les mains de l'opérateur, MediaPipe Hands en extrait 21 points de repère par main, la profondeur les projette dans l'espace 3D, et un algorithme de cinématique inverse à moindres carrés atténués (damped least-squares IK) génère les commandes articulaires du robot SO-ARM101 (5 degrés de liberté + 1 préhenseur). Les actions sont d'abord validées dans un simulateur physique avant d'être rejouées sur le robot réel. Sur un benchmark structuré pick-and-place (grille 5 cases, 10 saisies par case, 3 runs indépendants), la pipeline atteint un taux de succès de 86,7 % ± 4,2 %, avec une erreur IK moyenne de 36,4 mm et une réduction du jerk de 57 à 68 % grâce à un lissage par moyenne mobile exponentielle (EMA). En environnements non structurés réels (supermarché, pharmacie), ce taux chute à 9,3 %, principalement à cause de l'occultation des mains par les objets environnants. Ce résultat illustre avec brutalité le reality gap qui sépare les conditions de laboratoire du déploiement industriel : une marge de 77 points entre les deux contextes n'est pas un détail d'intégration, c'est un défi de fond pour toute approche marker-free analytique. La comparaison directe avec quatre politiques VLA entraînées sur données leader-follower (ACT, SmolVLA, pi_0.5 de Physical Intelligence et GR00T N1.5 de NVIDIA) est méthodologiquement utile : elle positionne cette approche de retargeting pur face aux modèles appris, et quantifie l'écart sans se limiter à la démonstration sélective. Pour un COO ou un intégrateur, le message est clair : le bas coût matériel (lunettes imprimées, caméra grand public) ne compense pas encore l'insuffisance de robustesse à l'occlusion. La télé-opération reste un goulot d'étranglement majeur pour la collecte de données d'entraînement robotique, et les systèmes leader-follower filaires ou magnétiques restent chers et contraignants. Ce travail s'inscrit dans une vague de recherche qui cherche à démocratiser la capture de démonstrations avec du matériel grand public, aux côtés d'approches comme UMI (Columbia) ou AnyTeleop. Pour contourner la faiblesse de MediaPipe face à l'occlusion, les auteurs intègrent WiLoR comme détecteur alternatif et obtiennent 8 % de gain en taux de détection, une amélioration modeste qui confirme que le problème reste ouvert. La prochaine étape logique serait d'ajouter une gestion multi-vues ou un suivi temporel robuste pour traiter les environnements encombrés, conditions précisément où la télé-opération sans marqueur aurait le plus de valeur.

RecherchePaper
1 source
Bras intégrés aux pattes arrière pour la loco-manipulation bimanuelle d'un quadrupède
4arXiv cs.RO 

Bras intégrés aux pattes arrière pour la loco-manipulation bimanuelle d'un quadrupède

Des chercheurs ont intégré un bras manipulateur complet dans chaque mollet avant d'un robot quadrupède Unitree Go2, transformant la plateforme en système de manipulation bimanuelle sans compromis sur la stabilité. Chaque bras combine une glissière prismatique, deux articulations rotoïdes et une pince, permettant aux deux « mains » de saisir des objets au niveau du sol pendant que les quatre pattes restent posées, sans que le robot ait besoin de se cabrer sur ses pattes arrière. Un modèle vision-langage pilote la sélection des compétences à chaque transition de tâche, à partir de l'image de la caméra frontale et de l'état de la tâche, pour permettre une autonomie sur des séquences longues. Le système a été validé en simulation sur trois tâches bimanuelles : une tâche d'ouverture de meuble à horizon long avec sélection autonome de compétences, un levage coopératif à deux mains, et un transfert d'objet d'un bras à l'autre. Ces travaux, publiés en préprint sur arXiv, n'ont pas encore été démontrés sur matériel réel. Cette approche s'attaque à un compromis structurel connu du secteur : les bras montés sur le tronc réduisent souvent la capacité à un seul bras et positionnent le centre de gravité en hauteur, tandis que l'usage des pattes elles-mêmes comme manipulateurs prive le robot d'un appui au sol. Intégrer la manipulation directement dans les mollets avant permet de conserver les quatre points d'appui tout en libérant un bras pour porter un objet pendant que la base continue de marcher. Pour les intégrateurs et les équipes de recherche en robotique mobile, c'est une piste concrète pour réconcilier locomotion quadrupède et manipulation bimanuelle sans multiplier les actionneurs, un axe encore peu exploré comparé aux humanoïdes bipèdes qui dominent les annonces commerciales du secteur. Le choix du Unitree Go2, plateforme quadrupède accessible et largement utilisée en recherche académique, s'inscrit dans une tendance à expérimenter la manipulation sur des robots à quatre pattes plutôt que sur des humanoïdes coûteux comme Figure 03 ou Optimus. Le recours à un modèle vision-langage pour l'enchaînement autonome de compétences rejoint des approches déjà testées sur des humanoïdes tels que Pi-0 ou GR00T N2. La prochaine étape logique, non abordée dans cette publication, sera le transfert du prototype simulé vers un démonstrateur physique.

RecherchePaper
1 source