Aller au contenu principal
RecherchearXiv cs.RO 

ArtManip : manipulation en main d'objets articulés par catégorie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté ArtManip, une méthode d'apprentissage décrite comme la première à réaliser la manipulation en main d'objets articulés au niveau de la catégorie, avec généralisation aux instances inédites et aux prises initiales variées, pour des mains robotiques dextres. L'article, publié sur arXiv sous la référence 2609.12498, détaille un pipeline automatisé qui génère de manière procédurale des objets articulés variés et synthétise des prises fonctionnelles orientées tâche, évitant la collecte manuelle jusque-là nécessaire pour constituer des jeux de modèles d'objets et de démonstrations de saisie. La politique de contrôle est entraînée en deux étapes, combinant randomisation de la physique des articulations, curriculum de récompense progressif et distillation de représentations latentes pour gérer les contacts complexes et la dynamique des jointures. Les tests couvrent quatre catégories d'objets articulés en simulation, avec un transfert zero-shot réussi vers 12 objets réels aux formes et mécanismes de jointure variés, sans réentraînement spécifique.

Le travail s'attaque à un verrou connu de la manipulation dextre: contrôler les degrés de liberté internes d'un objet articulé, comme une charnière, un tiroir ou un mécanisme à ciseaux, tout en maintenant une prise stable sur une base flottante, un couplage que la plupart des méthodes existantes contournent en se limitant à des objets rigides ou à des instances déjà vues à l'entraînement. Pour les laboratoires et intégrateurs travaillant sur la dextérité robotique, une généralisation inter-instances et inter-configurations, plutôt qu'un simple transfert sim-to-real sur un objet isolé, constitue un signal notable: elle suggère que l'écart entre simulation et monde réel peut se réduire même sur des tâches à haute dimensionnalité de contrôle. Le résultat reste néanmoins circonscrit à 12 objets réels et quatre catégories, loin d'un système déployé en production ou intégré à un produit commercial.

Cette recherche s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement en simulation physique haute-fidélité appliqué à la dextérité robotique, un axe qui coexiste avec les approches fondées sur des modèles vision-langage-action généralistes à politique unique multi-tâche. ArtManip se distingue en ciblant la généralisation au niveau de la catégorie d'objet plutôt que la polyvalence des tâches, et en misant sur une génération automatisée des données d'entraînement pour contourner le coût de collecte manuelle de prises fonctionnelles, identifié par les auteurs comme un frein majeur au passage à l'échelle. Aucun plan de déploiement industriel ni partenariat matériel n'est mentionné à ce stade: la publication demeure un résultat de recherche, dont l'extension à davantage de catégories d'objets et de plateformes physiques constitue la suite logique annoncée.

À lire aussi

Mana : manipulation habile d'outils articulés
1arXiv cs.RO 

Mana : manipulation habile d'outils articulés

Des chercheurs présentent Mana (Manipulation Animator), un framework sim-to-real conçu pour la manipulation dextre d'outils articulés, c'est-à-dire des outils dotés de degrés de liberté internes comme des ciseaux, des pinces ou des instruments à charnières. Publié en preprint sur arXiv (réf. 2606.13677), le travail comble une lacune notable : la quasi-totalité des recherches antérieures en robotique dextre s'est concentrée sur des objets rigides, laissant de côté les outils dont les parties mobiles exigent une coordination fine entre préhension et manipulation in-hand. Le pipeline repose sur une approche coarse-to-fine inspirée de l'animation par ordinateur : des keyframes de préhension générées procéduralement sont transformées en trajectoires de manipulation via planification de mouvement et apprentissage par renforcement. La génération de données est largement automatisée, spécifier les affordances fonctionnelles d'un nouvel outil ne demandant que quelques clics de souris, soit moins d'une minute par outil. Testé sur quatre outils articulés couvrant différentes échelles et types de liaisons cinématiques, Mana obtient un transfert sim-to-real zéro-shot pour la préhension comme pour la manipulation in-hand, sans fine-tuning supplémentaire sur robot réel. Ce résultat est significatif à plusieurs titres. Le transfert zéro-shot reste un défi ouvert en manipulation dextre, particulièrement pour des objets dont la dynamique de contact varie selon l'état interne de l'outil. La scalabilité du pipeline constitue également un argument fort : moins d'une minute d'annotation par outil contraste avec les pipelines d'imitation classiques qui nécessitent des heures de démonstrations humaines par tâche. Il convient toutefois de nuancer, les résultats étant ceux d'un preprint académique évalué sur quatre outils seulement, sans données de robustesse à grande échelle ni validation industrielle. Si les chiffres se confirment sur un éventail plus large, cela modifie le calcul économique pour les intégrateurs robotiques cherchant à déployer des manipulateurs dextres sur des lignes de production diversifiées. L'approche s'inscrit dans un courant qui cherche à réduire le sim-to-real gap via des pipelines de génération de données synthétiques plutôt que par le domain randomization seul. Les travaux concurrents incluent des frameworks VLA comme pi0 de Physical Intelligence ou les approches de manipulation généraliste développées à CMU et Stanford, qui misent davantage sur la généralisation via de larges datasets de démonstrations humaines. Mana prend un pari différent en substituant l'animation procédurale à la téléopération. Les prochaines étapes naturelles consisteraient à valider le framework sur des outils industriels concrets comme des tournevis ou des clés à cliquet, et à tester sa robustesse face aux variations de fabrication et aux conditions réelles de production.

RecherchePaper
1 source
GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés
2arXiv cs.RO 

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper
1 source
GIFT : transfert fonctionnel induit par la géométrie pour la manipulation d'objets par catégorie
3arXiv cs.RO 

GIFT : transfert fonctionnel induit par la géométrie pour la manipulation d'objets par catégorie

Des chercheurs ont publié sur arXiv (2503.15371v2) un framework de transfert de compétences robotiques baptisé GIFT (Geometry-Induced Functional Transfer), conçu pour permettre à un robot de reproduire des manipulations complexes à partir d'une seule démonstration humaine. Le système s'appuie sur le cadre des Cartes Fonctionnelles (Functional Maps, FMC), une technique issue de la géométrie computationnelle, pour extraire des représentations centrées sur les interactions objet-environnement. Une fois ces fonctions d'interaction cartographiées, le robot peut les transférer à des objets de topologie similaire, même si leurs formes diffèrent significativement. Pour générer des trajectoires fluides respectant les contraintes de la démonstration, GIFT intègre l'interpolation par vis (ScLERP, Screw Linear Interpolation). Aucun réentraînement n'est requis : le système s'adapte à de nouveaux environnements directement à l'inférence, validé sur des configurations réelles sans données supplémentaires. L'enjeu industriel est concret. La manipulation d'objets inconnus reste l'un des principaux goulots d'étranglement de la robotique de service et de logistique : chaque nouvelle catégorie d'objet exige aujourd'hui des données d'entraînement supplémentaires ou une reprogrammation manuelle, ce qui alourdit considérablement le coût de déploiement. Un framework one-shot capable de généraliser à travers des catégories d'objets sans réentraînement réduirait le temps de mise en production de façon significative. GIFT s'attaque à ce problème en prouvant qu'une représentation géométrique bien choisie peut absorber la variabilité de forme, offrant une alternative aux approches Vision-Language-Action (VLA) comme Pi-0 de Physical Intelligence ou RT-2 de Google DeepMind, qui nécessitent des volumes de données considérables. Les Functional Maps sont une technique mature en traitement de surfaces 3D, mais leur application au transfert de compétences robotiques reste récente. Ce travail s'inscrit dans un mouvement plus large visant à réduire le data gap de la manipulation, aux côtés d'approches comme ACT (Stanford), DexCap ou UMI, qui explorent également le few-shot learning pour des tâches de manipulation fine. La publication est à ce stade un preprint arXiv (soumis en mars 2025, v2 en remplacement), sans partenaire industriel annoncé ni métrique de cycle time publiée. L'absence de comparatifs quantitatifs avec des baselines VLA laisse ouverte la question de la robustesse à grande échelle.

RecherchePaper
1 source
Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés
4arXiv cs.RO 

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés

Des chercheurs présentent KAI (Kinematic-Aware Articulation Interface), une nouvelle représentation intermédiaire structurée conçue pour l'apprentissage de politiques de manipulation d'objets articulés par des robots, comme des tiroirs, des portes ou des charnières. Contrairement aux approches qui tentent d'apprendre la structure cinématique uniquement à partir de démonstrations robotiques, KAI intègre directement des a priori géométriques et cinématiques interprétables dans le processus d'apprentissage. Testée sur six tâches de simulation, la méthode atteint un taux de réussite moyen de 82,9%, égalant voire dépassant les performances des méthodes de référence tout en n'utilisant que la moitié des données de démonstration nécessaires. Le système, entraîné dans un environnement unique et non encombré, démontre également une capacité de généralisation vers des arrière-plans inédits et des scènes réelles encombrées de distracteurs visuels. En combinant l'entraînement avec des vidéos d'interactions humaines, grâce à sa conception indépendante de l'action ("action-agnostic"), le taux de réussite moyen dépasse 70% même face à des perturbations visuelles diverses. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement bien identifié: l'apprentissage par démonstration coûte cher en temps d'annotation et de téléopération, en particulier pour les objets articulés dont la cinématique varie fortement d'un instance à l'autre. Diviser par deux le volume de démonstrations nécessaires, si le résultat se confirme au-delà de la simulation, représenterait un gain d'efficacité concret pour les intégrateurs travaillant sur la manipulation domestique ou industrielle (portes d'armoires, électroménager, machines-outils). La possibilité de co-entraîner avec des vidéos humaines, sans capture de données robotiques dédiées, ouvre aussi une piste pour réduire davantage le coût de collecte, un enjeu central alors que les approches VLA (vision-language-action) peinent encore à passer l'échelle sans volumes massifs de données. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans nom d'institution ni de laboratoire précisé dans le résumé, et les résultats restent principalement validés en simulation, avec un transfert vers le réel limité à des scènes encombrées plutôt qu'à un déploiement en conditions industrielles. Le travail s'inscrit dans un courant de recherche plus large visant à injecter des priors structurels explicites dans les politiques d'apprentissage, en contraste avec les approches purement end-to-end de type GR00T N2 ou Pi-0, et pourrait alimenter les futures générations de modèles de manipulation généralistes si sa robustesse se confirme sur du matériel physique.

RecherchePaper
1 source