Aller au contenu principal
RecherchearXiv cs.RO 

Suivi de la forme de manipulabilité invariant à l'échelle pour des manipulateurs hétérogènes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode de suivi de forme de manipulabilité invariante à l'échelle, destinée à transférer le comportement cinématique d'un manipulateur à un autre malgré des tailles et des architectures différentes. L'ellipsoïde de manipulabilité décrit dans quelles directions le bras se déplace ou exerce une force le plus facilement. Les approches par matrice complète imposent à la fois sa forme (orientation, rapports entre demi-axes) et son échelle absolue, ce qui pénalise inutilement le suiveur quand seule la forme compte. La nouvelle méthode considère comme équivalentes deux matrices qui diffèrent d'un simple facteur scalaire positif, et travaille sur leurs représentants à déterminant unitaire. Les auteurs dérivent la différentielle de ce représentant et une représentation en coordonnées orthonormées du résidu de suivi sous la métrique riemannienne invariante affine (AIRM). L'objectif est intégré, avec des tâches de position et de direction de l'effecteur, dans un programme quadratique en vitesses articulaires sous contraintes. Les tests sont uniquement en simulation, sur quatre robots hétérogènes, dont les KR500 et UR20. Sur trois suiveurs, la distance de forme finale atteint 9,30 x 10^-5 sans réglage d'échelle. Avec des échelles cibles ajustées pendant le mouvement, la méthode complète conserve des erreurs de rapport d'axes de 0,19 à 0,31 sur KR500 et UR20. Pour un geste humain avec tâches concurrentes, les ellipsoïdes de force duaux s'allongent selon X comme la cible humaine sur les quatre robots. L'erreur de position finale reste de 2,4 à 5,6 % de la longueur de bras de référence, contre jusqu'à 75 % pour un suivi de l'ellipsoïde humain d'origine par matrice complète.

L'enjeu concerne la programmation par démonstration et le transfert de compétences humain-robot. Un opérateur humain et un robot industriel de plusieurs centaines de kilogrammes n'ont ni la même échelle ni la même cinématique. Chercher à reproduire l'ellipsoïde absolu revient à imposer des cibles physiquement inatteignables, et l'écart de 75 % d'erreur de position en est l'illustration : la tâche principale est sacrifiée au profit d'un critère mal posé. Séparer la forme, c'est-à-dire la stratégie de manipulation, de l'échelle, qui dépend du matériel, rend le transfert plus réaliste entre plateformes différentes. Cela intéresse les intégrateurs qui réutilisent des démonstrations sur plusieurs bras et les équipes qui cherchent à faire imiter aux humanoïdes des gestes humains. Cette approche reste géométrique et ne repose ni sur un VLA ni sur de l'apprentissage. Elle ne dit rien de la robustesse sur matériel réel : aucun essai physique n'est rapporté, seulement quatre robots simulés, et le gain dépend d'un réglage d'échelle sur certains cas.

Le travail prolonge la littérature sur la manipulabilité introduite par Yoshikawa dans les années 1980, puis sur le transfert de manipulabilité entre robots ou depuis l'humain, souvent formulé sur les variétés riemanniennes de matrices définies positives. L'article, publié sur arXiv (2609.36784v1), n'annonce ni produit ni pilote. La suite logique est une validation sur robots physiques et l'intégration dans des pipelines d'apprentissage par imitation, où le suivi de forme pourrait servir de contrainte ou de terme de récompense. Il faudra aussi comparer cette méthode à d'autres approches de transfert de compétences.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
1arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
2arXiv cs.RO 

EquivDP3 : un encodeur de nuages de points invariant SIM(3) pour la loco-manipulation humanoïde à faible besoin de données

Des chercheurs proposent EquivDP3, une politique visuomotrice hiérarchique pour la loco-manipulation du humanoïde Unitree G1 (43 articulations), décrite dans un preprint arXiv (2609.36575v1). Le système est en deux étages. Un planificateur de haut niveau, basé sur une diffusion, utilise un encodeur de nuages de points équivariant SIM(3) de type Vector Neuron Network (VNN). Il émet des blocs de commandes corps entier à 6 Hz. Ces commandes sont exécutées à 50 Hz par une politique de locomotion pré-entraînée par apprentissage par renforcement, gelée, et par un module de cinématique inverse différentielle pour les bras. L'ensemble est entraîné de bout en bout par clonage comportemental. SIM(3) désigne le groupe des rotations, translations et changements d'échelle. Les tests couvrent deux benchmarks simulés sous IsaacLab et quatre références non équivariantes, avec 5 à 100 démonstrations, en distribution et hors distribution. Avec 5 à 10 démonstrations, EquivDP3 atteint 67,1 % de succès, contre 38,2 à 52,4 % pour les références. À 50-100 démonstrations, tous les encodeurs convergent (74,3 à 85,2 %). Le surcoût est de 0,8 ms par bloc d'actions par rapport à l'encodeur PointNet remplacé. L'intérêt tient à la rareté des données. Collecter des démonstrations de loco-manipulation humanoïde par téléopération coûte cher, et un gain de robustesse avec 5 à 10 exemples est un levier concret pour les équipes qui déploient des humanoïdes sur des tâches variables. Les auteurs ajoutent un contrôle utile : en retirant le nuage de points, le succès tombe à 31 % contre 60 % pour EquivDP3 avec 5 démonstrations, et à 78 % contre 99 % avec 10. L'écart est donc bien d'origine perceptive et ne vient pas de la seule proprioception. Le plateau à forte quantité de données traduit selon eux un plafond du benchmark, pas cinq encodeurs qui apprendraient la même invariance. Il faut donc relativiser : les résultats sont uniquement simulés, aucun test sur robot réel n'est rapporté, et l'ordre des méthodes n'a plus de sens au-delà de 50 démonstrations. Le résultat suggère toutefois que injecter la symétrie géométrique dans le backbone de perception est presque gratuit en calcul. Ce travail prolonge deux lignes existantes. 3D Diffusion Policy (DP3) conditionne un générateur d'actions par diffusion sur des caractéristiques de nuages de points, mais son encodeur de type PointNet n'a pas d'équivariance intégrée aux transformations SIM(3). EquiBot avait comblé cette lacune avec un encodeur VNN équivariant, mais seulement pour des manipulateurs mobiles à roues. EquivDP3 transpose l'approche à un humanoïde bien plus complexe, en s'appuyant sur une architecture hiérarchique qui sépare planification lente et contrôle rapide. Les prochaines étapes évidentes sont le transfert sim-to-real sur un G1 physique, des benchmarks moins saturés et une comparaison avec les politiques VLA généralistes, qui misent sur l'échelle des données plutôt que sur les priors géométriques.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèles du monde à embodiment croisé : passage à l'échelle pour la manipulation dextérique
3arXiv cs.RO 

Modèles du monde à embodiment croisé : passage à l'échelle pour la manipulation dextérique

Résumé des risques : aucun outil nécessaire, ceci est une tâche de traduction/synthèse d'article. Voici le texte. Une équipe de recherche propose dans un article publié sur arXiv (2511.01177v3, version révisée) une nouvelle approche pour construire des modèles du monde partagés entre différentes morphologies de mains, robotiques comme humaines. Le problème posé est concret : les différences de cinématique et d'espaces d'action entre robots empêchent aujourd'hui de mutualiser les données d'entraînement et de transférer du contrôle d'un système à l'autre. Les chercheurs représentent les mains, humaines et robotiques, comme des ensembles de particules 3D, et définissent les actions comme des champs de déplacement de ces particules à l'extrémité effectrice. Cette abstraction géométrique s'affranchit des espaces articulaires propres à chaque plateforme tout en conservant la géométrie et le mouvement pertinents pour l'interaction physique. Le modèle du monde, basé sur des réseaux de graphes, est entraîné sur des données d'interaction aléatoires issues de mains robotiques simulées variées et de mains humaines réelles, puis couplé à du contrôle prédictif par modèle (MPC) pour piloter du matériel inédit. Les expériences, menées sur des tâches de manipulation d'objets rigides et déformables, dégagent trois résultats. D'abord, plus la diversité des morphologies utilisées à l'entraînement est grande, meilleure est la généralisation à des mains jamais vues. Ensuite, combiner données simulées et données réelles dans de bonnes proportions surpasse l'usage de l'une ou l'autre source seule. Enfin, un même modèle appris permet de contrôler efficacement des mains robotiques aux cinématiques et degrés de liberté (DOF) distincts. Pour le secteur, ces résultats intéressent directement la question du transfert de compétences entre plateformes hétérogènes, un verrou connu pour les approches VLA classiques qui restent souvent liées à un espace d'action fixe. Il s'agit d'un travail de recherche académique, pas d'un produit ni d'un déploiement industriel : aucune entreprise, aucun robot commercial n'est nommé, et les résultats sont obtenus en environnement contrôlé, majoritairement simulé. La méthode s'inscrit dans la lignée des travaux récents sur les modèles du monde et le contrôle prédictif appliqués à la manipulation dextre, un axe de recherche actif face aux limites de généralisation des politiques bout-en-bout entraînées par embodiment.

RecherchePaper
1 source
FORTE : optimisation adaptative de la capacité de force pour manipulateurs mobiles
4arXiv cs.RO 

FORTE : optimisation adaptative de la capacité de force pour manipulateurs mobiles

Une équipe de recherche présente FORTE, un framework de contrôle pour manipulateurs mobiles redondants, décrit dans un preprint publié sur arXiv (2609.21497, catégorie "new"). Le système s'appuie sur un modèle vision-langage qui analyse une image RGB et une description de tâche pour estimer les propriétés physiques d'un objet et générer une séquence de forces requises, incluant les effets gravitationnels et inertiels liés au port de charge. FORTE définit ensuite une métrique de capacité de force orientée tâche, calculée comme la distance signée entre une boule d'incertitude de force et le polytope de force résiduelle dynamique du robot, qui quantifie l'écart entre les besoins de la tâche et la capacité d'actionnement restante. Cette métrique est intégrée dans une optimisation de trajectoire corps entier combinant manipulabilité, évitement des butées articulaires, fluidité de mouvement et suppression des oscillations de la base mobile. Les essais portent sur un manipulateur mobile exécutant des tâches de levage et de maintien en un point sous charges utiles variables, avec code source public sur GitHub (yeying256/FORTE). Le résultat central concerne directement les intégrateurs de bras robotiques montés sur AMR ou plateformes mobiles: contrairement aux méthodes existantes qui maximisent systématiquement la capacité de force au détriment de la dextérité, ou qui ignorent les exigences propres à chaque tâche, FORTE ajuste dynamiquement l'effort de contrôle à la charge réelle. Le robot conserve ainsi une manipulabilité élevée pour les charges légères tout en garantissant une marge de force suffisante pour les charges lourdes, un compromis que les approches de référence testées ne reproduisent pas. C'est une piste concrète pour la logistique et l'industrie, où un même bras doit alterner entre pièces légères de précision et charges lourdes sans reparamétrage manuel des contraintes de force, et un exemple supplémentaire d'usage de modèles vision-langage pour informer la planification de mouvement sans modèle physique préalable de l'objet manipulé. Ce travail répond à une limite connue des méthodes de résolution de redondance: elles négligent généralement les exigences de force spécifiques à la tâche, ou maximisent la capacité de force de façon indiscriminée, sacrifiant la dextérité quand une large marge n'est pas nécessaire. Les auteurs comparent explicitement FORTE à trois références fixes, le rayon inscrit du polytope de force résiduelle, son cône, et l'optimisation basée sur la seule manipulabilité. Publié comme preprint arXiv en version initiale, le travail reste à ce stade une contribution de recherche accompagnée d'une implémentation ouverte, sans partenaire industriel, plateforme commerciale ni calendrier de déploiement mentionnés dans l'article.

RecherchePaper
1 source