Aller au contenu principal
ADMM Stein projeté avec contact implicite pour découvrir des stratégies variées de manipulation riche en contacts
RecherchearXiv cs.RO 

ADMM Stein projeté avec contact implicite pour découvrir des stratégies variées de manipulation riche en contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv (référence 2609.28299, soumission anonyme, signe probable d'une évaluation en double-aveugle pour une conférence de robotique) propose une nouvelle méthode d'optimisation de trajectoire pour la manipulation robotique riche en contacts. Le problème visé: les solveurs dits "contact-implicit trajectory optimization" formulent la tâche comme un programme d'optimisation unique sous contraintes, qui converge systématiquement vers un seul optimum local alors qu'il existe souvent plusieurs modes de contact, prises ou directions de poussée tout aussi valides. La stratégie obtenue est donc rigide et très sensible aux conditions d'initialisation. Les auteurs combinent une variante de l'ADMM par consensus (Consensus Alternating Direction Method of Multipliers) avec l'inférence variationnelle de Stein pour produire, en une seule résolution, un ensemble de solutions distinctes plutôt qu'une réponse unique. Leur trouvaille technique: appliquer la force répulsive de Stein sur la variable "splittée" de l'ADMM plutôt que sur sa forme primale, ce qui permet de couvrir l'espace des stratégies de contact faisables sans bloquer prématurément la convergence. La méthode est testée sur des tâches de poussée, de saisie et de transfert d'objet entre deux robots, avec vidéos et code publiés sur un site dédié.

Pour la recherche en manipulation robotique, ce travail s'attaque à une limite connue: l'incapacité des solveurs actuels à explorer plusieurs stratégies de contact en parallèle, ce qui fragilise les robots face aux perturbations ou aux variations d'initialisation en conditions réelles. Produire un ensemble diversifié de solutions plutôt qu'une trajectoire figée intéresse directement les intégrateurs cherchant à fiabiliser des tâches de pick-and-place ou de transfert d'objets en environnement non structuré. Les auteurs affirment que leur solveur, plus simple à formuler que les approches existantes, découvre des modes de contact que ces dernières manquent, ce qui, si confirmé indépendamment, nuancerait l'idée que la diversité de stratégies exige des architectures plus complexes.

Le travail s'inscrit dans la lignée des méthodes traitant les contacts comme variables continues plutôt qu'événements discrets, en combinant deux briques existantes, l'ADMM et l'échantillonnage par particules de Stein issu du machine learning bayésien. Aucun déploiement matériel, partenariat industriel ni acteur français ou européen n'est mentionné: il s'agit d'un résultat en simulation, à ce stade en preprint. Une validation sur robot physique et une comparaison chiffrée avec les solveurs concurrents restent les suites logiques attendues.

À lire aussi

Projection-rétraction MPPI : contrôle exact sur variété de contraintes pour manipulateurs
1arXiv cs.RO 

Projection-rétraction MPPI : contrôle exact sur variété de contraintes pour manipulateurs

Des chercheurs du RCI Lab publient sur arXiv (référence 2608.07573v1) une nouvelle méthode de commande pour bras manipulateurs baptisée Projection-Retraction MPPI (PR-MPPI). Le système a été validé sur des plateformes bimanuelles à 14 degrés de liberté (DOF) : en simulation, via un test de stress sur les limites articulaires et un test d'évitement d'obstacles randomisé, puis sur matériel réel avec un humanoïde Unitree H1-2 dont les deux bras évitent de façon réactive un obstacle mobile. Le code source et les vidéos d'expérience sont publiés sur rcilab.github.io/prmppi. Il s'agit d'une publication de recherche académique, sans annonce de produit commercial ni de déploiement industriel. Le Model Predictive Path Integral (MPPI) est une technique de commande prédictive très utilisée en manipulation robotique car elle gère des coûts non convexes sans calcul de gradient, en échantillonnant en parallèle de nombreuses trajectoires candidates, une approche qui tire parti du calcul GPU massivement parallèle. Sa limite connue est que les contraintes strictes, comme une chaîne cinématique fermée que deux bras doivent maintenir exactement pour porter ensemble un objet rigide, ou les limites articulaires et distances de sécurité aux obstacles, ne sont traitées que comme des pénalités douces dans le coût, susceptibles d'être violées dès que le coût de tâche devient dominant. PR-MPPI corrige ce point en projetant, à chaque étape de simulation, la vitesse échantillonnée sur le sous-espace de la contrainte d'égalité puis sur le demi-espace de chaque contrainte d'inégalité, avant de ramener la commande finale sur la contrainte à une tolérance numérique près, indépendamment du poids attribué à la tâche. Pour la manipulation bimanuelle et les humanoïdes évoluant près d'humains ou d'obstacles mobiles, cette garantie de respect exact, et non plus seulement approximatif, des contraintes de sécurité répond à une faiblesse pratique connue des architectures de commande par échantillonnage. Le MPPI est hérité des méthodes de commande prédictive par échantillonnage développées initialement pour les véhicules autonomes, avant d'être largement repris ces dernières années dans la commande corps-complet des bras manipulateurs et des humanoïdes, portée par les gains de calcul parallèle sur GPU. L'article positionne PR-MPPI comme une réponse directe à la principale faiblesse de cette famille de méthodes, la gestion uniquement molle des contraintes strictes, un problème qui concerne potentiellement des architectures de commande similaires chez d'autres constructeurs d'humanoïdes et de bras bimanuels, alors même que le H1-2 d'Unitree a servi ici de plateforme de test réel. Aucun partenariat industriel, pilote commercial ni calendrier de déploiement n'est mentionné : la publication reste, à ce stade, une validation académique en simulation et sur un seul robot en laboratoire, code et vidéos mis à disposition de la communauté recherche.

RecherchePaper
1 source
VISTA : attention spatiale de contact inférée visuellement pour la manipulation à contacts riches
2arXiv cs.RO 

VISTA : attention spatiale de contact inférée visuellement pour la manipulation à contacts riches

Un article arXiv publié fin août 2026 (2608.25872) présente VISTA-Policy, une méthode d'apprentissage par imitation pour la manipulation robotique en contact avec des objets. Plutôt que d'ajouter des capteurs tactiles ou de force, coûteux à calibrer et déployer, l'approche utilise le Visual Deformation Field (VDF), une représentation 3D des déformations d'un gripper compliant captée par caméra, comme signal de contact. Le système combine un module de décodage du VDF en temps réel, un mécanisme de débruitage isolant les vrais signaux de contact, et un réseau de politique pilotant des corrections incrémentales du gripper en boucle fermée. Il a été testé sur trois tâches, la préhension d'objets d'échelles variables, le dévissage de bouchons et l'écriture calligraphique, face à la référence vision pure 3D Diffusion Policy et à une référence tactile. L'enjeu dépasse la démonstration technique : en manipulation fine, la seule caméra peine à distinguer des états de contact subtils, notamment sous occlusion, tandis que les capteurs tactiles dédiés ajoutent du matériel, de la calibration et des coûts de déploiement. En montrant qu'un signal visuel dérivé de la déformation du gripper égale ou dépasse un capteur tactile physique, l'étude ouvre une voie moins coûteuse vers une manipulation généraliste en environnement non structuré. Les auteurs rapportent une généralisation à des objets d'échelles inédites et une robustesse à des perturbations dynamiques, deux points faibles fréquents des politiques vision seule. Pour des intégrateurs évaluant des piles VLA pour la préhension fine, cela suggère qu'un retour de contact riche est possible sans multiplier les capteurs embarqués. Le travail s'inscrit dans la tendance de l'apprentissage par imitation centré vision, où des politiques par diffusion comme 3D Diffusion Policy dominent mais restent limitées par l'ambiguïté des retours visuels purs ; la comparaison directe avec une référence tactile positionne VISTA-Policy comme alternative, plutôt que complément, aux capteurs de force dédiés. À ce stade, il s'agit d'une publication de recherche sur arXiv, pas d'un produit commercialisé : les résultats reposent sur des évaluations de laboratoire sur trois tâches, avec vidéos et matériel supplémentaire en ligne. Aucun calendrier de transfert industriel ni partenariat n'est communiqué.

RecherchePaper
1 source
Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact
3arXiv cs.RO 

Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact

Une équipe de chercheurs publie sur arXiv (référence 2605.19029) une méthode de contrôle robuste pour la manipulation robotique en contact riche, domaine couvrant la saisie, l'assemblage et l'insertion précise d'objets. Le travail formalise le problème comme une optimisation de contrôle robuste aux distributions (distributionally robust control), résolue via l'inférence variationnelle de Stein, une technique probabiliste déterministe issue du machine learning bayésien. Les contrôleurs qui en résultent modélisent explicitement l'incertitude paramétrique liée aux contacts, sans nécessiter les volumes massifs de données d'entraînement qu'exigent les approches data-driven modernes. Les résultats expérimentaux rapportés indiquent une robustesse améliorée jusqu'à un facteur 3 par rapport aux méthodes classiques à base de modèles, sur une gamme de tâches avec incertitude paramétrique large. Ce chiffre est à nuancer : il provient des propres benchmarks des auteurs, sans validation indépendante. La manipulation en contact riche reste l'un des goulots d'étranglement critiques pour le déploiement de robots industriels polyvalents. Les approches VLA (Vision-Language-Action models), comme pi-0 de Physical Intelligence, offrent une flexibilité remarquable mais se dégradent fortement lorsque les données d'entraînement sont rares, ce qui limite leur adoption dans des environnements industriels où les jeux de données sont difficiles à constituer. Les contrôleurs classiques à base de modèles, à l'inverse, sont computationnellement efficaces mais peinent à représenter l'incertitude task-sensitive, c'est-à-dire celle qui impacte réellement la performance sur une tâche précise. L'approche proposée tente de combler ce fossé en injectant une modélisation probabiliste flexible dans le cadre déterministe des contrôleurs classiques, un compromis potentiellement attractif pour les intégrateurs industriels cherchant fiabilité sans pipeline de données massif. Ce travail s'inscrit dans une tendance académique cherchant à réconcilier le model-based engineering (Boston Dynamics, ABB) et les learned policies (Physical Intelligence avec pi-0, Google DeepMind avec ses architectures GR00T-style). L'inférence variationnelle de Stein, popularisée par Liu et Wang en 2016, est ici adaptée au contrôle optimal, ce qui représente une contribution méthodologique notable. Le résumé disponible ne mentionne ni déploiements réels ni partenaires industriels, signalant clairement un stade de recherche fondamentale, probablement conduite en simulation ou sur bancs d'essai de laboratoire. Une validation sur des plateformes hardware standardisées comme les bras Franka Emika ou UR10, dont les propriétés de contact sont bien documentées, constituerait la prochaine étape logique avant toute perspective d'industrialisation.

RecherchePaper
1 source
VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts
4arXiv cs.RO 

VibeCheck : détection tactile acoustique active pour la manipulation riche en contacts

Des chercheurs du ROAM Lab présentent VibeCheck, un préhenseur de robot équipé de deux doigts piézoélectriques : l'un émet une vibration acoustique à travers l'objet saisi, l'autre la reçoit. Cette configuration de captation acoustique active permet d'extraire, en temps réel, des informations sur l'état de l'objet, ses propriétés matérielles, la position de saisie, la pose de structures internes, et la nature des contacts extrinsèques que l'objet entretient avec son environnement. Le système a été validé sur un bras UR5, en prenant le retour acoustique comme unique feedback sensoriel, sur la tâche d'insertion de goupille (peg insertion), un benchmark classique de manipulation dite contact-riche. Les travaux sont disponibles sur arXiv (2504.15535v2). L'intérêt principal de cette approche est d'offrir une modalité sensorielle tactile qui ne repose ni sur la vision (contrairement à GelSight ou DIGIT), ni sur un capteur force-couple classique, souvent coûteux et fragile. Le fait d'inférer le type de contact extrinsèque uniquement par signature acoustique, et d'en dériver une politique d'imitation learning robuste aux prédictions imparfaites du classificateur, suggère une voie sérieuse vers des manipulateurs capables de réagir à des contacts non planifiés sans percevoir explicitement la scène. La résilience de la politique à l'imperfection du signal est un point notable : elle a été entraînée sur un modèle de transition simulé calibré sur les performances réelles du capteur, ce qui réduit partiellement le sim-to-real gap habituel dans ce type de pipelines. L'acoustique active en robotique n'est pas nouvelle, des travaux comme SonicSense ou les approches vibrotactiles en exploration de matériaux existent depuis plusieurs années, mais son intégration dans un préhenseur commercialement plausible (doigts piézoélectriques standard) pour des tâches longue-durée reste rare. Côté concurrence, les capteurs vision-based (GelSight de MIT, DIGIT de Meta/CMU) dominent la recherche en tactile, tandis que des startups comme Touchlab ou Xela Robotics misent sur d'autres modalités. VibeCheck se distingue par sa capacité à fonctionner à travers l'objet, pas seulement à sa surface. Les prochaines étapes probables incluent l'extension à des géométries d'objets variées et l'intégration à des systèmes multi-modaux combinant acoustique et vision.

RecherchePaper
1 source