Aller au contenu principal
Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade
RecherchearXiv cs.RO 

Sélection et planification simultanées des contacts pour la manipulation riche en contacts par optimisation en cascade

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2605.27972) un cadre d'optimisation en cascade baptisé SCSP, pour Simultaneous Contact Selection and Planning, dédié à la manipulation robotique en contact riche. Ce type de manipulation regroupe les tâches où le bras doit gérer plusieurs points de contact dynamiques : pivotement d'objet, manipulation en main, assemblage serré. Le système repose sur deux modules séquentiels : CSO (Contact Selection Optimization), qui détermine automatiquement les localisations de contact optimales sur l'objet cible, et CPO (Contact Planning Optimization), qui génère ensuite les trajectoires de manipulation correspondantes en temps réel pour des bras redondants à sept degrés de liberté ou plus. Les auteurs valident l'approche en simulation et sur robot physique, sur des tâches décrites comme complexes, sans que l'abstract ne fournisse de métriques de temps de cycle ou de taux de succès chiffrés.

Le verrou que SCSP prétend lever est structurant pour la manipulation autonome : la quasi-totalité des méthodes contact-implicit existantes suppose que la séquence de points de contact est définie à l'avance par l'opérateur. Le robot optimise la trajectoire, pas l'endroit où il entre en contact. CSO contourne les deux obstacles qui rendaient la sélection active difficile, à savoir la complémentarité dans la dynamique de contact et les gradients parcimonieux, en substituant un modèle de contact approché et différentiable au modèle physique discontinu, couplé à une optimisation discrète-continue. CPO exploite ensuite ces localisations comme prior pour planifier en temps réel. Si le comportement se généralise hors simulation, le framework permettrait d'aborder des tâches de manipulation substantiellement plus complexes sans paramétrage manuel des modes de contact, ce qui est aujourd'hui l'un des goulots d'étranglement principaux en intégration industrielle.

Le champ de la manipulation en contact riche est partagé entre deux grandes familles : l'optimisation classique (contact-implicit trajectory optimization, MPC) et l'apprentissage (VLA, diffusion policies), portées notamment par Physical Intelligence avec Pi-0, Covariant et Figure AI. SCSP s'inscrit dans la ligne optimisation, plus interprétable et potentiellement plus robuste hors distribution que les approches end-to-end. L'identité institutionnelle des auteurs n'apparaît pas dans l'abstract arXiv, ce qui complique l'évaluation de la maturité et du soutien financier derrière le travail. Les démonstrations vidéo disponibles sur le site projet constitueront le vrai test de crédibilité avant tout positionnement industriel.

À lire aussi

SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts
1arXiv cs.RO 

SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts

Des chercheurs proposent SARI (Simulated Approach, Real Interaction), un cadre de co-entraînement simulation-réel « à phases séparées » destiné à adapter des modèles vision-langage-action (VLA) à des tâches de manipulation riches en contacts. Le principe : générer les trajectoires d'approche, en espace libre, dans un jumeau numérique photoréaliste, et ne collecter en conditions réelles que les phases de contact, sur un petit nombre de positions d'objets. Une seule politique est ensuite post-entraînée sur ces démonstrations segmentées par phase. Elle enchaîne approche simulée et interaction réelle grâce à un alignement de l'apparence visuelle et à une représentation d'action partagée, exprimée par rapport à la caméra. Elle n'utilise ni étiquettes de phase explicites ni commutateurs codés à la main. Testé sur cinq tâches de manipulation réelles, SARI réduit de 34,3 % le temps de collecte de données réelles et atteint 27,5 % de réussite sur des positions jamais vues, là où toutes les approches de référence sim-réel entraînées sur la tâche complète échouent totalement (0 %). Le travail est publié sur arXiv (2610.02804). Ces résultats comptent pour les équipes qui adaptent des VLA à des tâches d'assemblage ou d'insertion, où le coût des démonstrations téléopérées est le principal frein. L'intérêt tient à la répartition du travail : la diversité spatiale, gourmande en données mais tolérante aux écarts de simulation, est confiée à la synthèse. La physique du contact, sensible aux erreurs de modèle mais peu dépendante de la position de l'objet, reste réelle. Cela nuance l'idée d'un transfert sim-vers-réel de bout en bout et suggère qu'un découpage par phase est plus rentable. Il faut toutefois relativiser les chiffres. Un taux de 27,5 % sur positions inédites reste très loin d'un seuil industriel, et un gain de 34,3 % sur le temps de collecte est modeste. Les résultats portent sur cinq tâches, avec un échantillon et des conditions de laboratoire dont l'article ne détaille pas ici la variabilité. Le contraste avec les références à 0 % est parlant, mais il dépend du choix de ces références. L'article s'inscrit dans la série de travaux sur le co-entraînement sim-réel pour les politiques VLA, qui cherchent à réduire la dépendance aux démonstrations réelles, aujourd'hui l'un des principaux postes de coût du déploiement de modèles généralistes. Les approches concurrentes, qui mélangent simulation et réel sur la tâche entière, se heurtent à l'écart de réalité dès que le contact intervient, ce que SARI cherche à contourner. Il s'agit ici d'un résultat de recherche et non d'un produit ni d'un déploiement : aucun partenaire industriel, calendrier de pilote ni code disponible n'est mentionné dans le résumé. Les suites probables sont des validations sur davantage de tâches, de robots et de géométries d'objets, ainsi que des comparaisons avec les VLA généralistes actuels, afin de vérifier si le gain tient hors du cadre expérimental initial.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique
2arXiv cs.RO 

DUET-DINO : modélisation simultanée du monde multi-vue pour la planification latente en manipulation robotique

Des chercheurs affiliés au laboratoire UTN-AIR publient DUET-DINO, un modèle de monde latent conditionné par l'action, décrit dans une prépublication arXiv du 10 septembre 2026 (arXiv:2609.10506). Le système apprend simultanément à partir de deux flux vidéo, une caméra statique de scène et une caméra montée sur le poignet du bras robotique, en les faisant se conditionner mutuellement, pour prédire les conséquences visuelles d'une action sur l'ensemble des 7 degrés de liberté (DOF) d'un effecteur terminal. Entraîné à partir de zéro sur les jeux de données DROID et RoboArena, il atteint 92% de réussite sur des tâches d'atteinte spatiale (reach), 72,5% sur des tâches d'atteinte avec orientation fine (angled-reach) et 60,0% sur des tâches de préhension et levage d'objet (grasp-and-lift), surpassant des versions à vue unique ou à double vue non couplée. Les auteurs comparent aussi deux briques de vision : les prédictions du modèle V-JEPA 2 sur la vue poignet sous-estiment la dynamique visuelle induite par des actions fines, tandis que DINOv3 capture mieux ces changements et améliore la planification en aval. Le code et les poids seront publiés en open source, mais ne le sont pas encore à ce stade. L'enjeu technique visé est concret : les modèles de monde latents existants échouent souvent sur les actions spatiales et rotationnelles fines, ce qui limite leur usage pour un contrôle précis en 7 DOF, indispensable à des tâches d'insertion, de saisie orientée ou de manipulation fine en usine. En couplant vue globale de scène et vue centrée sur la pince, DUET-DINO cherche à combler cet écart pour permettre une planification zero-shot conditionnée par objectif, sans réentraînement spécifique à chaque tâche. Pour les intégrateurs et décideurs robotique, le résultat le plus utile n'est pas tant les scores de réussite, encore modestes sur des tâches de préhension complexes, que l'indication empirique que le choix du backbone visuel (DINOv3 plutôt que V-JEPA 2) conditionne directement la qualité de la planification en aval, un signal utile pour quiconque construit des architectures VLA ou de modèles de monde. Ce travail s'inscrit dans la lignée des modèles de monde auto-supervisés type V-JEPA de Meta et des familles DINOv2/DINOv3, plutôt que dans celle des politiques VLA de bout en bout comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent directement une politique d'action plutôt qu'un modèle prédictif séparé. DUET-DINO reste à ce stade une publication de recherche évaluée sur des bancs d'essai contrôlés, sans déploiement industriel annoncé ; les auteurs promettent la publication du code et des checkpoints ainsi qu'une page projet dédiée, mais aucun calendrier de mise à disposition n'est précisé.

RecherchePaper
1 source
Optimisation par données des configurations de capteurs tactiles pour la manipulation dextérique
3arXiv cs.RO 

Optimisation par données des configurations de capteurs tactiles pour la manipulation dextérique

Des chercheurs ont publié sur arXiv (arXiv:2409.20473v3) un cadre méthodologique permettant, pour la première fois, de quantifier la contribution individuelle de chaque capteur tactile à la performance d'une politique d'apprentissage par renforcement profond (DRL) appliquée à la manipulation dextère. L'étude cible la Shadow Hand, une main robotique à 24 degrés de liberté équipée de 92 capteurs tactiles. En deux étapes, les auteurs réduisent ce réseau dense à 14 capteurs tout en conservant plus de 90 % de la performance initiale sur trois tâches de manipulation standardisées (bloc, oeuf, stylo). La première phase, empirique, écrête le nombre de capteurs de 92 à 21 en maintenant 93 % des performances. La seconde phase, plus fine, combine une régression par processus gaussiens (GPR) et une régression Lasso pour classer l'importance fonctionnelle de chaque capteur restant. Le résultat le plus saillant contredit l'intuition habituelle en robotique : les capteurs du doigt médius contribuent négativement à l'apprentissage, dégradant activement la politique DRL plutôt que de l'améliorer. À l'inverse, le pouce, l'annulaire et l'auriculaire concentrent l'essentiel de l'information utile au contrôle de contact. Pour les intégrateurs et les équipes de R&D en manipulation robotique, cela signifie qu'une réduction drastique du nombre de capteurs n'est pas seulement possible sans sacrifier les performances, elle peut même les améliorer en éliminant des signaux redondants ou antagonistes. Des expériences de transfert zéro-shot sur deux nouveaux objets et une validation croisée sur l'Allegro Hand et la Leap Hand confirment que ces classements d'importance se généralisent au-delà de la plateforme d'entraînement. La problématique de placement de capteurs tactiles reste largement non résolue dans la littérature, en l'absence de méthodes systématiques comparables à celles développées pour la vision. Ce travail s'inscrit dans un contexte où plusieurs laboratoires et entreprises, dont Sanctuary AI, Agility Robotics ou encore OpenAI avec Dexterous Manipulation, investissent massivement dans la manipulation fine comme prochain verrou de la robotique humanoïde. Les concurrents directs sur la Shadow Hand incluent des frameworks basés sur le sim-to-real (IsaacGym, MuJoCo), qui peinent encore à modéliser fidèlement le retour tactile dense. Les auteurs proposent leurs critères de déploiement comme des guidelines quantitatifs applicables à d'autres morphologies robotiques, ouvrant la voie à des configurations capteurs optimisées dès la phase de conception mécanique plutôt qu'a posteriori.

RecherchePaper
1 source
Optimisation bi-niveaux pour la planification du mouvement et des contacts dans les robots à jambes assistés par corde
4arXiv cs.RO 

Optimisation bi-niveaux pour la planification du mouvement et des contacts dans les robots à jambes assistés par corde

Des chercheurs ont publié sur arXiv (2604.26910) un framework de planification pour robots à pattes assistés par câble, capables de grimper des surfaces verticales. Le système repose sur une optimisation bi-niveau qui résout un problème mixte entier-continu : au niveau supérieur, la méthode Cross-Entropy sélectionne les régions de terrain viables pour l'appui des membres ; au niveau inférieur, une optimisation non linéaire à gradient calcule les mouvements dynamiquement réalisables, en optimisant simultanément les tensions du câble, les forces exercées par les pattes, et la localisation précise des points de contact. L'approche est validée sur une plateforme expérimentale inédite baptisée ALPINE, testée sur plusieurs configurations de terrain difficiles. L'intérêt principal réside dans la décomposition du problème de planification de contact sur surfaces verticales, longtemps considéré comme computationnellement intractable pour les robots à pattes. Le schéma bi-niveau sépare la sélection discrète des zones d'appui de l'optimisation continue des forces et trajectoires, rendant le problème soluble en temps raisonnable. Pour les concepteurs de robots d'inspection d'infrastructure, de maintenance en hauteur ou de recherche en milieu confiné vertical, cette architecture offre un cadre de planification là où les AMR à roues sont inopérants. La robotique grimpante reste un domaine de niche en progression. Les approches antérieures reposaient principalement sur des ventouses, des griffes ou des systèmes d'escalade fortement contraints géométriquement. L'hybridation câble-pattes ouvre une voie potentiellement plus adaptable aux surfaces irrégulières. ETH Zurich via ANYbotics, le MIT et Boston Dynamics ont exploré la locomotion en terrain difficile, mais sans assistance câble active intégrée dans la boucle de planification. ALPINE constitue donc une contribution expérimentale distincte, même si le papier reste un preprint sans validation industrielle ni déploiement annoncé.

RecherchePaper
1 source