Aller au contenu principal
Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel
RecherchearXiv cs.RO 

Manipulation d'objets déformables en observabilité partielle grâce à l'estimation de forme complète en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente cRVAE (conditional récurrent variational autoencoder), un modèle léger capable d'estimer l'état complet d'un objet déformable comme une corde ou un tissu à partir de simples observations partielles de ses coins, sans nécessiter de paramètres physiques en entrée ni d'identification de paramètres en ligne. Décrit dans l'article arXiv:2609.10308v1, ce réseau sert de modèle prédictif dans un cadre de contrôle optimal à horizon glissant pour la manipulation collaborative d'objets déformables en présence d'obstacles. En simulation sur des scénarios de corde et de tissu, cRVAE atteint une précision comparable à celle d'un modèle physique XPBD (Extended Position Based Dynamics) pourtant calibré avec des paramètres identifiés au préalable, tout en étant environ 350 fois plus rapide sur la corde et plus de 1500 fois plus rapide sur le tissu à chaque passe de calcul. Cette vitesse permet de rester sous le budget de contrôle de 100 millisecondes nécessaire à une planification en boucle fermée, un seuil que le modèle XPBD dépasse déjà sur des horizons courts. Les chercheurs ont démontré le système sur un robot quadrupède Unitree Go2.

Ce résultat s'attaque à un angle mort persistant de la robotique industrielle : si la manipulation d'objets rigides est largement résolue par des méthodes basées modèle, les objets déformables (câbles, textiles, corde, emballages souples) restent un défi ouvert à cause de leur espace d'état de très haute dimension, de leur dynamique sous-actionnée et de l'observabilité partielle inhérente aux capteurs disponibles. Les simulateurs physiques comme XPBD, très utilisés pour le rendu de tissus et de cordes, exigent une calibration coûteuse par objet et deviennent trop lents pour du contrôle temps réel dès que l'horizon de planification s'allonge. En démontrant qu'un modèle appris peut remplacer cette simulation physique sans perte de précision et sans calibration objet par objet, l'étude lève un obstacle concret au déploiement de manipulateurs sur des tâches comme le routage de câbles, la manutention textile ou l'emballage souple en logistique, où le recalibrage manuel par pièce est impraticable à l'échelle. Le choix d'un robot quadrupède plutôt qu'un bras manipulateur classique suggère aussi une applicabilité à des contextes de manipulation mobile plus larges. La validation reste toutefois circonscrite à la simulation pour la comparaison de précision, et la démonstration matérielle sur Go2 n'est pas détaillée en termes de tâche ni de robustesse.

Ce travail s'inscrit dans la lignée des architectures d'autoencodeurs variationnels, ici adaptées en version récurrente et conditionnelle pour l'estimation d'état temporel, et vise spécifiquement à remplacer les moteurs physiques comme XPBD (utilisé notamment dans des environnements de simulation robotique et de jeu) comme modèle prédictif embarqué dans une boucle de contrôle. Il s'agit d'une publication de recherche académique et non d'une annonce produit ou d'un pilote industriel : aucun acteur commercial concurrent n'est cité, et aucun calendrier de déploiement n'est communiqué. Les prochaines étapes logiques, non annoncées dans l'article, porteraient vraisemblablement sur l'extension à d'autres matériaux déformables, à des configurations bimanuelles, et sur des essais matériels plus poussés au-delà de la démonstration initiale sur le Go2.

Dans nos dossiers

À lire aussi

Instant-Fold : apprentissage par imitation en contexte pour la manipulation d'objets déformables
1arXiv cs.RO 

Instant-Fold : apprentissage par imitation en contexte pour la manipulation d'objets déformables

Des chercheurs présentent Instant-Fold (arXiv:2606.04269, juin 2026), un cadre d'apprentissage par imitation en contexte appliqué à la manipulation d'objets déformables comme le textile. Le principe central : à partir d'une seule démonstration humaine, le système infère et exécute des modes de manipulation variés (pliage avec ordres et variantes spatiales différents) sans aucune mise à jour de gradients ni fine-tuning. L'approche repose sur deux composants : un encodeur visuel pré-entraîné par contrastive learning temporel pour capturer les déformations du matériau, et une politique basée sur un transformer à flow-matching conditionné sur cette démonstration. Le modèle est entraîné entièrement en simulation et revendique un transfert zero-shot vers des environnements réels, sans collecte de données supplémentaire. La manipulation d'objets déformables (DOM) est l'un des problèmes les plus persistants de la robotique de manipulation : l'état d'un tissu est de haute dimension, partiellement observable, et évolue à travers des interactions à long horizon avec des changements de topologie. La promesse d'Instant-Fold est double : une seule démonstration humaine suffit, et aucun réentraînement n'est requis pour chaque nouveau mode de pliage. Pour les intégrateurs en industrie textile ou en logistique e-commerce, l'implication est directe : déployer une nouvelle variante de pliage reviendrait à filmer une démonstration, sans pipeline de réentraînement. La revendication de transfert sim-to-real zero-shot mérite toutefois d'être lue prudemment : les vidéos disponibles sur le site du projet présentent des séquences sélectionnées, et la robustesse face à des matières de textures ou rigidités très variables n'est pas quantifiée dans l'abstract. La manipulation de tissu est un chantier actif depuis des années, longtemps dominé par des approches à base d'états denses et de planification hors ligne. L'émergence des politiques diffusion (ACT, Diffusion Policy) puis des modèles Vision-Language-Action a réorienté le domaine vers des méthodes end-to-end généralisables. Instant-Fold s'inscrit dans cette lignée, mais adopte le flow-matching (plus rapide à l'inférence que la diffusion) et mise sur l'in-context learning plutôt que le fine-tuning par démonstration, une approche encore minoritaire en robotique. Les groupes concurrents actifs sur la DOM incluent des équipes chez Google DeepMind et des labos universitaires ayant publié sur des benchmarks comme SoftGym ou ClothFunnels. La validation sur des évaluations standardisées et en conditions industrielles réelles reste la prochaine étape nécessaire avant tout pilote commercial.

RechercheOpinion
1 source
Planifier en cours de route : planification événementielle par modèle fondation pour l'exécution TAMP en manipulation partiellement observable
2arXiv cs.RO 

Planifier en cours de route : planification événementielle par modèle fondation pour l'exécution TAMP en manipulation partiellement observable

Des chercheurs publient sur arXiv (arXiv:2608.28075v1, 28 août 2026) ROBUST TAMP, un framework modulaire de planification tâche-et-mouvement (TAMP) piloté par des modèles de fondation, LLM et VLM, pour la manipulation robotique en environnement partiellement observable. Le système restreint le planificateur à l'état relationnel de la scène actuellement visible, valide chaque action générée contre une interface d'exécution stricte, puis achemine les actions acceptées vers des adaptateurs d'exécution propres à chaque scène. La découverte d'un objet imprévu, cible ou non, déclenche un événement de replanification distinct : après un horizon d'exécution stable, le système reconstruit l'état visible de la scène et replanifie à partir de l'historique des actions déjà complétées et du contexte structuré de l'événement. Les évaluations portent sur six variantes de cuisine et de grill sous simulateur RLBench/CoppeliaSim, incluant objets cachés, découverte d'objets non ciblés, interaction avec des contenants articulés et procédures de manipulation temporelles, en comparant des planificateurs LLM texte-seul et VLM de tailles différentes sous un pipeline identique de validation, exécution, surveillance et replanification. Le travail cible un angle mort des architectures TAMP guidées par foundation models, qui supposent le plus souvent un état de scène entièrement connu à l'avance ou déclenchent une replanification complète du modèle dès qu'un sous-objectif échoue. En environnement réel, un robot découvre en cours d'exécution des objets non anticipés, ce qui invalide un plan pourtant correct au départ ; traiter cette découverte comme un événement à part entière plutôt qu'un échec générique limite les appels coûteux au modèle de fondation, un point sensible pour les intégrateurs qui budgétisent le coût d'inférence à l'échelle d'une flotte. La comparaison entre planificateurs texte-seul et VLM de tailles variées fournit des données concrètes sur l'arbitrage précision/coût, utiles aux décideurs qui cherchent à dimensionner le bon niveau de modèle plutôt que de supposer qu'un VLA volumineux règle par défaut l'observabilité partielle. Ce travail s'inscrit dans la lignée des systèmes de TAMP guidés par LLM/VLM apparus ces dernières années pour générer décompositions de tâches, sous-objectifs et contraintes symboliques, mais que les auteurs jugent encore trop dépendants d'une scène pleinement spécifiée. Les six bancs d'essai restent entièrement simulés, sous RLBench/CoppeliaSim, sans mention de robot physique, d'affiliation industrielle ni de calendrier de transfert vers le réel : il s'agit d'une publication de recherche évaluant une architecture logicielle, non d'un produit commercialisé. La suite logique, non annoncée dans le résumé, serait une validation sur manipulateur réel et une extension au-delà des scènes de cuisine et de grill testées.

RecherchePaper
1 source
FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables
3arXiv cs.RO 

FolDeX : un benchmark en conditions réelles pour la manipulation robotique longue durée d'objets déformables

FolDeX, benchmark présenté dans un article arXiv publié le 10 septembre 2026, évalue la manipulation robotique longue durée d'objets déformables à partir de données collectées exclusivement sur robots réels, avec le pliage de vêtements comme tâche principale. Le jeu de données compte plus de 2000 heures d'expérience physique, plus de 20 tâches et plus de 10 types de robots différents. Il s'organise autour de quatre axes : réutilisation des interventions humaines et des récupérations effectuées en déploiement, transfert de données entre tâches (du rigide au déformable, entre catégories de vêtements), réutilisation entre scènes avec éclairage, arrière-plan et agencement variables, et transfert entre plateformes robotiques. Une plateforme d'évaluation publique, hébergée sur ai.midea.com/#/fold-challenge par le groupe chinois Midea, permet de soumettre des politiques externes selon un protocole standardisé, avec objets tenus à l'écart de l'entraînement et initialisations contrôlées. Le projet cible l'écart bien connu entre simulation et monde réel dans l'IA incarnée : les modèles vision-langage-action et monde-action qui réussissent en simulation se dégradent souvent sur robot physique, en particulier sur des séquences longues et bimanuelles exigeant un suivi continu de l'état de l'objet. Les benchmarks existants couvrent surtout des tâches courtes sur objets rigides, laissant un vide pour juger la fiabilité réelle des politiques généralistes à grande échelle. En imposant un protocole externe avec objets et initialisations non divulgués à l'avance, FolDeX limite le risque de démonstrations sélectionnées, fréquentes dans les annonces du secteur humanoïde, et donne aux intégrateurs un moyen concret de vérifier si la manipulation fine tient hors des vidéos contrôlées. FolDeX s'inscrit dans la course actuelle à l'IA incarnée généraliste, aux côtés d'approches comme Figure 03 et Helix chez Figure AI, Optimus Gen 3 chez Tesla, la famille Pi-0 chez Physical Intelligence ou GR00T N2 chez Nvidia. Contrairement à ces annonces produits, il s'agit d'un outil de recherche ouvert, non d'un robot ou d'un modèle commercial livré. Son hébergement par Midea, groupe chinois de l'électroménager également actionnaire majoritaire de l'allemand Kuka dans la robotique industrielle, traduit l'intérêt croissant des fabricants asiatiques pour la manipulation d'objets souples, un enjeu clé pour le textile ou la logistique. La plateforme est déjà accessible pour des soumissions externes, sans calendrier de résultats ni classement encore communiqué.

UELe fabricant allemand Kuka, actionnaire majoritaire détenu par Midea, est indirectement associe a cette initiative qui pourrait intéresser les intégrateurs européens de robotique industrielle pour le textile et la logistique.

RecherchePaper
1 source
DiffDef : un modèle de diffusion pour générer des formes cibles multimodales de manipulation d'objets déformables
4arXiv cs.RO 

DiffDef : un modèle de diffusion pour générer des formes cibles multimodales de manipulation d'objets déformables

La manipulation d'objets déformables par asservissement de forme (shape servoing) fait l'objet d'un nouveau système, DiffDef, décrit dans un preprint arXiv (2506.18779, version 2 remplaçant une première soumission). Ce réseau de neurones fonde sur un modèle de diffusion apprend une distribution de formes cibles plausibles plutôt que de prédire une unique configuration déterministe, ce qui évite l'effet de moyennage des modes typique des prédicteurs classiques. La méthode a été évaluée en simulation puis sur deux plateformes robotiques physiques : le da Vinci Research Kit (dVRK), plateforme de recherche en chirurgie robotique, et un système bimanual base sur des bras KUKA. Les taches testées s'inspirent de scenarios de fabrication industrielle et d'applications chirurgicales. Un site dédié (sites.google.com/view/diffdef) accompagne la publication. La manipulation d'objets déformables (tissus, câbles, textiles, organes) reste l'un des problèmes les plus difficiles de la robotique, loin derrière la maturité atteinte sur les objets rigides. Les approches existantes d'asservissement de forme dépendent généralement de méthodes d'acquisition de la forme cible peu praticables en conditions réelles, ingénierie manuelle de connaissances métier ou démonstration physique par un opérateur, et supposent un objectif unique et déterministe. Or de nombreuses taches réelles admettent plusieurs formes cibles distinctes menant toutes a une réussite, un cas multimodal que les méthodes actuelles géraient mal. En montrant une amélioration mesurable des performances sur des plateformes chirurgicales et industrielles réelles, DiffDef fournit une preuve de concept que la modélisation probabiliste par diffusion peut combler cet écart, avec un intérêt direct pour les intégrateurs travaillant sur la chirurgie assistée par robot ou l'automatisation de taches textiles et de câblage en usine. Ce travail s'inscrit dans une ligne de recherche académique sur l'asservissement de forme, domaine ou la génération de formes cibles a longtemps repose sur l'ingénierie manuelle plutôt que sur l'apprentissage automatique. Le choix des plateformes de validation, le dVRK largement utilise dans la communauté de recherche en chirurgie robotique, et un bras bimanual KUKA, marque allemande courante en robotique industrielle et de recherche, situe DiffDef comme un travail de validation croisée entre milieu médical et manufacturier plutôt que comme un produit commercial. Il s'agit a ce stade d'un résultat de recherche publie en preprint, sans annonce de déploiement industriel ni de partenariat commercial associe ; la suite logique pour la communauté robotique consistera a vérifier si l'approche généralisé a d'autres classes d'objets déformables et si le code sera rendu public au-delà du site web dédié a la publication.

UELe systeme est valide sur une plateforme bimanuelle KUKA, entreprise allemande, ce qui interesse la communaute robotique industrielle europeenne sans deploiement ni partenariat commercial confirme.

RecherchePaper
1 source