Aller au contenu principal
RecherchearXiv cs.RO 

PointCast : un seul modèle du monde pour la manipulation d'objets rigides, articulés et déformables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PointCast, un modèle du monde pour la manipulation robotique, est présente dans un article publie sur arXiv le 24 septembre 2026 (arXiv:2609.28393v1). Il represente une scene comme un nuage de points 3D sur l'objet manipule et sur l'effecteur du robot, sans maillage ni topologie fixe, chaque point gardant son identité le long de sa trajectoire. Le moteur est un transformeur de diffusion de 19,8 millions de paramètres qui debruite une courte fenêtre de positions futures, conditionnée par l'historique des points et le mouvement commande a l'effecteur. Une seule architecture et un seul entrainement couvrent quatre régimes, objets rigides, tissu, corde et meubles articules, chacun avec son point de contrôle propre. En simulation, compare a quatre références, il est meilleur sur trois régimes sur quatre; sur un jeu de téléopération réel, il obtient l'erreur la plus faible dans quatre catégories sur six et surpasse le modèle de référence du jeu de données dans les six. Couple a un controle predictif par modèle avec une seule évaluation réseau par fenêtre, il égale ou dépasse chaque référence sur quatre taches simulées totalisant 64 épisodes.

L'intérêt tient a l'unification: un réseau léger de moins de 20 millions de paramètres traite rigide, articule et déformable, trois familles d'objets habituellement gérées par des représentations distinctes, maillages, squelettes ou particules. Pour les équipes de R&D en manipulation, cela indique qu'un modèle du monde générique peut remplacer des pipelines spécialisés et alimenter un controle predictif en quasi temps réel avec une seule passe réseau par fenêtre de planification. Les performances supérieures aux références en simulation comme sur données réelles, ainsi qu'une généralisation zero-shot partielle vers le réel, vont dans le sens d'un rapprochement entre simulation et monde réel, écart qui demeure le principal obstacle des méthodes de manipulation apprises.

Le travail s'inscrit dans la lignée des modèles du monde appliques a la robotique, qui prédisent les conséquences d'une action avant exécution, ici via une représentation par points plutôt que par pixels ou maillage. Aucun acteur français ou européen n'est cite: il s'agit d'une contribution de recherche évaluée en simulation et sur un jeu de téléopération existant, sans déploiement industriel annonce. Le site du projet, pointcast-wm.github.io, met a disposition code et démonstrations pour une vérification indépendante des résultats.

À lire aussi

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés
1arXiv cs.RO 

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper
1 source
DiffDef : un modèle de diffusion pour générer des formes cibles multimodales de manipulation d'objets déformables
2arXiv cs.RO 

DiffDef : un modèle de diffusion pour générer des formes cibles multimodales de manipulation d'objets déformables

La manipulation d'objets déformables par asservissement de forme (shape servoing) fait l'objet d'un nouveau système, DiffDef, décrit dans un preprint arXiv (2506.18779, version 2 remplaçant une première soumission). Ce réseau de neurones fonde sur un modèle de diffusion apprend une distribution de formes cibles plausibles plutôt que de prédire une unique configuration déterministe, ce qui évite l'effet de moyennage des modes typique des prédicteurs classiques. La méthode a été évaluée en simulation puis sur deux plateformes robotiques physiques : le da Vinci Research Kit (dVRK), plateforme de recherche en chirurgie robotique, et un système bimanual base sur des bras KUKA. Les taches testées s'inspirent de scenarios de fabrication industrielle et d'applications chirurgicales. Un site dédié (sites.google.com/view/diffdef) accompagne la publication. La manipulation d'objets déformables (tissus, câbles, textiles, organes) reste l'un des problèmes les plus difficiles de la robotique, loin derrière la maturité atteinte sur les objets rigides. Les approches existantes d'asservissement de forme dépendent généralement de méthodes d'acquisition de la forme cible peu praticables en conditions réelles, ingénierie manuelle de connaissances métier ou démonstration physique par un opérateur, et supposent un objectif unique et déterministe. Or de nombreuses taches réelles admettent plusieurs formes cibles distinctes menant toutes a une réussite, un cas multimodal que les méthodes actuelles géraient mal. En montrant une amélioration mesurable des performances sur des plateformes chirurgicales et industrielles réelles, DiffDef fournit une preuve de concept que la modélisation probabiliste par diffusion peut combler cet écart, avec un intérêt direct pour les intégrateurs travaillant sur la chirurgie assistée par robot ou l'automatisation de taches textiles et de câblage en usine. Ce travail s'inscrit dans une ligne de recherche académique sur l'asservissement de forme, domaine ou la génération de formes cibles a longtemps repose sur l'ingénierie manuelle plutôt que sur l'apprentissage automatique. Le choix des plateformes de validation, le dVRK largement utilise dans la communauté de recherche en chirurgie robotique, et un bras bimanual KUKA, marque allemande courante en robotique industrielle et de recherche, situe DiffDef comme un travail de validation croisée entre milieu médical et manufacturier plutôt que comme un produit commercial. Il s'agit a ce stade d'un résultat de recherche publie en preprint, sans annonce de déploiement industriel ni de partenariat commercial associe ; la suite logique pour la communauté robotique consistera a vérifier si l'approche généralisé a d'autres classes d'objets déformables et si le code sera rendu public au-delà du site web dédié a la publication.

UELe systeme est valide sur une plateforme bimanuelle KUKA, entreprise allemande, ce qui interesse la communaute robotique industrielle europeenne sans deploiement ni partenariat commercial confirme.

RecherchePaper
1 source
DynaWM : un modèle du monde guidé par un VLA de base pour la manipulation d'objets en mouvement
3arXiv cs.RO 

DynaWM : un modèle du monde guidé par un VLA de base pour la manipulation d'objets en mouvement

DynaWM, un nouveau modèle du monde ("world foundation model") piloté par des architectures vision-langage-action (VLA), vient d'être présenté dans un preprint publié sur arXiv début juillet 2026. Le système cible un point faible connu des modèles VLA actuels : la manipulation d'objets en mouvement. Techniquement, DynaWM combine trois briques, un encodeur d'actions basé sur Mamba-3 qui traite les séquences d'actions produites par le modèle VLA de base, un encodeur visuel V-JEPA 2.1 qui exploite l'historique d'observations multi-vues, et un encodeur d'état proprioceptif du bras robotique, le tout conditionnant un transformeur à diffusion par flow-matching qui régénère des trajectoires d'action adaptées au mouvement de l'objet. Les auteurs ont aussi construit deux jeux de données : le benchmark DynaGrasp-32, qui couvre six catégories de tâches (variation de vitesse, de trajectoire, manipulation multi-objets), et DynaGrasp-1600, soit 32 scénarios, 1 600 démonstrations et environ 1,53 million d'images. Sur des checkpoints VLA finement réglés, DynaWM améliore les taux de réussite de 7,19 à 45,31 points de pourcentage selon le modèle de base (SmolVLA, X-VLA, Pi-0, Pi-0.5) ; sur des checkpoints seulement grossièrement réglés, les gains grimpent à 26 voire 44 points. L'enjeu dépasse la simple performance chiffrée : la plupart des modèles du monde existants sont fine-tunés directement dans l'architecture VLA, ce qui dégrade souvent les capacités du modèle pré-entraîné. En gardant le VLA de base intact et en ajoutant un module de guidage séparé, DynaWM évite ce compromis, un argument qui parle directement aux équipes de recherche en robotique confrontées à la fragilité des VLA lors du fine-tuning. Pour les intégrateurs, cela touche un cas d'usage concret : le tri ou la préhension d'objets sur convoyeur, en environnement non statique, un scénario encore largement absent des démonstrations spectaculaires de préhension immobile. Le travail s'inscrit dans la lignée des modèles VLA généralistes comme Pi-0, Pi-0.5, SmolVLA ou X-VLA, utilisés ici comme bases de comparaison, ainsi que des travaux sur les modèles du monde en robotique et sur l'encodeur visuel auto-supervisé V-JEPA de Meta. À ce stade, il s'agit d'un résultat de recherche académique évalué sur benchmark simulé et jeu de données maison, sans déploiement industriel annoncé ; la suite logique serait une validation sur bras robotiques réels et une comparaison avec d'autres approches de manipulation dynamique comme GR00T N2 ou Helix.

RechercheActu
1 source
SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables
4arXiv cs.RO 

SoftVTBench : un jeu de données et un benchmark visuo-tactiles pour la manipulation d'objets déformables

SoftVTBench, jeu de données visuo-tactile pour la manipulation d'objets déformables, a été publié le 20 août 2026 sur arXiv (2608.18701). Il réunit 4 000 démonstrations expertes sur plus de 50 objets, dont des objets déformables volumétriques et leurs jumeaux rigides visuellement identiques. À 20 Hz, chaque épisode synchronise RGB multi-vues, capteurs tactiles RGB, suivi de marqueurs sur les deux doigts du gripper, proprioception, instructions en langage naturel, actions de préhension, et des états de référence par éléments finis (FEM) réservés à l'évaluation. Le benchmark associé introduit le Deformation-aware Success Rate (DSR), qui ne valide un essai que si la tâche réussit sans dépasser une tolérance de déformation calibrée par objet. Sur Diffusion Policy, π0.5 et FastWAM, les 12 configurations testées comptent toutes des succès classiques qui violent en réalité cette tolérance, dans 0,7% à 24% des cas. Sous changement de distribution, les versions avec toucher font mieux en réussite (six comparaisons sur six) et en DSR (cinq sur six), un avantage plus incertain en distribution. Le message clé pour l'industrie: un taux de réussite binaire masque des comportements physiquement problématiques, glissement ou compression excessive, un enjeu direct pour les intégrateurs manipulant des produits fragiles (agroalimentaire, textile, emballage, médical). Plus notable, ajouter des capteurs tactiles n'améliore pas automatiquement la manipulation: le gain n'est net que sous changement de distribution, signe que la fusion visuo-tactile reste un problème d'ingénierie non résolu plutôt qu'un simple avantage matériel. Cela nuance le discours courant sur les architectures vision-langage-action, où le toucher est souvent présenté comme un bonus de robustesse automatique. L'absence de jeux de données associant observations exploitables par une politique et vérité terrain physique indépendante était jusque-là le principal obstacle à une évaluation fine de l'interaction, la plupart des benchmarks existants se limitant à un succès binaire de tâche. SoftVTBench se positionne comme ressource commune pour étudier non seulement si une politique réussit, mais comment elle interagit physiquement avec un objet mou et quand le toucher améliore réellement cette interaction. Il s'agit d'une publication de recherche, sans annonce de déploiement industriel ni partenariat constructeur, et sans acteur français ou européen identifié dans cette étude.

RecherchePaper
1 source