PointCast : un seul modèle du monde pour la manipulation d'objets rigides, articulés et déformables
PointCast, un modèle du monde pour la manipulation robotique, est présente dans un article publie sur arXiv le 24 septembre 2026 (arXiv:2609.28393v1). Il represente une scene comme un nuage de points 3D sur l'objet manipule et sur l'effecteur du robot, sans maillage ni topologie fixe, chaque point gardant son identité le long de sa trajectoire. Le moteur est un transformeur de diffusion de 19,8 millions de paramètres qui debruite une courte fenêtre de positions futures, conditionnée par l'historique des points et le mouvement commande a l'effecteur. Une seule architecture et un seul entrainement couvrent quatre régimes, objets rigides, tissu, corde et meubles articules, chacun avec son point de contrôle propre. En simulation, compare a quatre références, il est meilleur sur trois régimes sur quatre; sur un jeu de téléopération réel, il obtient l'erreur la plus faible dans quatre catégories sur six et surpasse le modèle de référence du jeu de données dans les six. Couple a un controle predictif par modèle avec une seule évaluation réseau par fenêtre, il égale ou dépasse chaque référence sur quatre taches simulées totalisant 64 épisodes.
L'intérêt tient a l'unification: un réseau léger de moins de 20 millions de paramètres traite rigide, articule et déformable, trois familles d'objets habituellement gérées par des représentations distinctes, maillages, squelettes ou particules. Pour les équipes de R&D en manipulation, cela indique qu'un modèle du monde générique peut remplacer des pipelines spécialisés et alimenter un controle predictif en quasi temps réel avec une seule passe réseau par fenêtre de planification. Les performances supérieures aux références en simulation comme sur données réelles, ainsi qu'une généralisation zero-shot partielle vers le réel, vont dans le sens d'un rapprochement entre simulation et monde réel, écart qui demeure le principal obstacle des méthodes de manipulation apprises.
Le travail s'inscrit dans la lignée des modèles du monde appliques a la robotique, qui prédisent les conséquences d'une action avant exécution, ici via une représentation par points plutôt que par pixels ou maillage. Aucun acteur français ou européen n'est cite: il s'agit d'une contribution de recherche évaluée en simulation et sur un jeu de téléopération existant, sans déploiement industriel annonce. Le site du projet, pointcast-wm.github.io, met a disposition code et démonstrations pour une vérification indépendante des résultats.
Dans nos dossiers




