GraspTwin : optimisation de préhension orientée tâche en zéro apprentissage via un jumeau numérique
Le laboratoire VT-Collab, rattaché à Virginia Tech, publie sur arXiv un système nommé GraspTwin, qui calcule des prises robotiques adaptées à une tâche à partir d'une seule image RGB-D. Le système reconstruit un jumeau numérique de la scène observée, interroge un grand modèle de fondation pour proposer des points de prise cohérents avec l'objet et la tâche visée (par exemple saisir une tasse par son anse, et non par le bord, pour pouvoir ensuite verser du café), puis affine ces propositions par optimisation bayésienne à échantillonnage de Thompson, testée en parallèle sur des simulations physiques à randomisation de domaine. Le transfert complet vers le robot réel, en zero-shot, prend quelques minutes et améliore jusqu'à 33% le taux de réussite des prises orientées tâche face aux pipelines existants. Le code est disponible sur GitHub, sous VT-Collab/GraspTwin.
L'intérêt de GraspTwin est de combler un fossé connu du secteur : les pipelines de grasping par apprentissage produisent des prises robustes et sans collision mais indifférentes à la tâche visée, tandis que les approches fondées sur des modèles de fondation proposent des zones sémantiquement pertinentes mais mal ancrées physiquement, avec un risque de manquer la cible. En traitant les suggestions du modèle de fondation comme de simples a priori servant d'amorce à une optimisation locale, l'approche illustre une limite désormais reconnue des VLA et modèles de fondation employés seuls : ils ne suffisent pas à garantir une exécution fiable sans une couche d'optimisation physique explicite en aval. Pour les intégrateurs visant des robots de service ou domestiques confrontés à des objets non standardisés, cette architecture hybride offre une piste concrète pour réduire l'écart entre démonstration et fiabilité réelle.
Ce travail s'inscrit dans les recherches visant à faire sortir la manipulation robotique des usines pour l'amener dans des environnements domestiques, où la variété des objets rend les stratégies de prise génériques insuffisantes. Il se positionne explicitement contre deux familles de méthodes concurrentes : les pipelines de grasping géométriques agnostiques à la tâche, et les approches récentes appuyées sur de grands modèles de fondation qui proposent des prises sémantiques sans validation physique fine. Publié comme prépublication arXiv, non encore relue par les pairs, GraspTwin reste à ce stade un résultat de recherche accompagné de code source ouvert, sans calendrier de portage commercial annoncé.
Dans nos dossiers




