Aller au contenu principal
GOAG : un planificateur de préhension génératif et agnostique à l'objet pour la manipulation robotique dextérique
FR/EU ecosystemearXiv cs.RO 

GOAG : un planificateur de préhension génératif et agnostique à l'objet pour la manipulation robotique dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CEA-List, laboratoire public français rattache au CEA Tech, publie sur arXiv (2608.19759) GOAG, un planificateur génératif de prises pour mains robotiques multi-doigts, conçu pour se généraliser a de nouveaux objets sans données d'entrainement spécifiques. Le modèle apprend uniquement la distribution des points de contact propres a une pince donnée, en exploitant le fait que pince et objet partagent la même géométrie de surface au point de contact; les caractéristiques de l'objet ne sont intégrées qu'au moment de l'inférence. Teste sur le protocole standard MultiDex, en simulation et en conditions réelles avec plusieurs pinces issues de la littérature, GOAG atteint un taux de réussite moyen de 86,93%, un niveau comparable aux meilleures méthodes entraînées spécifiquement sur ce jeu de données, avec une génération de prises nettement plus rapide. Code source et vidéos de démonstration sont publies sur cea-list.github.io/goagweb.

Cette approche cible directement le principal frein a l'industrialisation de la manipulation dexterale: la plupart des planificateurs appris échouent des qu'ils rencontrent un objet absent de leur jeu d'entrainement, imposant un cycle de collecte de données couteux a chaque nouvelle référence. En découplant l'apprentissage du gripper de celui des objets, GOAG promet aux intégrateurs logistiques et industriels une adaptation plus rapide a de nouveaux produits, sans ré-entrainement systématique. Les chiffres avances, 86,93% de réussite et une vitesse de génération supérieure, restent toutefois ceux d'un benchmark académique contrôle et d'un preprint non encore évalué par les pairs: la généralisation a des objets totalement inédits en environnement de production reste a démontrer a plus grande échelle.

Ce travail s'inscrit dans la recherche en planification de prise par apprentissage profond, un domaine largement domine par des méthodes entraînées objet par objet, des pinces parallèles simples aux mains anthropomorphes a haut nombre de degrés de liberté. En choisissant de généraliser via la géométrie du gripper plutôt que via des jeux de données d'objets toujours plus vastes, CEA-List se positionne sur un axe distinct de celui des groupes misant sur des modèles vision-langage-action entraines a grande échelle. Aucun pilote industriel ni calendrier de transfert technologique n'est annonce dans l'article; la suite logique consiste a valider l'approche sur un plus large éventail de pinces dexterales et d'objets non vus, avec une intégration possible dans des plateformes robotiques existantes.

Impact France/UE

CEA-List, laboratoire public francais rattache au CEA Tech, publie une methode de planification de prise robotique dexterale dont le code ouvert pourrait interesser les integrateurs industriels europeens en logistique et manufacturing.

À lire aussi

Compréhension vidéo découplée centrée sur les objets pour la génération de commandes de manipulation robotique
1arXiv cs.RO 

Compréhension vidéo découplée centrée sur les objets pour la génération de commandes de manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.16470) un framework de compréhension vidéo orienté objets, conçu pour traduire automatiquement des démonstrations gestuelles en commandes exécutables par un bras robotique, sans passer par une syntaxe de programmation classique. La méthode combine des modules TSM (Temporal Shift Module) pour la classification spatio-temporelle d'actions avec un algorithme original de sélection d'objets qui identifie, dans chaque séquence, les objets fonctionnellement pertinents via trois critères : classification de rôle par trajectoire, détection de flou, et minimisation de chevauchements. Les objets retenus sont ensuite analysés par des VLMs (Vision-Language Models) pour la reconnaissance de catégorie et la généralisation zero-shot. Évalué sur une version modifiée du benchmark Something-Something V2, le système atteint 86,79 % de précision en classification d'actions, un score BLEU-4 de 0,337 sur des objets connus et 0,261 sur des objets inédits, soit des gains respectifs de +80,2 % et +143,9 % face au meilleur baseline spécialisé. Sur METEOR et CIDEr, les gains montent à +157,9 % et +171,7 % pour les objets inconnus. Ce résultat est notable pour deux raisons distinctes. D'abord, la généralisation sur des objets non vus durant l'entraînement, qui est précisément le point de rupture habituel des systèmes task-specific : un robot industriel déployé dans un environnement variable ne peut pas être ré-entraîné pour chaque référence produit. Ensuite, l'architecture modulaire découplée (reconnaissance d'action d'un côté, identification d'objet de l'autre) facilite la maintenance et le débogage en production, à l'inverse des architectures bout-en-bout opaques. Sur le papier, ce type de système pourrait réduire la dépendance à la téléopération manuelle pour constituer des datasets de manipulation, un coût majeur pour les déploiements à grande échelle. Il s'agit ici d'un preprint académique, pas d'un produit validé en environnement réel : les métriques sont mesurées sur un benchmark vidéo, pas sur un robot physique, ce qui laisse entier le sim-to-real gap. Le benchmark Something-Something V2 reste un cadre contrôlé, éloigné du désordre d'un atelier de production. Ce travail s'inscrit dans un mouvement plus large de recherche sur les VLA (Vision-Language-Action models), où des acteurs comme Physical Intelligence (pi), Google DeepMind ou le MIT tentent de résoudre exactement ce problème : faire apprendre un robot par observation vidéo plutôt que par démonstration manuelle coûteuse. La prochaine étape naturelle serait une validation sur hardware réel avec un bras collaboratif standard (UR, Franka), ce que le papier ne documente pas encore.

RechercheOpinion
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
2arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
Gondola : planification vision-langage ancrée pour la manipulation robotique
3arXiv cs.RO 

Gondola : planification vision-langage ancrée pour la manipulation robotique

Gondola, un modèle de planification vision-langage « ancré », est présenté dans une nouvelle version (v2) d'un article arXiv. Il vise à séparer la planification de haut niveau du contrôle bas niveau en manipulation robotique. À partir d'observations multi-vues et de l'historique de planification, Gondola prédit l'étape suivante sous forme d'instructions textuelles entrelacées avec des masques de segmentation multi-vues. Ces masques désignent au niveau du pixel les objets cibles et les emplacements d'arrivée. Ce plan est ensuite exécuté par une politique de contrôle fondée sur la 3D. Pour l'entraîner, les auteurs ont construit des jeux de données synthétiques qui supervisent trois compétences : la planification ancrée à court horizon, les expressions référentielles multi-vues et le raisonnement compositionnel à long horizon. Le système affirme atteindre l'état de l'art sur le benchmark GemBench et montre un transfert « prometteur » vers des robots réels. Le résumé ne donne ni score chiffré, ni description du matériel, ni nombre de tâches réelles testées. L'approche répond à une faiblesse connue des modèles vision-langage-action (VLA). Lorsqu'ils associent directement pixels et instructions à des actions bas niveau, ils restent difficiles à interpréter et perdent en robustesse sur les tâches longues et complexes. Ici, le plan intermédiaire est lisible, et l'on peut voir quel objet le robot a ciblé avant qu'il n'agisse. Pour un intégrateur, cela facilite le diagnostic des échecs, car on distingue une erreur de raisonnement d'une erreur d'exécution. Les ablations indiquent que l'ancrage au pixel près et la supervision orientée planification pèsent réellement dans les performances. Cela plaide pour des architectures modulaires face aux VLA de bout en bout. Deux réserves s'imposent. GemBench est un benchmark en simulation, et une démonstration robotique réelle décrite comme « prometteuse » ne prouve pas une fiabilité industrielle. L'entraînement sur données synthétiques laisse aussi ouverte la question de l'écart simulation-réalité. Le travail s'inscrit dans un mouvement plus large de découplage entre un « cerveau » de haut niveau et un contrôleur d'exécution. Les architectures à deux systèmes de type Helix en sont un exemple, et les VLA généralistes comme Pi-0 misent au contraire sur le bout en bout. La page du projet est hébergée sur cshizhe.github.io, ce qui suggère un cadre académique, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement. L'article étant une révision (v2), l'évaluation a pu évoluer depuis la première version. La suite dépendra de la publication du code et des modèles, de résultats chiffrés sur des robots physiques et de comparaisons directes avec les VLA de bout en bout sur des tâches longues.

RecherchePaper
1 source
GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés
4arXiv cs.RO 

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper
1 source