Aller au contenu principal
RecherchearXiv cs.RO 

KeyGen : représentations centrées sur l'objet à points clés non supervisés pour généraliser des politiques par catégorie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire à l'origine de KeyGen a publié fin septembre 2026 sur arXiv (référence 2609.28818) un framework d'apprentissage de représentations 3D pour la manipulation robotique. La méthode apprend, sans supervision, des points-clés sémantiques 3D canonicalisés à partir de nuages de points, qui servent de représentation structurée et centrée sur l'objet. Une politique visuomotrice par diffusion se conditionne sur ces points-clés et sur la géométrie de l'objet pour prédire des trajectoires de manipulation complètes, en maintenant une correspondance géométrique cohérente entre différentes instances d'un même type d'objet. Pour évaluer la généralisation au niveau catégorie, les auteurs ont construit un banc d'essai de simulation photoréaliste couvrant trois tâches de manipulation, associé à un pipeline de génération de données piloté par planification capable de produire des trajectoires expertes sur des objets aux formes, tailles et poses variées. Les résultats rapportés montrent que KeyGen surpasse nettement les méthodes antérieures, sur des objets déjà vus comme inédits, sous variation de pose, qu'il continue de progresser avec davantage de démonstrations par objet, qu'il reste robuste face aux changements d'échelle, et qu'il obtient de bonnes performances aussi bien en simulation qu'en manipulation réelle.

L'enjeu visé est un défaut connu du clonage comportemental classique: les politiques apprises surajustent souvent la géométrie et l'apparence propres à chaque instance d'objet, ce qui limite fortement le transfert vers des objets jamais vus. En imposant une correspondance géométrique explicite via des points-clés canonicalisés, KeyGen s'attaque directement à l'écart entre démonstrations en laboratoire et généralisation réelle sur des familles d'objets hétérogènes, un problème central pour tout intégrateur cherchant à déployer une politique unique sur toute une catégorie de produits plutôt que sur des références individuelles. Si les résultats se confirment à plus grande échelle, l'approche pourrait réduire le volume de démonstrations nécessaire par objet, un critère économique clé pour l'industrialisation de la manipulation robotique.

Le travail s'inscrit dans la lignée des représentations centrées-objet, une alternative aux politiques bout-en-bout conditionnées uniquement sur des pixels ou des nuages de points bruts, à distinguer des approches vision-langage-action (VLA) qui misent surtout sur le volume de données pour généraliser. KeyGen reste à ce stade une contribution de recherche évaluée sur un banc d'essai simulé propriétaire et des tests réels limités à trois tâches, sans déploiement industriel ni partenariat annoncés. Les suites logiques évoquées par les auteurs concernent l'extension à davantage de catégories d'objets et de tâches plus complexes, ainsi qu'une comparaison directe avec des politiques VLA génériques entraînées à grande échelle.

À lire aussi

Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable
1arXiv cs.RO 

Au-delà de la sémantique liée aux points : champs sémantiques centrés sur l'objet pour une manipulation généralisable

Un nouvel article publié sur arXiv (référence 2607.03163v1) propose une méthode pour améliorer la manipulation robotique generalisable en dotant les nuages de points 3D d'une compréhension sémantique stable des parties fonctionnelles d'un objet, poignées, têtes d'outils, ouvertures, zones de préhension. Les nuages de points bruts capturent la géométrie mais pas la sémantique, et l'échantillonnage varie selon le point de vue, le capteur ou l'instance d'objet observée. Les auteurs introduisent un champ sémantique continu et centré sur l'objet, entraîné à partir de modèles d'objets annotés par parties, qui associe à toute position 3D interrogée un embedding sémantique conscient de la fonction de la partie concernée. Une fois entraîné, ce champ est figé et sert à générer des nuages de points sémantiques utilisés comme conditionnement au niveau de l'objet pour des politiques de manipulation. Les tests, menés sur les tâches de simulation RoboTwin ainsi que sur de la manipulation bimanuelle réelle, montrent une amélioration des performances par rapport aux approches de référence: nuage de points brut, lifting de features 2D vers la 3D, et features ponctuelles 3D discrètes. L'enjeu dépasse le simple gain de précision. Pour l'industrie de la manipulation robotique et les concepteurs de politiques de type VLA (vision-language-action), le vrai problème n'est pas de reconnaître un objet mais de savoir où et comment le saisir de façon fiable, quel que soit l'angle de vue ou l'exemplaire précis rencontré. En rendant la sémantique indépendante de l'échantillonnage observé, cette approche s'attaque directement à un point faible connu des pipelines actuels: la fragilité des indices sémantiques ponctuels quand la scène ou le capteur changent. C'est un argument de plus dans le débat sur la généralisation réelle des politiques de manipulation, un enjeu central alors que le secteur cherche à dépasser les démonstrations en environnement contrôlé. Ce travail s'inscrit dans la lignée des efforts pour enrichir la perception 3D en robotique, après les méthodes de projection de features 2D issues de modèles de vision-langage et les représentations ponctuelles 3D discrètes, deux approches dont l'article démontre les limites en comparaison directe. RoboTwin, la plateforme de simulation utilisée, sert de banc d'essai standard pour ce type d'évaluation comparative dans la communauté. Les auteurs mettent à disposition une page projet dédiée, laissant présager la publication du code et des modèles pour permettre une réplication et une adoption plus large par la communauté de recherche en manipulation robotique.

RecherchePaper
1 source
SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action
2arXiv cs.RO 

SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action

Cette recherche présente un cadre d'alignement de représentations 3D centré sur l'objet, appliqué au modèle vision-langage-action (VLA) $\pi0$. Les auteurs utilisent SAM3D, un modèle 3D figé servant de "professeur", pour injecter des connaissances géométriques sur les objets cibles pendant l'entraînement : les objets pertinents pour la tâche sont localisés via des modèles de reconnaissance, des masques sont générés, puis SAM3D en extrait des représentations 3D denses alignées avec les caractéristiques visuelles intermédiaires de $\pi0$. Fait notable, ce module 3D n'intervient qu'à l'entraînement : au moment de l'inférence, le pipeline reste purement RGB-langage-vers-action, sans besoin de profondeur, nuage de points, masques ou calculs SAM3D supplémentaires. Les résultats en simulation atteignent 99,1% de réussite sur le benchmark LIBERO et une longueur moyenne de tâches de 4,11 sur CALVIN, avec des gains confirmés en conditions réelles, notamment sur des scénarios de manipulation longue durée impliquant plusieurs sous-tâches et objets cibles différents. L'enjeu pour l'industrie robotique est la résolution d'un point faible connu des modèles VLA actuels : leur dépendance à des backbones vision-langage 2D qui peinent face à l'occlusion, aux variations de pose ou d'échelle, et aux interactions spatiales précises. En démontrant qu'on peut internaliser une compréhension 3D fine sans alourdir le pipeline de déploiement, ce travail répond à une critique récurrente du secteur : les architectures VLA génériques marchent bien en démo contrôlée mais échouent sur des tâches de manipulation fine en conditions réelles. Pour les intégrateurs et décideurs B2B, cela suggère une voie pour améliorer la robustesse des politiques de manipulation sans complexifier ni ralentir le matériel embarqué, un compromis critique pour le déploiement industriel à grande échelle de bras robotiques et de robots humanoïdes. Ce travail s'inscrit dans la lignée des modèles VLA construits sur $\pi_0$ (Physical Intelligence), déjà positionné comme concurrent direct des approches comme GR00T N2 de NVIDIA ou Helix de Figure AI dans la course à des politiques de manipulation généralistes. L'apport spécifique ici est méthodologique plutôt qu'un nouveau produit ou déploiement terrain : il s'agit d'une technique d'entraînement, testée pour l'instant en simulation (LIBERO, CALVIN) et en expérimentations réelles limitées, sans annonce de déploiement commercial ni de partenariat industriel. Les prochaines étapes attendues porteraient sur l'extension à d'autres backbones VLA et sur la validation à plus grande échelle en environnement réel, au-delà des bancs d'essai académiques actuels.

RecherchePaper
1 source
3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets
3arXiv cs.RO 

3D-DLP : apprentissage auto-supervisé de représentations de scènes 3D centrées sur les objets

Une équipe de chercheurs publie 3D-DLP (3D Deep Latent Particles), un modèle d'apprentissage auto-supervisé de représentations de scène centré sur les objets. À partir d'entrées RGB-D (couleur et profondeur combinées) ou volumétriques en voxels, le modèle décompose une scène en un ensemble de particules latentes 3D, chacune encodant trois attributs distincts : la position 3D du keypoint, les dimensions de la bounding box et des descripteurs d'apparence visuelle. L'entraînement repose sur un objectif de reconstruction end-to-end sans annotations manuelles, en étendant le cadre Deep Latent Particles (DLP) au domaine 3D. Le modèle génère également des cartes de segmentation par particule, lisibles directement. Des expériences sur données simulées et réelles sont présentées dans le preprint arXiv 2606.19451, avec le code open source disponible à l'adresse eubooks3003.github.io/3d-dlp. Pour la manipulation robotique, l'apport principal est une représentation de scène à la fois structurée et compacte. Les benchmarks internes montrent une amélioration par rapport à deux types de baselines : celles qui manquent d'information 3D explicite, et celles qui utilisent des représentations 3D denses (nuages de points complets, volumes de voxels) sans structure centrée sur les objets. Cette dernière catégorie est coûteuse en mémoire à l'échelle, ce que 3D-DLP contourne via sa paramétrisation par particules. L'espace latent est également manipulable : modifier les positions des particules avant décodage permet de synthétiser de nouvelles configurations de scène, une propriété utile pour la planification ou la simulation contrefactuelle en robotique. Le modèle s'inscrit dans le courant de l'apprentissage centré sur les objets, en alternative aux approches monolithiques comme les NeRF ou les Gaussian Splatting pour la représentation 3D de scènes. Il entre aussi en dialogue avec les architectures VLA (Vision-Language-Action), qui peinent encore à intégrer une géométrie 3D explicite et structurée. À ce stade, 3D-DLP reste un preprint académique sans validation industrielle ni intégration dans un pipeline robotique commercial, et les métriques de performance ne sont pas quantifiées précisément au-delà d'une comparaison qualitative aux baselines.

RechercheActu
1 source
ObstaDiff : apprentissage généralisable de politiques de diffusion via des représentations conscientes des obstacles
4arXiv cs.RO 

ObstaDiff : apprentissage généralisable de politiques de diffusion via des représentations conscientes des obstacles

ObstaDiff est une politique de diffusion pour la manipulation robotique conçue pour les scènes encombrées d'obstacles non structurés, point faible connu des approches d'imitation learning classiques, qui supposent généralement des arrière-plans dégagés. Le système s'appuie sur un encodeur visuel léger, dit obstacle-aware, qui décompose la scène en trois éléments, la cible, les obstacles et l'arrière-plan, avant de transmettre cette représentation structurée à une politique d'alignement générant la trajectoire de l'effecteur terminal jusqu'à une pose intermédiaire centrée sur la cible, en évitant les obstacles environnants. Testé sur robot réel en serre agricole, à raison de 61 essais par méthode comparée, soit 366 exécutions au total, ObstaDiff atteint un taux de réussite moyen de 75,41% et un taux de collision de 8,20%, des résultats supérieurs aux politiques d'imitation learning de référence évaluées dans les mêmes conditions. Le travail est publié en prépublication sur arXiv sous la référence 2609.10918v1. Ce résultat s'attaque à l'un des écarts les plus documentés du secteur, celui qui sépare les démonstrations en laboratoire sur fond neutre du déploiement réel où les obstacles imprévisibles sont la norme. Pour les intégrateurs visant l'automatisation de tâches de manipulation en agriculture, en entrepôt ou en industrie légère, la capacité d'une politique à raisonner explicitement sur les obstacles, plutôt qu'à les ignorer, conditionne directement la fiabilité et la viabilité économique d'un déploiement. Un taux de collision de 8,20% reste loin de zéro et ne prouve pas une robustesse totale, mais la comparaison favorable aux baselines suggère qu'une représentation structurée cible-obstacle-arrière-plan est une piste concrète pour réduire l'écart entre démonstration et réalité, plutôt qu'une simple optimisation marginale des politiques de diffusion existantes. ObstaDiff s'inscrit dans la lignée des politiques de diffusion appliquées à la manipulation robotique, une famille de méthodes étudiée pour générer des trajectoires continues à partir de démonstrations mais qui bute généralement sur la généralisation à des scènes visuellement différentes de l'entraînement. Il s'agit ici d'un travail de recherche en prépublication, non d'une annonce produit ni d'un déploiement commercial, évalué sur un nombre d'essais réels modeste mais transparent, sans partenaire industriel ni calendrier de commercialisation mentionné. Le choix d'une serre agricole comme terrain d'essai, où cultures et structures encombrent en permanence l'espace de travail, illustre un cas d'obstruction difficile à simuler ; la suite logique passe par l'extension à d'autres tâches et environnements, ainsi qu'une comparaison plus large face aux politiques vision-langage-action qui dominent aujourd'hui les débats sur la généralisation en robotique.

RecherchePaper
1 source