Aller au contenu principal
RecherchearXiv cs.RO 

Apprendre à explorer la cinématique cachée pour manipuler des objets articulés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (v1, septembre 2026) une méthode pour manipuler des objets articulés, comme des portes et des tiroirs, dont la cinématique réelle ne se devine pas à la seule vue. Le système maintient une distribution de croyance sur le type d'articulation (rotoïde, prismatique) et sur ses paramètres. Cette croyance est initialisée par un prior génératif, puis mise à jour par filtrage bayésien à partir du mouvement observé de la pièce. Pour la fournir à la politique, les auteurs la convertissent en champ de flux d'articulation par point : le mouvement que le postérieur actuel prédit pour chaque point de l'objet. La politique est entraînée par apprentissage par renforcement, avec pour récompense l'entropie retirée du postérieur par chaque interaction. Sur le benchmark PartManip, la méthode dépasse les approches précédentes en manipulation de portes et de tiroirs. Elle atteint 61,7 % de succès sur ArticuRiddle, un nouveau jeu de données d'objets dont l'apparence suggère une mauvaise articulation, contre 44,4 % pour la meilleure méthode antérieure. Les résultats proviennent de simulation, et le résumé ne mentionne aucun test sur robot physique.

L'enjeu dépasse la performance brute. Les méthodes de perception active existantes cherchent, à chaque pas, l'action unique qui réduit le plus l'incertitude. Cette recherche gloutonne ne s'étend pas sur un horizon long, faute de modèles directs de la dynamique de contact et d'inertie, eux-mêmes inconnus. Déplacer ce coût vers l'entraînement, pour que l'exploration informative devienne un comportement appris, évite un calcul d'inférence à chaque pas. Le choix de la représentation compte aussi : selon les auteurs, le flux d'articulation généralise mieux qu'un encodage latent de la croyance ou qu'un flux suivi sur l'observation, car il porte le biais inductif du mouvement articulé. Pour un intégrateur, la portée est concrète. Les robots de service, de logistique ou de cuisine rencontrent des portes, tiroirs et armoires dont l'apparence trompe. Cela dit, un gain de 17 points reste un score de 61,7 %, loin d'une fiabilité de déploiement. La différence avec ce que les grands modèles VLA font aujourd'hui reste nette : ils imitent des démonstrations plutôt que de lever activement une ambiguïté.

Ce travail s'inscrit dans la lignée de la perception interactive et de l'estimation de modèles articulés, où PartManip a servi de référence pour la manipulation de parties d'objets. ArticuRiddle cible un point faible connu : les priors visuels appris qui échouent quand la forme trompe. Les auteurs ne citent pas de partenaire industriel, ni de calendrier de transfert. Les suites logiques sont une validation sur bras réels, où le bruit tactile et le frottement compliquent le filtrage bayésien, puis l'intégration dans des politiques généralistes. Le projet est documenté sur hiddenkinematics.github.io.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés
1arXiv cs.RO 

Interface KAI : une approche tenant compte de la cinématique pour la manipulation efficace d'objets articulés

Des chercheurs présentent KAI (Kinematic-Aware Articulation Interface), une nouvelle représentation intermédiaire structurée conçue pour l'apprentissage de politiques de manipulation d'objets articulés par des robots, comme des tiroirs, des portes ou des charnières. Contrairement aux approches qui tentent d'apprendre la structure cinématique uniquement à partir de démonstrations robotiques, KAI intègre directement des a priori géométriques et cinématiques interprétables dans le processus d'apprentissage. Testée sur six tâches de simulation, la méthode atteint un taux de réussite moyen de 82,9%, égalant voire dépassant les performances des méthodes de référence tout en n'utilisant que la moitié des données de démonstration nécessaires. Le système, entraîné dans un environnement unique et non encombré, démontre également une capacité de généralisation vers des arrière-plans inédits et des scènes réelles encombrées de distracteurs visuels. En combinant l'entraînement avec des vidéos d'interactions humaines, grâce à sa conception indépendante de l'action ("action-agnostic"), le taux de réussite moyen dépasse 70% même face à des perturbations visuelles diverses. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement bien identifié: l'apprentissage par démonstration coûte cher en temps d'annotation et de téléopération, en particulier pour les objets articulés dont la cinématique varie fortement d'un instance à l'autre. Diviser par deux le volume de démonstrations nécessaires, si le résultat se confirme au-delà de la simulation, représenterait un gain d'efficacité concret pour les intégrateurs travaillant sur la manipulation domestique ou industrielle (portes d'armoires, électroménager, machines-outils). La possibilité de co-entraîner avec des vidéos humaines, sans capture de données robotiques dédiées, ouvre aussi une piste pour réduire davantage le coût de collecte, un enjeu central alors que les approches VLA (vision-language-action) peinent encore à passer l'échelle sans volumes massifs de données. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans nom d'institution ni de laboratoire précisé dans le résumé, et les résultats restent principalement validés en simulation, avec un transfert vers le réel limité à des scènes encombrées plutôt qu'à un déploiement en conditions industrielles. Le travail s'inscrit dans un courant de recherche plus large visant à injecter des priors structurels explicites dans les politiques d'apprentissage, en contraste avec les approches purement end-to-end de type GR00T N2 ou Pi-0, et pourrait alimenter les futures générations de modèles de manipulation généralistes si sa robustesse se confirme sur du matériel physique.

RecherchePaper
1 source
GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés
2arXiv cs.RO 

GSAM : un cadre robotique sûr et généralisable pour la manipulation d'objets articulés

Des chercheurs ont publié sur arXiv (référence 2605.30740) GSAM, un framework conçu pour la manipulation d'objets articulés (tiroirs, portes, robinets) par des robots de service. Le système combine quatre modules : un percepteur visuel qui extrait les paramètres cinématiques (axe de rotation, amplitude de mouvement), un raffineur basé sur un VLM fine-tuné utilisant le raisonnement par chaîne-de-pensée (CoT) pour corriger les estimations brutes, un générateur de contraintes d'interaction qui encode la géométrie de l'objet et l'évitement d'obstacles, et un planificateur cinématique qui vérifie l'atteignabilité avant exécution. Sur 50 tâches de type charnière réparties en 5 catégories d'objets et 50 configurations initiales aléatoires de l'effecteur, GSAM améliore le taux de succès de 36,0 % par rapport à la meilleure baseline existante, avec une réduction de l'écart-type de 3,1 % indiquant une meilleure consistance comportementale. Ce résultat s'attaque directement au fossé démo-réalité sur une sous-tâche souvent ignorée : les interactions avec des objets mécaniquement contraints impliquent des trajectoires curvilignes et une compréhension de la géométrie interne que ni les politiques end-to-end entraînées en simulation ni les planificateurs purement visuels ne gèrent correctement. L'usage du raisonnement CoT pour corriger des estimations cinématiques erronées plutôt que pour générer un plan de haut niveau constitue un usage pragmatique et inhabituel des VLM en robotique. Pour les intégrateurs sur des robots de service industriels ou hospitaliers, la réduction des collisions destructrices a une valeur opérationnelle directe : forcer mécaniquement un joint en production est un incident matériel, pas une métrique abstraite. Le problème de manipulation articulée est étudié depuis plusieurs années dans des équipes comme Stanford (projet Where2Act, 2021), ETH Zurich et CMU. Les approches concurrentes comprennent les frameworks VLA tels que pi0 (Physical Intelligence) ou OpenVLA, ainsi que les méthodes de perception articulée comme PARIS ou CatGrasp. GSAM se distingue en combinant explicitement un LLM pour la génération de contraintes et un VLM pour la perception raffinée, plutôt qu'une politique implicite entraînée bout-en-bout. Le travail reste un preprint arXiv non soumis à une conférence majeure (ICRA, IROS, CoRL) : les gains annoncés sont encourageants mais nécessitent une validation sur robot physique en conditions non contrôlées.

RecherchePaper
1 source
PokeNet : apprentissage de modèles cinématiques d'objets articulés à partir d'observations humaines
3arXiv cs.RO 

PokeNet : apprentissage de modèles cinématiques d'objets articulés à partir d'observations humaines

PokeNet, un nouveau framework de recherche présenté dans un article arXiv (2602.02741v2, version révisée), apprend le modèle cinématique complet d'un objet articulé à partir d'une seule démonstration humaine, sans connaissance préalable du nombre ou du type d'articulations. Le système reçoit une séquence d'observations en nuages de points capturant une personne en train de manipuler un objet inconnu (porte, tiroir, appareil à plusieurs axes), et en déduit trois choses simultanément : les paramètres des articulations (position et orientation des axes), l'ordre dans lequel les liaisons doivent être actionnées, et l'évolution de l'état de chaque articulation au fil du temps. Sur un ensemble d'objets variés, y compris des catégories jamais vues à l'entraînement, PokeNet améliore la précision d'estimation des axes et des états articulaires de plus de 27% en moyenne par rapport aux meilleures méthodes existantes, avec des résultats validés à la fois en simulation et en conditions réelles. L'enjeu dépasse la simple prouesse technique : la modélisation d'articulations est une brique de base pour toute manipulation robotique d'objets du quotidien, en amont de l'apprentissage de compétences ou de la planification de mouvements. Les approches précédentes butaient sur plusieurs limites pratiques, à commencer par la dépendance à des priors sur l'objet, l'incapacité à récupérer des articulations occultées qui ne se révèlent que pendant l'interaction, ou le besoin de dizaines d'images multi-vues par objet, difficilement compatible avec un déploiement réel. PokeNet s'attaque aussi à un point souvent négligé : l'ordre des manipulations, crucial pour des objets à plusieurs degrés de liberté comme un lave-vaisselle, où il faut ouvrir la porte avant de pouvoir sortir le panier. Un robot capable d'apprendre ce modèle à partir d'une simple démonstration humaine, sans instrumentation lourde, se rapproche d'un déploiement générique en environnement domestique ou industriel non structuré. Le travail s'inscrit dans la lignée des méthodes de "articulation modeling" qui cherchent à généraliser au-delà des catégories d'objets prédéfinies, un axe de recherche actif en robotique de manipulation ces dernières années. En s'appuyant uniquement sur une observation humaine plutôt que sur une exploration robotique coûteuse en essais, PokeNet ouvre la voie à des pipelines où un robot apprend par observation avant d'agir. Les auteurs ne précisent pas de calendrier d'intégration dans un système robotique complet, mais les résultats en environnement réel suggèrent une maturité suffisante pour des tests d'intégration à court terme sur des plateformes de manipulation existantes.

RecherchePaper
1 source
Imagine2Act : exploiter la cohérence objet-action à partir de buts imaginés pour la manipulation robotique
4arXiv cs.RO 

Imagine2Act : exploiter la cohérence objet-action à partir de buts imaginés pour la manipulation robotique

Une équipe de recherche présente Imagine2Act, un framework d'apprentissage par imitation en 3D conçu pour les tâches de réarrangement relationnel d'objets, comme insérer une fleur dans un vase, où la précision sémantique et géométrique est critique. Publié sur arXiv sous la référence 2509.17125 (version mise à jour), le système génère d'abord des images de but imaginées à partir d'instructions en langage naturel, puis reconstruit les nuages de points 3D correspondants pour fournir des a priori sémantiques et géométriques robustes. Ces nuages de points imaginés sont injectés comme entrées supplémentaires dans le modèle de politique, tandis qu'une stratégie de cohérence objet-action, avec une supervision de pose souple, aligne explicitement le mouvement prédit de l'effecteur terminal avec la transformation d'objet générée. Les auteurs rapportent des expériences menées à la fois en simulation et sur robot réel montrant que Imagine2Act surpasse les politiques de référence précédentes considérées comme état de l'art. L'intérêt de cette approche tient à la faiblesse qu'elle cible directement : les méthodes existantes s'appuient soit sur des démonstrations pré-collectées, qui peinent à capturer des contraintes géométriques complexes, soit sur la génération d'images d'état-but, qui capture bien la sémantique et la géométrie mais ne relie pas explicitement la transformation d'objet à la prédiction d'action, ce qui introduit des erreurs liées au bruit génératif. En couplant explicitement ces deux étapes via la cohérence objet-action, Imagine2Act tente de refermer l'écart entre génération de but visuel et exécution motrice précise, un problème central pour les intégrateurs qui cherchent des politiques de manipulation fiables sur des tâches fines (insertion, assemblage, positionnement relatif) plutôt que du simple pick-and-place. Ce travail s'inscrit dans la tendance des modèles vision-langage-action, où la promesse dépasse souvent la robustesse démontrée hors laboratoire ; les auteurs limitent ici l'écart démo/réalité en testant à la fois en simulation et sur robot physique, même si les résultats avancés restent ceux d'une publication académique et non d'un déploiement industriel. Imagine2Act se positionne face à deux familles de méthodes concurrentes dans la recherche en manipulation robotique : l'imitation pure à partir de démonstrations humaines, et les approches récentes de génération d'images de but conditionnées par le langage, qui se sont multipliées avec les progrès des modèles de diffusion texte-image. Le papier, disponible en version mise à jour sous la référence 2509.17125v3, ne mentionne aucune plateforme robotique commerciale ni partenariat industriel ; il s'agit d'une contribution de recherche, accompagnée d'un site dédié (sites.google.com/view/imagine2act) proposant des visualisations supplémentaires des expériences en simulation et en conditions réelles. Aucune date de déploiement, aucun volume de production ni tarif n'est associé à ces travaux, qui restent au stade de la preuve de concept scientifique plutôt que du produit prêt à être intégré en ligne de production.

RechercheActu
1 source