Aller au contenu principal
RecherchearXiv cs.RO 

Estimation d'articulation conditionnée par une requête à partir d'une seule image

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent QueryArt, un modèle qui estime les paramètres cinématiques d'objets articulés (portes, tiroirs, charnières) à partir d'une seule image RGB, d'un point de requête 2D désignant la partie d'intérêt et des intrinsèques de la caméra. Le modèle prédit la géométrie d'articulation 3D relativement au point interrogé, exprimée en unités de profondeur de ce point. Une seule mesure de profondeur à cet endroit suffit ensuite pour restituer l'échelle et obtenir les paramètres métriques. L'entraînement repose sur un mélange sélectionné de jeux de données synthétiques et réels. Sur plusieurs benchmarks, QueryArt dépasse les approches récentes sur la plupart des métriques d'articulation, y compris sur des données hors distribution. Côté robot, l'équipe l'a testé sur un manipulateur mobile : 57 essais de manipulation, 16 parties d'objets, cinq classes de points de vue, pour un taux de réussite de 70,2 %. Le code et des vidéos sont publiés avec l'article (arXiv 2610.01726).

L'intérêt tient à deux verrous que les méthodes monoculaires actuelles laissent ouverts. Elles couplent la segmentation des parties articulées et l'estimation de l'articulation, ce qui les rend fragiles : une détection manquée ou une association de parties erronée fait échouer toute la prédiction. Elles régressent aussi une géométrie métrique que la vue unique ne fixe qu'à un facteur d'échelle près, ce qui rend la cible mal définie. En conditionnant la prédiction sur un point de requête et en travaillant en unités de profondeur, QueryArt rend la cible identifiable depuis l'image seule et transfère l'échelle à un capteur de profondeur ponctuel, que presque tout robot mobile possède déjà. Pour un intégrateur, cela rapproche la manipulation d'objets jamais vus d'une chaîne simple : un point choisi, une mesure de profondeur, une action. Reste que 70,2 % de réussite sur 57 essais est un résultat de laboratoire, avec un échantillon modeste, loin des taux de fiabilité exigés en production. Le texte ne détaille pas ici les conditions d'essai ni les échecs.

Ces travaux s'inscrivent dans une lignée de recherches sur l'estimation d'articulation depuis une image unique ou des observations multiples, souvent dépendantes de la segmentation de parties ou de scans 3D préalables. QueryArt se compare à des références récentes de cette famille, sans que le résumé les nomme. La prochaine étape logique est son intégration avec des politiques de manipulation de type VLA, qui pourraient fournir le point de requête à partir d'une instruction en langage naturel. Le code et les vidéos, accessibles sur la page du projet, permettront à d'autres équipes de vérifier ces résultats et de mesurer la robustesse du modèle hors du cadre des benchmarks.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

SimuScene : reconstruction compositionnelle de scènes 3D prêtes pour la simulation à partir d'une seule image
1arXiv cs.RO 

SimuScene : reconstruction compositionnelle de scènes 3D prêtes pour la simulation à partir d'une seule image

Une équipe de chercheurs a présenté SimuScene (arXiv:2606.03994, juin 2026), un pipeline de reconstruction 3D compositionnelle capable de produire, à partir d'une seule image, des scènes directement exploitables dans un simulateur physique. Le verrou technique adressé est précis : les méthodes existantes de reconstruction mono-image génèrent des géométries par objet plausibles visuellement, mais dès qu'on les compose dans une scène et qu'on lance la simulation, les objets s'interpénètrent, flottent ou s'enfoncent dans le sol, rendant la scène inutilisable pour l'entraînement robotique. SimuScene résout ce problème en intégrant le moteur physique non pas comme une étape de correction a posteriori, mais comme un outil de diagnostic pendant le processus de reconstruction lui-même. Concrètement, les objets reconstruits sont soumis à une simulation gravitationnelle ; les échecs de pénétration ou de support sont convertis en signaux de correction quantitatifs qui pilotent deux mécanismes : un étirement de la géométrie selon l'axe vertical ("gravity-axis stretching") et un rééchantillonnage de la forme amodale pour les parties non visibles. Les auteurs rapportent des résultats état de l'art sur des benchmarks de stabilité physique et d'alignement géométrique, et valident l'utilité de la pipeline sur des tâches de manipulation bras robotique et de contrôle humanoïde. Pour l'industrie robotique et la recherche en manipulation, l'enjeu est direct : l'un des goulots d'étranglement majeurs dans la génération de données simulées est la constitution d'environnements 3D physiquement cohérents. Si une seule image suffit à produire une scène immédiatement utilisable dans un simulateur comme Isaac Sim ou MuJoCo, le coût de création de données d'entraînement pour les VLA (Vision-Language-Action models) et les politiques de manipulation chute drastiquement. L'approche "physics-in-the-loop" pendant la génération, plutôt qu'en correction post-hoc, est une distinction architecturale importante : elle corrige les erreurs géométriques à la source plutôt que de les masquer par un réarrangement de layout, ce qui limite les artefacts cumulatifs. Cela dit, le papier étant un preprint, les benchmarks présentés restent à valider par la communauté, et les métriques de performance sur les tâches robotiques aval (taux de succès de saisie, généralisation hors distribution) ne sont pas détaillées dans l'abstract. SimuScene s'inscrit dans un axe de recherche actif depuis 2022 environ, alimenté par la convergence entre les reconstructeurs 3D génératifs (Zero-1-to-3, One-2-3-45, LRM) et le besoin croissant de données synthétiques pour l'entraînement de robots physiques. Les concurrents directs incluent les méthodes de layout correction physique comme PhyScene ou les pipelines de génération de scènes pour la simulation (GENESIS, RoboVerse), qui opèrent eux aussi sur ce créneau sim-to-real mais partent généralement de descriptions textuelles ou de scans multi-vues. La force revendiquée de SimuScene est la contrainte d'entrée minimale (une image) combinée à la validité physique en sortie. Les applications démontrées sur le contrôle humanoïde suggèrent un intérêt pour les labos travaillant sur des plateformes comme Figure 03, Unitree H1 ou Agility Digit, où la génération rapide d'environnements d'entraînement en simulation reste un facteur limitant. Aucun partenariat industriel ni timeline de déploiement n'est mentionné ; il s'agit pour l'instant d'un résultat de recherche académique.

RecherchePaper
1 source
Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile
2arXiv cs.RO 

Estimation de la pose 6-DOF d'un objet à partir d'un seul contact tactile

Une équipe de recherche publie sur arXiv (réf. 2606.28899) YOTO, pour "You Only Touch Once", un système d'estimation de pose 6-DoF fondé exclusivement sur le toucher. Contrairement aux approches visuelles classiques, YOTO reconstruit la position et l'orientation complète d'un objet à partir d'une seule paire de contacts tactiles simultanés, sans nécessiter d'historique de manipulation. Chaque contact est modélisé comme un nuage de points 3D local, puis localisé sur la surface de l'objet par un réseau coarse-to-fine. Les deux contacts localisés, combinés aux poses calibrées des capteurs, alimentent un solveur SVD en forme fermée, conscient des normales de surface, qui restitue la pose 6-DoF en une seule passe. Le réseau est préentraîné sur des patches tactiles virtuels générés depuis le modèle 3D de l'objet, puis affiné avec un petit nombre de contacts réels, réduisant significativement les besoins en données terrain. Les expériences portent sur quatre objets aux géométries variées avec des capteurs GelSight, et incluent une évaluation comparative entre reconstructions issues de scans mobiles grand public et modèles CAO de référence. Ce travail s'attaque à un angle mort bien documenté de la manipulation robotique : les méthodes visuelles de pose estimation échouent systématiquement en cas d'occlusion, d'éclairage défavorable, ou face à des surfaces réfléchissantes et transparentes, conditions courantes en environnement industriel réel. L'approche à contact unique sans historique constitue un avantage pratique majeur, car elle élimine les séquences d'exploration multi-contacts et s'intègre dans des boucles de manipulation courtes. YOTO surpasse les baselines visuelles et géométriques testées dans les scénarios où la perception visuelle est dégradée. La compatibilité avec des scans mobiles plutôt que des modèles CAO précis abaisse la barrière d'intégration pour des objets non catalogués, un point non négligeable pour les intégrateurs industriels. L'estimation de pose par capteurs tactiles de type GelSight est un axe de recherche actif depuis les travaux pionniers du MIT et de l'entreprise éponyme GelSight Inc. Les méthodes antérieures nécessitaient généralement plusieurs contacts successifs ou un historique de manipulation pour converger ; YOTO rompt avec cette contrainte. Sur le plan compétitif, les pipelines visuels basés sur des modèles de fondation (MegaPose, FoundPose, benchmarks BOP) restent dominants en conditions nominales, mais leur robustesse aux surfaces dégradées est limitée, c'est précisément là que le toucher devient complémentaire. Le code, les modèles entraînés et le jeu de données GelSight seront publiés à l'acceptation de l'article. À ce stade, il s'agit d'un preprint arXiv sans déploiement annoncé ni partenaire industriel identifié.

RecherchePaper
1 source
ReGIL : apprentissage par imitation guidé par récupération à partir d'une seule démonstration
3arXiv cs.RO 

ReGIL : apprentissage par imitation guidé par récupération à partir d'une seule démonstration

Des chercheurs présentent ReGIL (Retrieval-Guided Imitation Learning), un framework d'apprentissage par imitation capable d'entraîner un robot manipulateur à partir d'une seule démonstration. La méthode traite cette démonstration unique comme une mémoire externe statique, interrogée en continu durant l'entraînement pour guider simultanément l'exploration, générer un buffer de régularisation et construire les récompenses. Le calcul de récompense repose sur un alignement temporel local entre la trajectoire courante et le segment récupéré, fournissant un feedback pas-à-pas plutôt qu'un signal binaire succès/échec. Évalué sur les benchmarks LIBERO et Meta-World, ReGIL surpasse les baselines antérieures en taux de réussite et en efficacité d'entraînement. Sur robot réel, avec une seule démonstration et moins d'une heure d'entraînement en ligne, le système atteint plus de 75 % de taux de réussite sur trois tâches de manipulation avec randomisation à la fois de la pose initiale du robot et de la position cible. Ces résultats sont issus d'un preprint arXiv (2606.09381) et n'ont pas encore été soumis à revue par les pairs. Le principal défi que ReGIL cherche à résoudre est connu sous le nom de "compounding error" : en imitation learning classique (behavior cloning), les petites déviations par rapport à la trajectoire démontrée s'accumulent et mènent rapidement à l'échec, ce qui oblige généralement à collecter des centaines, voire des milliers de démonstrations. Ramener ce seuil à une seule démonstration plus moins d'une heure d'interaction en ligne représente un gain opérationnel significatif pour le déploiement industriel, où la collecte de données est coûteuse. Le taux de 75 % obtenu avec randomisation de pose et de cible est un indicateur de robustesse plus solide qu'une démonstration en conditions fixes, même si l'absence de détails sur les tâches spécifiques et la complexité des scènes limite l'interprétation. L'apprentissage par imitation à faible nombre de démonstrations est un axe de recherche très actif, concurrencé notamment par les modèles VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence ou les politiques de diffusion (Diffusion Policy, ACT). Ces approches misent sur des grandes quantités de données préentraînées pour compenser la rareté des démos spécifiques à une tâche, là où ReGIL propose une alternative radicalement data-light. Le benchmark LIBERO est devenu un standard de fait pour comparer ces méthodes en simulation, et Meta-World permet d'évaluer la généralisation multi-tâches. La prochaine étape logique serait une validation sur des tâches de manipulation plus complexes et une publication dans une conférence de robotique (ICRA, CoRL, RSS) pour valider les claims de manière indépendante.

RecherchePaper
1 source
Estimation des états dynamiques d'un robot à continuum souple à partir de ses limites
4arXiv cs.RO 

Estimation des états dynamiques d'un robot à continuum souple à partir de ses limites

Des chercheurs en robotique publient une nouvelle méthode d'estimation d'état pour les robots à corps continu souples, dans une version révisée (v3) d'un article déposé sur arXiv. Le problème traité : ces robots ont des états (poses, déformations, efforts internes, vitesses) intrinsèquement de dimension infinie du fait de leur déformabilité continue, alors que les capteurs ne fournissent que des mesures discrètes. Une méthode récente, l'observateur de frontière (boundary observer), utilise la théorie des tiges de Cosserat pour reconstruire l'ensemble de ces états à partir de la vitesse mesurée en bout de robot, captée en général par un système de capture de mouvement externe. L'équipe propose ici une conception duale : plutôt que la vitesse en bout, elle mesure l'effort interne (wrench) à la base du robot, avec un simple capteur de force/couple. Les deux familles d'observateurs, fondées sur des principes de dissipation d'énergie, peuvent être combinées. Une analyse basée sur la théorie de Lyapunov montre que la vitesse de convergence s'améliore puis se dégrade quand les gains de l'observateur augmentent, une tendance convexe qui permet un réglage efficace des paramètres. Les auteurs identifient aussi des cas où états linéaires et angulaires se déterminent mutuellement, réduisant encore le besoin de capteurs. Les essais, en simulation et sur un robot continu actionné par tendons, valident la convergence en mouvements dynamiques rapides, l'existence de gains optimaux, la robustesse au bruit de mesure, aux forces externes et aux incertitudes de modèle, ainsi que des performances de calcul temps réel. Pour l'industrie de la robotique souple, l'apport pratique est concret : remplacer un système de capture de mouvement externe, coûteux, encombrant et limité à un espace calibré, par un simple capteur de force/couple embarqué à la base réduit le coût et la complexité d'installation, et ouvre la voie à des déploiements hors laboratoire, en environnement industriel confiné, en chirurgie mini-invasive ou en inspection. C'est aussi une réponse à un doute récurrent du secteur : peut-on estimer en continu et en temps réel l'état complet d'un robot souple sans instrumentation lourde. Les résultats, avec règle de réglage de gain systématique et calcul temps réel démontré, suggèrent que oui, au moins pour cette classe de robots à tendons, même si l'étude reste validée en simulation et sur un seul prototype expérimental, loin d'un système intégré prêt à l'emploi. Ces travaux prolongent directement l'observateur de frontière initial, qui s'appuyait déjà sur la théorie des tiges de Cosserat mais imposait une mesure de vitesse en bout de robot, donc un dispositif de capture de mouvement externe. En proposant une version duale reposant sur un capteur de force/couple à la base, les auteurs suppriment cette contrainte et élargissent le champ d'application aux configurations où un mocap est impraticable. L'article ne mentionne aucun partenariat industriel ni calendrier de transfert vers un produit commercial ; pour ce type de travaux académiques, les suites attendues sont l'extension à des robots multi-segments ou à actionnement pneumatique, et des essais en conditions réelles au-delà du banc de laboratoire.

RecherchePaper
1 source