Estimation d'articulation conditionnée par une requête à partir d'une seule image
Des chercheurs présentent QueryArt, un modèle qui estime les paramètres cinématiques d'objets articulés (portes, tiroirs, charnières) à partir d'une seule image RGB, d'un point de requête 2D désignant la partie d'intérêt et des intrinsèques de la caméra. Le modèle prédit la géométrie d'articulation 3D relativement au point interrogé, exprimée en unités de profondeur de ce point. Une seule mesure de profondeur à cet endroit suffit ensuite pour restituer l'échelle et obtenir les paramètres métriques. L'entraînement repose sur un mélange sélectionné de jeux de données synthétiques et réels. Sur plusieurs benchmarks, QueryArt dépasse les approches récentes sur la plupart des métriques d'articulation, y compris sur des données hors distribution. Côté robot, l'équipe l'a testé sur un manipulateur mobile : 57 essais de manipulation, 16 parties d'objets, cinq classes de points de vue, pour un taux de réussite de 70,2 %. Le code et des vidéos sont publiés avec l'article (arXiv 2610.01726).
L'intérêt tient à deux verrous que les méthodes monoculaires actuelles laissent ouverts. Elles couplent la segmentation des parties articulées et l'estimation de l'articulation, ce qui les rend fragiles : une détection manquée ou une association de parties erronée fait échouer toute la prédiction. Elles régressent aussi une géométrie métrique que la vue unique ne fixe qu'à un facteur d'échelle près, ce qui rend la cible mal définie. En conditionnant la prédiction sur un point de requête et en travaillant en unités de profondeur, QueryArt rend la cible identifiable depuis l'image seule et transfère l'échelle à un capteur de profondeur ponctuel, que presque tout robot mobile possède déjà. Pour un intégrateur, cela rapproche la manipulation d'objets jamais vus d'une chaîne simple : un point choisi, une mesure de profondeur, une action. Reste que 70,2 % de réussite sur 57 essais est un résultat de laboratoire, avec un échantillon modeste, loin des taux de fiabilité exigés en production. Le texte ne détaille pas ici les conditions d'essai ni les échecs.
Ces travaux s'inscrivent dans une lignée de recherches sur l'estimation d'articulation depuis une image unique ou des observations multiples, souvent dépendantes de la segmentation de parties ou de scans 3D préalables. QueryArt se compare à des références récentes de cette famille, sans que le résumé les nomme. La prochaine étape logique est son intégration avec des politiques de manipulation de type VLA, qui pourraient fournir le point de requête à partir d'une instruction en langage naturel. Le code et les vidéos, accessibles sur la page du projet, permettront à d'autres équipes de vérifier ces résultats et de mesurer la robustesse du modèle hors du cadre des benchmarks.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




