Aller au contenu principal
RecherchearXiv cs.RO 

DeViGrasp : préhension mobile visuelle robuste pour manipulateurs quadrupèdes en cas de perception dégradée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2609.22278v1) présente DeViGrasp-Bench et DeViGrasp-Net, un banc d'essai et une méthode pour la préhension mobile des manipulateurs quadrupèdes en cas de perception visuelle dégradée. Le benchmark applique des dégradations contrôlées, occlusions, décrochage du masque de segmentation, bruit de profondeur, instabilité de localisation de la cible, sur des objets connus et inconnus, plusieurs niveaux de difficulté et des terrains complexes. DeViGrasp-Net combine un enseignant privilégié, qui raisonne hors ligne sur des candidats de préhension conditionnés par l'état de l'objet, du robot et de la tâche, et un élève déployable qui fusionne une perception de profondeur segmentée en double vue avec des hypothèses de cible actuelles, mémorisées et de secours, via deux modules nommés Target Hold Memory et Temporal Memory Attention. En configuration Difficult, le taux de réussite atteint 62,3%, soit 16,1 points de plus que VBC et 4,3 de plus qu'une version adaptée de DQ-Net, écart qui grimpe à 10,5 points face à DQ-Net en configuration Hard.

Le travail cible un angle mort de la manipulation mobile : les politiques de contrôle corps entier sont généralement validées sous perception quasi idéale, alors que les déploiements réels exposent caméras et capteurs de profondeur embarqués à des occlusions et du bruit. En formalisant ces dégradations dans un benchmark reproductible plutôt qu'en anecdotes, les auteurs objectivent l'écart entre démonstrations contrôlées et robustesse opérationnelle, un point sensible pour les intégrateurs évaluant des quadrupèdes à bras pour la logistique ou l'inspection industrielle. Le gain provient moins d'une perception brute améliorée que d'une gestion de la mémoire temporelle et de la fiabilité des estimations de cible, ce qui suggère que la robustesse peut s'obtenir par architecture logicielle plutôt que par des capteurs plus coûteux.

L'approche s'inscrit dans la recherche sur les manipulateurs quadrupèdes, robots à pattes équipés d'un bras combinant mobilité tout-terrain et dextérité de préhension, et se positionne explicitement contre deux méthodes de référence, VBC et une adaptation de DQ-Net, qu'elle surpasse sur tous les niveaux de dégradation testés. Il s'agit pour l'instant d'une publication de recherche accompagnée d'un benchmark ouvert, non d'un produit commercialisé : aucun partenaire industriel ni déploiement sur robot physique au-delà de la simulation n'est mentionné, les gains étant confirmés par des études d'ablation. Le benchmark ouvre la voie à des comparaisons futures, alors que les quadrupèdes à bras commencent tout juste à sortir des laboratoires pour des essais pilotes en conditions réelles.

Dans nos dossiers

À lire aussi

Stratégies de préhension pratiques pour la manipulation mobile en environnement réel
1arXiv cs.RO 

Stratégies de préhension pratiques pour la manipulation mobile en environnement réel

Des chercheurs ont publié en avril 2025 sur arXiv (référence 2504.12512) une étude de terrain portant sur SHOPPER, une plateforme de manipulation mobile conçue pour évaluer des stratégies de préhension dans un supermarché réel. L'environnement choisi n'est pas anodin : un magasin d'alimentation impose une diversité extrême d'objets (formes irrégulières, emballages souples, produits réfléchissants), de configurations d'étagères et de layouts changeants. L'équipe a conduit des centaines de tentatives de saisie distinctes et documente en détail les modes de défaillance observés, sans annoncer de taux de réussite global, ce qui tranche avec la communication habituelle du secteur. Ce travail apporte une valeur rare dans la littérature robotique actuelle : une analyse honnête des échecs en conditions non structurées réelles, plutôt qu'une démonstration soigneusement sélectionnée en laboratoire. Le fossé demo-to-reality reste le principal obstacle au déploiement commercial des manipulateurs mobiles, et les auteurs cherchent précisément à le cartographier. Pour un intégrateur ou un décideur industriel, ce type d'inventaire des cas limites est plus exploitable qu'un benchmark contrôlé : il permet de calibrer les attentes sur ce que les pipelines VLA (Vision-Language-Action) et les approches de grasp planning généraliste peuvent réellement délivrer aujourd'hui hors laboratoire. La recherche en manipulation mobile s'est intensifiée ces deux dernières années, portée par des acteurs comme Apptronik, Agility Robotics (Digit) ou Boston Dynamics (Spot avec bras), mais aussi par des startups spécialisées dans le picking retail comme Symbotic ou des robots de supermarché tels que ceux de Focal Systems. Les approches fondées sur l'apprentissage end-to-end (pi0 de Physical Intelligence, RT-2 de Google DeepMind) promettent une généralisation, mais leur robustesse en environnement chaotique reste peu documentée de façon indépendante. SHOPPER s'inscrit dans une démarche de recherche ouverte visant à fournir à la communauté robotique un référentiel de problèmes concrets non résolus, ce qui suggère des publications de suivi et potentiellement un benchmark partagé.

RecherchePaper
1 source
BinWalker : conception et évaluation sur le terrain d'un robot quadrupède manipulateur pour la collecte durable de déchets
2arXiv cs.RO 

BinWalker : conception et évaluation sur le terrain d'un robot quadrupède manipulateur pour la collecte durable de déchets

Des chercheurs du laboratoire DLSLab de l'Istituto Italiano di Tecnologia (IIT) ont présenté BinWalker, une plateforme robotique quadrupède équipée d'un bras manipulateur et d'un conteneur embarqué, conçue pour la collecte autonome de déchets en extérieur. Décrit dans un article publié sur arXiv (référence 2603.10529, version révisée), le système combine la mobilité de la locomotion à pattes avec un module de manipulation permettant de détecter, saisir et stocker des détritus tout en évoluant sur des terrains irréguliers comme les zones côtières, les parcs ou les bas-côtés végétalisés. Les essais ont été menés en conditions réelles extérieures, avec des évaluations sur le terrain destinées à valider l'intégration de la perception, de la locomotion et de la manipulation sur une même plateforme. Le code du projet, nommé trash-collection-isaaclab, a été rendu public sur le dépôt GitHub de l'équipe iit-DLSLab, ce qui suggère un entraînement appuyé sur l'environnement de simulation Isaac Lab de NVIDIA. L'article ne fournit toutefois aucun chiffre précis de charge utile, de degrés de liberté du bras, de temps de cycle ou de volumes traités, restant centré sur une démonstration de faisabilité plutôt que sur des métriques de performance industrielle. Ce travail illustre une tendance de fond dans la robotique de terrain: le recours à des plateformes quadrupèdes, plus aptes que les robots à roues ou les AMR classiques à franchir obstacles, pentes et sols meubles, pour des tâches de service extérieur jusqu'ici réservées à la main-d'œuvre humaine. La collecte de déchets sauvages, aujourd'hui manuelle, coûteuse et chronophage, représente un usage potentiel pour les municipalités, gestionnaires de parcs et opérateurs de nettoyage côtier, mais qui bute sur l'accessibilité des sites. En associant locomotion à pattes et manipulation embarquée sur une seule plateforme, BinWalker teste concrètement la viabilité d'une chaîne complète perception-navigation-préhension en environnement non structuré, un défi encore mal résolu malgré les progrès des modèles vision-langage-action. Pour les intégrateurs, l'intérêt tient moins à un produit prêt à déployer qu'à la preuve que l'architecture quadrupède plus bras reste praticable sur un segment environnemental à faible marge, généralement délaissé au profit d'applications logistiques ou d'inspection industrielle plus rémunératrices. Le projet s'inscrit dans les travaux du DLSLab de l'IIT, laboratoire italien spécialisé dans la locomotion dynamique des robots à pattes, qui publie régulièrement en accès libre, comme en témoigne la mise à disposition du code sur GitHub. BinWalker se positionne sur un créneau distinct des grandes plateformes humanoïdes commerciales telles que Figure 03 ou Optimus, ou des systèmes pilotés par des modèles comme Pi-0, GR00T N2 ou Helix, en misant sur une architecture quadrupède spécialisée plutôt que sur la polyvalence humanoïde générale. Aucun acteur français ou européen du secteur, comme Wandercraft ou Enchanted Tools, n'apparaît dans cette publication, qui reste un travail de recherche académique sans partenariat industriel ni pilote annoncé avec une municipalité. Les suites évoquées portent sur l'amélioration de la robustesse du système en conditions réelles variées, plutôt que sur un calendrier de commercialisation.

UEL'IIT est un institut de recherche italien reconnu en robotique à pattes, mais cette publication reste purement académique, sans partenariat industriel ni pilote municipal annoncé, et n'implique aucun acteur français comme Wandercraft ou Enchanted Tools.

RecherchePaper
1 source
ShapeGrasp : complétion de forme et préhension visuo-haptiques simultanées pour une manipulation robotique améliorée
3arXiv cs.RO 

ShapeGrasp : complétion de forme et préhension visuo-haptiques simultanées pour une manipulation robotique améliorée

ShapeGrasp est un pipeline de manipulation robotique itératif présenté en mai 2025 sur arXiv (2605.02347), qui couple reconstruction de forme 3D implicite avec planification de saisie par simulation physique. À partir d'une seule image RGB-D, le système infère la forme complète d'un objet partiellement occulté (nuage de points ou maillage triangulaire), génère des candidats de saisie par simulation de corps rigides, puis exécute la prise jugée optimale. Après chaque tentative, les contacts tactiles enregistrés et le volume occupé par le préhenseur sont fusionnés pour affiner le modèle 3D de l'objet. En cas d'échec, le système re-estime la pose et re-planifie depuis la forme mise à jour. Validé sur deux robots distincts et deux types de préhenseurs, l'approche atteint 84 % de taux de succès avec un préhenseur à trois doigts et 91 % avec un préhenseur à deux doigts, tout en améliorant la qualité de reconstruction 3D sur l'ensemble des métriques retenues. La manipulation d'objets inconnus ou partiellement visibles reste un verrou majeur en robotique industrielle. La plupart des systèmes de grasping actuels reposent sur une estimation visuelle initiale figée, sans correction post-tentative. ShapeGrasp introduit une boucle de raffinement perceptif où chaque échec enrichit la représentation géométrique de l'objet, reproduisant ainsi la stratégie d'exploration tactile humaine face à un objet non familier. Les auteurs affirment qu'il s'agit de la première approche à mettre à jour une représentation de forme après une saisie réelle, et non en simulation, ce qui comble un écart important entre résultats de labo et conditions opérationnelles réelles. Pour les intégrateurs industriels, cette correction itérative réduit la dépendance aux modèles CAO préalables et aux conditions d'éclairage maîtrisées, deux contraintes structurantes dans les environnements de production variables. La complétion de forme pour la manipulation robotique croise vision 3D (réseaux d'occupation implicite, PointNet) et perception tactile (capteurs GelSight, Digit). Des systèmes concurrents comme Contact-GraspNet ou GraspNeRF opèrent sur des représentations visuelles statiques, sans exploitation du retour haptique post-saisie. ShapeGrasp s'inscrit dans une tendance plus large de systèmes multimodaux couplant vision et proprioception, visible également dans les plateformes humanoïdes récentes (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA). Le travail est actuellement un preprint arXiv non encore soumis à une conférence majeure du domaine (ICRA, IROS, RSS), et les conditions expérimentales détaillées, notamment les familles d'objets testés, les vitesses de cycle et les contraintes d'environnement, n'ont pas encore été publiées dans leur intégralité.

RecherchePaper
1 source
Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles
4arXiv cs.RO 

Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles

Des chercheurs présentent APT-RL (Action Pretrained Transformer-based Reinforcement Learning), un framework unifié permettant à un robot quadrupède de franchir des terrains complexes en n'utilisant que ses capteurs et son calcul embarqués, sans dépendre d'une infrastructure externe. La méthode génère d'abord des jeux de données de mouvement 2D à grande échelle via optimisation de trajectoires sur une dynamique simplifiée, ce qui permet d'entraîner des compétences de locomotion variées et réutilisables. Ces compétences servent ensuite de base solide pour apprendre des tâches plus complexes en 3D, avec transition autonome entre différentes allures. Lors des tests en conditions réelles, le robot a exécuté des manœuvres agiles à travers des obstacles intérieurs et extérieurs, y compris des sauts en descente dynamiques atteignant une vitesse de pointe instantanée de 6 mètres par seconde. Une seule politique embarquée lui a permis de franchir escaliers, haies, pierres de gué, trous et branches tombées au sol, sans changer de modèle selon le type d'obstacle. L'intérêt de ce travail réside dans sa capacité à combiner plusieurs compétences motrices en un seul système embarqué et autonome, un point de friction connu dans la robotique quadrupède où la plupart des démonstrations reposent encore sur des politiques spécialisées par terrain ou sur une assistance en calcul déporté. En s'appuyant uniquement sur la perception et le calcul embarqués, APT-RL s'attaque directement à l'écart classique entre simulation et réalité, tout en montrant que des priors de mouvement générés à moindre coût en 2D peuvent se généraliser efficacement à des environnements 3D non structurés. Pour les intégrateurs travaillant sur l'inspection industrielle, la robotique de terrain ou les interventions en environnement accidenté, cela représente une piste concrète vers des robots capables de gérer la diversité des obstacles réels sans reconfiguration manuelle entre chaque scénario. Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion des robots à pattes, un domaine où des plateformes comme Unitree Go2, Boston Dynamics Spot ou ANYbotics ANYmal servent de référence pour les capacités tout-terrain. Publié comme preprint sur arXiv, l'article ne précise ni laboratoire porteur ni calendrier de déploiement commercial : il s'agit à ce stade d'une contribution de recherche, sans indication de produit shippé ni de pilote industriel annoncé.

RecherchePaper
1 source