Aller au contenu principal
Contrôle de corps entier des manipulateurs mobiles avec prise en compte de la reconstruction des objets
RecherchearXiv cs.RO 

Contrôle de corps entier des manipulateurs mobiles avec prise en compte de la reconstruction des objets

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode de reconstruction d'objets 3D par manipulateur mobile qui supprime le planificateur de trajectoire dédié, pour un coût de calcul nettement réduit. Le travail, publié sur arXiv (troisième version, septembre 2025 pour la première), part d'un constat: pour reconstruire ou inspecter un objet, il faut choisir des trajectoires qui révèlent le plus de zones encore inconnues. Les approches actuelles échantillonnent des trajectoires candidates et évaluent de nombreuses vues le long de chacune, ce qui coûte cher en calcul. La nouvelle méthode calcule un point de focalisation dans la région la plus informative, puis impose au robot de le garder dans le champ de vision de la caméra pendant son déplacement. Cette contrainte de visibilité est intégrée directement dans le contrôle du corps entier (whole-body control) du manipulateur mobile.

L'évaluation repose sur des simulations réalistes avec 114 objets de tailles variées, issus de 57 catégories, et sur une analyse statistique bayésienne. Trois stratégies sont comparées: la méthode proposée, une planification par échantillonnage, et une approche sans trajectoires informatives. Face à l'échantillonnage, aucune différence statistiquement significative n'apparaît sur l'entropie de reconstruction, et la probabilité que les deux soient pratiquement équivalentes en couverture est de 52,3 %. Le calcul est 6,2 à 19,36 fois plus rapide, et le temps passé par le robot entre deux vues baisse de 13,76 % à 27,9 %, selon le champ de vision de la caméra et la résolution du modèle. Des essais réels ont été menés avec un manipulateur mobile omnidirectionnel à 8 DoF et un manipulateur à pattes.

L'intérêt pour les intégrateurs est concret: l'inspection, le contrôle qualité et la numérisation d'objets par robot mobile sont limités par la latence de décision entre deux vues, et pas seulement par la qualité de la reconstruction. Ici, la qualité reste proche de l'état de l'art tout en réduisant le calcul embarqué, ce qui compte sur des plateformes à ressources limitées. Il faut toutefois nuancer: l'équivalence de couverture n'est établie qu'à 52,3 %, donc non démontrée. Il s'agit en outre d'un résultat académique, validé en simulation et sur deux plateformes de laboratoire, sans déploiement industriel ni mesure en environnement de production.

Ce travail s'inscrit dans la lignée de la planification de la « prochaine meilleure vue » (next-best-view), dominante depuis des années en reconstruction active, et du contrôle de corps entier des manipulateurs mobiles, qui coordonne base et bras comme un seul système. La démarche rejoint ainsi la tendance à fusionner perception active et commande, plutôt que de les chaîner. Les suites probables concernent des tests sur des scènes plus complexes, avec occlusions et objets déformables, et une intégration dans des chaînes d'inspection. Aucun partenaire industriel ni calendrier de transfert n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles
1arXiv cs.RO 

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles

Des chercheurs présentent dans un preprint arXiv (2605.17593) un cadre de planification baptisé "motion-uncertainty-aware next-best-view" (NBV), destiné à reconstruire en 3D des objets rigides en mouvement planaire avec un robot mobile équipé d'un capteur de profondeur. Le problème central est le délai entre la sélection d'un viewpoint et son exécution : au moment où le robot atteint la position choisie, l'objet a déjà bougé, rendant caduc tout plan basé sur une pose prédite unique. Pour y répondre, chaque viewpoint candidat est évalué non pas sur une position fixe, mais sur l'ensemble des états futurs plausibles de l'objet, modélisés par un lisseur à processus gaussien à fenêtre glissante (fixed-lag Gaussian Process smoother) alimenté par des mesures de position bruitées. Les expériences, menées en simulation et en conditions réelles, montrent une complétude de reconstruction supérieure à celle des planificateurs NBV non-prédictifs et des méthodes de tracking-seul. Ce résultat comble un angle mort documenté de la robotique perceptive : les planificateurs NBV classiques optimisent la couverture de surface en supposant des objets statiques, tandis que les méthodes de perception active orientées mouvement favorisent le suivi au détriment de la qualité de reconstruction. La combinaison des deux dans un seul cadre probabiliste est directement applicable à l'inspection automatisée de pièces sur convoyeur, au contrôle qualité en ligne ou à la génération de jumeaux numériques en environnement dynamique. Traiter le futur comme une distribution d'états plutôt qu'une estimation ponctuelle améliore la robustesse aux perturbations capteurs et aux variations de dynamique que les approches déterministes ne gèrent pas. La planification NBV est un problème actif depuis les années 1990 en robotique perceptive, mais son extension aux objets en mouvement reste peu traitée dans la littérature. L'usage de processus gaussiens pour la prédiction de trajectoire est éprouvé dans d'autres domaines, rarement couplé jusqu'ici à des scores de couverture de surface en contexte NBV. Il s'agit d'un preprint sans évaluation par les pairs à ce stade, sans partenaire industriel ni déploiement annoncé. Les métriques de complétude avancées restent à confirmer sur des dynamiques plus complexes : les expériences actuelles se limitent au mouvement planaire et aux objets rigides. Les extensions naturelles incluent le mouvement 3D non-planaire, les objets déformables et les configurations multi-cibles. Aucun acteur français ou européen n'est impliqué dans cette publication.

RecherchePaper
1 source
Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède
2arXiv cs.RO 

Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède

Des chercheurs publient sur arXiv (référence 2609.18930v1, septembre 2026) un contrôleur unifié de corps entier pour un robot bipède manipulateur mobile, entraîné par apprentissage par renforcement. Le système prend en entrée une seule cible d'effecteur terminal en 6 degrés de liberté (position et orientation) et produit directement les actions coordonnées de la base bipède et du bras, sans qu'aucune commande explicite de vitesse de base ou de placement de pas ne soit fournie séparément. L'entraînement repose sur une stratégie de "reward-gating" qui arbitre dynamiquement entre suivi de trajectoire de l'effecteur, locomotion et maintien de l'équilibre. Un module d'estimation de contexte temporel, combinant un encodeur Transformer à fenêtre glissante, une mémoire récurrente GRU et une prédiction auxiliaire de dynamique, extrait des informations pertinentes de l'historique d'observation pour affiner le contrôle. Sur robot réel, les auteurs montrent que ce même contrôleur exécute des tâches d'atteinte, d'adaptation posturale et de pas sous trois types de commandes différentes : téléopération en réalité virtuelle, une politique de diffusion apprise, et des trajectoires scriptées. L'intérêt pour l'industrie robotique tient à la simplification de l'architecture de contrôle: au lieu de piloter séparément la locomotion et la manipulation, ou de dépendre de commandes de pas explicites, une seule interface d'effecteur terminal suffit à coordonner l'ensemble du corps. Cela facilite en théorie le branchement de politiques de haut niveau (VLA, diffusion, téléopération) sur un même contrôleur bas niveau, sans réentraînement spécifique à chaque source de commande. C'est un signal pertinent pour les équipes qui travaillent sur l'intégration de piles de manipulation sur plateformes humanoïdes ou bipèdes mobiles, dans la lignée des efforts sectoriels pour découpler la couche de décision de la couche de contrôle moteur. Le travail s'inscrit dans la recherche académique sur la loco-manipulation bipède, un problème identifié de longue date car il étend la portée effective des bras au-delà de leur espace de travail nominal en mobilisant les jambes. L'abstract ne précise ni l'identité des auteurs, ni la plateforme robotique utilisée, ni un calendrier de déploiement commercial: il s'agit d'un preprint de recherche avec validation expérimentale en laboratoire, pas d'un produit ou d'un pilote industriel annoncé.

RecherchePaper
1 source
HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
3arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets
4arXiv cs.RO 

TacO : évaluation comparative des capteurs tactiles pour la manipulation d'objets

Des chercheurs ont publié sur arXiv (réf. 2605.21976) un cadre d'évaluation systématique baptisé TacO, conçu pour comparer les capteurs tactiles sur des tâches de manipulation robotique concrètes. Quatre modalités ont été mises à l'épreuve : capteurs visuels (à base de caméra et d'élastomère), acoustiques, magnétiques et résistifs, testés sur trois scénarios représentatifs de l'assemblage industriel : pick-and-place avec masse inconnue, réorientation d'objet en main, et insertion de connecteur. Pour chaque tâche, des politiques de manipulation distinctes ont été entraînées, puis évaluées selon les propriétés intrinsèques de chaque capteur : résolution spatiale, détection du cisaillement (shear sensing), représentation tactile, et friction du matériau de contact. L'ensemble des capteurs, du code, des données et des configurations matérielles sera rendu public sur le site du projet. Ce travail remet en cause une hypothèse structurante de la communauté robotique : que le toucher améliore systématiquement les performances de manipulation. TacO montre au contraire que l'utilité de l'information tactile dépend fortement de la modalité du capteur, des propriétés mécaniques des matériaux et de la nature exacte de la tâche. Cette nuance a des implications directes pour les intégrateurs et les équipes R&D : choisir un capteur tactile sans référence à la tâche cible relève du pari. Pour les COO et décideurs industriels qui évaluent des solutions de manipulation complexe (assemblage, insertion, tri de pièces), TacO fournit un étalon comparatif là où n'existait jusqu'ici que du consensus non quantifié. Il faut noter que les métriques de performance détaillées par tâche ne sont pas divulguées dans le préprint, ce qui limite l'interprétation sans accès au papier complet. Le besoin de ce benchmark s'inscrit dans une dynamique plus large : le succès des approches vision-language-action (VLA) et de l'apprentissage par démonstration a repoussé les limites du manipulation standard, mais ces méthodes butent sur les tâches à contact riche, où le retour visuel seul ne suffit pas. Plusieurs capteurs font figure de références sectorielles -- GelSight et DIGIT pour le tactile visuel, ReSkin pour le magnétique, des matrices résistives pour la pression -- mais aucune comparaison tête-à-tête rigoureuse ne permettait aux équipes de justifier leur choix. TacO comble ce vide méthodologique. Les prochaines étapes naturelles incluent l'extension à des tâches bi-manuelles, à des environnements moins contrôlés, et l'intégration de ces résultats dans les pipelines d'entraînement de politiques généralisées comme Pi-0 ou GR00T N2.

UELes équipes R&D et intégrateurs européens travaillant sur la manipulation à contact riche pourront s'appuyer sur ce benchmark open-source pour justifier objectivement leurs choix de capteurs tactiles, comblant un vide méthodologique jusqu'ici non quantifié.

RecherchePaper
1 source