Aller au contenu principal
Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine
RechercheInteresting Engineering 

Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine
▶ Voir sur YouTube

Une équipe dirigée par des chercheurs de l'Université York, à Toronto, a développé CBS (convergent binocular stéréo), un algorithme de vision stéréoscopique pour têtes robotiques dont les deux caméras convergent vers un même point plutôt que de rester parallèles, à l'image des yeux humains. Contrairement aux systèmes stéréo classiques qui ne mesurent que les disparités horizontales entre caméras parallèles, CBS exploite aussi les disparités verticales issues de la convergence, via une pyramide gaussienne à cinq niveaux, une détection de points SIFT sous contraintes épipolaires et des filtres de Gabor pour affiner la mise en correspondance des pixels. L'équipe a testé la méthode sur un nouveau jeu de données, CBS-BM : 49 scènes (tables ordinaires, motifs répétés, surfaces sans texture, objets occlus), chacune avec des images parallèles et 5 à 12 paires en fixation convergente. Sur les scènes à motifs répétés, où les méthodes classiques échouent le plus souvent, CBS réduit l'erreur de profondeur d'environ 0,8 mètre et l'erreur de disparité horizontale d'environ 100 pixels par rapport à la meilleure méthode concurrente, mais le traitement prend environ 69 secondes par scène sur un processeur AMD Ryzen 7 7700X.

Pour l'industrie robotique, l'enjeu dépasse la seule photogrammétrie : une perception de profondeur plus proche du fonctionnement binoculaire humain aiderait les humanoïdes à mieux juger les distances, estimer l'orientation des objets et naviguer en environnement encombré, des capacités utiles à la manipulation comme au déplacement. Mais l'annonce doit être relativisée : il ne s'agit ni d'un produit commercial ni d'un système temps réel, un temps de calcul de 69 secondes par scène étant incompatible avec un usage embarqué, la précision se dégradant en outre avec la distance et restant dépendante d'un calibrage caméra très précis. Les chercheurs présentent eux-mêmes CBS comme un complément, non un remplacement, des systèmes stéréo parallèles pour les applications qui n'exigent pas une vision de type humain.

La publication relève de la recherche académique plutôt que d'une annonce produit : aucun partenariat, pilote ou calendrier de commercialisation n'est mentionné. Elle s'inscrit dans une tendance du secteur des humanoïdes qui traite la perception visuelle comme un prérequis aussi critique que la manipulation ou la locomotion, avec une approche différente des modèles vision-langage-action appris de bout en bout : ici, ce sont les mouvements physiques des caméras et le traitement d'image qui coopèrent, à la manière du système oculaire humain. Les auteurs reconnaissent une large marge d'optimisation avant tout usage pratique, notamment pour réduire le temps de calcul, ce qui situe CBS comme une preuve de concept plutôt qu'une technologie prête à l'intégration.

Dans nos dossiers

À lire aussi

PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes
1arXiv cs.RO 

PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes

Traversée d'escaliers pour robots humanoïdes: des chercheurs présentent PolyMap, un système de navigation qui construit en temps réel une carte sémantique polygonale des marches à partir de la fusion de plusieurs capteurs, LiDAR, caméra RGB-D et centrales inertielles. Le robot segmente chaque plan de marche sous forme de polygones puis calcule où poser le pied grâce à un planificateur qui exploite directement ces segments plans. L'ensemble tourne sur une carte NVIDIA Orin embarquée, avec une sortie de planification de mouvement corps entier à 20-30 Hz, une cadence suffisante pour ajuster la trajectoire du robot en marchant sans interrompre la locomotion. Les auteurs, dont les travaux sont documentés dans un article déposé sur arXiv (2510.12346, version 2, remplaçant une publication antérieure), rapportent des essais réels en intérieur et en extérieur validant la robustesse et l'efficacité de l'approche pour la montée d'escaliers. L'enjeu dépasse la simple prouesse technique: la marche humanoïde actuelle reste largement conçue pour des sols plats et prévisibles, un schéma de marche générique qui ne demande pas au robot de regarder où il pose le pied. Grimper un escalier inconnu exige au contraire une perception précise et une planification de pas en temps réel, exactement le type de tâche où les démonstrations spectaculaires en environnement contrôlé échouent souvent une fois confrontées à un terrain réel non calibré. En combinant cartographie sémantique et planification de pas sur du matériel embarqué à cadence élevée, PolyMap répond directement à ce fossé entre démonstration et déploiement, un point sensible pour tout intégrateur envisageant des humanoïdes en environnement industriel ou logistique comportant des dénivelés. Cette approche s'inscrit dans une lignée de recherche plus large sur la locomotion perceptive, qui cherche à remplacer les mouvements scriptés par une perception active de l'environnement, un axe également exploré par d'autres laboratoires académiques et industriels travaillant sur la marche humanoïde. Le papier étant une publication arXiv de recherche et non une annonce produit, aucun calendrier de commercialisation n'est communiqué; il s'agit ici d'une contribution méthodologique destinée à alimenter les futurs systèmes de contrôle plutôt que d'un déploiement commercial annoncé.

RecherchePaper
1 source
Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs
2arXiv cs.RO 

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs

Des chercheurs ont publié le 21 août 2026 sur arXiv (référence 2608.20087v1) AdaPT, un système de planification et de suivi de mouvement adaptatif qui apprend à des robots humanoïdes à servir et échanger au tennis avec un style proche de celui des joueurs professionnels, directement à partir de vidéos de retransmissions télévisées. L'architecture est hiérarchique : un planificateur génère la trajectoire cinématique stylisée, tandis qu'un module de suivi (tracker) l'exécute en interférant le moins possible avec le plan initial. Validée en simulation, l'approche a ensuite révélé un écart important entre simulation et réel sur le robot Unitree G1, la précision du suivi se dégradant à cause de la planification autorégressive et du bruit de perception ; pour corriger cela, les auteurs ont entraîné le tracker à suivre des vitesses d'exécution randomisées et conditionné le planificateur via un adaptateur de vitesse appris. Les politiques AdaPT ont ensuite été déployées sur le robot humanoïde grand format Dobot Atom (1,7 mètre), capable de servir en conditions réelles sans capture de mouvement, avec vidéos et code publiés sur le site du projet. Ce résultat illustre concrètement la possibilité de transférer un mouvement stylisé et physiquement exigeant, appris depuis de simples vidéos, vers un robot humanoïde grande taille opérant sans motion capture ni environnement contrôlé, un enjeu central pour l'industrie face au fossé habituel entre démonstrations et performance réelle. Il faut toutefois le lire comme un résultat de recherche académique et non comme un produit commercialisé : aucune annonce de volumes, de prix ni de partenariat industriel n'accompagne la publication, et les essais restent limités en nombre. La méthode elle-même dépasse le seul tennis, puisqu'elle traite un problème plus général, générer des mouvements stylistiques complexes sans sacrifier la performance de la tâche, pertinent pour toute application humanoïde exigeant dextérité et fluidité. Ce travail s'inscrit dans une vague récente de recherches sur des humanoïdes jouant à des sports de balle, un domaine où plusieurs laboratoires ont récemment montré des frappes ou services au tennis, badminton ou ping-pong, souvent via des architectures de type VLA ou du renforcement pur. AdaPT se distingue par la combinaison d'une imitation de style issue de vidéos de diffusion et d'une architecture planificateur/tracker pensée spécifiquement pour limiter la dégradation lors du transfert simulation-réel. Les tests ont porté sur deux plateformes, le Unitree G1, standard courant en recherche sur la locomotion, et le Dobot Atom, humanoïde grand format du fabricant chinois Dobot. Les auteurs n'annoncent aucun calendrier de pilote commercial, se limitant à publier code et vidéos et à souligner des enseignements algorithmiques et d'ingénierie pour de futurs systèmes humanoïdes sportifs.

RecherchePaper
1 source
OA-NBV : planification de vues sensible aux occlusions pour la perception active centrée sur l'humain de robots mobiles
3arXiv cs.RO 

OA-NBV : planification de vues sensible aux occlusions pour la perception active centrée sur l'humain de robots mobiles

Des chercheurs présentent OA-NBV (Occlusion-Aware Next-Best-View Planning), un pipeline de planification de point de vue pour robots mobiles confrontés à une personne partiellement masquée par des obstacles, publié sur arXiv sous la référence 2603.11072, en version 2 remplaçant une publication antérieure. Le système évalue les points de vue candidats accessibles au robot à l'aide d'un modèle de visibilité centré sur la cible, qui intègre l'occlusion, l'échelle de la personne dans le champ visuel et la complétude de l'observation. Les auteurs rapportent un taux de réussite supérieur à 90% en simulation comme en essais réels, alors que les méthodes NBV de référence se dégradent nettement dès qu'une occlusion survient. Comparé au meilleur de ces baselines, OA-NBV augmente la surface normalisée occupée par la cible d'au moins 81% et la visibilité des points clés du corps, utilisés pour l'estimation de posture, d'au moins 58%, selon les configurations testées. L'enjeu dépasse la démonstration en laboratoire: recherche et sauvetage, triage d'urgence et intervention post-catastrophe se déroulent justement dans des environnements encombrés où la visibilité partielle dégrade la détection de personnes ou l'estimation de pose en aval. Or la plupart des méthodes NBV existantes optimisent une exploration générique ou une couverture à long horizon, sans viser l'objectif immédiat d'obtenir une seule vue exploitable d'une personne cachée sous des contraintes de mouvement réelles. En ciblant ce cas d'usage plus étroit, OA-NBV se présente comme un module de sélection de point de vue intégrable à diverses tâches de perception centrées sur l'humain sans refonte de la chaîne d'autonomie, un argument qui parle directement aux intégrateurs confrontés au même écart entre couverture générique et besoin réel de perception. Le travail s'inscrit dans la lignée des recherches sur le Next-Best-View, historiquement tournées vers l'exploration ou la reconstruction 3D générique, dont OA-NBV se démarque en ciblant la perception active centrée sur l'humain. Ses méthodes de référence sont explicitement présentées comme des approches NBV standards qui échouent dès que l'occlusion s'installe, l'écart précis que la contribution cherche à combler. Il s'agit pour l'instant d'une publication de recherche, un preprint arXiv en version 2, sans plateforme, entreprise ni calendrier de déploiement mentionnés dans le texte, son adoption dépendant d'une intégration dans des piles logicielles existantes et de validations sur d'autres morphologies de robots et des occlusions plus denses que celles testées.

RecherchePaper
1 source
Allocation de tâches adaptative en temps réel pour la supervision de plusieurs robots par plusieurs humains
4arXiv cs.RO 

Allocation de tâches adaptative en temps réel pour la supervision de plusieurs robots par plusieurs humains

Des chercheurs proposent, dans une prépublication arXiv (2610.00897v1), une méthode d'allocation en temps réel des tâches de supervision de robots à plusieurs opérateurs humains, qui tient compte de leur état cognitif. Le scénario visé est celui où plusieurs opérateurs télé-opèrent ponctuellement plusieurs robots pour les aider à surmonter une difficulté. L'algorithme est glouton : il cherche à minimiser la charge de travail estimée de chaque opérateur, avec une priorisation des tâches. Les robots sont affectés en fonction de la capacité de supervision courante de chaque opérateur, l'effort requis variant selon le type de tâche. Une étude utilisateur compare la méthode à une référence qui ignore les facteurs humains. Sur des intervalles de temps prédéfinis, l'approche obtient de meilleures performances et moins de signes comportementaux de fatigue. Le résumé ne fournit ni nombre de participants, ni taille des flottes, ni ampleur des gains, ni type de robots. L'enjeu concerne directement les opérations où l'autonomie reste incomplète. Beaucoup de déploiements de robots mobiles, de manipulateurs ou d'humanoïdes reposent sur un modèle « un humain pour N robots », où l'opérateur intervient quand le robot bloque. Les méthodes d'allocation existantes supposent une capacité de supervision fixe par opérateur et ignorent les variations de charge mentale et de fatigue. Le résultat est une charge déséquilibrée : certains opérateurs saturent pendant que d'autres sont sous-employés. Les auteurs présentent l'ajustement adaptatif de la capacité comme un mécanisme préventif pour les longues durées et les environnements exigeants. Pour un intégrateur ou un COO, cela déplace la question du ratio opérateurs/robots vers la qualité de l'orchestration humaine. Ce ratio conditionne le coût d'exploitation réel d'une flotte, notamment quand les VLA (modèles vision-langage-action) laissent encore une part d'interventions humaines. Les limites sont à garder en tête : l'évaluation est une étude utilisateur, sans mention de terrain industriel, et le gain est mesuré face à une référence simple. Ce travail s'inscrit dans la littérature sur la supervision multi-robot et la télé-opération partagée. Cette littérature a longtemps traité l'opérateur comme une ressource de capacité constante, alors que l'industrialisation de la logistique, de la livraison et des humanoïdes de première génération rend les pics d'exceptions et la fatigue sur de longues vacations plus gênants. Plusieurs acteurs commerciaux misent déjà sur des centres de téléassistance pour couvrir les cas limites, sans qu'on sache s'ils modulent la charge de leurs opérateurs de cette façon. Aucun déploiement, pilote ou calendrier n'est annoncé, et aucun acteur français ou européen n'est cité. Les prochaines étapes naturelles seraient une validation sur des flottes réelles, avec des mesures physiologiques ou comportementales de la fatigue en conditions de production, ainsi qu'une intégration dans les logiciels d'orchestration de flottes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source