Aller au contenu principal
Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine
RechercheInteresting Engineering 

Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Nouvel algorithme de vision stéréo donne aux robots humanoïdes une perception de la profondeur plus humaine
▶ Voir sur YouTube

Une équipe dirigée par des chercheurs de l'Université York, à Toronto, a développé CBS (convergent binocular stéréo), un algorithme de vision stéréoscopique pour têtes robotiques dont les deux caméras convergent vers un même point plutôt que de rester parallèles, à l'image des yeux humains. Contrairement aux systèmes stéréo classiques qui ne mesurent que les disparités horizontales entre caméras parallèles, CBS exploite aussi les disparités verticales issues de la convergence, via une pyramide gaussienne à cinq niveaux, une détection de points SIFT sous contraintes épipolaires et des filtres de Gabor pour affiner la mise en correspondance des pixels. L'équipe a testé la méthode sur un nouveau jeu de données, CBS-BM : 49 scènes (tables ordinaires, motifs répétés, surfaces sans texture, objets occlus), chacune avec des images parallèles et 5 à 12 paires en fixation convergente. Sur les scènes à motifs répétés, où les méthodes classiques échouent le plus souvent, CBS réduit l'erreur de profondeur d'environ 0,8 mètre et l'erreur de disparité horizontale d'environ 100 pixels par rapport à la meilleure méthode concurrente, mais le traitement prend environ 69 secondes par scène sur un processeur AMD Ryzen 7 7700X.

Pour l'industrie robotique, l'enjeu dépasse la seule photogrammétrie : une perception de profondeur plus proche du fonctionnement binoculaire humain aiderait les humanoïdes à mieux juger les distances, estimer l'orientation des objets et naviguer en environnement encombré, des capacités utiles à la manipulation comme au déplacement. Mais l'annonce doit être relativisée : il ne s'agit ni d'un produit commercial ni d'un système temps réel, un temps de calcul de 69 secondes par scène étant incompatible avec un usage embarqué, la précision se dégradant en outre avec la distance et restant dépendante d'un calibrage caméra très précis. Les chercheurs présentent eux-mêmes CBS comme un complément, non un remplacement, des systèmes stéréo parallèles pour les applications qui n'exigent pas une vision de type humain.

La publication relève de la recherche académique plutôt que d'une annonce produit : aucun partenariat, pilote ou calendrier de commercialisation n'est mentionné. Elle s'inscrit dans une tendance du secteur des humanoïdes qui traite la perception visuelle comme un prérequis aussi critique que la manipulation ou la locomotion, avec une approche différente des modèles vision-langage-action appris de bout en bout : ici, ce sont les mouvements physiques des caméras et le traitement d'image qui coopèrent, à la manière du système oculaire humain. Les auteurs reconnaissent une large marge d'optimisation avant tout usage pratique, notamment pour réduire le temps de calcul, ce qui situe CBS comme une preuve de concept plutôt qu'une technologie prête à l'intégration.

Dans nos dossiers

À lire aussi

PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes
1arXiv cs.RO 

PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes

Traversée d'escaliers pour robots humanoïdes: des chercheurs présentent PolyMap, un système de navigation qui construit en temps réel une carte sémantique polygonale des marches à partir de la fusion de plusieurs capteurs, LiDAR, caméra RGB-D et centrales inertielles. Le robot segmente chaque plan de marche sous forme de polygones puis calcule où poser le pied grâce à un planificateur qui exploite directement ces segments plans. L'ensemble tourne sur une carte NVIDIA Orin embarquée, avec une sortie de planification de mouvement corps entier à 20-30 Hz, une cadence suffisante pour ajuster la trajectoire du robot en marchant sans interrompre la locomotion. Les auteurs, dont les travaux sont documentés dans un article déposé sur arXiv (2510.12346, version 2, remplaçant une publication antérieure), rapportent des essais réels en intérieur et en extérieur validant la robustesse et l'efficacité de l'approche pour la montée d'escaliers. L'enjeu dépasse la simple prouesse technique: la marche humanoïde actuelle reste largement conçue pour des sols plats et prévisibles, un schéma de marche générique qui ne demande pas au robot de regarder où il pose le pied. Grimper un escalier inconnu exige au contraire une perception précise et une planification de pas en temps réel, exactement le type de tâche où les démonstrations spectaculaires en environnement contrôlé échouent souvent une fois confrontées à un terrain réel non calibré. En combinant cartographie sémantique et planification de pas sur du matériel embarqué à cadence élevée, PolyMap répond directement à ce fossé entre démonstration et déploiement, un point sensible pour tout intégrateur envisageant des humanoïdes en environnement industriel ou logistique comportant des dénivelés. Cette approche s'inscrit dans une lignée de recherche plus large sur la locomotion perceptive, qui cherche à remplacer les mouvements scriptés par une perception active de l'environnement, un axe également exploré par d'autres laboratoires académiques et industriels travaillant sur la marche humanoïde. Le papier étant une publication arXiv de recherche et non une annonce produit, aucun calendrier de commercialisation n'est communiqué; il s'agit ici d'une contribution méthodologique destinée à alimenter les futurs systèmes de contrôle plutôt que d'un déploiement commercial annoncé.

RecherchePaper
1 source
Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs
2arXiv cs.RO 

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs

Des chercheurs ont publié le 21 août 2026 sur arXiv (référence 2608.20087v1) AdaPT, un système de planification et de suivi de mouvement adaptatif qui apprend à des robots humanoïdes à servir et échanger au tennis avec un style proche de celui des joueurs professionnels, directement à partir de vidéos de retransmissions télévisées. L'architecture est hiérarchique : un planificateur génère la trajectoire cinématique stylisée, tandis qu'un module de suivi (tracker) l'exécute en interférant le moins possible avec le plan initial. Validée en simulation, l'approche a ensuite révélé un écart important entre simulation et réel sur le robot Unitree G1, la précision du suivi se dégradant à cause de la planification autorégressive et du bruit de perception ; pour corriger cela, les auteurs ont entraîné le tracker à suivre des vitesses d'exécution randomisées et conditionné le planificateur via un adaptateur de vitesse appris. Les politiques AdaPT ont ensuite été déployées sur le robot humanoïde grand format Dobot Atom (1,7 mètre), capable de servir en conditions réelles sans capture de mouvement, avec vidéos et code publiés sur le site du projet. Ce résultat illustre concrètement la possibilité de transférer un mouvement stylisé et physiquement exigeant, appris depuis de simples vidéos, vers un robot humanoïde grande taille opérant sans motion capture ni environnement contrôlé, un enjeu central pour l'industrie face au fossé habituel entre démonstrations et performance réelle. Il faut toutefois le lire comme un résultat de recherche académique et non comme un produit commercialisé : aucune annonce de volumes, de prix ni de partenariat industriel n'accompagne la publication, et les essais restent limités en nombre. La méthode elle-même dépasse le seul tennis, puisqu'elle traite un problème plus général, générer des mouvements stylistiques complexes sans sacrifier la performance de la tâche, pertinent pour toute application humanoïde exigeant dextérité et fluidité. Ce travail s'inscrit dans une vague récente de recherches sur des humanoïdes jouant à des sports de balle, un domaine où plusieurs laboratoires ont récemment montré des frappes ou services au tennis, badminton ou ping-pong, souvent via des architectures de type VLA ou du renforcement pur. AdaPT se distingue par la combinaison d'une imitation de style issue de vidéos de diffusion et d'une architecture planificateur/tracker pensée spécifiquement pour limiter la dégradation lors du transfert simulation-réel. Les tests ont porté sur deux plateformes, le Unitree G1, standard courant en recherche sur la locomotion, et le Dobot Atom, humanoïde grand format du fabricant chinois Dobot. Les auteurs n'annoncent aucun calendrier de pilote commercial, se limitant à publier code et vidéos et à souligner des enseignements algorithmiques et d'ingénierie pour de futurs systèmes humanoïdes sportifs.

RecherchePaper
1 source
Les robots humanoïdes plient, ramassent et manipulent des objets fragiles avec plus de précision grâce à une nouvelle technologie
3Interesting Engineering 

Les robots humanoïdes plient, ramassent et manipulent des objets fragiles avec plus de précision grâce à une nouvelle technologie

Des chercheurs de Carnegie Mellon University (CMU) et du Bosch Center for AI ont publié un nouveau système d'IA baptisé HTD (Humanoid Transformer with Touch Dreaming), conçu pour améliorer la manipulation d'objets par des robots humanoïdes dans des environnements à contact complexe. Le framework combine l'apprentissage par imitation avec un module de prédiction tactile, permettant au robot d'anticiper l'évolution des forces de contact et du retour haptique avant et pendant la saisie. Testé sur cinq tâches réelles, insertion d'objet en T, rangement de livres, pliage de serviette, ramassage de litière et service du thé, HTD affiche une amélioration relative de 90,9 % du taux de réussite moyen par rapport à la baseline ACT, un modèle d'imitation de référence dans le domaine. Le système repose sur une architecture dissociée : un contrôleur bas-corps entraîné par renforcement en simulation via une méthode teacher-student stabilise l'orientation du torse, la vitesse et l'équilibre, tandis que la cinématique inverse et le retargeting de main gèrent les mouvements du haut du corps et la dextérité digitale. Les représentations tactiles ne sont pas reconstruites brutes mais encodées dans un espace latent compact via un réseau cible mis à jour lentement, ce qui filtre le bruit sensoriel et améliore la stabilité de la manipulation. Ce résultat est notable parce qu'il adresse directement l'un des verrous persistants de la robotique humanoïde : la cohabitation entre locomotion et manipulation fine sans dégradation mutuelle. La séparation architecturale bas/haut corps n'est pas nouvelle en soi, mais son intégration avec un modèle prédictif tactile dans une politique unifiée évite le recours à un pré-entraînement tactile séparé ou à un world model externe, ce qui simplifie le pipeline de déploiement. Les études d'ablation sont particulièrement instructives : incorporer le toucher comme entrée brute supplémentaire ne suffit pas, la prédiction dans l'espace latent apporte 30 % de gain relatif supplémentaire sur le raw tactile. Pour les intégrateurs qui envisagent des humanoïdes dans des cellules de manutention délicate, c'est un signal clair que la qualité de la représentation sensorielle prime sur la quantité de capteurs. HTD s'inscrit dans une vague de travaux cherchant à combler le sim-to-real gap pour la manipulation contact-riche. Le controller bas-corps a été entraîné sur le dataset AMASS, qui fournit des mouvements humains réalistes pour perturber le torse pendant l'apprentissage, une approche de robustification déjà utilisée dans des projets comme Isaac Lab de NVIDIA ou les travaux de Stanford sur whole-body control. Dans le paysage concurrentiel, Figure (Figure 03), Physical Intelligence (Pi-0), Boston Dynamics et 1X Technologies travaillent tous sur des architectures VLA (Vision-Language-Action) pour la manipulation généraliste, mais peu publient des résultats quantitatifs sur des tâches aussi précises que l'insertion de connecteurs ou la manipulation de textiles. CMU n'a pas encore annoncé de partenariat industriel ni de calendrier de transfert vers un produit commercial, mais le Bosch Center for AI comme co-auteur suggère un intérêt applicatif concret dans l'automatisation industrielle à manipulation variable.

UELe Bosch Center for AI (Allemagne) co-auteur du papier signale un intérêt applicatif concret pour l'automatisation industrielle européenne à manipulation variable, sans calendrier de transfert industriel annoncé.

RechercheOpinion
1 source
Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation
4Interesting Engineering 

Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation

Galbot, entreprise chinoise de robotique, a dévoilé RoboGesture, un framework destiné à générer en temps réel des gestes synchronisés avec la parole pour les robots humanoïdes. Développé avec des chercheurs de l'université Tsinghua, de l'université de Pékin, du Beijing Institute of Technology, du Harbin Institute of Technology et du Shanghai Qi Zhi Institute, le système sera présenté à l'European Conference on Computer Vision (ECCV) 2026. Annoncé le 5 septembre 2026 sur le compte X de Galbot, RoboGesture ferme la boucle écoute-réponse-geste en environ deux secondes. Le système convertit la parole entrante en tokens audio via le codec Mimi, puis analyse le signal à plusieurs niveaux : les caractéristiques de bas niveau captent le rythme et les variations de ton, tandis que les couches plus profondes extraient le sens sémantique. La composante sémantique a été entraînée sur 300 catégories de gestes. Les signaux sont ensuite transmis à un modèle de génération de mouvement fondé sur un transformer à diffusion, qui produit des trajectoires dans un espace de mouvement continu plutôt que des commandes fixes, permettant un enchaînement fluide des gestes. Cette annonce vise une limite récurrente des robots humanoïdes commerciaux : des mouvements souvent perçus comme mécaniques, répétitifs ou déconnectés du discours, un défaut qui nuit à l'acceptation des robots dans des rôles d'accueil, de guide ou d'assistance sociale. Les chercheurs affirment s'attaquer à trois obstacles concrets : le manque de données d'entraînement, la difficulté à relier la parole au mouvement approprié, et les risques de sécurité lorsque des gestes générés par IA sont transférés à un robot physique. Ils identifient également un problème baptisé « éclipse de modalité », où le modèle se met à répéter des gestes issus de ses mouvements précédents au lieu de réagir à la nouvelle parole ; une méthode de guidage nommée Anti-Inertia classifier-free guidance masking est présentée comme correctif. Ces travaux restent toutefois au stade de la recherche académique : la démonstration diffusée sur X ne constitue pas une validation indépendante, et aucun chiffre de déploiement, de coût ou de robustesse en conditions réelles n'est fourni, ce qui invite à la prudence sur la portée réelle du système hors laboratoire. Galbot s'inscrit dans la vague des start-up chinoises de robotique généraliste qui, comme leurs homologues américaines telles que Figure avec son modèle Figure 03, Tesla avec Optimus, ou les initiatives fondées sur des modèles VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, cherchent à doter les humanoïdes de capacités de manipulation et de perception avancées. RoboGesture se distingue en ciblant spécifiquement la communication non verbale plutôt que la manipulation ou la locomotion, un axe encore peu exploré par une concurrence surtout focalisée sur les tâches industrielles ou logistiques. La présentation prévue à l'ECCV 2026, conférence académique de référence en vision par ordinateur, signale une publication scientifique plutôt qu'un lancement commercial : l'article ne mentionne ni pilote annoncé, ni calendrier de déploiement, ni partenaire industriel identifié à ce stade.

RecherchePaper
1 source