Aller au contenu principal

Dossier Unitree — page 3

477 articles · page 3 sur 10

Unitree, l'humanoïde et quadrupède chinois low-cost : G1, H1, R1, prix grand public sur AliExpress, démonstrations agressives en vidéo et impact sur les concurrents premium.

101arXiv cs.RO RecherchePaper

Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D

Une équipe de recherche présente un framework open source de navigation sémantique piloté par le langage naturel pour robots mobiles, publié sur arXiv (2607.13624v1). Le système, bâti sur des composants modulaires ROS 2, traduit des requêtes en langage naturel comme "va vers la boîte aux lettres" en objectifs de navigation exécutables. Concrètement, le pipeline identifie l'objet cible mentionné dans la phrase, estime sa position dans l'espace à partir de données RGB-D, puis génère un point de navigation transmis à la pile Nav2 de ROS 2 pour l'exécution autonome. Les auteurs ont validé l'approche à la fois en simulation et en conditions réelles, sur deux plateformes distinctes : un TurtleBot3 Waffle et un Unitree Go2 équipé d'une caméra RealSense. Le code sera publié en open source après acceptation de l'article. Cette architecture illustre une tendance de fond dans la robotique mobile : le passage d'une navigation pilotée par coordonnées ou par carte à une navigation pilotée par l'intention exprimée en langage naturel, sans expertise technique requise de l'utilisateur. Pour les intégrateurs, l'intérêt réside moins dans la performance brute que dans la portabilité : en s'appuyant sur ROS 2 et sur des topics et services standardisés, le framework promet une adaptation à différentes plateformes robotiques via une simple reconfiguration plutôt qu'un développement spécifique par robot. Le système va au-delà des commandes directes en interprétant aussi des requêtes contextuelles et en générant du feedback en langage naturel, deux capacités clés pour une interaction homme-robot fluide dans des environnements domestiques ou logistiques où les utilisateurs finaux ne sont pas des opérateurs formés. Ce travail s'inscrit dans la vague plus large des architectures vision-langage-action qui traversent la robotique depuis l'essor de modèles comme Pi-0 ou GR00T N2, même si ceux-ci ciblent surtout la manipulation plutôt que la navigation pure. Plutôt qu'une approche end-to-end déléguant tout le raisonnement à un modèle unique, les auteurs optent pour une architecture modulaire combinant perception RGB-D, compréhension du langage et planification via Nav2, une pile de navigation déjà largement adoptée dans l'écosystème ROS 2 académique et industriel. L'ambition de portabilité multi-plateforme et la publication annoncée du code positionnent ce travail comme une brique réutilisable plutôt qu'une démonstration isolée, même si, à ce stade, rien n'indique un calendrier de diffusion précis ni des tests en environnements plus complexes ou à grande échelle.

1 source
102arXiv cs.RO 

TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact

Cette étude, publiée sur arXiv en juillet 2026, présente TAC-LOCO, un cadre d'apprentissage par renforcement qui unifie pour la première fois le contrôle corporel complet d'un robot quadrupède doté d'un bras manipulateur en intégrant un retour tactile dans la boucle de commande. Le système encode les données d'un réseau de capteurs tactiles montés sur une pince compliante en une représentation latente compacte, fusionnée avec la proprioception du robot pour piloter simultanément les pattes, le bras et la pince. Les chercheurs ont déployé la politique sans réentraînement supplémentaire (zero-shot) sur un quadrupède Unitree Go2 équipé d'un bras Interbotix WidowX 250 et d'une pince tactile. Les résultats chiffrés sont précis : une réduction de 47% de la force de préhension appliquée et un taux de chute d'objet inférieur à 1%, y compris lors de changements de charge progressifs et de relâchements brusques. L'apport principal tient à ce que le système régule activement la force de préhension en fonction de l'interaction physique réelle, plutôt que de simplement serrer fermement l'objet comme le font la plupart des approches existantes en loco-manipulation dynamique. Pour l'industrie robotique, cela répond à une limite concrète des robots à pattes actuels : la capacité à transporter des charges tout en se déplaçant dynamiquement sans les endommager ni les laisser tomber, un enjeu direct pour la logistique, l'inspection industrielle ou les interventions en environnement non structuré. Ce résultat illustre aussi que l'intégration tactile n'est plus cantonnée aux tâches de manipulation statique en laboratoire, mais devient exploitable dans des scénarios de contrôle corporel complet à haute dynamique, un signal notable pour les intégrateurs qui évaluent la maturité des architectures VLA et RL appliquées à la robotique mobile. Le travail s'inscrit dans la continuité des recherches sur la loco-manipulation, un domaine où la coordination entre stabilité locomotrice et précision de manipulation reste un défi ouvert, généralement traité sans capteurs tactiles faute de méthodes robustes pour exploiter ce signal en temps réel. TAC-LOCO se positionne ainsi face aux approches de contrôle corporel complet sans tactile, en démontrant un gain mesurable sur la robustesse aux perturbations externes. La validation reste toutefois limitée à une plateforme de recherche (Go2 plus bras WidowX), sans indication de calendrier vers un déploiement industriel ou une plateforme commerciale.

RecherchePaper
1 source
103Interesting Engineering 

Regardez : le premier modèle d'IA nativement incarnée promet des robots plus intelligents et plus performants

Robbyant, filiale d'intelligence artificielle incarnée du groupe chinois Ant Group (maison mère d'Alipay), a présenté LingBot-VA 2.0, un modèle de monde vidéo-action que l'entreprise qualifie de premier du secteur conçu nativement pour la robotique plutôt qu'adapté de systèmes de génération vidéo destinés au contenu numérique. Le modèle repose sur une architecture autorégressive entraînée depuis zéro : il prédit comment les actions d'un robot modifient son environnement, puis choisit l'action suivante à partir de ces relations causales. Robbyant met en avant quatre innovations : un tokenizer visuel-action sémantique compressant conjointement image et action, un pré-entraînement causal strict garantissant l'ordre temporel des prédictions, une architecture Mixture of Experts augmentant la capacité sans alourdir l'inférence, et un mécanisme d'inférence asynchrone qui recale en continu les prédictions sur les observations réelles pendant l'exécution. Selon l'entreprise, cette combinaison permet un contrôle en boucle fermée à 150 Hz sur un seul GPU, et le modèle s'adapte à une nouvelle tâche de manipulation avec seulement 20 démonstrations, par apprentissage en contexte, sans réentraînement. Robbyant a montré le système sur des tâches longues et précises : préparer un petit-déjeuner, déballer des colis, insérer des tubes, ramasser des vis, plier du linge, ouvrir des tiroirs. L'entreprise revendique aussi de meilleurs résultats que les méthodes existantes sur les benchmarks de simulation RoboTwin 2.0 et LIBERO. Ce lancement illustre un changement de philosophie dans les modèles fondation pour la robotique. La plupart des systèmes d'IA incarnée actuels réutilisent des modèles vidéo pensés pour générer du contenu grand public, qui privilégient qualité d'image et créativité au détriment de la précision physique et de la vitesse d'exécution. Adapter ces modèles à la robotique, selon Robbyant, dégrade la généralisation, un constat qui rejoint le débat récurrent dans le secteur des modèles vision-langage-action (VLA) sur l'écart entre démonstrations impressionnantes et fiabilité réelle. Si les chiffres avancés se confirment au-delà des vidéos sélectionnées par l'entreprise, ils positionneraient LingBot-VA 2.0 comme alternative face à des VLA généralistes comme Pi-0 ou GR00T N2, avec un argument clé pour les intégrateurs : moins de données pour déployer un nouveau geste, et un temps de cycle compatible avec du matériel limité à un seul GPU. La mémoire à long terme mise en avant, permettant de distinguer des situations visuellement identiques mais contextuellement différentes et d'exécuter des tâches multi-étapes avec comptage et répétition, répond à une limite connue des politiques robotiques actuelles sur les séquences longues. Robbyant a accéléré ses investissements en robotique humanoïde et modèles fondation physiques, dans un contexte où les groupes technologiques chinois, Ant Group mais aussi Unitree, AgiBot ou Xiaomi, intensifient la compétition face à des acteurs américains comme Figure AI ou Physical Intelligence. LingBot-VA 2.0 succède à une première version et s'inscrit dans une stratégie où l'entreprise dit vouloir accélérer le développement d'un écosystème ouvert, sans préciser de calendrier de commercialisation, de partenariats industriels ni de premiers déploiements pilotes. Pour l'instant, la démonstration reste cantonnée aux benchmarks de simulation et aux vidéos publiées par l'entreprise, sans validation indépendante en environnement de production, une réserve qui s'applique à la plupart des annonces de modèles fondation robotiques cette année.

IA physiqueOpinion
1 source
Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes
104arXiv cs.RO 

Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes

ABot-C0, présenté dans un rapport technique publié sur arXiv (2607.07370), est un système généraliste de contrôle de mouvement pour robots quadrupèdes reposant sur trois piliers complémentaires. Les chercheurs ont d'abord construit une pyramide de données combinant génération vidéo conditionnelle, capture de mouvement annotée, téléopération et conception manuelle, pour produire 16 074 séquences de mouvement physiquement réalisables. Sur cette base, ils ont entraîné une politique généraliste par flow-matching qui, selon les auteurs, démontre pour la première fois une loi d'échelle pour le suivi de mouvement chez les quadrupèdes: les performances s'améliorent de façon constante avec l'augmentation des données d'entraînement, avec une capacité à suivre des mouvements inédits sans exemples spécifiques (zero-shot). Pour la locomotion sur tout-terrain, l'équipe a développé un cadre en trois étapes passant d'un contrôle privilégié à un contrôle perceptif, appuyé sur une mémoire temporelle LiDAR et une supervision prédictive du terrain. Le système a été testé en navigation autonome sur terrain urbain et en interaction multimodale de type compagnon. L'enjeu dépasse la simple démonstration technique. Contrairement aux robots humanoïdes, qui bénéficient de vastes corpus de capture de mouvement humain et d'un paradigme de motion-tracking déjà mature, les quadrupèdes souffrent d'un manque criant de données animales exploitables, et le transfert d'un squelette à un autre reste fragile. En traitant ce problème par la synthèse vidéo et une politique d'apprentissage unifiée, ce travail cherche à combler l'écart entre les deux familles de robots. La revendication centrale, faire passer les quadrupèdes de démonstrations mono-fonction à une intelligence comportementale de niveau produit, doit toutefois être lue comme une affirmation d'auteurs de papier de recherche, non comme un déploiement commercial vérifié: les expériences relatées restent des tests en conditions contrôlées ou semi-contrôlées, pas des mises en service industrielles à grande échelle. Ce travail s'inscrit dans une dynamique plus large où l'apprentissage de bout en bout par grands modèles de mouvement, déjà éprouvé sur les humanoïdes commerciaux, cherche à s'étendre aux plateformes quadrupèdes utilisées en inspection, sécurité ou logistique, un segment où des acteurs comme Unitree, ANYbotics ou Boston Dynamics dominent aujourd'hui avec des commandes plus classiques. En s'appuyant sur des données synthétiques plutôt que sur la capture animale, coûteuse et rare, les auteurs ouvrent une piste pour industrialiser l'entraînement de ces robots. Aucune date de déploiement commercial ni partenaire industriel n'est mentionnée dans ce rapport, qui reste à ce stade une contribution académique destinée à être suivie par d'autres itérations.

RecherchePaper
1 source
Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines
105Interesting Engineering 

Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines

La startup française UMA a dévoilé le design de son premier robot humanoïde alimenté par IA lors du Machina Summit à Paris. L'engin affiche des proportions à taille humaine, une visière neutre en guise de visage plutôt qu'un visage anthropomorphe, et des articulations mécaniques volontairement visibles. UMA vise en priorité les usines, les entrepôts et les centres logistiques, avec un usage domestique envisagé à terme, et fait de l'Europe son premier marché de déploiement. La société a présenté en parallèle son architecture "Real-Time Learning", un système d'IA qui permet au robot d'apprendre de nouvelles tâches par démonstration humaine plutôt que par programmation manuelle : il observe une tâche, s'entraîne, s'adapte aux conditions changeantes et améliore ses performances avec l'expérience. Aucune spécification technique détaillée (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade. "Les robots humanoïdes mettront des années à atteindre un déploiement à grande échelle, tout comme Internet et les smartphones ont eu besoin de temps avant de transformer des industries entières", a déclaré Rémi Cadène, PDG et cofondateur d'UMA. L'annonce intervient peu après le dévoilement par l'américain Weave Robotics de son robot domestique Isaac 1, capable de ranger une pièce ou faire la lessive avec assistance humaine à distance. Pour les intégrateurs et décideurs industriels, ce pari sur l'apprentissage par démonstration illustre un basculement plus large du secteur : remplacer la programmation tâche par tâche par des modèles capables de généraliser, la même logique que poursuivent les architectures VLA (vision-language-action) de Physical Intelligence ou de NVIDIA. Si la promesse tient, elle réduirait le temps et le coût d'intégration d'un robot dans une chaîne existante, un frein majeur à l'adoption des humanoïdes en usine. Il faut toutefois noter qu'UMA n'a pour l'instant montré qu'un design et un concept d'architecture, sans vidéo de démonstration ni métrique de performance vérifiable : il s'agit d'une annonce de positionnement, pas d'un produit livré ni d'un déploiement réel. Le choix explicite d'une visière neutre plutôt qu'un visage humain, et l'exposition volontaire des articulations, traduit une volonté de se démarquer des démonstrations spectaculaires façon Tesla Optimus ou Figure, au profit d'un discours centré sur la fiabilité industrielle de long terme plutôt que sur l'effet de démonstration publique. UMA a été cofondée par Rémi Cadène, connu pour avoir dirigé le projet LeRobot chez Hugging Face, une bibliothèque open-source d'apprentissage par imitation qui a contribué à démocratiser l'entraînement de robots par démonstration, un héritage direct dans l'architecture Real-Time Learning présentée aujourd'hui. La startup entre sur un marché déjà occupé par les géants américains (Tesla avec Optimus, Figure et son modèle Helix, Physical Intelligence avec Pi-0) et chinois (Unitree, UBTech), ainsi que par des humanoïdes grand public comme Isaac 1 de Weave Robotics. Face à cette concurrence, UMA mise sur l'écosystème industriel et de recherche européen ainsi que sur la pénurie de main-d'œuvre du continent pour justifier son positionnement. Aucun calendrier précis de commercialisation ni de pilotes clients n'a été communiqué au-delà de cette présentation du design, ce qui laisse ouverte la question du délai entre ce concept et un déploiement industriel effectif.

UEUMA est une startup française qui fait de l'Europe son premier marché de déploiement pour un robot humanoïde industriel, renforçant l'écosystème robotique franco-européen face à la concurrence américaine et chinoise.

FR/EU ecosystemeOpinion
1 source
UBTECH : ses robots humanoïdes grandeur nature ne tiennent que deux à quatre heures, batterie du U1 critiquée
106TechNode 

UBTECH : ses robots humanoïdes grandeur nature ne tiennent que deux à quatre heures, batterie du U1 critiquée

UBTECH a dévoilé son robot humanoïde grande taille U1, dont la version masculine haut de gamme U1 Ultra est commercialisée à 990 000 yuans, soit environ 146 000 dollars. L'annonce a surtout été retenue pour un point critiqué : une autonomie de batterie limitée à deux à quatre heures, jugée insuffisante par certains observateurs pour un usage prolongé, notamment nocturne. Face aux critiques, UBTECH a répondu que cette autonomie correspond au standard actuel de l'industrie pour les humanoïdes grande taille, et non à une faiblesse propre au U1. L'entreprise a par ailleurs positionné le robot comme un "compagnon émotionnel", une orientation qu'elle dit soutenue par les autorités chinoises, tout en évitant explicitement de le présenter comme un partenaire romantique ou un substitut de conjoint. Cette réponse illustre un problème structurel de la robotique humanoïde grande taille : l'autonomie énergétique reste le goulot d'étranglement technique majeur, bien avant la marche bipède ou la manipulation fine. Si deux à quatre heures constituent effectivement la norme du secteur, cela questionne la viabilité commerciale immédiate de robots vendus comme compagnons du quotidien plutôt que comme démonstrateurs technologiques, un écart entre promesse marketing et réalité d'usage que l'on retrouve chez plusieurs acteurs du segment. UBTECH, société basée à Shenzhen et cotée à Hong Kong, s'est imposée ces dernières années comme un pionnier chinois de la commercialisation industrielle des humanoïdes, notamment via sa gamme Walker déployée chez des industriels comme Foxconn. Le U1 marque une bascule vers un positionnement grand public et affectif, dans un marché chinois où Unitree, Fourier Intelligence ou AgiBot rivalisent également, aux côtés d'acteurs occidentaux comme Tesla ou Figure confrontés aux mêmes limites d'autonomie.

HumanoïdesOpinion
1 source
74 yuans pour 3 heures : des robots à IA incarnée entrent dans les foyers chinois pour les tâches ménagères
107Pandaily 

74 yuans pour 3 heures : des robots à IA incarnée entrent dans les foyers chinois pour les tâches ménagères

En Chine, les robots à intelligence artificielle incarnée sortent des usines pour entrer dans les foyers, sous forme de location à l'heure pour des tâches ménagères. Plusieurs plateformes à la demande proposent désormais des robots humanoïdes ou à roues capables de nettoyer les sols, essuyer les surfaces, récupérer des objets ou effectuer de petites tâches de rangement, pour un tarif de départ de 74 yuans les trois heures, soit environ 25 yuans de l'heure (un peu plus de 3 euros). Ces machines s'appuient sur des modèles vision-langage-action pour naviguer de façon autonome dans un environnement domestique, éviter les obstacles, reconnaître des objets et répondre à des commandes vocales simples. C'est l'un des premiers déploiements commerciaux réels de l'IA incarnée en dehors du cadre industriel, après des investissements en R&D chiffrés en milliards de yuans. Ce tarif rend la main-d'œuvre robotique moins chère que le personnel de ménage humain dans les grandes villes chinoises, mais l'écart de capacités reste net : les retours d'utilisateurs montrent que ces robots gèrent correctement les tâches de nettoyage simples, tout en peinant face aux objets de forme irrégulière, aux instructions à plusieurs étapes et aux espaces exigus typiques des appartements chinois. Le compromis est assumé, fonctionnalités limitées contre accessibilité tarifaire, et il interroge la trajectoire des investissements massifs consacrés à l'IA incarnée en Chine. Des entreprises comme Unitree, AgiBot, Star Dynasty ou X Square Robot ont levé des fonds considérables pour des robots humanoïdes généralistes, alors que le premier vrai marché de masse concerne des robots de service bien plus spécialisés et modestes. Les défenseurs de l'approche avancent toutefois que ce déploiement réel, même limité, génère des données précieuses pour entraîner les modèles de nouvelle génération, des données que la simulation en laboratoire ne peut reproduire : agencements imprévus, objets variés, comportements d'utilisateurs divers. Cette stratégie rappelle celle des entreprises chinoises de conduite autonome, qui ont déployé des fonctions de conduite partiellement automatisée des années avant d'atteindre une autonomie complète, misant sur l'accumulation de données réelles plutôt que sur l'attente d'une technologie parfaite. Les analystes du secteur anticipent une expansion rapide du marché de la location de robots domestiques à mesure que les coûts baissent et que les capacités progressent, plusieurs acteurs chinois développant déjà des modèles de nouvelle génération optimisés pour l'environnement du foyer, avec une meilleure dextérité pour manipuler de petits objets et une compréhension plus fine des instructions complexes. Reste une question ouverte : ce modèle de facturation à la tâche, encore marginal, pourra-t-il générer des revenus suffisants pour justifier l'ampleur des investissements déjà engagés dans l'infrastructure de l'IA incarnée.

Chine/AsieActu
1 source
RoboCup2026 : la ligue humanoïde, jour 2
108Robohub 

RoboCup2026 : la ligue humanoïde, jour 2

La deuxieme journee de la RoboCup 2026 s'est achevee sur une nouvelle serie de matchs dans la ligue de football humanoide, avec 17 pays representes cette annee, de la Colombie a la Malaisie en passant par l'Allemagne et l'Australie. La Chine reste le pays le plus present avec 15 equipes reparties sur les trois divisions (petite, moyenne et grande taille). La journee de la veille a connu le premier carton rouge de la competition: un robot, deja averti de deux cartons jaunes pour des tacles dangereux, a ete exclu du terrain pour des raisons de securite. Cote gabarits, le robot ALICE 4 de l'equipe HERoEHS (Coree du Sud) est le plus lourd et le plus grand du plateau, avec 48 kg pour 1,60 m, devant le Z4 bipede de BigHeroX (37 kg). Plusieurs equipes alignent le Unitree G1, plateforme de 35 kg devenue une base commune. A l'oppose, le robot Chape de l'equipe bresilienne ITAndroids est le plus leger et le plus petit du tournoi, avec seulement 3,8 kg pour 53 cm. Ces chiffres illustrent la maturite grandissante du football humanoide comme banc d'essai pour la robotique bipede: coexistence de plateformes commerciales standardisees comme le Unitree G1 et de robots concus sur mesure, allant du quasi-jouet a des machines proches de la taille humaine. L'apparition d'un carton rouge pour tacle dangereux souligne aussi que les organisateurs traitent desormais la securite physique entre robots comme un enjeu de regle sportive a part entiere, signe que les comportements dynamiques et les contacts deviennent suffisamment realistes pour poser un risque concret. Pour les equipes de recherche et les integrateurs qui suivent ces competitions comme indicateur de l'etat de l'art en locomotion et en prise de decision autonome, la densite du plateau (17 pays, dominance chinoise) confirme aussi l'internationalisation rapide du secteur. Avec les tours de qualification presque termines, les competitions se resserrent. En petite division, CAU Mountain&Sea (China Agricultural University) reste seule invaincue apres quatre matchs, 12 points, un seul but concede, devant Hamburg Bit-Bots et GeoHBots. En division moyenne, B-Human domine avec quatre victoires et une difference de buts de +35, suivie par un groupe de quatre equipes a neuf points: HTWK Robots, Rhoban, whIRLwind Amsterdam et THMOS. En grande division, Tsinghua Hephaestus reste la seule equipe parfaite avec neuf points, devant PCMS-HRG et Robo-Erectus. Douze equipes par division se qualifieront pour les phases finales, dont les quarts de finale se disputeront des le lendemain soir.

UEL'equipe francaise Rhoban figure parmi les equipes de tete de la division moyenne, aux cotes d'equipes allemandes et neerlandaises, illustrant la vitalite de la recherche europeenne en robotique bipede lors de cette competition internationale.

FR/EU ecosystemePaper
1 source
Tech Giants se ruent vers l'intelligence incarnée alors que la bataille s'intensifie
109Pandaily 

Tech Giants se ruent vers l'intelligence incarnée alors que la bataille s'intensifie

Li Auto, Alibaba et ByteDance viennent d'annoncer leur entrée dans l'intelligence incarnée (embodied intelligence), signe que la bataille chinoise des robots humanoïdes s'intensifie. Li Auto a dévoilé son projet de véhicules à intelligence incarnée, Alibaba a lancé sa série de modèles fondation Qwen-Robot dédiée à la robotique, et ByteDance a restructuré sa division IA Seed pour en faire une activité stratégique centrale. Morgan Stanley prévoit 28 000 ventes de robots humanoïdes en Chine en 2026, soit une hausse de 133% sur un an, avec une projection à 2,6 millions d'unités d'ici 2035. Roland Berger estime que le marché de la robotique chez les constructeurs automobiles pourrait atteindre 750 milliards de dollars en 2035, puis 4 000 milliards en 2050, une échelle comparable à celle de l'industrie automobile elle-même. Le financement suit la même dynamique: selon IT Orange, entre juillet 2025 et juin 2026, le marché primaire chinois a enregistré 503 levées de fonds dans l'intelligence incarnée, pour un total dépassant 96 milliards de yuans (environ 12,4 milliards d'euros). Une vingtaine d'entreprises du secteur, dont Unitree, AgiBot et Galaxy General, ont annoncé des projets d'introduction en bourse. Cette ruée signale un changement de nature dans la course aux humanoïdes: elle passe du stade de la démonstration technologique à celui de l'infrastructure industrielle, avec les géants du numérique chinois (Alibaba, Tencent, ByteDance) qui se positionnent comme fournisseurs de modèles fondation plutôt que comme simples investisseurs. Le rapprochement avec l'automobile est particulièrement révélateur: les chaînes d'approvisionnement des véhicules électriques (capteurs, systèmes de décision, actionneurs, pipelines de données) sont directement réutilisables pour développer des robots humanoïdes, ce qui explique l'entrée de constructeurs comme Li Auto. Son PDG Li Xiang décrit d'ailleurs le véhicule à intelligence incarnée comme un produit "quatre-en-un": voiture électrique, chauffeur professionnel, ordinateur IA et assistant de vie. Mais l'engouement financier masque un secteur encore très jeune: Unitree, pourtant leader reconnu, ne détient que 262 brevets, dont 20 seulement sont des brevets d'invention fondamentaux, ce qui indique qu'aucune barrière technologique durable n'est encore établie. La compétition reste ouverte à de nouveaux entrants, comme l'a montré le récent semi-marathon de robots humanoïdes, remporté de manière inattendue par Honor Robot face à des acteurs plus établis. Cette effervescence chinoise s'inscrit dans un mouvement mondial où startups spécialisées (Figure, Agility) et laboratoires de modèles VLA (comme ceux derrière GR00T ou Helix) rivalisent également pour dominer la prochaine génération de robots généralistes. Pour l'instant, la Chine mise sur une convergence entre capitaux, industrie automobile et plateformes technologiques pour accélérer le déploiement, avec des étapes clés à surveiller: les premières introductions en bourse du secteur, les objectifs de vente 2026, et la concrétisation ou non des promesses de véhicules à intelligence incarnée de Li Auto.

Chine/AsieOpinion
1 source
UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée
110Interesting Engineering 

UBTech déploie ses robots humanoïdes pour contrôler les foules à une frontière internationale chinoise très fréquentée

La Chine a commencé à déployer des robots humanoïdes au poste-frontière de Fangchenggang, dans la région du Guangxi, l'un des points de passage les plus fréquentés avec le Vietnam. Le site, qui englobe le port de Dongzhong et celui de Dongxing voisin, gère un trafic quotidien important de camions de fret, de bus et de voyageurs, générant des embouteillages lors des contrôles douaniers. Les autorités frontalières ont acheté des robots Walker S2 du fabricant chinois UBTech Robotics dans le cadre d'un contrat évalué à environ 40 millions de dollars, sans préciser le nombre d'unités commandées ; les premières livraisons ont débuté pour un déploiement dans les hubs de transit clés. Le Walker S2 mesure 1,76 mètre, dispose de 52 degrés de liberté et peut soulever jusqu'à 15 kg par bras grâce à des mains articulées dextres. Il embarque un système de double batterie interchangeable pour un fonctionnement quasi continu, ainsi qu'une pile logicielle baptisée BrainNet 2.0 couplée à une vision stéréo binoculaire pour la navigation autonome et l'équilibre dynamique. Dans le terminal passagers, les robots détectent les engorgements de foule, orientent les voyageurs vers des files organisées et répondent en plusieurs langues aux questions sur les procédures douanières. Côté fret, d'autres unités scannent codes-barres, numéros de série et manifestes numériques sur les conteneurs, puis transmettent les données croisées avec les bases douanières à des agents humains pour validation. UBTech a par ailleurs présenté récemment sa gamme UWORLD U1, décrite par l'entreprise comme la première ligne de robots humanoïdes « ultra-bioniques » grandeur nature conçue pour la production de masse, une affirmation qui reste à vérifier à l'échelle industrielle. Ce déploiement constitue un test grandeur nature bien plus exigeant que les usines contrôlées où évoluent habituellement les humanoïdes commerciaux : humidité côtière, poussière, intempéries et flux constant de voyageurs et de véhicules. C'est précisément ce type d'épreuve qui permettra de juger si la robotique humanoïde a dépassé le stade de la démonstration scénarisée pour tenir dans la durée en conditions réelles, l'écart entre promesse et réalité restant l'un des points de friction majeurs du secteur. Pour les intégrateurs et décideurs industriels, l'enjeu dépasse le seul cas d'usage douanier : Pékin présente explicitement ce projet comme un pilote susceptible de s'étendre aux aéroports, gares ferroviaires internationales et ports maritimes si les résultats sont concluants, ce qui en ferait un cas d'école pour l'automatisation des services publics à grande échelle. Le déploiement soulève aussi des questions pratiques et juridiques non résolues : le temps d'adaptation des voyageurs face à des machines assurant des tâches de service et de sécurité, et la répartition des responsabilités en cas d'erreur opérationnelle d'un robot lors d'une inspection ou d'un contrôle. Les tâches critiques de sécurité et les décisions relevant des forces de l'ordre restent, en l'état, hors du périmètre confié aux machines. Le contrat de Fangchenggang s'inscrit dans la stratégie plus large de la Chine visant à accélérer l'adoption de l'IA et de la robotique dans les infrastructures publiques, un axe porté à la fois par les autorités locales et par la politique industrielle nationale de soutien aux acteurs de la robotique humanoïde comme UBTech, Unitree ou AgiBot. UBTech a construit sa position sur des contrats industriels et logistiques avant d'étendre le Walker S2 à des environnements publics, une trajectoire distincte de celle d'acteurs américains comme Figure (Figure 03, associé au modèle Helix) ou Tesla (Optimus Gen 3), encore essentiellement cantonnés à des pilotes en usine, tandis que des plateformes comme GR00T N2 de Nvidia ou Pi-0 continuent de viser l'apprentissage générique de tâches de manipulation plutôt que le déploiement en environnement public. La suite dépendra des résultats du pilote de Fangchenggang : en cas de fiabilité démontrée sur la durée, les autorités chinoises ont indiqué vouloir étendre le concept à d'autres points d'entrée internationaux, faisant de ce poste-frontière un banc d'essai déterminant pour la robotique humanoïde appliquée aux services publics de transport.

Chine/AsieActu
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
111arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

UELe code et le dataset open-source pourraient être exploités par des équipes de recherche européennes travaillant sur la navigation de robots à pattes (ex. ANYbotics en Suisse, labos SLAM EU), mais aucun acteur français ou européen n'est directement impliqué dans les travaux.

RecherchePaper
1 source
Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique
112arXiv cs.RO 

Vers un raisonnement par trace spatiale dans les modèles vision-langage pour la robotique

Une équipe de chercheurs présente RoboTracer, un modèle de vision-langage (VLM) 3D permettant aux robots de tracer des trajectoires dans l'espace physique en raisonnant sur des mesures métriques concrètes. Publié en version 3 sur arXiv (2512.13660, décembre 2025), le système combine référencement spatial 3D et mesure de distance via un encodeur universel et un décodeur à supervision par régression, affiné d'abord en apprentissage supervisé (SFT) puis par renforcement (RFT) avec des récompenses intermédiaires sensibles aux métriques. Le dataset d'entraînement TraceSpatial regroupe 30 millions de paires question-réponse sur scènes intérieures, extérieures et de manipulation, avec des chaînes de raisonnement atteignant 9 étapes. Sur le benchmark TraceSpatial-Bench introduit par les auteurs, RoboTracer atteint 79,1 % de taux de succès moyen et dépasse Gemini-2.5-Pro de 36 points de précision. Le système a été validé sur bras UR5 (Universal Robots) et humanoïde G1 (Unitree) dans des scènes réelles encombrées. La contribution principale tient dans le raisonnement métrique, une capacité absente des VLM classiques : décrire une scène en langage naturel ne suffit pas pour estimer qu'un obstacle se trouve à 0,47 m à gauche, information nécessaire à toute trajectoire exécutable. L'approche RFT avec récompenses de processus supervise les étapes perceptuelles intermédiaires et non uniquement le résultat final, ce qui réduit concrètement l'écart entre compréhension sémantique et exécution physique (le demo-to-reality gap). Pour un intégrateur ou un COO industriel, cela signifie un robot capable d'opérer dans des espaces non cartographiés à l'avance. L'avance de 36 % sur Gemini-2.5-Pro est notable, même si ce modèle n'est pas conçu pour la robotique embarquée. RoboTracer s'inscrit dans la compétition autour des modèles VLA (Vision-Language-Action), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA, qui cherchent tous à unifier perception, raisonnement et action dans un modèle unique. Sa spécificité est l'accent sur la conscience métrique plutôt que sur le contrôle moteur fin, niche où Pi-0 reste dominant. Le choix des plateformes UR5 (bras industriel 6 axes, référence en intégration industrielle) et G1 (humanoïde Unitree, 43 degrés de liberté, environ 35 000 $) renforce la crédibilité de la généralisation multi-robots. À ce stade, il s'agit d'un résultat de recherche sans déploiement commercial annoncé ; la publication du dataset TraceSpatial et du benchmark ouvert constitue en revanche une infrastructure réutilisable directement par la communauté robotique.

UELe dataset TraceSpatial et le benchmark ouvert sont librement accessibles aux laboratoires européens de robotique, mais aucun acteur ou déploiement européen n'est impliqué dans cette contribution.

IA physiqueOpinion
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
113arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs
114arXiv cs.RO 

Libérer des mouvements expressifs infinis chez les quadrupèdes via des priors vidéo génératifs

Des chercheurs ont publié le 29 juin 2026 sur arXiv (2606.28237) un pipeline nommé Uni-Mo, capable de générer automatiquement des mouvements expressifs pour robots quadrupèdes sans recourir à des animaux réels comme source de données. Le système enchaîne trois étapes : un LLM produit des descriptions textuelles de mouvements, un modèle de diffusion vidéo synthétise les comportements correspondants sous forme de séquences visuelles, puis ces vidéos sont converties en trajectoires 3D servant à entraîner des politiques de suivi déployées sur un Unitree Go2. Pour stabiliser les générations vidéo naturellement instables sur la durée, les auteurs introduisent une "Identity Consistency Loss" qui impose une cohérence d'apparence du robot entre les frames. Le jeu de données résultant, Quad-Imaginarium (disponible en open source sur GitHub), regroupe 7 488 séquences de mouvements annotées en langage naturel, couvrant 18,5 heures de comportements acrobatiques et expressifs. Sur 392 mouvements tirés aléatoirement et testés physiquement sur un Go2 réel, le taux de succès de déploiement atteint 96,7 %, contre 97,6 % en simulation sur l'ensemble du dataset. Ce résultat est notable parce qu'il contourne une hypothèse tacite qui plombait les approches précédentes : faire passer les données de mouvement par un corps animal réel, ce qui rendait la collecte dépendante d'animaux coopératifs, la reconstruction fragile selon les espèces, et le retargeting mal posé face aux incompatibilités morphologiques. En traitant la rareté des données comme un problème de génération plutôt que de capture, Uni-Mo démontre qu'un pipeline entièrement synthétique peut atteindre un taux sim-to-real supérieur à 96 %, ce qui valide empiriquement l'hypothèse que la diffusion vidéo peut servir de simulateur comportemental crédible pour la robotique quadrupède. Pour les intégrateurs et décideurs B2B, cela signifie potentiellement une voie vers des robots compagnons ou d'inspection aux comportements riches, sans infrastructure de motion capture animale. Le champ du mouvement quadrupède expressif est dominé par des approches d'imitation sur données réelles (Boston Dynamics, ANYbotics, Unitree lui-même) ou de retargeting depuis des séquences canines capturées en laboratoire. Uni-Mo s'inscrit dans une tendance émergente qui mobilise les générateurs vidéo comme oracles de physique approximative, après des travaux similaires dans le domaine humanoïde (notamment autour de Pi-0 de Physical Intelligence et des pipelines VLA). L'Unitree Go2, robot grand public à moins de 3 000 dollars, est ici utilisé comme plateforme de validation, ce qui renforce la reproductibilité de l'approche. Les prochaines étapes probables incluent l'extension à des morphologies différentes et l'intégration de retours proprioceptifs pour fermer la boucle en temps réel.

💬 Le gros truc ici, c'est qu'ils ont retourné le problème : au lieu de capturer des mouvements sur de vrais animaux, ils les génèrent entièrement par diffusion vidéo. 96,7% de succès sur robot physique, c'est pas de la simulation flatteuse, ça valide empiriquement qu'un modèle vidéo peut servir d'oracle comportemental crédible pour la robotique quadrupède. Si tu vois ça se confirmer sur d'autres morphologies, la capture motion animale commence sérieusement à sentir la dette technique.

IA physiqueOpinion
1 source
SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement
115arXiv cs.RO 

SceneBot : suivi corps entier d'humanoïde généraliste guidé par contacts avec l'environnement

SceneBot est un cadre de contrôle pour robots humanoïdes déposé le 29 juin 2026 sur arXiv (référence 2606.27581), dont le code et les données seront entièrement publiés en open source. Le système entraîne une politique unique de reinforcement learning sur 7,5 heures de données de mouvement annotées en contacts, reconstituées depuis la motion capture humaine. SceneBot conditionne cette politique à la fois sur des mouvements de référence et sur des étiquettes de contact par segment corporel (per-link contact labels), définissant explicitement les interactions physiques attendues avec l'environnement. Le résultat est un agent humanoïde capable d'enchaîner locomotion en espace libre, franchissement de terrain irrégulier et manipulation corps entier, illustré par une tâche de référence : porter une boîte en montant un escalier. Ce que SceneBot résout est un verrou technique bien documenté : les politiques RL de locomotion humanoïde fonctionnent bien en espace libre mais échouent dès qu'un contact physique avec un objet ou une surface irrégulière est requis, car le tracking cinématique pur ne peut pas résoudre les ambiguïtés physiques de ces situations. En introduisant le "contact conditioning" comme interface de contrôle, les chercheurs montrent que 7,5 heures de données suffisent à généraliser à des mouvements et environnements non vus à l'entraînement. Pour les intégrateurs B2B et les décideurs industriels, cela suggère qu'une politique unifiée peut couvrir navigation et manipulation sans modules spécialisés distincts, et constitue une réponse partielle au "demo-to-reality gap" qui fragilise la crédibilité des annonces humanoïdes depuis plusieurs années. La contribution technique centrale est une méthode appelée "hindsight scene reconstruction" : à partir de mouvements humains retargeted, les auteurs reconstruisent après coup les graphes d'interaction avec la scène pour inférer les contacts, évitant l'annotation manuelle qui freine habituellement la constitution de tels datasets. Ce positionnement académique a des implications directes pour les développeurs de plateformes humanoïdes confrontés au même obstacle, notamment Figure AI, Agility Robotics, Unitree et Apptronik. Aucun déploiement industriel n'est annoncé à ce stade : SceneBot est une publication de recherche dont les résultats n'ont pas encore été validés sur hardware en conditions réelles, et les métriques présentées s'appuient sur des simulations et des démonstrations sélectionnées.

HumanoïdesPaper
1 source
Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace
116arXiv cs.RO 

Élagage spatio-temporel de tokens visuels conditionné par l'historique pour une navigation vision-langage efficace

Une équipe de chercheurs propose, dans un preprint arXiv (référence 2603.06480, version 2, 2026), un framework de pruning spatio-temporel des tokens visuels conçu pour réduire la latence d'inférence des modèles Vision-Language-Action (VLA) appliqués à la navigation robotique guidée par langage naturel (Vision-Language Navigation, VLN). L'approche est sans réentraînement : elle ne modifie pas les poids des modèles sources et s'intègre en plug-and-play dans tout pipeline VLA existant. Deux mécanismes la composent : une sélection spatiale des tokens sur la vue courante, pilotée par les scores d'attention interne du modèle, et une compression spatio-temporelle des mémoires visuelles historiques accumulées au fil du déplacement. Les expériences sur les benchmarks VLN standards montrent une supériorité sur les stratégies de pruning existantes, y compris sous compression extrême où la majorité des tokens sont éliminés. Un déploiement en conditions réelles sur un robot quadrupède commercial Unitree Go2 valide la fiabilité et la faible latence du suivi d'instructions. Le verrou industriel que cette méthode adresse est bien identifié : les grands modèles VLA, dont les performances sur benchmark sont désormais reconnues (Pi-0 de Physical Intelligence, GR00T N2 de Nvidia), génèrent des délais d'inférence souvent incompatibles avec un déploiement embarqué en temps réel. Ni la quantification post-training ni la distillation de modèles ne permettent d'éviter un réentraînement coûteux, ce qui freine l'industrialisation. La compatibilité plug-and-play de cette approche constitue un levier concret pour les intégrateurs souhaitant réduire le délai entre prototype de recherche et déploiement terrain, sans dépendance à l'équipe ayant entraîné le modèle source. La VLN est l'une des capacités les plus exigeantes de la robotique embodied, car elle suppose qu'un robot navigue dans un espace non balisé en interprétant des consignes verbales ambiguës et changeantes, sans cartographie prédéfinie. Le Unitree Go2, quadrupède commercialisé à moins de 20 000 dollars par Unitree Robotics (Shenzhen, Chine), s'est imposé comme un banc de test de référence dans la recherche académique grâce à son coût d'accès. Les approches concurrentes pour atténuer la latence des VLA, dont l'attention sparse et la distillation, restent plus intrusives sur les architectures sources. Les prochaines étapes logiques incluront l'extension du framework à des modèles VLA plus larges et à des scénarios de navigation longue distance en environnement extérieur non contrôlé.

💬 Les grands modèles VLA (Pi-0, GR00T...) cartonnent sur benchmark, mais tu sais ce que ça donne en temps réel sur du matériel embarqué : latence incompatible, déploiement impossible. Ce framework de pruning corrige ça sans retoucher les poids, plug-and-play, et j'aime qu'ils aient validé sur un Go2 à 20k€ plutôt que dans un labo sous vide. Pour les intégrateurs, c'est enfin une brique qui permet de passer d'un proto de recherche au terrain sans dépendre de l'équipe qui a entraîné le modèle source.

IA physiqueOpinion
1 source
RoboAtlas : SLAM actif contextuel
117arXiv cs.RO 

RoboAtlas : SLAM actif contextuel

Des chercheurs ont publié le 25 juin 2026 RoboAtlas, un framework de SLAM actif contextuel conçu pour permettre à un robot de naviguer et de cartographier un environnement inconnu tout en accomplissant des tâches sémantiques complexes. Le système s'appuie sur OpenRoboVox, une couche de cartographie 3D sémantique scalable, et pilote un robot quadrupède Unitree Go2 dans des environnements réels dépassant 1 800 m², avec environ 30 000 instances sémantiques cartographiées. Sur le benchmark GOAT-Bench "Val Unseen", RoboAtlas atteint un taux de succès (SR) de 90,6 % avec GPT-4o, soit +17,8 points de pourcentage sur le meilleur baseline précédent. Avec le modèle Qwen2.5-VL-7B, sept fois plus petit, il obtient 88,8 % SR, dépassant tous les baselines GPT-4o du benchmark. En environnement réel, le système affiche un taux de réussite de 100 % sur les tâches testées, ce qui constitue une barre haute pour ce type d'évaluation. Le résultat le plus significatif n'est pas le score absolu, mais ce qu'il révèle sur l'architecture : passer d'un VLM de 7 milliards de paramètres à GPT-4o ne fait gagner que 1,8 point, alors que retirer la couche de cartographie sémantique ferait s'effondrer les performances. Cela contredit la stratégie dominante dans les labs robotiques qui misent sur des modèles fondationnels toujours plus grands comme levier principal de robustesse. Pour un intégrateur ou un décideur B2B, la leçon est concrète : la qualité de la représentation spatiale et sémantique de l'environnement compte davantage que la puissance brute du modèle de raisonnement. RoboAtlas utilise un bandit manchot multi-bras pour arbitrer dynamiquement entre exploration frontière (cartographier l'inconnu) et navigation sémantique guidée (aller vers ce qui est déjà compris), ce qui résout élégamment le dilemme exploration-exploitation en robotique indoor. RoboAtlas s'inscrit dans la lignée des travaux sur le SLAM actif sémantique, un domaine en consolidation rapide depuis que les VLM ont rendu tractable le raisonnement sur scènes complexes. Sur le benchmark GOAT-Bench, les baselines précédents incluaient des approches modulaires classiques et des pipelines end-to-end purs, tous inférieurs de plus de 17 points. Les auteurs n'annoncent pas de déploiement commercial, et les résultats terrain portent sur un seul robot dans un cadre contrôlé : le "100% success rate" mérite d'être pondéré en conséquence. La prochaine étape naturelle est l'extension à des flottes multi-robots et à des environnements dynamiques, où la cohérence de la carte sémantique partagée reste un problème ouvert.

UEL'architecture RoboAtlas (cartographie sémantique > puissance du modèle) ouvre une piste concrète pour les labos FR/UE (INRIA, CEA-List) visant une navigation sémantique robuste sans infrastructure GPU massive.

💬 Le score à 90% sur GOAT-Bench, c'est bien. Mais le chiffre qui compte vraiment c'est 1,8 point : l'écart entre un Qwen 7B et GPT-4o dans ce système. C'est la couche de cartographie sémantique qui porte les performances, pas la puissance brute du modèle, et ça contredit frontalement ce que les grands labs s'obstinent à défendre.

IA physiquePaper
1 source
Au-delà de la topologie : une représentation en graphe des symétries morphologiques pour les politiques de locomotion
118arXiv cs.RO 

Au-delà de la topologie : une représentation en graphe des symétries morphologiques pour les politiques de locomotion

Des chercheurs présentent MS-PPO (Morphological Symmetry Proximal Policy Optimization), une architecture d'apprentissage par renforcement pour la locomotion robotique qui encode les symétries morphologiques directement dans la structure du réseau de contrôle. Ce preprint, mis à jour sur arXiv en juin 2026 (identifiant 2512.00727v2), valide l'approche sur deux plateformes commerciales d'Unitree Robotics : le quadrupède Go2 et l'humanoïde G1. À partir du graphe topologique du robot, l'algorithme augmente chaque espace d'observation et d'action avec les transformations de permutation et de signe induites par la symétrie corporelle, produisant un acteur de graphe symétrique-équivariant et un critique invariant. Quatre scénarios sont évalués : suivi de commande de vitesse, pannes asymétriques de joints, généralisation hors distribution, et déploiement zéro-shot du simulateur vers le robot physique. L'enjeu est structurel : les politiques de contrôle actuelles, MLP génériques ou réseaux de graphes (GNN), ignorent comment les grandeurs physiques se transforment symétriquement d'un membre à l'autre. Un quadrupède a quatre pattes quasi-identiques, un humanoïde a deux côtés symétriques, et cette information doit normalement être apprise empiriquement au prix de milliers d'échantillons supplémentaires. MS-PPO l'impose par construction plutôt que par reward shaping ou data augmentation, ce qui, selon les auteurs, améliore simultanément la généralisation aux symétries, la robustesse aux pannes de joints, l'efficacité d'échantillonnage et la compacité du modèle. Le résultat le plus fort reste le transfert sim-to-real zéro-shot : aucun fine-tuning sur le matériel physique, là où le reality gap demeure l'obstacle principal au déploiement industriel. À noter : l'abstract ne fournit pas de métriques chiffrées ; les gains quantifiés sont dans le corps du papier. L'exploitation des symétries en RL de locomotion est un axe de recherche actif depuis les travaux sur les réseaux équivariants et les architectures morpho-symétriques, notamment ceux d'Ordonez-Apraez et al. MS-PPO se positionne comme l'étape suivante : encoder non plus seulement la connectivité mais la physique des transformations dans le graphe. Les plateformes Go2 et G1 d'Unitree Robotics dominent les benchmarks académiques grâce à leur accessibilité commerciale et leur large base d'utilisateurs chercheurs. Aucun acteur européen n'est cité dans l'étude ; côté FR/EU, Wandercraft (Paris, humanoïdes médicaux) et PAL Robotics (Barcelone) développent leurs propres pipelines de contrôle. L'étape suivante attendue pour MS-PPO : validation sur des tâches locomotion-manipulation combinées et des déploiements longue durée hors laboratoire.

UELes laboratoires européens de contrôle locomotion (Wandercraft, PAL Robotics) pourraient appliquer MS-PPO à leurs propres plateformes, mais aucun acteur européen n'est impliqué dans l'étude.

RecherchePaper
1 source
TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur
119arXiv cs.RO 

TEXEDO : mise à l'échelle à l'inférence pour la génération de mouvements humanoïdes guidée par le langage et le contrôleur

Des chercheurs ont publié TEXEDO, un cadre d'inférence pour améliorer la génération de mouvements de robots humanoïdes guidée par texte, sans réentraîner le modèle sous-jacent. Présenté sur arXiv (2606.22998) et validé en déploiement réel sur un Unitree G1, le système génère plusieurs mouvements candidats à partir d'un prompt textuel, puis sélectionne le meilleur via un modèle de récompense à deux composantes : un vérificateur de faisabilité dynamique, distillé depuis des simulations de contrôleurs whole-body pour prédire l'exécutabilité physique, et un vérificateur d'alignement sémantique dans un espace d'embedding partagé texte-mouvement. La faisabilité physique est imposée comme contrainte dure ; l'alignement sémantique sert d'objectif de sélection parmi les candidats valides. Les résultats montrent des améliorations en fidélité de tracking et en cohérence textuelle, en simulation comme sur le G1 en conditions réelles. Ce travail adresse une limite structurelle des générateurs actuels : entraînés sur des données de mouvements humains re-ciblés vers des morphologies robotiques, ils ignorent les contraintes propres aux contrôleurs physiques réels, équilibre, dynamiques de contact, limites d'actuation, modes de défaillance spécifiques à chaque plateforme. Des mouvements "sémantiquement plausibles" s'avèrent ainsi souvent inexécutables sur le matériel, un écart bien documenté dans la communauté robotique. TEXEDO applique à la génération de mouvements le principe de "test-time compute scaling" popularisé par les LLMs de type o1 ou o3 : allouer du calcul supplémentaire à l'inférence plutôt qu'au réentraînement. Pour un intégrateur ou un ingénieur robotique, cela signifie qu'un générateur existant peut être amélioré en déploiement sans pipeline de fine-tuning coûteux, ce qui est un argument pratique solide. TEXEDO s'inscrit dans la compétition autour de la programmation des robots par langage naturel, face à des approches VLA (Vision-Language-Action) end-to-end comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La distinction clé est que TEXEDO cible exclusivement la couche de génération de mouvements, en amont du contrôleur, sans chercher à unifier perception, langage et action dans un seul modèle. Le Unitree G1, humanoïde commercial répandu dans les labos de recherche autour de 16 000 dollars, sert ici de banc de test réel, ce qui renforce la portée des résultats par rapport à des évaluations purement simulées. La suite logique serait d'étendre le cadre à d'autres plateformes humanoïdes et d'autres familles de générateurs préentraînés.

💬 Le test-time compute scaling arrive en robotique physique, et c'est une direction que j'attendais : tu peux améliorer un générateur de mouvements existant à l'inférence, sans pipeline de fine-tuning, ce que les approches VLA end-to-end comme pi-0 ne proposent pas. Validé sur un vrai G1, pas en sim. Reste à voir si ça généralise à d'autres plateformes.

IA physiqueOpinion
1 source
Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source
120arXiv cs.RO 

Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source

Des chercheurs ont intégré la théorie de la force résistive tridimensionnelle (3D RFT) dans le moteur de simulation physique MuJoCo, comblant un angle mort persistant des outils de robotique open-source. La 3D RFT permet d'approximer les forces de réaction du sol lors de la locomotion en milieu granulaire (sable, gravier fin) sans simuler l'interaction avec chaque grain individuellement, ce qui constitue l'approche classique par éléments discrets (DEM), prohibitive en temps de calcul. Les auteurs ont validé leur implémentation sur un robot hexapode à 12 degrés de liberté évoluant en bac à sable : la simulation prédit la distance parcourue et l'enfoncement des pattes à moins de 20 % des valeurs mesurées expérimentalement, avec des tendances cohérentes selon la forme de l'effecteur, la vitesse de déplacement et la charge appliquée. Les travaux sont publiés sur arXiv (2606.19504) et le code est rendu disponible en open source. L'impact pratique est significatif pour les équipes qui développent des robots mobiles destinés à évoluer hors piste. Jusqu'ici, simuler fiablement la locomotion sur sol meuble imposait soit des moteurs DEM spécialisés (CHRONO, LIGGGHTS) avec des temps de calcul rédhibitoires pour l'apprentissage par renforcement, soit des approximations ad hoc peu transférables. Intégrer la RFT directement dans MuJoCo, l'environnement de référence pour l'entraînement de politiques de locomotion, ouvre une voie crédible vers le sim-to-real sur substrats granulaires. La précision de 20 % est honnête pour une approximation analytique et constitue une base exploitable pour l'optimisation de design ou le pré-entraînement de contrôleurs, même si elle reste insuffisante pour garantir un transfert direct sans recalibration. La RFT granulaire a été initialement développée dans les laboratoires de Daniel Goldman (Georgia Tech) pour étudier la locomotion animale dans le sable, avant d'être étendue aux systèmes robotiques. MuJoCo, racheté par DeepMind en 2021 et passé open-source la même année, est aujourd'hui le moteur dominant pour l'entraînement de politiques de locomotion humanoïde et quadrupède chez Figure, Boston Dynamics ou Unitree. Les débouchés concrets de ce travail concernent les rovers planétaires (JPL, ESA), les robots agricoles évoluant en sol labouré, et les plateformes de recherche et sauvetage en milieu sableux. La prochaine étape logique sera l'extension aux substrats hétérogènes et l'intégration dans des pipelines d'apprentissage par renforcement standard pour valider le gain sim-to-real à l'échelle.

RecherchePaper
1 source
Données et standards pour la robotique humanoïde : l'infrastructure manquante de l'IA physique
121arXiv cs.RO 

Données et standards pour la robotique humanoïde : l'infrastructure manquante de l'IA physique

Un groupe de chercheurs impliqués dans l'élaboration de la norme ISO/WD 26264-1 au sein du comité technique ISO/TC 299/WG 16 publie un préprint arXiv (2606.19769, juin 2026) posant que la standardisation des données constitue le prochain verrou critique pour les robots humanoïdes. Leur thèse centrale: le goulot d'étranglement n'est pas seulement la rareté des données, mais leur caractère non cumulatif, causé par des coûts de collecte élevés, des silos organisationnels et des protocoles d'évaluation incompatibles. Les auteurs identifient trois conditions pour qu'un jeu de données soit réutilisable: l'expérience physique doit rester liée au corps du robot, à la tâche et au contexte d'exécution; les flux multimodaux doivent partager synchronisation temporelle, repères de coordonnées, calibration et unités documentées; les données doivent enfin être versionnées et traçables pour s'accumuler entre projets et organisations. L'enjeu est direct pour les équipes qui entraînent des modèles VLA (Vision-Language-Action) comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI. Sans grammaire commune (métadonnées, provenance, versioning), chaque acteur repart de zéro à chaque nouveau déploiement. Pour un intégrateur industriel, cela signifie concrètement que des données collectées sur un site ne peuvent pas réentraîner un modèle sur un autre, même avec du matériel identique. L'article recadre le "sim-to-real gap" non pas comme un problème de simulation, mais comme un déficit d'alignement des référentiels physiques entre jeux de données: les hypothèses de synchronisation et de cinématique, si elles ne sont pas documentées, rendent les flux non interopérables dès le départ. La norme proposée s'articule en deux couches: une infrastructure horizontale couvrant le cycle de vie, les métadonnées, la qualité, le versioning et la traçabilité, et des parties spécifiques par capacité (manipulation, locomotion, interaction humain-robot, cognition). Le contexte est celui d'un secteur ou Figure AI, Boston Dynamics, Tesla (Optimus Gen 3), Unitree et 1X accumulent des données de manière cloisonnée, tandis que des initiatives ouvertes comme Open X-Embodiment (Google DeepMind) ou LeRobot (HuggingFace) posent des bases communes sans force normative. Le préprint est en phase WD (Working Draft) sans date de ratification annoncée: c'est une prise de position académique, pas une norme publiée ni un déploiement industriel.

UESi ratifiée, la norme ISO/WD 26264-1 structurera les pratiques de données des acteurs européens de la robotique humanoïde ; HuggingFace (Paris) est déjà cité comme contributeur aux bases ouvertes communes (LeRobot), sans force normative à ce stade.

InfrastructureOpinion
1 source
Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique
122Pandaily 

Soutien politique et production de masse propulsent les ETF de robots humanoïdes à l'aube d'une phase critique

La Chine accélère sa stratégie dans la robotique humanoïde : le ministère de l'Industrie et des Technologies de l'Information (MIIT), en coordination avec la SASAC (Commission de supervision des actifs d'État), a fixé un objectif contraignant de plus de 10 000 unités humanoïdes déployées d'ici fin 2026, signalant un passage de l'incitation à la R&D vers une obligation de déploiement industriel. Sur le plan production, le Centre d'innovation en robotique humanoïde de Pékin a confirmé que le Tiangong 3.0 entrera en fabrication en série au second semestre 2026, avec des réductions de coûts attendues supérieures à 50 %. UBTECH a formalisé une coentreprise pour développer des puces d'intelligence incarnée, avec un capital enregistré de 100 millions de yuans. Côté chaîne d'approvisionnement, Wanma et Langxin Electric ont commencé des livraisons en volume de composants critiques. À l'international, GenesisAI, soutenu par l'ex-PDG de Google Eric Schmidt, a lancé son robot industriel Eno, tandis que Faraday Future affirme avoir livré 157 unités réparties sur quatre modèles. Dans ce contexte, l'ETF Robot d'Invesco Great Wall (code 159559), indexé sur le Guozheng Robot Industry Index (980022), affiche une exposition de plus de 73 % aux valeurs du secteur humanoïde, avec une allocation sectorielle dominée par les équipements mécaniques à 47,23 % (réducteurs, vis à billes, moteurs) et les équipements électriques à 14,68 %. Ce moment marque une inflexion structurelle : la Chine ne pilote plus la filière par subventions symboliques mais par objectifs de déploiement chiffrés et datés, ce qui force les intégrateurs et les acheteurs industriels à anticiper des volumes réels dès 2026. La maturité affichée de la chaîne d'approvisionnement, notamment autour des composants à haute valeur (actionneurs, chips embarqués), réduit un des principaux goulets d'étranglement identifiés lors des phases pilotes. Toutefois, il convient de rester prudent : l'article source est en grande partie un texte promotionnel pour le fonds 159559 lui-même, dont la performance de 60,81 % sur deux ans est mise en avant face aux 34,02 % du CSI 300. Les chiffres de déploiement restent des objectifs politiques, pas des confirmations de livraisons effectives, et les vidéos de démonstration des robots ne constituent pas une preuve de passage à l'échelle industrielle. La trajectoire de la robotique humanoïde chinoise s'inscrit dans un effort stratégique accéléré depuis 2023, avec des acteurs comme Unitree, AgiBot et UBTECH qui avancent en parallèle. À l'international, Tesla (Optimus Gen 3), Figure (Figure 03), Physical Intelligence (pi0), Agility Robotics et Boston Dynamics maintiennent une pression concurrentielle forte, principalement sur les cas d'usage logistique et manufacture. Le second semestre 2026 et l'année 2027 sont désignés comme la première fenêtre de réalisation de revenus réels pour le secteur, sous réserve que les objectifs de déploiement se confirment en commandes fermes plutôt qu'en annonces de pilotes.

UELa montée en puissance industrielle chinoise dans les humanoïdes (objectif 10 000 unités d'ici fin 2026, passage aux mandats de déploiement) crée une pression concurrentielle indirecte sur les fabricants et intégrateurs européens de composants robotiques critiques (actionneurs, réducteurs, chips embarqués).

Chine/AsieActu
1 source
DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent
123arXiv cs.RO 

DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent

DREAM-Chunk (arXiv:2606.18589, juin 2026) est une méthode d'inférence conçue pour corriger une fragilité structurelle des modèles vision-language-action (VLA) : l'exécution en boucle ouverte lors de l'action chunking. Ce paradigme, devenu standard dans les VLA actuels, consiste à inférer à basse fréquence un bloc d'actions (un "chunk") que le robot exécute séquentiellement à haute fréquence, sans rétroaction intermédiaire. Dès qu'un chunk est lancé, le robot le suit à l'aveugle, vulnérable aux perturbations dynamiques, aux erreurs matérielles et à l'observabilité partielle. DREAM-Chunk adresse ce problème sans modifier ni réentraîner la politique sous-jacente : à l'inférence, il génère plusieurs chunks candidats, simule leurs trajectoires dans un espace latent via un world model léger, et sélectionne celui dont l'état prédit correspond le mieux à l'observation réelle. La méthode est validée sur le benchmark Kinetix et sur quatre tâches de manipulation couvrant deux plateformes robotiques et deux architectures VLA distinctes. L'intérêt pratique est direct pour les intégrateurs industriels qui déploient des VLA pré-entraînés sans accès au pipeline d'entraînement : DREAM-Chunk s'insère comme une couche plug-and-play, sans fine-tuning requis. La méthode s'inscrit dans la tendance du test-time compute scaling, bien établie côté LLM mais encore naissante en robotique physique, où dépenser davantage de calcul à l'inférence peut compenser les limites d'un modèle sans passer par un nouveau cycle d'entraînement coûteux. Les résultats montrent que les gains augmentent avec le nombre de chunks candidats échantillonnés, et que l'avantage est particulièrement marqué lorsque les démonstrations contiennent des comportements correctifs, ce qui soulève une question pratique sur la composition des datasets de démo. Les world models latents en robotique ont une longue tradition (DREAMER, TD-MPC2, DreamerV3), mais leur couplage avec des VLA basés sur le chunking reste récent. Physical Intelligence avec pi-0, Figure AI et des équipes de Stanford, CMU et Berkeley explorent simultanément comment améliorer la robustesse en déploiement sans réentraînement complet. DREAM-Chunk se distingue par son caractère agnostique au modèle sous-jacent, ce qui facilite son adoption sur des architectures hétérogènes. La prochaine étape logique serait une validation sur des plateformes commerciales à manipulation dextre (Fourier GR1, Unitree G1) et des tâches à dynamiques hautement stochastiques comme l'assemblage de précision. Le papier ne mentionne ni partenaires industriels ni pilotes commerciaux annoncés.

💬 Le test-time compute scaling arrive enfin en robotique physique, et DREAM-Chunk en est un premier signal propre : générer des trajectoires candidates, simuler dans un espace latent, choisir la meilleure, sans toucher au modèle sous-jacent. Le chunking en boucle ouverte, c'est le point faible silencieux de tous les VLA actuels (ça marche dans 80% des cas, alors on n'en parle pas trop). Pour les intégrateurs qui déploient sans accès au pipeline d'entraînement, une couche qui corrige à l'inférence sans réentraîner, c'est la pièce manquante.

IA physiqueOpinion
1 source
Le prochain robot humanoïde pourrait ne pas ressembler à un humain
124The Verge 

Le prochain robot humanoïde pourrait ne pas ressembler à un humain

La startup française Genesis AI a présenté Eno, un robot se réclamant du "général purpose" sans reproduire la silhouette humaine. Soutenue par Eric Schmidt, ancien PDG de Google, la société fait le choix radical d'une morphologie repensée : pas de tête au sens classique, une base potentiellement sur roues, une structure compacte et pliable. Seul élément fidèle à l'anatomie : les mains, conçues pour reproduire "exactement la forme et les fonctions" de la main humaine. Genesis AI positionne Eno comme un robot polyvalent capable d'une large gamme de tâches, à l'opposé des machines spécialisées. Les métriques techniques précises (charge utile, degrés de liberté, prix) n'ont pas été communiquées. Ce parti pris interroge une hypothèse dominante du secteur : pourquoi l'humanoïde doit-il ressembler à un humain ? La réponse de Genesis est fonctionnelle. Ce qui compte, c'est la compatibilité avec des environnements et des outils conçus pour des mains humaines, pas la forme du torse ou l'existence d'un visage. Pour les intégrateurs industriels, cela ouvre une piste concrète : des robots ergonomiquement compatibles avec l'espace de travail humain, potentiellement moins coûteux si les composants non fonctionnels sont supprimés. Genesis AI s'inscrit dans une vague de startups françaises de robotique avancée, aux côtés de Wandercraft (exosquelettes) et Enchanted Tools (robots hospitaliers). Le soutien d'Eric Schmidt lui donne une visibilité internationale dans un secteur dominé par Figure AI, Agility Robotics, Boston Dynamics côté américain et Unitree ou Fourier Intelligence côté asiatique. Eno reste à ce stade un teaser : aucun déploiement ni pilote industriel n'a été annoncé, et les performances réelles du système restent entièrement à démontrer.

UEGenesis AI est une startup française dont le projet Eno, soutenu par Eric Schmidt, renforce la visibilité internationale de l'écosystème robotique français, bien que le produit reste à un stade de teaser sans métriques ni déploiement validés.

FR/EU ecosystemeOpinion
1 source
Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée
125TechNode 

Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée

Alibaba a publié mardi une suite robotique composée de trois modèles fondamentaux : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld. Qwen-RobotNav étend les capacités vision-langage à la robotique mobile en unifiant quatre tâches au sein d'un même framework : suivi d'instructions, navigation orientée objectif, tracking de cible et conduite autonome. Qwen-RobotManip standardise l'espace état-action et représente le mouvement de l'effecteur terminal sous forme de poses incrémentielles dans le référentiel caméra, une approche conçue pour faciliter la généralisation multi-plateforme. Ce modèle a été entraîné sur plus de 38 100 heures de données entièrement open source. Qwen-RobotWorld, le troisième composant, fonctionne comme un world model généraliste : il prédit des états futurs physiquement cohérents via une interface en langage naturel, couvrant simultanément la navigation, la conduite et la manipulation depuis un seul modèle. L'approche modulaire mais unifiée est la proposition de valeur centrale de cette suite. Un world model unique opérant sur trois domaines d'action représente une architecture qui, si elle tient ses promesses en conditions réelles, réduirait significativement les coûts d'intégration pour les équipes robotiques industrielles. L'utilisation de données entièrement open source pour Qwen-RobotManip est un signal notable dans un secteur où les datasets propriétaires constituent souvent un avantage concurrentiel défensif : Alibaba positionne ainsi Qwen-Robot davantage comme une infrastructure partagée que comme un produit fermé. Réserve importante cependant : l'annonce ne s'accompagne d'aucun benchmark public (RLBench, LIBERO, CARLA) ni de déploiement physique documenté. Il s'agit d'une publication de modèles, pas d'un produit shipé. L'équipe Qwen d'Alibaba est reconnue pour ses modèles multimodaux (Qwen2.5-VL, QwQ), mais ce lancement marque son entrée explicite dans l'embodied AI. Le terrain est disputé : Google DeepMind pousse ses dérivés de RT-2, Physical Intelligence a publié Pi-0 et Pi-0.5, Hugging Face soutient l'initiative LeRobot, et NVIDIA propose GR00T N2 comme backbone pour les robots humanoïdes partenaires. Côté chinois, Unitree, Agibot et Zhiyuan Robot accélèrent eux aussi leurs pipelines VLA (vision-language-action). La prochaine étape pour Alibaba sera de démontrer des résultats sur des plateformes matérielles réelles ; faute de quoi, Qwen-Robot restera un framework académique parmi d'autres dans une course déjà très chargée.

UEImpact indirect sur l'écosystème européen : la suite open-source d'Alibaba accentue la pression concurrentielle sur les initiatives VLA portées par des acteurs à ancrage européen comme Hugging Face (LeRobot), sans déploiement physique documenté en Europe à ce stade.

IA physiqueOpinion
1 source
Optimisation bayésienne pour l'apprentissage du MPC non linéaire dans la navigation d'agents autonomes
126arXiv cs.RO 

Optimisation bayésienne pour l'apprentissage du MPC non linéaire dans la navigation d'agents autonomes

Des chercheurs ont publié le 17 juin 2026 (arXiv:2606.14763) un framework de navigation autonome temps-réel combinant planification réactive, représentation d'occupation gaussienne par LiDAR et contrôle prédictif non-linéaire (MPC). À chaque cycle de contrôle, le système construit une carte d'occupation gaussienne à partir des données LiDAR, génère une trajectoire sans collision via algorithme A*, puis la fait suivre par un MPC formulé avec CasADi/IPOPT intégrant une barrière obstacle à sigmoïde lisse. Le tuning des paramètres du contrôleur est réalisé hors-ligne par optimisation bayésienne via Tree-structured Parzen Estimators (TPE), complétée d'un surrogate Gaussian Process pour analyser la sensibilité paramétrique. Déployé sur le quadrupède Unitree Go2, le système atteint un taux de succès de navigation de 90,0 % en conditions réelles et une amélioration moyenne de 38,9 % sur les métriques composites en simulation, sans retuning supplémentaire entre sim et hardware. Le résultat le plus significatif pour le secteur est la validation du transfert sim-to-real sans post-tuning sur hardware : les paramètres identifiés en Gazebo tiennent sur le robot physique à performances comparables. C'est un point non trivial pour les équipes d'intégration robotique, où la divergence simulation/réalité reste un goulot d'étranglement majeur. L'approche "map-free" (sans cartographie préalable) combinée à un MPC réactif positionne ce framework pour des environnements dynamiques non-structurés, là où les planificateurs à carte globale échouent. La nature robot-agnostique de l'architecture élargit le périmètre d'application au-delà du quadrupède testé. Ce travail s'inscrit dans un mouvement de recherche plus large visant à rendre le MPC praticable sur des plateformes embarquées à ressources limitées, en externalisant le coût computationnel du tuning vers une phase offline. Les concurrents directs incluent les approches RL-for-MPC (apprentissage de politiques qui paramètrent le contrôleur) et les méthodes de navigation end-to-end par réseau de neurones, mais ces dernières offrent moins de garanties de sécurité formelles. Le Unitree Go2, plateforme open-source à ~2 700 USD, est devenu un banc de test standard dans la communauté académique. Les suites naturelles incluent l'extension à des dynamiques multi-agents et le test sur plateformes à roues ou bras manipulateurs.

RecherchePaper
1 source
ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde
127arXiv cs.RO 

ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (2606.16542) une méthode baptisée ADAPT (Analytical Disturbance-Aware Policy Training), destinée à améliorer la robustesse locomotrice des robots humanoïdes soumis à des perturbations externes. Le système a été validé sur un Unitree G1 dans trois scénarios représentatifs : poussées au niveau du torse, perturbations en posture statique, et charges asymétriques appliquées aux mains. Dans chaque cas, ADAPT surpasse une politique de référence basée uniquement sur la proprioception (capteurs internes articulaires), avec un meilleur suivi de vitesse et une meilleure stabilité, y compris face à des perturbations hors distribution, c'est-à-dire non rencontrées lors de l'entraînement. La méthode n'exige aucun capteur de force/couple externe : elle s'appuie uniquement sur la dynamique interne du robot pour estimer en ligne les résidus de force et de couple appliqués au corps entier. L'intérêt technique d'ADAPT tient à son observateur de perturbations analytique, fondé sur la physique du corps rigide plutôt que sur un réseau de neurones ou une large randomisation de domaine. Les approches existantes présentent chacune un défaut structurel : la randomisation de domaine dégrade la précision, les objectifs de force spécifiques à une tâche limitent la transférabilité, et les estimateurs appris depuis l'historique de mouvement peinent hors distribution. ADAPT contourne ces compromis en fournissant à la politique un signal d'entrée explicite et physiquement fondé sur les forces et couples perturbateurs estimés, ce qui lui permet de se généraliser à des scénarios jamais vus. Un bénéfice secondaire notable : en pénalisant les perturbations inférées au niveau des articulations inférieures, le système favorise une locomotion plus légère, réduisant les impacts au sol, ce qui peut prolonger la durée de vie mécanique et améliorer la discrétion sonore en milieu de travail. Le Unitree G1 est une plateforme humanoïde commerciale abordable, largement utilisée dans la recherche sur la locomotion apprise, ce qui confère à ces résultats une portée pratique directe. Ce travail s'inscrit dans une tendance plus large où les laboratoires cherchent à combler le fossé sim-to-real sans ajouter de capteurs coûteux, une contrainte forte pour les déploiements industriels à grande échelle. Côté concurrence, des approches similaires ont été explorées par des équipes travaillant sur Boston Dynamics Atlas, Agility Robotics Digit et les humanoïdes Figure et 1X, mais souvent avec des capteurs de force dédiés. ADAPT représente une direction sensorless qui, si elle se confirme sur d'autres plateformes, pourrait simplifier l'intégration matérielle. L'article étant un preprint arXiv non encore évalué par les pairs, la reproductibilité reste à confirmer indépendamment, et les conditions exactes des expériences (vitesses testées, amplitude des poussées) ne sont pas précisées dans le résumé disponible.

IA physiquePaper
1 source
L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes
128arXiv cs.RO 

L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes

Une étude publiée sur arXiv le 11 juin 2026 (réf. 2606.11891) présente une comparaison rigoureuse de deux architectures de critique en apprentissage par renforcement multi-objectifs pour robots humanoïdes : un critique unifié (un seul réseau estimant la valeur combinée de tous les objectifs) contre des critiques duaux (deux réseaux distincts, chacun associé à un signal de récompense séparé, l'un pour la locomotion, l'autre pour la manipulation). Les expériences ont été conduites sur le Unitree G1, un humanoïde à 23 degrés de liberté actifs, dans le simulateur NVIDIA Isaac Lab, via un curriculum séquentiel de 13 niveaux progressant de l'atteinte stationnaire jusqu'à la marche avec des cibles à orientation variable. Résultat : les politiques entraînées avec critiques duaux atteignent leurs cibles 3,5 fois plus vite (6,5 pas de simulation contre 22,6), affichent un débit deux fois supérieur (14,3 contre 7,0 atteintes validées pour 1 000 pas), et un taux de réussite validé de 65,2 % contre 53,8 % pour le critique unifié. Ce que l'étude démontre, c'est que le choix de l'architecture du critique est un levier de conception primaire, souvent négligé, dont l'impact surpasse celui du reward engineering. Fait notable : l'ajout de mécanismes anti-gaming, conçus pour empêcher la politique d'exploiter les failles de la fonction de récompense, ne produit aucun gain au-delà du changement architectural seul (60,9 % contre 65,2 %). L'implication la plus immédiate concerne le fine-tuning RL de politiques pré-entraînées par imitation : lorsqu'on affine un modèle de manipulation déjà appris (style Pi-0 ou GR00T N2), un critique unifié risque de supprimer les comportements acquis par interférence des gradients de locomotion. Pour les équipes qui cherchent à spécialiser des modèles de fondation robotiques par RL, cette mise en garde est directement opérationnelle. Le Unitree G1, vendu autour de 16 000 dollars, est devenu un banc de test standard pour la recherche en humanoïde abordable, face aux plateformes de Figure AI, Agility Robotics ou 1X Technologies qui opèrent sur des gammes de prix bien supérieures. NVIDIA Isaac Lab, successeur d'Isaac Gym, s'est imposé comme l'environnement de référence pour l'entraînement sim-to-real. La question du découplage locomotion/manipulation en RL multi-objectifs est au coeur de plusieurs groupes de recherche (Stanford, CMU, ETH Zurich), et les résultats de cette étude, issus d'un cadre contrôlé et reproductible, offrent une base solide pour orienter les choix d'architecture avant tout entraînement coûteux sur robot réel.

RecherchePaper
1 source
Vidéo : des robots humanoïdes volent la vedette dans America's Got Talent
129Interesting Engineering 

Vidéo : des robots humanoïdes volent la vedette dans America's Got Talent

Huit robots humanoïdes G1 du fabricant chinois Unitree ont performé en direct sur NBC lors du premier épisode de la saison en cours d'America's Got Talent, diffusé mardi soir aux États-Unis. Aux côtés du danseur Wu Yufei, originaire du Sichuan et connu sous le pseudonyme "Flying Bug", les machines ont exécuté une chorégraphie synchronisée combinant mouvements rythmés et coordination précise avec l'interprète humain. Le numéro a reçu une ovation debout du public en studio et l'approbation unanime des quatre juges, propulsant le duo vers la prochaine étape d'une compétition dotée d'un grand prix d'un million de dollars. Yufei a présenté l'un des robots sous le surnom "Jackie", en référence au kung-fu. Le mode de pilotage des machines pendant la performance (téléopération partielle, séquences préenregistrées ou autonomie hybride) n'a pas été divulgué par l'équipe, un point que les commentateurs spécialisés n'ont pas manqué de relever. La prestation illustre un paradoxe croissant aux États-Unis: l'enthousiasme du grand public pour les humanoïdes chinois se heurte à une pression législative grandissante. Le lendemain même de la diffusion, une proposition de loi bipartisane, le Guard Act, a été déposée au Congrès pour interdire les robots d'origine chinoise jugés risques pour la sécurité nationale. En parallèle, l'American Security Robotics Act avance avec pour objectif d'empêcher les agences fédérales d'acquérir des robots produits par des entreprises chinoises, humanoïdes inclus. Pour les décideurs B2B et les intégrateurs industriels, cette double dynamique crée une incertitude réelle: adopter une technologie qui capte l'adhésion populaire tout en naviguant un risque réglementaire croissant. La visibilité télévisée d'Unitree renforce la crédibilité commerciale de ses machines auprès des acheteurs non spécialisés, un levier marketing qu'aucun salon professionnel ne peut reproduire à cette échelle. Fondée à Hangzhou, Unitree commercialise ses robots à l'international via la plateforme AliExpress d'Alibaba, ciblant les marchés d'Amérique du Nord, d'Europe et du Japon. La société a récemment annoncé un partenariat avec Nvidia pour concevoir un design de référence humanoïde baptisé H2+, dont la disponibilité est prévue pour la fin de l'année. Sur le terrain, les observateurs notent que le déploiement opérationnel des robots chinois à l'étranger se heurte à des obstacles concrets: identification des cas d'usage industriels, collecte de données opérationnelles, et construction de réseaux locaux de maintenance, d'intégration et de calibration. Face à Unitree, le marché des humanoïdes voit s'affronter Figure AI (Figure 02), Tesla (Optimus Gen 2), Boston Dynamics (Atlas électrique), Physical Intelligence (pi0) et Agility Robotics (Digit), tous positionnés sur des verticales industrielles précises. L'apparition télévisée ne règle aucun de ces défis opérationnels, mais marque une étape dans la bataille pour la normalisation culturelle des humanoïdes auprès du grand public américain.

UEUnitree ciblant explicitement les marchés européens via AliExpress, la pression réglementaire américaine sur les robots chinois (Guard Act, American Security Robotics Act) pourrait inspirer des mesures similaires en Europe sur l'acquisition de robotique d'origine chinoise par les entités publiques et industrielles.

Chine/AsieOpinion
1 source
IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique
130arXiv cs.RO 

IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique

Une équipe de chercheurs publie sur arXiv (identifiant 2606.05660, juin 2026) une revue systématique de la sécurité dans les systèmes d'IA incarnée (embodied AI) appliqués à la manipulation robotique à long horizon. Ce survey structure la littérature selon trois niveaux d'intervention : la sécurité au stade de la planification (planning-time), au niveau de la politique de contrôle (policy-time) et pendant l'exécution (execution-time). Les auteurs identifient quatre vecteurs de risque pouvant s'accumuler dans un même système en boucle fermée : le misgrounding sémantique (l'agent interprète mal l'instruction de haut niveau), la propagation d'erreur entre sous-tâches, la dérive d'exécution (execution drift) et les risques physiques liés aux contacts. Ils distinguent par ailleurs trois catégories de garanties dans la littérature existante : formelles, statistiques et heuristiques empiriques, et concluent que les preuves formelles font défaut à chaque couche. L'enjeu est direct pour les intégrateurs et les décideurs industriels. Un bras robotique déployé en entrepôt ou en ligne de production enchaîne des dizaines d'actions sur des horizons temporels étendus, et chaque sous-tâche peut propager silencieusement une erreur vers les suivantes. Or le survey révèle que la sécurité au niveau de la politique de contrôle, au coeur même des modèles VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, est la couche la moins documentée empiriquement. Les mécanismes d'intervention déclenchés par l'incertitude (uncertainty-triggered intervention) restent immatures, et les benchmarks spécifiques à la sécurité en manipulation longue durée sont quasi-inexistants, ce qui rend toute validation rigoureuse avant déploiement aujourd'hui difficile. Ce travail paraît dans un contexte d'accélération industrielle : Figure AI, Boston Dynamics, Unitree et Physical Intelligence multiplient les démonstrations de manipulation dextère, souvent en conditions semi-contrôlées, alimentant un écart potentiel entre annonces marketing et réalité opérationnelle. Il convient de souligner que ce papier est une analyse critique de l'existant, pas un nouveau système ou algorithme. Ses recommandations prioritaires portent sur trois axes : des assurances cross-couche cohérentes de la planification jusqu'à l'exécution physique, des benchmarks dédiés à la sécurité en manipulation longue durée, et des protocoles de déploiement progressifs pour les agents robotiques en environnements réels. En creux, le constat est que les capacités du secteur progressent plus vite que les outils pour en évaluer la sécurité.

UEL'absence de benchmarks formels de sécurité pour la manipulation longue durée concerne directement les industriels européens déployant des bras robotisés, et pourrait alimenter les exigences de validation dans le cadre de l'AI Act pour les systèmes robotiques à haut risque.

RecherchePaper
1 source
M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements
131arXiv cs.RO 

M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements

Des chercheurs de Renforce Dynamics ont publié le 5 juin 2026 sur arXiv un article présentant M3imic (Multi-Modal Mimic), un contrôleur corps entier destiné aux robots humanoïdes. L'objectif : unifier dans une seule politique d'apprentissage par renforcement trois types de références de mouvement jusqu'ici traités séparément, les trajectoires articulaires du robot (angles de joints), les trajectoires de pose humaine capturées par motion capture, et les poses d'effecteurs terminaux (end-effector poses). Le système exploite des encodeurs spécialisés par modalité pour projeter ces données hétérogènes dans un espace latent commun, puis entraîne une politique unique à grande échelle en simulation. Les expériences sont conduites sur le robot humanoïde Unitree G1 : en simulation, la politique atteint un taux de succès maximal de 98,42 % sur un jeu de test non vu, et un transfert sim-to-réel est démontré sans réentraînement spécifique à chaque modalité. Le code source est disponible publiquement sur GitHub. Le problème que M3imic cherche à résoudre est structurel : les contrôleurs corps entier existants traitent la locomotion et la manipulation comme deux domaines distincts, avec des formats de données incompatibles, des vecteurs denses d'angles articulaires d'un côté, des poses 6-DOF d'effecteurs creuses de l'autre. Forcer une seule politique à ingérer ces deux représentations sans architecture dédiée dégrade les performances. M3imic propose une solution architecturale rather than une solution de données : un espace latent partagé avec encodeurs par modalité, ce qui permet à une même politique de piloter aussi bien la marche que la manipulation sans compromis de performance. Pour les intégrateurs et équipes robotiques, cela réduit potentiellement le coût de développement en éliminant le besoin de pipelines parallèles par type de tâche. Le robot cible, le Unitree G1, est un humanoïde commercialisé depuis 2024 à environ 16 000 dollars, devenu une plateforme de référence pour la recherche en locomotion et loco-manipulation grâce à son accessibilité. Renforce Dynamics est un laboratoire ou startup dont M3imic constitue l'une des premières publications publiques. Dans le paysage concurrent, les approches comparables incluent les travaux de Berkeley Humanoid (Pi-0 de Physical Intelligence), les contrôleurs corps entier de CMU et ETH Zurich, et les politiques VLA de Figure AI, tous confrontés au même défi du sim-to-real gap sur tâches mixtes locomotion-manipulation. M3imic se positionne explicitement sur l'unification multimodale plutôt que sur la performance brute d'une seule tâche. Les prochaines étapes naturelles seraient des déploiements en environnement non structuré et une évaluation sur des humanoïdes à plus haute cinématique (plus de DOF, payload supérieur).

IA physiqueOpinion
1 source
Transfert de style de mouvement humain pour le contrôle physique de robots humanoïdes
132arXiv cs.RO 

Transfert de style de mouvement humain pour le contrôle physique de robots humanoïdes

Un groupe de chercheurs présente dans un preprint arXiv (2606.03536, soumis le 3 juin 2026) un framework de transfert de style de mouvement pour robots humanoïdes. Le système prend en entrée un court clip humain illustrant un style moteur désiré (rythme de marche, balancement des bras, posture) et un mouvement cible distinct, puis génère un mouvement corps entier stylisé adapté au robot. Le modèle central est un modèle de diffusion latente multi-condition, sensible à la physique, fusionnant conditions de style, de contenu et de trajectoire. La guidance classifier-free permet d'ajuster l'intensité du style sans réentraîner le modèle. Les références générées sont ensuite converties pour le robot Unitree G1 et exécutées par une politique de suivi corps entier entraînée via une stratégie "cluster-and-distill". Sur 125 essais sur robot réel, la méthode atteint un taux de réussite de 96,0 %, avec moins d'artefacts de contact et de jitter que les baselines orientées animation. Ce résultat remet en question le paradigme dominant où chaque comportement expressif d'un humanoïde est soit capturé en démonstration directe, soit scripté manuellement, deux approches coûteuses et non réutilisables entre contenus de mouvement différents. En permettant à un court clip humain de servir de source de style transférable sur des contenus arbitraires, le framework ouvre la voie à une personnalisation motrice procédurale. L'écart simulation-hardware est adressé directement par des régularisations de cohérence de contact et de lissage temporel imposées lors de l'entraînement, un point de friction récurrent dans la chaîne génération-contrôle. Un taux de 96 % sur 125 essais réels représente un résultat solide pour de la recherche académique dans ce domaine, où beaucoup de travaux restent confinés à la simulation. Le Unitree G1 (environ 16 000 dollars) s'est imposé ces 18 derniers mois comme la plateforme de référence pour la recherche humanoïde académique. Ces travaux s'inscrivent dans la tendance des modèles de diffusion appliqués à la génération de mouvement (MDM, MotionDiffuse), prolongée ici jusqu'au contrôle physique sur hardware réel. Dans la course à l'expression motrice des humanoïdes, Boston Dynamics (Atlas), Figure et 1X investissent massivement côté imitation learning et VLA end-to-end, tandis que ce preprint se positionne sur la génération procédurale contrôlée, approche complémentaire. Du côté européen, Wandercraft et Enchanted Tools (France, robot Mirokaï) travaillent sur des problématiques d'expression motrice proches, sur des architectures distinctes. La suite logique serait l'intégration de ce framework dans des pipelines de téléopération ou d'interfaces humain-robot en conditions industrielles réelles.

UEWandercraft et Enchanted Tools (France) travaillent sur des problématiques d'expression motrice similaires et pourraient s'inspirer de cette approche de transfert de style procédural sur hardware réel.

HumanoïdesPaper
1 source
Suivi corporel intégral contraint pour robots humanoïdes
133arXiv cs.RO 

Suivi corporel intégral contraint pour robots humanoïdes

Des chercheurs ont publié sur arXiv (2606.00374) un framework de contrôle baptisé ConstrainedMimic, conçu pour imposer des contraintes de sécurité en temps réel sur des robots humanoïdes pilotés par apprentissage par renforcement. La démonstration s'appuie sur un Unitree G1 simulé : le système fait tourner la politique de suivi de mouvement whole-body à 300-500 Hz, indifféremment sur CPU, GPU ou TPU, tout en garantissant simultanément l'évitement de collisions (auto-collisions et obstacles externes), le respect des butées articulaires et la stabilité du centre de masse. Les expériences couvrent le suivi de mouvements cinématiques référencés et la téléopération. Le code sera libéré à la publication. L'enjeu sous-jacent est structurant pour l'industrialisation des humanoïdes : les politiques RL apprennent des comportements agiles mais ne savent pas, par défaut, respecter des contraintes ajoutées après entraînement, ce qui bloque le déploiement dans des environnements où les exigences de sécurité évoluent (cellule de travail reconfigurée, proximité opérateur, certification CE). ConstrainedMimic répond à ce problème en combinant deux outils de contrôle classiques, le contrôle en espace opérationnel (OSC) et les control barrier functions (CBF), pour projeter la commande du réseau de neurones dans un espace faisable respectant les contraintes actives. La méthode est entièrement différentiable et n'altère la politique que le strict minimum lorsqu'une contrainte entre en jeu, ce qui la distingue des approches d'override brutales. C'est un pas vers la séparation propre entre performance et sécurité dans les pipelines RL pour humanoïdes. Le sujet s'inscrit dans une course active à la robustesse des politiques whole-body : Figure (Figure 02/03), Boston Dynamics (Atlas), Agility Robotics (Digit) et Unitree investissent massivement en RL locomotion, mais la question des garanties formelles reste un angle mort industriel. Les CBF sont bien établies en robotique mobile (AMR, véhicules autonomes) mais leur intégration dans des politiques RL pour humanoïdes à haute dimension cinématique est encore exploratoire. À noter : l'évaluation reste entièrement en simulation, ce qui laisse ouverte la question du sim-to-real gap sur les contraintes dynamiques, un point que les auteurs n'adressent pas dans cet abstract. La publication du code facilitera la reproductibilité et pourrait accélérer l'adoption dans des labos comme le DLR, l'INRIA ou des intégrateurs industriels européens travaillant sur la certification de robots collaboratifs.

UELa publication du code pourrait permettre à des laboratoires européens comme l'INRIA ou le DLR d'intégrer des garanties formelles de sécurité dans leurs pipelines RL pour humanoïdes, facilitant la certification CE de robots collaboratifs en environnement industriel partagé.

HumanoïdesPaper
1 source
BYD confirme son offensive robotique humanoïde avec le projet de septième génération Yao-Shun-Yu, ciblant particulièrement les concessionnaires et les foyers
134Pandaily 

BYD confirme son offensive robotique humanoïde avec le projet de septième génération Yao-Shun-Yu, ciblant particulièrement les concessionnaires et les foyers

Li Ke, vice-président exécutif de BYD, a détaillé dans une interview récente la stratégie robotique humanoïde du constructeur, développée en interne sous le nom de code "Yao-Shun-Yu". Le projet en est à sa septième génération d'itération, signe d'un cycle de développement soutenu. Les premiers déploiements visent les concessions automobiles 4S à l'international, les réseaux européens étant cités parmi les sites prioritaires. Les robots y assureront accueil client, démonstrations produits et support commercial standardisé en plusieurs langues simultanément, répondant à un problème opérationnel concret : recrutement difficile et coûts élevés dans les marchés étrangers. À plus long terme, BYD envisage un second débouché, le domicile, avec des fonctions de ménage, préparation des repas et compagnie sociale. Aucun chiffre de production, de spécifications techniques ou de calendrier de livraison précis n'a été communiqué ; il s'agit d'une annonce de stratégie, pas d'un produit expédié. L'entrée de BYD dans la robotique humanoïde est structurellement significative pour deux raisons. D'abord, le groupe dispose d'une chaîne d'approvisionnement verticalement intégrée : l'expertise en systèmes logiciels embarqués et en fabrication de précision acquise dans l'automobile électrique se transpose directement à la robotique, où la maîtrise mécanique et le contrôle temps réel sont aussi critiques que l'intelligence artificielle. Ensuite, Li Ke a formulé un diagnostic précis sur l'état du secteur : les humanoïdes chinois présentent généralement un hardware solide mais un "cerveau" IA insuffisant, tandis que les concurrents américains affichent l'inverse. BYD se positionne explicitement comme intégrateur des deux capacités dans une plateforme unique. Si cette convergence se concrétise à l'échelle, elle modifierait les rapports de force dans la commercialisation des humanoïdes industriels, où aucun acteur n'a encore démontré de production de masse rentable. BYD est devenu en 2023 le premier constructeur mondial de véhicules électriques par le volume, précisément sur la base de cette intégration verticale, supplantant Tesla dans plusieurs segments. Le groupe s'inscrit dans une vague plus large de groupes industriels chinois investissant la robotique humanoïde : UBTECH, Unitree et Fourier Intelligence sont déjà actifs sur ce terrain. Côté américain, les références restent Figure Robotics (Figure 02 en déploiement chez Amazon), Boston Dynamics (Atlas), Tesla (Optimus Gen 2) et 1X Technologies. BYD se distingue en se déclarant lui-même acheteur initial à grande échelle dans ses propres usines chinoises, un levier de dérisquage commercial que très peu de roboticiens peuvent activer de façon crédible. Les prochaines étapes annoncées portent sur des pilotes en concessions européennes, sans calendrier précis confirmé à ce jour.

UEBYD cible explicitement les réseaux de concessions automobiles européens comme sites de déploiement prioritaires, ce qui pourrait introduire un acteur chinois à intégration verticale sur le marché européen de la robotique de service B2B.

Chine/AsieActu
1 source
SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot
135arXiv cs.RO 

SOLE-R1 : le raisonnement vidéo-langage comme unique récompense pour l'apprentissage par renforcement sur robot

Des chercheurs du MIT ont publié SOLE-R1 (Self-Observing LEarner), un modèle de raisonnement vidéo-langage conçu pour fonctionner comme signal de récompense exclusif dans l'apprentissage par renforcement (RL) en robotique, sans aucun accès à des récompenses terrain, indicateurs de succès, démonstrations ou réglages spécifiques à la tâche. Soumis sur arXiv (2503.28730v2), le système prend en entrée uniquement des observations vidéo brutes et un objectif en langage naturel, puis génère à chaque pas de temps un raisonnement spatiotemporel de type chain-of-thought (CoT) pour estimer de façon dense la progression de la tâche. Entraîné sur un pipeline de synthèse massif de trajectoires vidéo annotées temporellement, SOLE-R1 combine fine-tuning supervisé et RL depuis des récompenses vérifiables. Évalué sur quatre environnements de simulation distincts et en setting réel, il réussit 24 tâches de manipulation inédites en apprentissage zéro-shot depuis une initialisation aléatoire. L'enjeu central que résout SOLE-R1 est celui du reward hacking : aujourd'hui, utiliser un VLM généraliste comme évaluateur RL expose le système à des erreurs perceptuelles sous observabilité partielle ou changement de distribution, que la politique apprenante exploite rapidement au lieu de résoudre réellement la tâche. SOLE-R1 surpasse nettement des comparatifs forts - Robometer, RoboReward, ReWiND, mais aussi GPT-5 et Gemini-3-Pro - sur la robustesse à ce phénomène. Pour les intégrateurs et ingénieurs robotique, c'est un signal concret que le goulot d'étranglement du RL sur robot réel (définir une fonction de récompense dense et fiable) peut être délégué à un modèle de raisonnement vidéo entraîné spécifiquement, sans instrumentation matérielle supplémentaire. SOLE-R1 s'inscrit dans un courant actif qui cherche à remplacer les récompenses codées à la main par des superviseurs fondationnels (EUREKA d'NVIDIA, VLM-RM, SuSIE). La différence revendiquée ici est le raisonnement CoT temporel explicite par pas de temps, contre des évaluations épisodiques ou des scores scalaires instantanés. Le projet est encore au stade preprint sans déploiement industriel annoncé, mais les modèles, données et code sont publiés en open access sur la page anonyme du MIT. Les prochaines étapes naturelles seraient la validation sur des plateformes commerciales (Figure, Unitree, Boston Dynamics Spot) et l'extension à des tâches longue-horizon en environnement non structuré, deux gaps que l'article ne comble pas encore.

RechercheOpinion
1 source
Étude de l'effet d'un retrofit à actionnement élastique en série sur des actionneurs boîte noire
136arXiv cs.RO 

Étude de l'effet d'un retrofit à actionnement élastique en série sur des actionneurs boîte noire

Des chercheurs ont publié sur arXiv (référence 2605.24127, mai 2026) les résultats d'une étude portant sur le retrofit d'un élément élastique en série (SEA, Series Elastic Actuation) sur un actionneur dit "boîte noire", c'est-à-dire un actionneur commercial dont les paramètres internes sont inaccessibles. L'élément élastique torsionnel a été dimensionné par analyse en éléments finis (FE analysis), aboutissant à une raideur de 2 155,4 Nm/rad. Le résultat principal est une amélioration de la bande passante en contrôle d'effort en boucle ouverte, passant de 10,32 Hz pour le moteur seul à 30,32 Hz avec le module SEA intégré, soit un gain de 2,93x. En boucle fermée, le module surpasse un capteur d'effort commercial de 7,63%, pour un coût matière de seulement 25 GBP. Ce résultat a une portée directe pour les intégrateurs robotiques confrontés à des actionneurs industriels standard dont ils ne maîtrisent pas la couche logicielle basse. Les actionneurs rigides à faible jeu mécanique sont omniprésents en robotique industrielle précisément parce qu'ils garantissent répétabilité et précision, mais ils sont inadaptés dès que la tâche exige du contrôle d'effort ou une compliance face à des contacts incertains. Le principe SEA, qui insère un ressort entre le moteur et la charge pour mesurer les efforts via la loi de Hooke, est connu depuis les travaux de Gill Pratt au MIT dans les années 1990, mais son application reste généralement cantonnée aux plateformes conçues pour l'accepter dès l'origine. Ce travail démontre qu'un retrofit peu coûteux peut débloquer la mesure d'effort haute fidélité sans remplacer l'actionneur existant. L'approche s'inscrit dans un courant de recherche actif autour de la compliance en actionnement, qui irrigue aussi bien les robots humanoïdes (Boston Dynamics Atlas, Agility Digit, Figure 02) que les exosquelettes et cobots collaboratifs. Les concurrents directs de cette approche incluent le quasi-direct drive (QDD), popularisé par MIT Cheetah et repris chez nombre de fabricants chinois (Unitree, Fourier Intelligence), ainsi que les capteurs d'effort six axes montés en poignet. La limite principale du SEA reste la réduction de bande passante, que ce travail atténue mais ne supprime pas entièrement. Les prochaines étapes logiques concerneraient des validations sur tâches manipulatoires réelles et une caractérisation de la durée de vie mécanique de l'élément élastique retrofit dans des cycles répétitifs.

RecherchePaper
1 source
Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques
137arXiv cs.RO 

Apprendre à évoluer : champs interactifs multimodaux pour la navigation humanoïde robuste en environnements dynamiques

Des chercheurs ont publié sur arXiv (2605.21935, mai 2026) un système de cartographie dynamique baptisé MIF (Multi-modal Interactive Field), conçu pour permettre aux robots humanoïdes de naviguer et de manipuler des objets dans des environnements réels en constante évolution. Testé sur un Unitree G1, le système améliore le taux de relocalisation dans un bureau non-statique de 12 % à 94 %, tout en réduisant l'empreinte mémoire sémantique de 91,4 % grâce à la distillation de features. MIF repose sur trois composantes couplées : un champ d'apparence basé sur le 3D Gaussian Splatting (3DGS) conscient de l'incertitude pour atténuer le flou induit par la marche bipède, un champ spatial maintenant une mémoire topologique de la scène, et un champ géométrique qui calcule une pose d'interaction sûre (Interaction Pose Safety, IPS) avant chaque manipulation. Un score de détection de discordance distingue les fausses alarmes dues aux oscillations du robot des changements persistants réels, et ne met à jour que les zones localement incohérentes. L'enjeu pratique est direct : les systèmes de cartographie sémantique existants (semantic maps, scene graphs) supposent généralement des trajectoires caméra stables et des environnements statiques, deux hypothèses qu'un humanoïde en mouvement viole en permanence. Passer de 12 % à 94 % de succès en relocalisation sur un robot réel dans un bureau avec personnes en mouvement constitue un résultat concret, pas une démo en laboratoire contrôlé. Pour un intégrateur ou un COO industriel évaluant des humanoïdes pour des tâches de pick-and-place, la capacité à maintenir une carte cohérente sous perturbation locomotrice est un prérequis opérationnel non négociable que la plupart des démos actuelles ne valident pas. Le contexte de ce travail s'inscrit dans l'essor du 3DGS comme alternative aux NeRF pour la représentation de scènes en temps réel, une technique popularisée en 2023 et dont l'adaptation à la robotique mobile reste un sujet de recherche actif. L'Unitree G1 est l'une des plateformes humanoïdes commerciales les plus accessibles du marché (autour de 16 000 dollars), ce qui rend ce type de validation plus reproductible que sur des robots propriétaires comme l'Atlas de Boston Dynamics ou le Figure 02. Le code et la page projet sont publiés (ziya-jiang.github.io/MIF-homepage), signal d'une recherche ouverte à la reproduction. Les prochaines étapes naturelles seraient une validation à plus grande échelle et une intégration dans des pipelines de manipulation end-to-end, terrain sur lequel Physical Intelligence (Pi-0) et les équipes GR00T de NVIDIA travaillent en parallèle.

HumanoïdesPaper
1 source
WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés
138arXiv cs.RO 

WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés

Une équipe de chercheurs a publié WestWorld (arXiv:2603.14392), un modèle de monde trajectoire conçu pour opérer sur des systèmes robotiques hétérogènes. Préentraîné sur 89 environnements complexes couvrant une large variété de morphologies en simulation et en conditions réelles, le modèle cible deux lacunes récurrentes dans la littérature : la difficulté de passer à l'échelle face à un grand nombre de dynamiques système distinctes, et l'absence d'intégration des connaissances sur les structures physiques des robots. La validation réelle a été conduite sur un quadrupède Unitree Go1, où WestWorld a démontré des performances stables en locomotion. Le code source est disponible sur GitHub. L'architecture repose sur un mécanisme baptisé Sys-MoE (system-aware Mixture-of-Experts), qui route dynamiquement des experts spécialisés selon le système robotique fourni en entrée, via un embedding système appris. Un embedding structurel complémentaire aligne les représentations de trajectoires avec les informations morphologiques du robot, permettant au modèle de tenir compte du fait qu'un bras articulé, un quadrupède et une plateforme mobile n'obéissent pas aux mêmes contraintes physiques. Les résultats affichent des gains significatifs en prédiction de trajectoire zero-shot et few-shot face aux baselines compétitives, ainsi qu'une amélioration des performances sur le contrôle model-based downstream pour différentes plateformes robotiques. La scalabilité tient sur un spectre large d'environnements, ce qui constitue l'argument central de la contribution. La publication s'inscrit dans une tendance forte : appliquer aux robots les world models issus du monde des agents RL et des LLMs multimodaux, à l'image de Dreamer, UniSim, ou des frameworks VLA (Vision-Language-Action) orientés manipulation. WestWorld se distingue par son ambition généraliste multi-morphologie, là où la majorité des approches concurrentes restent spécialisées sur une famille de robots. L'usage du Unitree Go1 comme banc de test réel est pertinent mais reste un cas relativement balisé dans la littérature, ce qui nuance la portée de la démonstration sim-to-real. Les prochaines étapes logiques seront d'évaluer le transfert sur des morphologies plus complexes, humanoïdes notamment, là où les défis de généralisation sont encore ouverts.

RecherchePaper
1 source
Tests adversariaux des filtres de sécurité du robot humanoïde SPARK
139arXiv cs.RO 

Tests adversariaux des filtres de sécurité du robot humanoïde SPARK

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.19009) une étude de robustesse portant sur les filtres de sécurité SPARK pour robots humanoïdes. Le travail consiste en une réplication du cas de référence G1SportMode\D1\WG\SO\v1 dans le simulateur MuJoCo, puis en une batterie de tests adversariaux sur six méthodes de filtrage : RSSA, RSSS, SSA, CBF (Control Barrier Function), PFM et SMA. Les auteurs ont également construit un pipeline de post-traitement pour convertir les logs bruts SPARK en trois métriques exploitables, suivi d'objectif, distance minimale aux obstacles, et nombre de pas en collision. Résultat principal : certaines méthodes optimisent le suivi de trajectoire au détriment de l'évitement, tandis que d'autres réduisent les collisions sans maintenir l'efficacité de déplacement. L'importance de ce travail tient à un angle souvent négligé dans l'évaluation des humanoïdes : les benchmarks nominaux, ceux qui servent à comparer les méthodes en conditions idéales, ne capturent pas les modes d'échec qui émergent dans des environnements contraints. Trois types de perturbations ont été testés : densification des obstacles ("obstacle crowding"), estimation bruitée des distances, et information obstacle avec délai. Dans ces conditions, le comportement de sécurité de plusieurs filtres se dégrade significativement, un résultat qui contredit implicitement l'hypothèse que les scores de référence suffisent à valider une méthode avant déploiement terrain. Pour un intégrateur ou un responsable de sécurité industrielle, c'est un signal clair : la qualification d'un filtre de sécurité humanoïde doit inclure des scénarios de stress, pas seulement les cas nominaux. Le SPARK framework s'est imposé ces dernières années comme cadre de référence pour évaluer la sécurité des humanoïdes à corps complet, face à la complexité inhérente de ces systèmes : haute dimensionnalité, contraintes de collision multiples, proximité avec des opérateurs humains. Le cas répliqué ici est lié au robot Unitree G1, l'une des plateformes humanoïdes accessibles les plus répandues en recherche. Les concurrents directs dans cet espace incluent des travaux sur MPC avec CBF (MIT, CMU), les approches RoboSafe d'ETH Zurich, et les filtres embarqués dans Boston Dynamics Atlas. La suite logique de cette recherche serait un protocole de stress testing standardisé, intégrable dans les pipelines de CI/CD robotique avant déploiement en environnement semi-contrôlé.

RechercheOpinion
1 source
PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes
140arXiv cs.RO 

PRIME : estimation inertielle et de mouvement physiquement cohérente pour robots à pattes et humanoïdes

Une équipe de chercheurs a présenté PRIME (Physically-consistent Robotic Inertial and Motion Estimation), une méthode d'estimation de mouvement pour robots à pattes et humanoïdes publiée sur arXiv en mai 2026 (arXiv:2605.17681). Là où les pipelines conventionnels basés sur des filtres de Kalman étendus (EKF) ou la capture de mouvement externe ne reconstruisent que la cinématique, PRIME formule le problème comme une estimation MAP (Maximum A Posteriori) qui raffine simultanément les données proprioceptives brutes et les commandes des actionneurs pour produire une trajectoire dynamiquement cohérente. L'algorithme estime conjointement les forces de contact frictionnelles et les paramètres inertiels du robot (masses, centres de masse, moments d'inertie), via une modélisation différentiable de la dynamique de contact avec contraintes de complémentarité lissées et un modèle de friction d'Anitescu. Les validations ont été conduites sur des robots quadrupèdes et sur l'humanoïde Unitree G1, lors de séquences de locomotion à contacts multiples en déploiement réel. Le problème abordé est structurel : les pipelines de perception robotique actuels ignorent les forces de contact et les paramètres inertiels effectifs du système, ce qui entraîne des reconstructions qui violent régulièrement la dynamique des corps rigides, en particulier lors des phases de contact. Cette incohérence dégrade la qualité des données d'entraînement et limite la robustesse des contrôleurs en boucle fermée. PRIME produit des reconstructions de mouvement annotées en forces et contacts directement depuis des robots en déploiement terrain, sans infrastructure de laboratoire. Pour les équipes qui développent des modèles de fondation robotiques ou des architectures Visual-Language-Action (VLA), cette capacité représente une source de données haute qualité exploitable à grande échelle, là où la rareté d'annotations dynamiques fiables reste un goulot d'étranglement reconnu. L'estimation d'état pour robots à pattes est un problème ancien, historiquement traité par EKF couplés à la proprioception, la capture de mouvement restant cantonnée aux laboratoires. PRIME se distingue en proposant une solution embarquée et déployable en conditions réelles, sans dépendance à une infrastructure externe. L'humanoïde Unitree G1, commercialisé autour de 16 000 dollars et très présent dans la recherche académique mondiale, sert de banc de validation représentatif. Dans un contexte où Boston Dynamics, Figure AI, Agility Robotics, 1X et Unitree accumulent des données de déploiement pour alimenter leurs pipelines d'apprentissage, PRIME propose une brique méthodologique transversale pour enrichir ces corpus avec des annotations dynamiques fiables. Les applications naturelles incluent l'imitation learning, le transfert sim-to-real et l'entraînement de modèles de fondation à partir de données terrain.

UELes équipes de recherche européennes en locomotion robotique (INRIA, LAAS-CNRS) pourraient exploiter PRIME pour enrichir leurs pipelines d'entraînement sans infrastructure de laboratoire, mais aucun acteur ou institution européen n'est directement impliqué.

RecherchePaper
1 source
Asimov : un robot humanoïde open source accessible à tous
141Hackaday Robots Hacks 

Asimov : un robot humanoïde open source accessible à tous

Le projet Asimov v1 est un robot humanoïde open source en kit, proposé à un prix cible de 15 000 dollars, avec la nomenclature complète publiée sur GitHub pour permettre aux équipes de sourcer leurs propres composants. Doté de 25 degrés de liberté au total, il embarque un calculateur basé sur un Raspberry Pi 5 et un module Radxa CM5, deux références grand public faciles à approvisionner. Les performances physiques déclarées restent modestes : 5 kg en squat et 18 kg en tirage unilatéral à un bras, ce qui le positionne clairement dans la catégorie expérimentale. Tout le code est libre, laissant aux développeurs la latitude d'implémenter leurs propres couches de contrôle. À 15 000 dollars avec du matériel sur étagère, Asimov v1 représente une rupture de prix notable dans un secteur longtemps réservé aux géants industriels. Les démonstrations emblématiques de Honda (Asimo, programme lancé dans les années 1980) et les investissements massifs de Tesla pour Optimus ont durablement ancré l'image d'un marché inaccessible aux laboratoires ou aux startups. L'open source change la donne : une équipe universitaire ou un intégrateur peut désormais disposer d'une base matérielle documentée pour tester des modèles de contrôle visuomoteur ou des politiques d'apprentissage par renforcement sans dépendre d'un fournisseur propriétaire. Il convient toutefois de rester prudent sur les métriques publiées, présentées sans protocole de test standardisé et sans vidéo en conditions réelles. Asimov v1 s'inscrit dans une tendance de démocratisation du hardware robotique comparable à ce que l'open source a réalisé dans les drones avec ArduPilot ou PX4 dans les années 2010. Sur le segment accessible, il se distingue du Unitree G1 (environ 16 000 dollars, non open source) par sa transparence architecturale complète. Il reste très éloigné des plateformes industrielles comme Figure 03, Agility Robotics Digit ou Apptronik Apollo, qui ciblent la logistique avec des financements de plusieurs centaines de millions de dollars et des déploiements confirmés chez des partenaires industriels. Fédérer une communauté active de contributeurs sera la prochaine étape critique pour faire progresser les performances mécaniques et logicielles du projet.

UELes laboratoires universitaires et startups robotique français et européens disposent d'une base matérielle open source documentée à 15 000 $ pour prototyper des algorithmes de contrôle visuomoteur sans dépendre d'un fournisseur propriétaire.

HumanoïdesOpinion
1 source
DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale
142Pandaily 

DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale

DeepMotor, une startup pékinoise fondée par Chen Kai au début 2025, développe une approche d'intelligence artificielle incarnée (embodied AGI) basée sur l'entraînement à partir de vidéos en première personne capturées par des humains. Au lancement, la thèse de l'entreprise n'a convaincu ni les investisseurs domestiques ni la majorité du secteur : pourquoi parier sur une méthode que même les géants américains n'avaient pas encore validée ? La startup a levé plusieurs centaines de millions de RMB et poursuit aujourd'hui un déploiement accéléré. La chronologie des validations industrielles donne la mesure de son avance : en mai 2025, Tesla a annoncé réorienter l'entraînement d'Optimus vers des données vidéo humaines. En juin 2025, GeneralistAI a présenté une démo d'apprentissage imitatif robotique, puis a confirmé les lois de mise à l'échelle avec 270 000 heures de données humaines réelles collectées sur le terrain. FigureAI a de son côté annoncé des partenariats avec des opérateurs immobiliers commerciaux pour collecter des flux en première personne. En février 2026, NVIDIA a publié EgoScale, un modèle pré-entraîné sur 20 000 heures de vidéo première personne destiné à la manipulation dextre. L'importance de cette séquence dépasse le simple calendrier. Elle valide l'hypothèse centrale de DeepMotor : la vidéo en vue égocentrique est le signal d'apprentissage le plus dense pour combler le sim-to-real gap en robotique généraliste. Chaque acteur majeur converge vers cette approche non par choix idéologique, mais parce que les benchmarks internes le forcent. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que la prochaine génération de robots manipulateurs ne sera pas entraînée dans des simulateurs mais sur des flux de travail humains réels, ce qui redéfinit les exigences en matière de collecte de données et de gouvernance des contenus vidéo. DeepMotor s'inscrit dans un écosystème robotique chinois en forte accélération, concurrent direct d'Unitree, d'Agibot et des branches robotique de Baidu et Tencent, mais avec une orientation plus fondamentale sur la couche de données brutes plutôt que sur le hardware. La startup a devancé d'environ un an le consensus industriel mondial sur l'approche egocentric data, ce qui lui confère une position de référence potentielle si elle parvient à publier ses propres scaling laws ou à ouvrir un dataset. Les prochaines étapes probables incluent la publication de résultats comparatifs et des partenariats avec des fabricants de robots humanoides pour valider le transfert de politique sur des plateformes tiers. La source originale (Waves/暗涌) reste un media chinois spécialisé, et les chiffres de levée ne sont pas précisément détaillés.

UELe basculement de l'industrie vers les données vidéo égocentristes comme signal d'entraînement de référence redéfinira les exigences de collecte de données et de gouvernance vidéo pour les intégrateurs et fabricants de robots européens, sans acteur français ou européen directement impliqué à ce stade.

Chine/AsieOpinion
1 source
VEGA : alignement par ancrage de l'encodeur visuel pour les modèles VLA à conscience spatiale
143arXiv cs.RO 

VEGA : alignement par ancrage de l'encodeur visuel pour les modèles VLA à conscience spatiale

Des chercheurs proposent VEGA (Visual Encoder Grounding Alignment), publié sur arXiv (2605.10485) en mai 2026, un cadre d'alignement destiné à corriger un défaut structurel des modèles vision-langage-action (VLA) : leurs encodeurs visuels, préentraînés sur des images 2D, manquent de perception géométrique 3D. VEGA aligne la sortie de l'encodeur visuel du VLA directement avec les features spatiales de DINOv2-FiT3D, une variante de DINOv2 (Meta) affinée via supervision par 3D Gaussian Splatting multi-vues. L'alignement repose sur un projecteur léger entraîné par perte cosinus en parallèle de la prédiction d'action standard, puis éliminé à l'inférence pour ne pas alourdir le runtime. Sur benchmarks de simulation et tâches réelles de manipulation, VEGA établit un nouvel état de l'art parmi les méthodes d'ancrage spatial implicite. L'enjeu opérationnel est direct : la manipulation fine exige une compréhension géométrique de la scène, pas uniquement sémantique. Les approches existantes alignaient déjà les VLA avec des modèles 3D-aware, mais au niveau des tokens LLM, là où spatial et linguistique sont déjà mélangés, limitant la généralisation. En remontant l'alignement à l'encodeur visuel, VEGA évite cette contamination sémantique et produit un ancrage plus interprétable. Pour un intégrateur ou un fabricant de bras manipulateurs, le ratio est favorable : gain de précision spatiale sans surcoût à l'inférence, et compatibilité avec des architectures VLA existantes sans refonte. Cette contribution s'inscrit dans la course aux VLA comme couche de contrôle universelle : Physical Intelligence (π0, π0.5), Google DeepMind et NVIDIA (GR00T N2), Figure AI (Helix) ou Unitree reposent tous sur des architectures de ce type. La faiblesse du raisonnement 3D dans les VLA reste un frein documenté au passage démo-vers-déploiement, et plusieurs équipes y travaillent via sim-to-real et foundation models 3D. VEGA choisit une voie minimaliste : pas de pipeline 3D à l'inférence, juste un alignement ciblé à l'entraînement. Aucun déploiement industriel ni partenariat commercial n'est mentionné, c'est une contribution académique, mais sa légèreté architecturale la rend directement intégrable dans des projets en cours.

IA physiqueOpinion
1 source
IA incarnée : conditionnement géométrique explicite des escaliers pour une locomotion humanoïde robuste
144arXiv cs.RO 

IA incarnée : conditionnement géométrique explicite des escaliers pour une locomotion humanoïde robuste

Des chercheurs ont publié sur arXiv (2605.09944) un cadre de conditionnement géométrique explicite pour la montée d'escaliers par robot humanoïde. Le système extrait trois paramètres compacts depuis la perception : la hauteur de marche, la profondeur de marche, et l'angle de lacet courant par rapport au cap du robot. Ces paramètres conditionnent directement une politique de locomotion entraînée par Proximal Policy Optimization (PPO), permettant une modulation proactive de la hauteur d'enjambée et des caractéristiques de foulée selon la géométrie de l'escalier. Validé sur le Unitree G1, humanoïde à 23 degrés de liberté de Unitree Robotics, le système a enchaîné 33 marches consécutives en extérieur sans défaillance lors des expériences en conditions réelles. Des tests en simulation confirment par ailleurs une généralisation à des hauteurs de marches hors de la distribution d'entraînement. L'intérêt de l'approche tient au choix de représentations explicites et interprétables plutôt que des encodages latents haute dimension. Les politiques de locomotion actuelles s'appuient généralement sur du feedback proprioceptif aveugle ou des représentations implicites du terrain, ce qui limite leur capacité à anticiper les ajustements de gait face à des géométries non vues, problème central du sim-to-real gap. En conditionnant la politique sur des paramètres lisibles par un ingénieur, le système peut moduler proactivement la hauteur d'enjambée avant le contact, là où une représentation opaque réagirait après coup. Pour un intégrateur ou un COO logistique, cela se traduit par une robustesse prédictive accrue dans des environnements réels non maîtrisés, sans instrumentation supplémentaire des escaliers. Le Unitree G1, commercialisé depuis 2024 à partir de 16 000 USD, s'est imposé comme plateforme de référence pour la recherche en locomotion humanoïde grâce à sa disponibilité et son prix d'accès. Unitree concurrence directement Agility Robotics (Digit), Boston Dynamics (Atlas) et des startups comme Figure ou 1X sur la capacité à opérer dans des espaces tertiaires et industriels non modifiés. La traversée d'escaliers reste un verrou opérationnel clé pour les déploiements logistiques et de services, segment où des acteurs européens comme Wandercraft et Enchanted Tools opèrent sur des créneaux voisins mais distincts. L'article, soumis en preprint sans revue par les pairs à ce stade, ne fournit pas de comparaison quantitative avec d'autres politiques sur le même matériel, ce qui limite l'évaluation rigoureuse des gains réels.

UELa traversée d'escaliers étant un verrou opérationnel clé pour les déploiements en espaces non modifiés, cette avancée fixe un niveau de référence que des acteurs européens comme Wandercraft et Enchanted Tools devront intégrer dans leur feuille de route locomotion.

RecherchePaper
1 source
Figure et 1X accélèrent la production de robots humanoïdes
145IEEE Spectrum Robotics 

Figure et 1X accélèrent la production de robots humanoïdes

Figure atteint désormais une cadence de production de 55 robots humanoïdes par semaine, selon une annonce publiée fin avril 2026. Ces unités sont, selon la startup américaine, destinées aux équipes internes de R&D, à la collecte de données, au développement de tâches domestiques de bout en bout et à des "cas d'usage commerciaux en développement", une formulation qui interroge sur la destination réelle de cette production alors que les déploiements commerciaux restent à maturité. En parallèle, 1X Technologies a officiellement ouvert la NEO Factory à Hayward, en Californie : une usine de 58 000 pieds carrés (environ 5 400 m²) employant plus de 200 personnes, avec une chaîne entièrement intégrée couvrant moteurs, batteries, transmissions, capteurs, structures et assemblage final. Les premières unités NEO sortent déjà des lignes de production, avec des livraisons grand public annoncées pour 2026. Sur le plan technique, Agility Robotics a publié des tests d'équilibre dynamique sur une seule jambe pour son robot Digit, et une équipe de recherche a présenté HTD (Humanoid Transformer with Touch Dreaming), un système de manipulation humanoïde combinant téleopération VR, apprentissage par renforcement pour le bas du corps et capteurs tactiles distribués. La montée en cadence simultanée de Figure et 1X marque un glissement du secteur humanoïde vers la production industrielle, mais chaque annonce appelle une lecture critique. Produire 55 unités par semaine sans contrats commerciaux confirmés suggère soit une stratégie de collecte de données à grande échelle, ressource clé pour l'entraînement des politiques VLA (Vision-Language-Action), soit une anticipation agressive de la demande avant une prochaine levée de fonds. L'intégration verticale revendiquée par 1X, inspirée du modèle Tesla, offre une flexibilité d'itération et réduit la dépendance aux fournisseurs, mais mobilise des capitaux considérables. Les travaux d'Agility sur l'équilibre dynamique illustrent par ailleurs que le gap sim-to-real reste un verrou technique central : la moindre divergence entre modèle simulé et robot réel peut provoquer une instabilité en conditions réelles, limitant directement la fiabilité en milieu industriel. Figure, fondée en 2022 par Brett Adcock, a levé plus de 750 millions de dollars avec BMW, Microsoft et Amazon comme partenaires, et opère un pilote chez BMW Manufacturing en Caroline du Sud depuis 2024, bien que les vidéos publiées restent en conditions contrôlées. 1X, société norvégienne soutenue par OpenAI et Tiger Global, se positionne sur le marché résidentiel face à Tesla Optimus (déployé progressivement dans les usines Tesla), aux robots Agility Digit (opérés chez Amazon) et aux fabricants chinois comme Unitree (G1, H1) qui exercent une pression tarifaire croissante. Aucun acteur européen, ni Wandercraft, ni Enchanted Tools, ni Pollen Robotics, n'annonce de production à ce volume pour l'instant. Les prochains trimestres détermineront si ces cadences correspondent à des commandes fermes ou à une stratégie de positionnement avant financement.

UELa montée en cadence de Figure et 1X exerce une pression concurrentielle sur les acteurs européens (Wandercraft, Enchanted Tools, Pollen Robotics), qui n'annoncent pas de volumes de production comparables à ce stade.

HumanoïdesActu
1 source
Apprentissage du parkour pour quadrupèdes : mélange d'experts parcimonieux avec entrée visuelle
146arXiv cs.RO 

Apprentissage du parkour pour quadrupèdes : mélange d'experts parcimonieux avec entrée visuelle

Des chercheurs ont publié sur arXiv (référence 2604.19344) une étude comparant deux architectures de réseaux de neurones pour le contrôle d'un robot quadrupède Unitree Go2 face à des obstacles de parkour, notamment des marches et discontinuités élevées. L'architecture testée repose sur un mécanisme dit de "mixture d'experts à portes creuses" (sparsely gated MoE) : au lieu d'activer tous les paramètres du réseau à chaque inférence, seul un sous-ensemble d'experts spécialisés est sollicité selon le contexte. Les résultats sur robot réel sont nets : la politique MoE atteint le double de taux de succès dans la traversée de grands obstacles par rapport à une baseline MLP classique, à budget computationnel identique (même nombre de paramètres actifs à l'inférence). Pour obtenir des performances équivalentes avec un MLP dense, il faut augmenter sa taille totale au niveau du MoE complet, ce qui entraîne une hausse de 14,3 % du temps de calcul. L'intérêt de ce résultat tient moins aux performances brutes qu'à ce qu'il démontre structurellement : les gains architecturaux qui ont propulsé les grands modèles de langage (Mixtral, GPT-4 et consorts utilisent des variantes MoE) sont transférables aux politiques de contrôle robotique bas niveau. Cela valide une intuition croissante dans la communauté : la scalabilité des politiques de locomotion n'est pas uniquement une question de données ou de sim-to-real, mais aussi d'architecture. Pour les équipes travaillant sur des robots embarqués avec contraintes computationnelles, l'activation creuse offre un levier concret pour améliorer les performances sans alourdir les exigences matérielles. Le parkour quadrupède s'est imposé ces deux dernières années comme un benchmark exigeant pour la locomotion, avec des travaux notables issus de Berkeley, ETH Zurich et CMU sur des plateformes similaires (ANYmal, Spot, Go1/Go2). L'approche dominante jusqu'ici reposait sur des MLP séquentiels entraînés par reinforcement learning en simulation puis transférés sur le robot physique. Cette étude, dont le code est accessible en version anonymisée, ouvre une piste d'amélioration architecturale orthogonale aux efforts habituels sur les données ou les environnements de simulation. Les prochaines étapes naturelles concerneraient l'extension à des environnements plus complexes et l'évaluation du comportement des experts spécialisés pour mieux comprendre la décomposition fonctionnelle apprise.

RecherchePaper
1 source
CLAW : génération de mouvements corps entier composables et annotés en langage naturel
147arXiv cs.RO 

CLAW : génération de mouvements corps entier composables et annotés en langage naturel

Une équipe de chercheurs a publié CLAW (Composable Language-Annotated Whole-body Motion Generation), un pipeline open source conçu pour générer à grande échelle des données de mouvement annoté en langage naturel pour robots humanoïdes, appliqué ici au Unitree G1. Le système compose des primitives de mouvement paramétrées par six variables, type de déplacement, cap, vitesse, hauteur du bassin (pelvis height) et durée, et les exécute dans le simulateur MuJoCo pour produire des trajectoires physiquement cohérentes. Deux interfaces navigateur sont proposées : un mode clavier en temps réel pour l'exploration, et un éditeur de séquences en timeline pour la collecte de données en batch. En parallèle, un moteur de génération d'annotations basé sur des templates produit des descriptions en langage naturel à deux niveaux de granularité : segment individuel et trajectoire complète. Le code est disponible publiquement sur GitHub sous la référence arXiv:2604.11251. L'enjeu central est le goulot d'étranglement des données pour entraîner des contrôleurs whole-body conditionnés au langage (VLA, Vision-Language-Action). La capture de mouvement réelle est coûteuse, peu scalable et limitée en diversité ; les modèles génératifs text-to-motion existants produisent des sorties purement cinématiques, sans garantie de faisabilité physique, un écueil critique pour le déploiement réel. CLAW apporte une réponse intermédiaire : la simulation MuJoCo ancre les trajectoires dans la physique, tandis que la composition modulaire de primitives permet une diversité combinatoire élevée. C'est une approche sim-to-real pragmatique qui vise à réduire le fossé entre données d'entraînement et comportement robot en conditions réelles, sans le coût d'un studio de mocap. Le Unitree G1, robot humanoïde chinois positionné sur le segment accessible (prix catalogue autour de 16 000 USD), est une plateforme de recherche de plus en plus utilisée dans la communauté académique, notamment face aux plateformes fermées comme Figure 02 ou Apptronik Apollo. CLAW s'inscrit dans une dynamique plus large de démocratisation des pipelines de données pour la robotique humanoïde, aux côtés de travaux comme le dataset HumanoidBench ou les approches de Physical Animation de Berkeley. La mise à disposition publique du système est son principal atout différenciant : elle permet aux laboratoires sans ressources de mocap de constituer des jeux de données whole-body annotés pour leurs propres expériences de contrôle en langage. Les prochaines étapes attendues, non annoncées dans ce papier, concernent le transfert réel sur G1 et la validation des politiques entraînées sur ces données synthétiques.

UELes laboratoires européens de recherche en robotique humanoïde peuvent exploiter ce pipeline open source pour constituer des jeux de données whole-body annotés sans infrastructure de mocap coûteuse.

IA physiqueOpinion
1 source
Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives
148arXiv cs.RO 

Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives

Une revue systématique publiée sur arXiv (2604.15395) recense l'état de l'art des modèles de fondation appliqués à la robotique, couvrant l'ensemble du spectre allant des grands modèles de langage (LLM) aux architectures vision-langage-action (VLA). Les auteurs structurent leur analyse en cinq phases historiques distinctes, depuis les premières intégrations de modèles NLP et vision par ordinateur jusqu'aux déploiements multi-sensoriels en environnement réel. La taxonomie proposée examine six axes : les types de modèles employés (LLM, VFM, VLM, VLA), les architectures de réseaux de neurones sous-jacentes, les paradigmes d'apprentissage, les stades d'incorporation des connaissances, les tâches robotiques ciblées, et les domaines applicatifs industriels. L'étude recense également les datasets publics utilisés pour l'entraînement et l'évaluation sur ces différentes tâches. L'intérêt de ce travail pour les intégrateurs et les décideurs industriels réside dans sa cartographie des capacités réelles versus annoncées des VLA en déploiement. Le passage d'agents mono-tâche et spécialisés vers des agents adaptatifs multi-fonctions à usage général constitue le fil directeur de l'analyse. Les auteurs traitent explicitement du gap simulation-réalité (sim-to-real), de la généralisation inter-embodiment (cross-embodiment), et de la planification à horizon long, trois verrous techniques qui conditionnent la commercialisation à grande échelle. La revue identifie aussi les défis ouverts et les directions de recherche prometteuses, utiles pour orienter des feuilles de route R&D. Ce survey s'inscrit dans une accélération documentée depuis 2022, portée par des laboratoires comme Google DeepMind (RT-2, π0), Physical Intelligence, Figure AI, et Unitree, qui ont tous misé sur les VLA comme colonne vertébrale de leurs systèmes. Côté européen, des acteurs comme Enchanted Tools ou Wandercraft n'apparaissent pas dans ce corpus, ce qui reflète un déséquilibre de publication favorable aux équipes nord-américaines et asiatiques. La revue ne constitue pas un benchmark expérimental indépendant mais une synthèse bibliographique, ce qui en fait un point d'entrée solide pour un ingénieur robotique cherchant à situer une technologie ou comparer des approches, sans remplacer une évaluation terrain des solutions commerciales disponibles.

UELe déséquilibre de publication constaté, acteurs FR/EU (Enchanted Tools, Wandercraft) absents du corpus, souligne un déficit de visibilité des équipes européennes dans la recherche VLA, ce qui peut biaiser les benchmarks de référence utilisés par les industriels pour orienter leurs feuilles de route R&D.

RecherchePaper
1 source
Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde
149arXiv cs.RO 

Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde

Une équipe de chercheurs a publié NMR (Neural Motion Retargeting), un framework d'apprentissage automatique conçu pour résoudre l'un des verrous fondamentaux de la robotique humanoïde : transférer des mouvements humains bruts vers un robot physique sans générer d'artefacts cinématiques. Testé sur le Unitree G1, un humanoïde à 23 degrés de liberté commercialisé autour de 16 000 dollars, NMR démontre sa capacité sur des tâches dynamiquement exigeantes comme les arts martiaux et la danse. Les résultats publiés montrent une élimination quasi-totale des "joint jumps" (discontinuités articulaires) et une réduction significative des auto-collisions par rapport aux méthodes de référence actuelles, tout en accélérant la convergence des politiques de contrôle en aval. Le problème que NMR adresse est structurel. Les approches traditionnelles par optimisation géométrique sont non-convexes et convergent systématiquement vers des optima locaux, produisant des mouvements physiquement incohérents inutilisables pour l'entraînement de politiques de contrôle. NMR reformule le problème différemment : au lieu de chercher une solution optimale, il apprend la distribution des données de mouvement valides. Le pipeline repose sur CEPR (Clustered-Expert Physics Refinement), qui utilise un VAE pour regrouper les mouvements humains hétérogènes en motifs latents homogènes, puis fait intervenir des experts en reinforcement learning massivement parallèle pour projeter chaque cluster sur le manifold de mouvements réalisables du robot. Ces données haute-fidélité supervisent ensuite un réseau hybride CNN-Transformer non-autoregressif capable de raisonner sur le contexte temporel global, évitant les pièges géométriques locaux. L'implication pour les intégrateurs est directe : un pipeline de retargeting plus robuste signifie moins de curation manuelle des données de démonstration, goulot d'étranglement majeur dans le développement de politiques whole-body. Ce travail s'inscrit dans une compétition intense autour du sim-to-real et du retargeting humain-robot, domaine où s'affrontent des approches comme SMPL-based retargeting, PhysHOI ou encore les pipelines de Berkeley Humanoid. Unitree, fabricant chinois qui positionne le G1 comme plateforme de recherche accessible face aux robots Figure, Agility ou Boston Dynamics, bénéficie directement de ces avancées publiées en open research. La prochaine étape naturelle sera la validation sur des tâches de manipulation en environnement non structuré, où la cohérence whole-body entre locomotion et bras reste le défi non résolu du secteur.

RecherchePaper
1 source
L'usine Tesla de Shanghai capable de produire des robots humanoïdes, selon son président en Chine
150SCMP Tech 

L'usine Tesla de Shanghai capable de produire des robots humanoïdes, selon son président en Chine

Allan Wang Hao, président de Tesla Chine, a déclaré lors d'un briefing médias ce mardi que la Gigafactory de Shanghai, la plus grande base de production du constructeur américain, pourrait constituer une "clé en or" pour la fabrication en masse de robots humanoïdes. Wang n'a pas annoncé de calendrier précis ni de volume de déploiement, mais il a explicitement lié la capacité manufacturière exceptionnelle du site, qui produit actuellement plus de 450 000 véhicules par an, à l'ambition d'Elon Musk de commercialiser l'Optimus à grande échelle. Aucun chiffre de production cible pour le robot n'a été communiqué lors de cet événement. Cette déclaration signale une évolution stratégique notable : Tesla envisage de faire de sa chaîne automobile existante un vecteur d'industrialisation robotique, ce qui réduirait structurellement les coûts de montée en cadence. Pour les décideurs industriels, cela suggère que le vrai différenciateur dans la course humanoïde ne sera pas uniquement la performance du modèle d'IA, mais la maîtrise du scale-up manufacturier, un domaine où Tesla dispose d'un avantage reconnu. Il reste cependant à distinguer cette déclaration d'intention d'un engagement de production ferme. Tesla teste actuellement des unités Optimus Gen 2 en interne dans plusieurs de ses usines, sans déploiement commercial confirmé à ce jour. Sur le marché, les concurrents directs incluent Figure AI (Figure 02), Agility Robotics (Digit, déployé chez Amazon), et le chinois Unitree. La Gigafactory de Shanghai, implantée en Chine, donnerait également à Tesla un accès privilégié à la chaîne d'approvisionnement en composants robotiques, dominée par des fournisseurs asiatiques, ce qui constitue un levier logistique non négligeable pour atteindre les objectifs de coût évoqués par Musk.