Aller au contenu principal

Dossier Unitree — page 2

458 articles · page 2 sur 10

Unitree, l'humanoïde et quadrupède chinois low-cost : G1, H1, R1, prix grand public sur AliExpress, démonstrations agressives en vidéo et impact sur les concurrents premium.

Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes
51arXiv cs.RO RecherchePaper

Recherche technique d'ABot-C0 sur les comportements fondamentaux pour robots quadrupèdes

ABot-C0, présenté dans un rapport technique publié sur arXiv (2607.07370), est un système généraliste de contrôle de mouvement pour robots quadrupèdes reposant sur trois piliers complémentaires. Les chercheurs ont d'abord construit une pyramide de données combinant génération vidéo conditionnelle, capture de mouvement annotée, téléopération et conception manuelle, pour produire 16 074 séquences de mouvement physiquement réalisables. Sur cette base, ils ont entraîné une politique généraliste par flow-matching qui, selon les auteurs, démontre pour la première fois une loi d'échelle pour le suivi de mouvement chez les quadrupèdes: les performances s'améliorent de façon constante avec l'augmentation des données d'entraînement, avec une capacité à suivre des mouvements inédits sans exemples spécifiques (zero-shot). Pour la locomotion sur tout-terrain, l'équipe a développé un cadre en trois étapes passant d'un contrôle privilégié à un contrôle perceptif, appuyé sur une mémoire temporelle LiDAR et une supervision prédictive du terrain. Le système a été testé en navigation autonome sur terrain urbain et en interaction multimodale de type compagnon. L'enjeu dépasse la simple démonstration technique. Contrairement aux robots humanoïdes, qui bénéficient de vastes corpus de capture de mouvement humain et d'un paradigme de motion-tracking déjà mature, les quadrupèdes souffrent d'un manque criant de données animales exploitables, et le transfert d'un squelette à un autre reste fragile. En traitant ce problème par la synthèse vidéo et une politique d'apprentissage unifiée, ce travail cherche à combler l'écart entre les deux familles de robots. La revendication centrale, faire passer les quadrupèdes de démonstrations mono-fonction à une intelligence comportementale de niveau produit, doit toutefois être lue comme une affirmation d'auteurs de papier de recherche, non comme un déploiement commercial vérifié: les expériences relatées restent des tests en conditions contrôlées ou semi-contrôlées, pas des mises en service industrielles à grande échelle. Ce travail s'inscrit dans une dynamique plus large où l'apprentissage de bout en bout par grands modèles de mouvement, déjà éprouvé sur les humanoïdes commerciaux, cherche à s'étendre aux plateformes quadrupèdes utilisées en inspection, sécurité ou logistique, un segment où des acteurs comme Unitree, ANYbotics ou Boston Dynamics dominent aujourd'hui avec des commandes plus classiques. En s'appuyant sur des données synthétiques plutôt que sur la capture animale, coûteuse et rare, les auteurs ouvrent une piste pour industrialiser l'entraînement de ces robots. Aucune date de déploiement commercial ni partenaire industriel n'est mentionnée dans ce rapport, qui reste à ce stade une contribution académique destinée à être suivie par d'autres itérations.

1 source
Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines
52Interesting Engineering 

Robot humanoïde industriel français : apprentissage accéléré grâce aux démonstrations humaines

La startup française UMA a dévoilé le design de son premier robot humanoïde alimenté par IA lors du Machina Summit à Paris. L'engin affiche des proportions à taille humaine, une visière neutre en guise de visage plutôt qu'un visage anthropomorphe, et des articulations mécaniques volontairement visibles. UMA vise en priorité les usines, les entrepôts et les centres logistiques, avec un usage domestique envisagé à terme, et fait de l'Europe son premier marché de déploiement. La société a présenté en parallèle son architecture "Real-Time Learning", un système d'IA qui permet au robot d'apprendre de nouvelles tâches par démonstration humaine plutôt que par programmation manuelle : il observe une tâche, s'entraîne, s'adapte aux conditions changeantes et améliore ses performances avec l'expérience. Aucune spécification technique détaillée (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade. "Les robots humanoïdes mettront des années à atteindre un déploiement à grande échelle, tout comme Internet et les smartphones ont eu besoin de temps avant de transformer des industries entières", a déclaré Rémi Cadène, PDG et cofondateur d'UMA. L'annonce intervient peu après le dévoilement par l'américain Weave Robotics de son robot domestique Isaac 1, capable de ranger une pièce ou faire la lessive avec assistance humaine à distance. Pour les intégrateurs et décideurs industriels, ce pari sur l'apprentissage par démonstration illustre un basculement plus large du secteur : remplacer la programmation tâche par tâche par des modèles capables de généraliser, la même logique que poursuivent les architectures VLA (vision-language-action) de Physical Intelligence ou de NVIDIA. Si la promesse tient, elle réduirait le temps et le coût d'intégration d'un robot dans une chaîne existante, un frein majeur à l'adoption des humanoïdes en usine. Il faut toutefois noter qu'UMA n'a pour l'instant montré qu'un design et un concept d'architecture, sans vidéo de démonstration ni métrique de performance vérifiable : il s'agit d'une annonce de positionnement, pas d'un produit livré ni d'un déploiement réel. Le choix explicite d'une visière neutre plutôt qu'un visage humain, et l'exposition volontaire des articulations, traduit une volonté de se démarquer des démonstrations spectaculaires façon Tesla Optimus ou Figure, au profit d'un discours centré sur la fiabilité industrielle de long terme plutôt que sur l'effet de démonstration publique. UMA a été cofondée par Rémi Cadène, connu pour avoir dirigé le projet LeRobot chez Hugging Face, une bibliothèque open-source d'apprentissage par imitation qui a contribué à démocratiser l'entraînement de robots par démonstration, un héritage direct dans l'architecture Real-Time Learning présentée aujourd'hui. La startup entre sur un marché déjà occupé par les géants américains (Tesla avec Optimus, Figure et son modèle Helix, Physical Intelligence avec Pi-0) et chinois (Unitree, UBTech), ainsi que par des humanoïdes grand public comme Isaac 1 de Weave Robotics. Face à cette concurrence, UMA mise sur l'écosystème industriel et de recherche européen ainsi que sur la pénurie de main-d'œuvre du continent pour justifier son positionnement. Aucun calendrier précis de commercialisation ni de pilotes clients n'a été communiqué au-delà de cette présentation du design, ce qui laisse ouverte la question du délai entre ce concept et un déploiement industriel effectif.

UEUMA est une startup française qui fait de l'Europe son premier marché de déploiement pour un robot humanoïde industriel, renforçant l'écosystème robotique franco-européen face à la concurrence américaine et chinoise.

FR/EU ecosystemeOpinion
1 source
Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées
53arXiv cs.RO 

Le paradoxe de l'accélération : repenser le compromis vitesse-qualité à l'inférence dans les tâches incarnées

Des chercheurs ont déposé fin juin 2026 sur arXiv (réf. 2606.28529) une étude qui remet en question une hypothèse centrale de l'optimisation des modèles robotiques de fondation : supposer qu'une latence d'inférence réduite par pas d'action améliore mécaniquement les performances à l'échelle de la tâche. Le papier introduit TISED (Task-level Inference Speedup Effect Decomposition), un cadre analytique unifiant les techniques "avec perte" couramment appliquées aux modèles embarqués, notamment la quantization, l'élagage (pruning) et l'inférence asynchrone. L'étude documente trois paradoxes sur deux familles de tâches : sur les tâches statiques, l'optimisation peut allonger le temps d'exécution total même quand la latence par action diminue ; sur les tâches dynamiques, une compression modérée peut faire monter le taux de succès au-dessus de la ligne de base non-optimisée ; et l'emplacement du point d'équilibre optimal dépend de la configuration matérielle du robot. Ce résultat interroge directement les équipes déployant des VLA (Vision-Language-Action) en production, qu'il s'agisse de bras manipulateurs en usine ou de robots humanoïdes en entrepôt. L'industrie a massivement adopté la quantization et le pruning en supposant un arbitrage simple : un peu de qualité d'action contre une réduction de latence et de coût de calcul. TISED montre que ce compromis est trompeur. Sur les tâches statiques à longues séquences, la dégradation par pas s'accumule et peut effacer le gain de vitesse global. Sur les tâches dynamiques, la boucle fermée propre à l'exécution robotique crée des dynamiques que les benchmarks statiques ne capturent pas, ce qui explique pourquoi un modèle légèrement compressé peut paradoxalement mieux performer en répondant plus fréquemment à l'environnement. Ce travail s'inscrit dans la course à l'inférence rapide portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous contraints à tourner sur du matériel embarqué limité. L'enjeu est particulièrement critique pour les acteurs qui visent un déploiement à grande échelle, comme Figure AI dans ses usines BMW, ou les plateformes AMR européennes comme Exotec. TISED reste à ce stade un preprint non évalué par les pairs, sans validation publiée sur du matériel physique ; les prochaines étapes naturelles seraient une confrontation avec des benchmarks standard comme RoboMimic ou Calvin, et des tests sur des plateformes réelles comme Unitree ou Franka.

UELes plateformes AMR européennes comme Exotec, qui déploient ou évaluent des systèmes VLA embarqués, devront réévaluer leurs hypothèses d'optimisation d'inférence (quantization, pruning) à la lumière des paradoxes documentés par TISED avant tout déploiement à grande échelle.

RechercheOpinion
1 source
GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité
54arXiv cs.RO 

GaRLILEO : odométrie radar-jambes-inertielle améliorée et alignée sur la gravité

Des chercheurs ont publié sur arXiv (référence 2511.13216v2) GaRLILEO, un framework d'odométrie à temps continu fusionnant radar Doppler embarqué (radar SoC), cinématique des jambes et centrale inertielle (IMU) pour les robots à pattes évoluant sur terrains complexes, escaliers, pentes, environnements non structurés. Le système introduit deux contributions principales : une spline de vitesse ego-motion construite en continu à partir des mesures Doppler du radar et des données proprioceptives des jambes, découplant ainsi l'estimation de vitesse de l'intégration IMU ; et un facteur de gravité à contrainte douce sur la sphère S2, permettant d'estimer le vecteur gravité avec précision sans recourir à LiDAR ni caméra. L'algorithme a été évalué sur un dataset réel multimodalités collecté par l'équipe, couvrant des trajectoires intérieures et extérieures variées. Les auteurs revendiquent des performances état de l'art en odométrie verticale sur escaliers et pentes. Le code et le dataset sont publiés en open source. La dérive verticale est le talon d'Achille des systèmes d'odométrie proprioceptive pour robots bipèdes ou quadrupèdes : les impacts de contact répétés, le glissement des pieds et les vibrations accumulent des erreurs sur les angles de roulis et tangage, rendant la localisation peu fiable dès que le terrain n'est plus plan. Les approches existantes compensent avec du LiDAR ou des caméras, mais ces capteurs extéroceptifs se dégradent dans les scènes pauvres en features ou répétitives (couloirs, tunnels, zones enneigées). GaRLILEO propose une alternative robuste : le radar Doppler, peu sensible aux conditions d'éclairage et aux surfaces texturées, fournit une mesure directe de vitesse sans double intégration, ce qui élimine la source principale d'erreur IMU. Pour les intégrateurs déployant des robots d'inspection ou de logistique en environnement industriel réel, cette combinaison radar-pattes-IMU représente un profil de robustesse différent des stacks LiDAR-SLAM dominants. L'odométrie pour robots à pattes s'est structurée autour de quelques frameworks proprioceptifs de référence, TSIF, Pronto, DRIFT, et de pipelines LiDAR-inertiel comme LIO-SAM ou FAST-LIO. L'ajout du radar comme modalité principale reste marginal dans la littérature legged robotics, contrairement au domaine automobile où les radars 4D SoC (Texas Instruments, Vayyar, Arbe) ont connu une forte adoption. GaRLILEO s'inscrit dans une tendance récente visant à exploiter ces puces radar embarquées bas coût pour la navigation en intérieur dégradé. Les prochaines étapes naturelles incluent la validation sur des plateformes commerciales (Spot de Boston Dynamics, ANYmal de ANYbotics, Unitree B2) et l'intégration dans des pipelines SLAM complets. La mise en open source du dataset multimodale constitue en soi une contribution pour le benchmarking communautaire.

UELe code et le dataset open-source pourraient être exploités par des équipes de recherche européennes travaillant sur la navigation de robots à pattes (ex. ANYbotics en Suisse, labos SLAM EU), mais aucun acteur français ou européen n'est directement impliqué dans les travaux.

RecherchePaper
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
55Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

UELes modèles WALL-OSS-0.5 et WALL-WM étant open source, les équipes R&D européennes peuvent les évaluer directement ; la montée en puissance de l'écosystème chinois (Alibaba, ByteDance, Meituan comme investisseurs lead simultanés) intensifie la pression concurrentielle sur les acteurs européens de l'IA incarnée.

Chine/AsieOpinion
1 source
Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond
56arXiv cs.RO 

Introduction aux représentations d'actions SO(3) en apprentissage par renforcement profond

Une étude publiée sur arXiv (référence 2510.11103, troisième révision) analyse systématiquement comment les différentes représentations mathématiques du groupe SO(3), l'espace des rotations 3D, influencent l'apprentissage par renforcement appliqué au contrôle robotique. Les chercheurs ont comparé quatre familles de représentations courantes : angles d'Euler, quaternions, matrices de rotation et coordonnées d'algèbre de Lie, en les évaluant sur trois algorithmes d'RL continus de référence (PPO, SAC et TD3), sous deux régimes de récompenses (dense et sparse), et sur une suite de benchmarks robotiques standardisés. Le résultat central : représenter les actions comme des vecteurs tangents dans le repère local donne les résultats les plus fiables et les plus stables, quel que soit l'algorithme utilisé. Le code et la page projet sont disponibles à amacati.github.io/so3_primer. Ce résultat a une portée directe pour les ingénieurs qui développent des politiques de contrôle pour la manipulation ou la locomotion humanoïde. Le choix de représentation n'est pas neutre : la géométrie induite par chaque paramétrisation conditionne la manière dont l'agent explore l'espace des actions, interagit avec la régularisation entropique (notamment dans SAC), et converge, ou échoue à converger, lors de l'entraînement. Les angles d'Euler souffrent de singularités connues (gimbal lock), les quaternions imposent une contrainte de norme unitaire difficile à respecter en sortie de réseau neuronal, et les matrices de rotation introduisent des redondances qui compliquent la projection sur SO(3) valide. L'étude fournit des recommandations directement applicables, ce qui est rare dans la littérature RL sur la rotation. La problématique SO(3) est bien documentée pour l'apprentissage supervisé, notamment dans les pipelines d'estimation de pose, mais ses implications pour les actions en RL restaient peu explorées. Ce travail comble ce manque à un moment où les politiques d'entrée-sortie continues (VLA, diffusion policies, flux-matching) deviennent centrales dans les robots manipulateurs commerciaux. Les équipes qui développent des politiques pour des plateformes comme Figure 03, Unitree H1 ou des manipulateurs industriels s'appuient de plus en plus sur SAC et TD3 ; savoir que la représentation en vecteur tangent surpasse systématiquement les alternatives simplifie un choix d'architecture souvent fait de manière empirique. Les auteurs publient le code en open source, ce qui permettra à la communauté de valider ces résultats sur d'autres benchmarks et accélérera potentiellement l'adoption de cette convention dans les frameworks d'RL robotique.

RecherchePaper
1 source
Nous savons construire des robots plus intelligents, il reste à apprendre à mieux les tester
57Robotics Business Review 

Nous savons construire des robots plus intelligents, il reste à apprendre à mieux les tester

Un robot humanoïde est aujourd'hui accessible à l'achat pour 14 000 dollars, sans certification de sécurité standardisée ni protocole de validation comportementale obligatoire. L'auteur de cet article, chercheur en robotique, a co-publié deux travaux récents qui convergent vers un même constat : les méthodologies de test n'évoluent pas au même rythme que les architectures de contrôle autonome. Pour cartographier ce décalage, il propose une taxonomie en cinq niveaux, classifiant les robots non pas selon le degré d'attention humaine (comme le fait la norme SAE pour les véhicules), mais selon le mode de traitement de l'information et de génération du comportement par la machine elle-même. Niveau 0 : téléopération pure. Niveau 1 : imitation par behavior cloning, fragile dès que les conditions terrain s'écartent légèrement des données d'entraînement. Niveau 2 : apprentissage supervisé en temps réel, où le robot détecte son incertitude, se met en pause et intègre une correction humaine via inverse reinforcement learning. Niveau 3 : apprentissage auto-supervisé, le robot générant ses propres signaux d'entraînement par essais-erreurs sans intervention humaine. Niveau 4 : reinforcement learning complet, le robot reformulant chaque tâche comme un problème d'optimisation résolu en interaction continue avec son environnement. Ce que cette taxonomie révèle est structurellement important pour les intégrateurs et les décideurs industriels : chaque niveau supplémentaire introduit un type de défaillance fondamentalement différent, qui rend les approches de test existantes insuffisantes. Aux niveaux 0 et 1, les outils sont matures et les comportements testables de façon exhaustive. Dès le niveau 2, il faut valider non seulement le comportement mais aussi le mécanisme de détection d'incertitude et l'intégrité de chaque mise à jour d'apprentissage. Au niveau 3, le robot réécrit continuellement sa propre politique : tester une performance instantanée ne suffit plus, il faut auditer le processus d'apprentissage lui-même. Au niveau 4, l'espace comportemental est trop vaste et trop dynamique pour une énumération exhaustive des cas de test. La thèse centrale est que les garanties formelles de sécurité doivent remplacer l'énumération de cas tests aux niveaux élevés d'autonomie, et que l'évaluation de robustesse adversariale doit devenir aussi systématique que les tests fonctionnels. Cette réflexion s'inscrit dans un moment charnière de l'industrie : les laboratoires et industriels (Figure, Boston Dynamics, Agility, 1X, Unitree côté hardware ; Physical Intelligence, DeepMind, NVIDIA côté fondations VLA) poussent vers une autonomie croissante, mais le cadre réglementaire reste absent pour les systèmes à prise de décision autonome en environnement non contrôlé. L'absence de standards équivalents aux normes ISO 10218 pour les robots industriels fixes crée un vide que comblent actuellement les constructeurs eux-mêmes, avec des métriques internes difficiles à auditer. Les prochaines étapes identifiées par l'auteur pointent vers l'intégration de méthodes de vérification formelle et de red-teaming adversarial comme pratiques standard de validation, avant que des déploiements à grande échelle dans des environnements non structurés ne rendent ces lacunes coûteuses.

UELe vide réglementaire identifié, absence de normes équivalentes aux ISO 10218 pour les robots à décision autonome, concerne directement le marché européen, où l'AI Act devra s'appliquer à des systèmes dont les méthodes de validation restent aujourd'hui définies unilatéralement par les constructeurs.

RechercheOpinion
1 source
Main dextérique de Zhiyuan : 1 milliard de dollars, déjà rentable en 5 mois ; DeepSeek double ses départements
5836Kr 

Main dextérique de Zhiyuan : 1 milliard de dollars, déjà rentable en 5 mois ; DeepSeek double ses départements

Le 26 juin 2026, deux opérations de financement majeures ont marqué l'écosystème de la robotique incarnée en Chine. Critical Point (临界点), spécialiste des mains dextres pour robots humanoïdes issue d'un spin-off de Zhiyuan Robotics (智元) en janvier 2026, a bouclé une levée proche du milliard de RMB, atteignant une valorisation d'un milliard de dollars en cinq mois d'existence seulement, soit quatre tours de table successifs avec Baidu, Hillhouse Capital et Lanchi Ventures au capital. La société revendique en outre un premier trimestre rentable depuis sa création, sans toutefois publier de comptes détaillés. Dans le même temps, Wujie Dongli (无界动力), positionnée sur les cerveaux généraux pour robots incarnés (embodied general AI), a annoncé un tour d'amorçage supérieur à 200 millions de dollars, co-mené par le fonds lié à JD.com, C Capital et Hongyi Investment, avec Sequoia China et Linear Capital en suivi. Une troisième société, Shengdu Jizhi (深度机智), a simultanément clos un tour de plusieurs centaines de millions de RMB, mené par le fonds China Life Yangtze Delta. Ces levées surviennent dans un contexte de croissance sectorielle soutenue : le marché chinois de la robotique incarnée a atteint 915 milliards de RMB (environ 125 milliards de dollars) en 2025 et devrait franchir 1 090 milliards de RMB en 2026, selon les données présentées au Link Expo 2026. Plus de 10 000 entreprises sont désormais actives dans le secteur en Chine. Le cas Critical Point illustre une tendance de fond, celle de la spécialisation de sous-systèmes robotiques (actionneurs dextres, vision, planification de trajectoire) en entités autonomes, par opposition aux approches full-stack de Figure AI, Tesla Optimus ou 1X Technologies. La rentabilité annoncée dès le premier trimestre, si elle se confirme, indiquerait une demande B2B réelle en composants dextres, mais l'absence de données financières publiques invite à la prudence. Zhiyuan Robotics, dont est issue Critical Point, figure parmi les acteurs les mieux financés de la robotique humanoïde en Chine, aux côtés d'Unitree et d'UBTECH. La stratégie de spin-off de sous-systèmes rejoint une tendance observable dans l'écosystème occidental, notamment chez Apptronik. Par ailleurs, DeepSeek a annoncé le 25 juin son intention de doubler au minimum la taille de tous ses départements, avec de multiples offres d'emploi publiées simultanément, signe que le laboratoire entend capitaliser sur la dynamique de ses modèles R1 et V3 pour construire une infrastructure de recherche à long terme. Wujie Dongli a précisé que les fonds levés seront alloués au développement d'un cerveau général incarné et à une livraison à l'échelle mondiale, sans communiquer de calendrier de déploiement ni de site client précis.

Chine/AsieActu
1 source
Comment allouer un budget de transfert simulation-réel ?
59arXiv cs.RO 

Comment allouer un budget de transfert simulation-réel ?

Une étude publiée sur arXiv (réf. 2606.22062, juin 2026) s'attaque à une question pratique restée sans réponse claire dans la robotique par apprentissage : comment répartir un budget de temps de mesure sur robot réel entre l'identification de système (mesurer précisément les paramètres physiques du robot) et la randomisation de domaine (entraîner sur une large plage de dynamiques simulées) ? Les chercheurs ont conduit une expérience contrôlée sim-à-sim sur un pendule, en substituant un modèle à paramètres cachés au robot physique pour pouvoir varier proprement les gaps de réalité et les niveaux de bruit. Résultat : un faible nombre de rollouts d'identification suffisait à combler l'essentiel de l'écart de transfert. Une fois des données réelles disponibles, les politiques entraînées aux paramètres estimés surpassaient systématiquement celles entraînées sur une bande de randomisation élargie, même lorsque cette bande contenait les vrais paramètres du système. Ce résultat contredit une intuition répandue dans le secteur : celle que "plus de randomisation = plus de robustesse au sim-to-real gap". Les pipelines sim-to-real actuels (notamment pour les mains, les bras, et les humanoïdes) consacrent souvent une fraction importante de l'ingénierie à construire des distributions de randomisation larges via DR (Domain Randomization), parfois au détriment d'une identification soignée. Cette étude suggère que cette stratégie est sous-optimale dans le régime "bénin" où les dynamiques sont identifiables. Pour les intégrateurs robotiques et les équipes de déploiement, la leçon opérationnelle est directe : mesurer d'abord ce qu'il est possible de mesurer, et réserver la randomisation à l'incertitude résiduelle non modélisable, pas l'inverse. Le sim-to-real reste l'un des goulots d'étranglement centraux du robot learning depuis les travaux fondateurs d'OpenAI Robotics sur Dactyl (2019) et les benchmarks de transfert de Meta AI et Google DeepMind. La communauté a largement misé sur des variantes de Domain Randomization (DR) et sur les Visual-Language-Action models (VLA) pour contourner le gap sans nécessiter d'identification fine. Cette étude s'inscrit dans un contre-courant : celui d'une meilleure caractérisation du robot physique via la sysid, une approche défendue également par des travaux récents de Unitree, Boston Dynamics, et par des labos académiques proches du contrôle optimal. La limite explicitement posée par les auteurs est importante : leurs conclusions tiennent dans un régime à deux paramètres inconnus et sans mismatch structurel de modèle ; dans des systèmes plus complexes (contact, déformation, friction multipoint), la randomisation large pourrait reprendre l'avantage. Prochaines étapes naturelles : valider sur des systèmes à plus haute dimensionnalité, des robots articulés réels, et en présence de mismatch structurel explicite.

RecherchePaper
1 source
Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes
60arXiv cs.RO 

Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2606.25179) une étude portant sur la conception de contrôleurs de locomotion universels pour robots quadrupèdes, capables de s'adapter à plusieurs morphologies de robots différents tout en intégrant de la perception en temps réel. Les auteurs s'appuient sur le cadre MorAL (Morphology-Aware Locomotion), qu'ils étendent en comparant trois architectures : un contrôleur aveugle (baseline sans perception), MorAL+ (perception intégrée uniquement dans le critique du réseau, pas dans l'acteur), et PPAL (acteur-critique entièrement perceptif). Les politiques ont été évaluées en simulation sur terrains plats et accidentés, puis déployées sur du matériel réel via le robot ANYmal d'ANYbotics. Résultat principal : MorAL+ surpasse les deux autres configurations en robustesse et en cohérence de suivi de trajectoire, notamment parce qu'un acteur entièrement perceptif se révèle sensible au bruit de capteur, tandis qu'un acteur aveugle manque de conscience du terrain. Ce résultat va à contre-courant d'une intuition répandue dans la communauté robotique : intégrer plus de perception n'est pas toujours meilleur. Le fait que la perception placée uniquement dans le critique (et non dans l'acteur) améliore la robustesse sans fragiliser la politique face au bruit de capteur est une contribution architecturale concrète. Pour les intégrateurs industriels qui déploient des quadrupèdes en environnements non structurés (entrepôts, sites industriels, inspection d'infrastructures), cette distinction a des implications directes sur la conception des pipelines de contrôle. Elle indique aussi que le problème du sim-to-real pour la locomotion quadrupède n'est pas uniquement une question de quantité de données perceptives, mais de leur positionnement dans l'architecture d'apprentissage par renforcement. ANYmal, développé par ANYbotics (spin-off de l'ETH Zurich), est l'un des robots quadrupèdes les plus utilisés en recherche académique et en déploiements industriels pilotes, aux côtés de Spot de Boston Dynamics et des modèles Unitree (Go2, B2) qui dominent le segment prix bas. Le cadre MorAL, sur lequel s'appuie ce travail, visait déjà à entraîner des politiques transférables entre morphologies de robots différents, un problème ouvert dans la course à la généralisation inter-robots (cross-embodiment). Ce papier reste pour l'instant un preprint académique sans déploiement industriel annoncé ; les suites naturelles seraient une validation sur un ensemble plus large de morphologies quadrupèdes et des tests en conditions réelles prolongées, en dehors du cadre contrôlé d'un labo.

UEANYbotics étant un spin-off suisse de l'ETH Zurich, les conclusions architecturales sur MorAL+ intéressent directement les intégrateurs européens qui déploient des quadrupèdes en inspection industrielle ou en environnements non structurés.

RecherchePaper
1 source
RoboAtlas : SLAM actif contextuel
61arXiv cs.RO 

RoboAtlas : SLAM actif contextuel

Des chercheurs ont publié le 25 juin 2026 RoboAtlas, un framework de SLAM actif contextuel conçu pour permettre à un robot de naviguer et de cartographier un environnement inconnu tout en accomplissant des tâches sémantiques complexes. Le système s'appuie sur OpenRoboVox, une couche de cartographie 3D sémantique scalable, et pilote un robot quadrupède Unitree Go2 dans des environnements réels dépassant 1 800 m², avec environ 30 000 instances sémantiques cartographiées. Sur le benchmark GOAT-Bench "Val Unseen", RoboAtlas atteint un taux de succès (SR) de 90,6 % avec GPT-4o, soit +17,8 points de pourcentage sur le meilleur baseline précédent. Avec le modèle Qwen2.5-VL-7B, sept fois plus petit, il obtient 88,8 % SR, dépassant tous les baselines GPT-4o du benchmark. En environnement réel, le système affiche un taux de réussite de 100 % sur les tâches testées, ce qui constitue une barre haute pour ce type d'évaluation. Le résultat le plus significatif n'est pas le score absolu, mais ce qu'il révèle sur l'architecture : passer d'un VLM de 7 milliards de paramètres à GPT-4o ne fait gagner que 1,8 point, alors que retirer la couche de cartographie sémantique ferait s'effondrer les performances. Cela contredit la stratégie dominante dans les labs robotiques qui misent sur des modèles fondationnels toujours plus grands comme levier principal de robustesse. Pour un intégrateur ou un décideur B2B, la leçon est concrète : la qualité de la représentation spatiale et sémantique de l'environnement compte davantage que la puissance brute du modèle de raisonnement. RoboAtlas utilise un bandit manchot multi-bras pour arbitrer dynamiquement entre exploration frontière (cartographier l'inconnu) et navigation sémantique guidée (aller vers ce qui est déjà compris), ce qui résout élégamment le dilemme exploration-exploitation en robotique indoor. RoboAtlas s'inscrit dans la lignée des travaux sur le SLAM actif sémantique, un domaine en consolidation rapide depuis que les VLM ont rendu tractable le raisonnement sur scènes complexes. Sur le benchmark GOAT-Bench, les baselines précédents incluaient des approches modulaires classiques et des pipelines end-to-end purs, tous inférieurs de plus de 17 points. Les auteurs n'annoncent pas de déploiement commercial, et les résultats terrain portent sur un seul robot dans un cadre contrôlé : le "100% success rate" mérite d'être pondéré en conséquence. La prochaine étape naturelle est l'extension à des flottes multi-robots et à des environnements dynamiques, où la cohérence de la carte sémantique partagée reste un problème ouvert.

UEL'architecture RoboAtlas (cartographie sémantique > puissance du modèle) ouvre une piste concrète pour les labos FR/UE (INRIA, CEA-List) visant une navigation sémantique robuste sans infrastructure GPU massive.

💬 Le score à 90% sur GOAT-Bench, c'est bien. Mais le chiffre qui compte vraiment c'est 1,8 point : l'écart entre un Qwen 7B et GPT-4o dans ce système. C'est la couche de cartographie sémantique qui porte les performances, pas la puissance brute du modèle, et ça contredit frontalement ce que les grands labs s'obstinent à défendre.

IA physiquePaper
1 source
Vidéo : un chien robot effectue 33 000 inspections dans une cimenterie vieille de 150 ans
62Interesting Engineering 

Vidéo : un chien robot effectue 33 000 inspections dans une cimenterie vieille de 150 ans

Depuis début 2025, le robot quadrupède ANYmal d'ANYbotics est déployé en exploitation nocturne autonome à l'usine de ciment Vigier Ciment en Suisse, un site vieux de 150 ans abritant plus de 1 000 machines réparties sur six niveaux et trois unités de broyage. En seize mois d'exploitation, l'ANYmal a réalisé plus de 33 000 inspections couvrant 450 points de contrôle prédéfinis, sans intervention humaine. Pesant 50 kilogrammes, le robot embarque une caméra haute résolution pour la détection visuelle d'anomalies structurelles, une caméra thermique pour le suivi des températures sur roulements, moteurs et engrenages, un capteur de gaz mesurant les taux d'ammoniac, et un imageur acoustique capable de localiser des fuites d'air comprimé jusqu'à 50 mètres de distance. Ces capteurs ont permis quatre découvertes documentées : une fissure dans la fondation d'un concasseur détectée avant qu'elle ne provoque un arrêt estimé à 630 000 dollars de production perdue ; une montée en température d'un roulement vers 140 °C interceptée grâce à une réparation planifiée de huit heures ; des niveaux d'exposition à l'ammoniac identifiés dans des zones de déchargement jusque-là non mesurées ; et des fuites d'air dans des systèmes de filtration à cinquante mètres du sol localisées par imagerie acoustique. Ce déploiement constitue l'un des rares cas industriels documentés où un robot mobile autonome dépasse les 30 000 cycles opérationnels sans panne mécanique sur un site de production actif. Pour les responsables maintenance et les décideurs B2B, c'est moins la technologie embarquée qui retient l'attention que le modèle économique : ANYbotics affirme que l'ANYmal a récupéré plus que le coût total du programme sur la période, sans chiffrer précisément ce ratio. La capacité à détecter en amont des défaillances sur équipements rotatifs (roulements surchauffés, fondations fissurées) transforme l'inspection robotisée d'un outil de conformité HSE en levier direct de continuité de production. L'argument tient particulièrement pour les environnements à fort risque HSE et forte contrainte de disponibilité : chimie, ciment, pétrochimie, fonderies. L'ANYmal opère également les nuits et week-ends, intervalles que les rondes manuelles couvrent rarement, ce qui augmente structurellement la fréquence de détection des dérives thermiques ou mécaniques. ANYbotics est un spin-off de l'ETH Zurich fondé en 2016 ; le robot ANYmal y est développé depuis les premiers travaux du Robotic Systems Lab, publiés dès 2014. Les données collectées lors des patrouilles sont agrégées dans la plateforme logicielle Data Navigator d'ANYbotics. Sur ce segment de l'inspection robotique industrielle quadrupède, le principal concurrent est Boston Dynamics avec Spot, déployé chez des groupes pétroliers et chimiques comme BP, Aker BP ou BASF ; Ghost Robotics (États-Unis) et Unitree (Chine) sont également présents, mais avec peu de références industrielles lourdes en Europe. En France, aucun acteur comparable n'opère sur ce créneau spécifique, même si Exotec (AMR logistique) et Enchanted Tools (manipulation collaborative) adressent des niches adjacentes. Aucun calendrier d'extension du déploiement Vigier à d'autres sites n'a été officiellement annoncé.

UECe retour d'expérience suisse, avec métriques documentées sur 16 mois, constitue une référence exploitable pour les opérateurs industriels européens (ciment, chimie, pétrochimie) qui évaluent le ROI de l'inspection quadrupède autonome face à Boston Dynamics Spot.

IndustrielOpinion
1 source
VivaTech 2026 : l’année où les robots humanoïdes sont devenus une réalité industrielle
63Robot Magazine FR 

VivaTech 2026 : l’année où les robots humanoïdes sont devenus une réalité industrielle

Les 17 et 18 juin 2026, la dixième édition de VivaTech à Paris Porte de Versailles a réuni des dizaines de démonstrations de robots humanoïdes capables de marcher, manipuler des objets et interagir avec des opérateurs humains. L'événement s'est distingué des éditions précédentes par la présence notable d'acteurs chinois en nombre, venus exposer leurs avancées en « Embodied AI », la convergence entre modèles de raisonnement LLM et corps robotiques physiques. Parmi les machines les plus remarquées figurait KANGAROO, développé par PAL Robotics (Barcelone) en partenariat avec plusieurs centres de recherche européens : un humanoïde à mobilité avancée, entraîné par renforcement, positionné comme plateforme industrielle et logistique polyvalente. L'article ne fournit pas de spécifications techniques précises (charge utile, degrés de liberté, temps de cycle) ni de confirmation de déploiement commerciaux signés, les présentations restaient majoritairement au stade de démonstrations salon. Ce moment marque une inflexion rhétorique autant que technique : depuis ChatGPT en 2022, l'IA était associée aux assistants logiciels ; VivaTech 2026 a déplacé le centre de gravité vers l'IA physique. Pour les intégrateurs et décideurs industriels, le signal le plus structurant est la montée en puissance de la Chine sur le segment humanoïde, un marché qu'elle dominait déjà en volumes sur les bras industriels classiques. Pékin traite désormais la robotique humanoïde comme secteur stratégique au même titre que les semi-conducteurs, avec une logique de mise à l'échelle rapide et de compression des coûts qui change la donne compétitive. Pour les acheteurs B2B européens, la question n'est plus seulement « quelle plateforme est la plus capable » mais « laquelle peut être produite en volumes suffisants à un prix d'entrée industriel ». La trajectoire rappelle celle des véhicules électriques : l'Europe dispose de l'ingénierie, la Chine de la capacité de production. PAL Robotics, fondée en 2004 à Barcelone et pionnière de l'humanoïde de recherche avec REEM puis TALOS, représente l'une des rares maisons européennes avec une expérience longue sur les plateformes bipèdes. KANGAROO s'inscrit dans une stratégie de positionnement pragmatique face aux offres américaines (Figure, Apptronik, Tesla Optimus) et chinoises (Unitree, Fourier, UBTECH), en visant des environnements industriels structurés plutôt que des cas d'usage grand public. Les suites annoncées restent vagues : aucun calendrier de commercialisation ni volume de déploiement n'est mentionné dans l'article source. L'édition 2026 confirme que la course à l'humanoïde industriel est désormais ouverte et multipolaire, mais la majorité des acteurs en sont encore à la phase démonstration-salon, pas à la livraison cliente à l'échelle.

UEPAL Robotics (Barcelone) positionne KANGAROO comme plateforme humanoïde industrielle européenne lors de VivaTech Paris, mais l'Europe reste structurellement exposée à la montée en puissance chinoise sur les volumes et la compression des coûts, un risque compétitif direct pour les intégrateurs industriels français et européens.

FR/EU ecosystemeOpinion
1 source
Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source
64arXiv cs.RO 

Simuler la locomotion robotique dans le sable : la théorie des forces résistives dans un moteur physique open source

Des chercheurs ont intégré la théorie de la force résistive tridimensionnelle (3D RFT) dans le moteur de simulation physique MuJoCo, comblant un angle mort persistant des outils de robotique open-source. La 3D RFT permet d'approximer les forces de réaction du sol lors de la locomotion en milieu granulaire (sable, gravier fin) sans simuler l'interaction avec chaque grain individuellement, ce qui constitue l'approche classique par éléments discrets (DEM), prohibitive en temps de calcul. Les auteurs ont validé leur implémentation sur un robot hexapode à 12 degrés de liberté évoluant en bac à sable : la simulation prédit la distance parcourue et l'enfoncement des pattes à moins de 20 % des valeurs mesurées expérimentalement, avec des tendances cohérentes selon la forme de l'effecteur, la vitesse de déplacement et la charge appliquée. Les travaux sont publiés sur arXiv (2606.19504) et le code est rendu disponible en open source. L'impact pratique est significatif pour les équipes qui développent des robots mobiles destinés à évoluer hors piste. Jusqu'ici, simuler fiablement la locomotion sur sol meuble imposait soit des moteurs DEM spécialisés (CHRONO, LIGGGHTS) avec des temps de calcul rédhibitoires pour l'apprentissage par renforcement, soit des approximations ad hoc peu transférables. Intégrer la RFT directement dans MuJoCo, l'environnement de référence pour l'entraînement de politiques de locomotion, ouvre une voie crédible vers le sim-to-real sur substrats granulaires. La précision de 20 % est honnête pour une approximation analytique et constitue une base exploitable pour l'optimisation de design ou le pré-entraînement de contrôleurs, même si elle reste insuffisante pour garantir un transfert direct sans recalibration. La RFT granulaire a été initialement développée dans les laboratoires de Daniel Goldman (Georgia Tech) pour étudier la locomotion animale dans le sable, avant d'être étendue aux systèmes robotiques. MuJoCo, racheté par DeepMind en 2021 et passé open-source la même année, est aujourd'hui le moteur dominant pour l'entraînement de politiques de locomotion humanoïde et quadrupède chez Figure, Boston Dynamics ou Unitree. Les débouchés concrets de ce travail concernent les rovers planétaires (JPL, ESA), les robots agricoles évoluant en sol labouré, et les plateformes de recherche et sauvetage en milieu sableux. La prochaine étape logique sera l'extension aux substrats hétérogènes et l'intégration dans des pipelines d'apprentissage par renforcement standard pour valider le gain sim-to-real à l'échelle.

RecherchePaper
1 source
La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes
65arXiv cs.RO 

La configuration des capteurs est déterminante : une évaluation systématique du SLAM multimodal sur des robots quadrupèdes

Des chercheurs publient sur arXiv (réf. 2606.19067) une évaluation systématique de méthodes SLAM (Simultaneous Localization and Mapping) appliquées aux robots quadrupèdes, en s'appuyant sur le dataset GrandTour enregistré sur un ANYmal D d'ANYbotics. Trois familles d'approches sont comparées : SLAM visuel pur, visuel-inertiel (VIO), et LiDAR-visuel-inertiel. L'étude isole trois variables matérielles : modalité caméra (monoculaire, stéréo, RGB-D), type d'obturateur (global shutter vs rolling shutter), et qualité de l'IMU. Résultats principaux : les configurations stéréo surpassent systématiquement le monoculaire et le RGB-D en précision de localisation ; les caméras à obturateur global réduisent significativement les échecs de tracking liés au mouvement ; et, point contre-intuitif, l'intégration d'une IMU standard peut dégrader les performances des frameworks principalement visuels sous les dynamiques agressives de la locomotion quadrupède. Les robots à pattes génèrent des perturbations sensorielles que les plateformes à roues ou les drones ne produisent pas à la même intensité : chocs d'impact au sol à chaque appui, vibrations mécaniques haute fréquence dans la structure, rotations angulaires rapides lors des corrections de posture. Ces phénomènes dégradent les pipelines de perception conçus pour des dynamiques plus lisses. L'enseignement clé pour les intégrateurs : le choix matériel conditionne la robustesse avant même le choix algorithmique. Que l'IMU standard puisse activement nuire à la perception visuelle, plutôt que simplement ne pas l'améliorer, remet en question la pratique courante d'ajouter une centrale inertielle bas de gamme par défaut dans un payload. Pour un responsable technique évaluant un quadrupède pour l'inspection d'infrastructure, l'étude fournit des critères de sélection hardware directement actionnables. L'ANYmal D, développé par ANYbotics (spin-off de l'ETH Zurich), est l'une des plateformes quadrupèdes les plus déployées en inspection industrielle, notamment dans le secteur pétrolier et gazier. Le SLAM visuel-inertiel a été largement validé sur drones et robots à roues, mais sa transposition aux systèmes à pattes reste un chantier de recherche actif. Les équipes travaillant sur Boston Dynamics Spot, Unitree B2 ou les plateformes d'Agility Robotics affrontent les mêmes contraintes d'embodiment. L'article formule des recommandations concrètes pour la constitution de payloads capteurs sur systèmes agiles, directement exploitables par les intégrateurs définissant les prochaines itérations de ces plateformes.

UELes critères de sélection hardware identifiés (stéréo + obturateur global, méfiance envers IMU bas de gamme) bénéficient directement aux intégrateurs européens déployant des quadrupèdes ANYmal D (ANYbotics, spin-off ETH Zurich) sur des sites d'inspection industrielle en Europe.

RecherchePaper
1 source
Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique
66Pandaily 

Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique

Le 16 juin 2026, Alibaba a lancé Qwen-Robot, sa première famille complète de modèles d'IA incarnée intégrée à la série Qwen. Elle regroupe trois composants distincts : Qwen-RobotManip pour la manipulation physique, Qwen-RobotNav pour la navigation autonome, et Qwen-RobotWorld comme modèle de monde, c'est-à-dire un moteur de raisonnement contextuel sur l'environnement physique. Ces modules peuvent être déployés séparément ou en coordination, selon le type de robot ciblé. Le positionnement d'Alibaba est explicitement logiciel : l'entreprise ne vise pas à construire des corps robotiques, mais à fournir le "cerveau intelligent" à des fabricants tiers. Simultanément, ByteDance a réorganisé ses efforts en robotique incarnée en élevant Seed Robotics au rang de division stratégique principale, désormais sous la supervision de Zhou Chang, responsable multi-modal du groupe. ByteDance a déjà produit plus de 1 000 robots, majoritairement des robots mobiles à roues pour la logistique en entrepôt et en usine, et compte parmi ses clients externes SF Express et BYD Electronics. Ce double mouvement illustre un changement structurel dans la course aux humanoïdes et à la robotique généraliste : les géants de l'internet entrent dans le secteur non par la mécanique, mais par la donnée et l'intelligence. La valeur qu'ils apportent repose sur trois piliers. D'abord, leurs grands modèles de langage compressent le temps d'adaptation à de nouvelles tâches : là où un ingénieur robotique traditionnel passerait plusieurs semaines à reprogrammer un bras ou un AGV pour un nouveau scénario, une approche VLA (vision-language-action) peut réduire cette itération à quelques jours. Ensuite, leur infrastructure opérationnelle génère des données d'entraînement à une échelle inaccessible aux startups : le réseau de livraison instantanée de Meituan, les entrepôts de JD Logistics, les chaînes d'approvisionnement e-commerce de ByteDance accumulent chaque jour des millions d'interactions physiques réelles. Enfin, et c'est peut-être le facteur le plus sous-estimé, ces entreprises sont leurs propres premiers clients. JD a validé ses robots logistiques dans ses propres entrepôts "Asia No.1" avant de les commercialiser. ByteDance fait circuler ses AMR sur de vraies routes opérationnelles avant de les vendre. Ce raccourci entre laboratoire et déploiement à l'échelle est ce qui manque le plus aux startups hardware-first. Pour autant, les analystes du secteur rappellent que l'avantage logiciel ne dissout pas les contraintes physiques. Les composants critiques comme les actionneurs, les capteurs de force ou les joints à haute précision restent des goulots d'étranglement de supply chain qui ne s'effacent pas parce qu'un géant tech entre dans la pièce. Alibaba et ByteDance font face à une concurrence à deux niveaux : d'un côté les acteurs hardware-first américains comme Figure AI, 1X, Boston Dynamics ou Agility Robotics qui avancent en parallèle sur la couche IA ; de l'autre les constructeurs chinois comme Unitree ou Fourier Intelligence qui maîtrisent déjà la chaîne de fabrication. La prochaine étape pour évaluer ces annonces sera de mesurer si les modèles Qwen-Robot passent l'épreuve du déploiement industriel répété en dehors des environnements contrôlés d'Alibaba, ce qui reste à ce stade une démonstration en cours, pas un produit livré.

Chine/AsieOpinion
1 source
Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots
67Interesting Engineering 

Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots

Alibaba a annoncé en juin 2026 le lancement de la suite Qwen-Robot, sa première famille de modèles d'IA dite "embodied", développée par son Tongyi Lab et actuellement en phase de pilote avec des clients entreprise d'Alibaba Cloud. La suite repose sur trois modèles spécialisés : Qwen-RobotNav pour la navigation et le suivi de cibles, Qwen-RobotManip pour la manipulation d'objets physiques, et Qwen-RobotWorld pour la modélisation de l'environnement et la prédiction des conséquences d'actions. Le groupe a également publié Qwen-RobotClaw, un framework d'agents qui expose les modèles Qwen-Robot comme outils accessibles à des agents LLM, ainsi que Chat2Robot, une plateforme open-source en navigateur pour tester des interactions avec des robots physiques. Sur le plan des performances déclarées, Qwen-RobotManip a été entraîné sur plus de 38 000 heures de données open-source et a obtenu sur le benchmark RoboChallenge un process score de 59,83 avec un taux de succès de tâches de 45 % dans la catégorie "généraliste". La démonstration de navigation a mis en scène un quadrupède Unitree Go2 équipé d'un NVIDIA Jetson Thor et d'une seule caméra basse résolution, atteignant une latence d'inférence de 196 millisecondes dans un appartement inconnu, sans carte préchargée. Ces résultats méritent d'être lus avec prudence : un taux de succès de 45 % sur un benchmark réel, s'il est confirmé en conditions non contrôlées, reste modeste mais significatif pour un modèle généraliste. Le vrai signal industriel n'est pas le score brut, c'est l'approche architecturale : au lieu de fusionner indifféremment données de navigation, bras robotiques, caméras et véhicules autonomes, Alibaba a opté pour une spécialisation par modalité, évitant les conflits d'apprentissage que génère le mélange hétérogène de données physiques. Pour les intégrateurs et décideurs B2B, la disponibilité via Alibaba Cloud en pilote marque un premier pas vers la commercialisation d'une couche d'IA robotique as-a-service, potentiellement utilisable sur du matériel tiers sans pipeline de training propriétaire. Alibaba entre dans une course déjà engagée par plusieurs acteurs de premier plan. Aux États-Unis, Google DeepMind fait avancer Gemini Robotics sur des architectures Vision-Language-Action (VLA) similaires, tandis que Physical Intelligence (Pi-0), Figure AI (Figure 03) et Boston Dynamics misent sur des pipelines de données propriétaires et des déploiements industriels réels. NVIDIA pousse son framework GR00T N2 comme socle hardware-logiciel pour l'humanoid. Côté chinois, Unitree et Agibot ont déjà des robots en production, mais sans la couche LLM intégrée qu'Alibaba apporte. L'open-sourcing de Chat2Robot et les pilotes cloud suggèrent une stratégie d'écosystème : capter les développeurs et intégrateurs autour des modèles Qwen-Robot avant que le marché des robots généraux ne se consolide, probablement d'ici 2027-2028 selon les timelines annoncées par les principaux concurrents.

UEL'entrée d'Alibaba dans l'IA robotique cloud-as-a-service intensifie la pression concurrentielle mondiale, sans déploiement ni partenariat européen annoncé à ce stade.

💬 45 % de réussite sur un benchmark généraliste, c'est pas brillant, je sais, mais tu regardes au mauvais endroit. Le vrai signal, c'est l'architecture : trois modèles spécialisés par modalité plutôt qu'un gros fourre-tout, parce que mélanger navigation, manipulation et caméras dans le même pipeline, ça crée des conflits d'apprentissage que tout le monde a sous-estimés depuis le début. Alibaba ne cherche pas à gagner les benchmarks robotiques, ils cherchent à s'installer comme la couche cloud entre le matériel tiers et l'IA physique avant que le marché se consolide.

IA physiqueOpinion
1 source
FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle
68arXiv cs.RO 

FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle

Des chercheurs ont publié FARM (Find Anything using Relational Spatial Memory), un système de mémoire spatiale pour robots capable de localiser des objets en temps réel via des requêtes en langage naturel exprimant des relations contextuelles, du type "la grande lampe sous la cible de fléchettes et à gauche de l'affiche". Le système construit une carte sémantique compacte à 5-10 Hz intégrant géométrie, descripteurs visuels-linguistiques et indices de point de vue. Évalué sur 44 000 requêtes couvrant 67 scènes intérieures et extérieures de 15 à 15 000 m², FARM améliore le Recall@5 de 164 % et le Recall@10 de 224 % par rapport aux méthodes existantes. Une étape de réordonnancement par VLM améliore encore l'Accuracy@1 de 35 %. Le système tourne en temps réel et a été validé en boucle fermée sur un robot quadrupède fonctionnant uniquement avec capteurs et calcul embarqués. L'enjeu dépasse la simple localisation d'objet: dans des entrepôts, habitations ou espaces industriels, un robot doit résoudre des ambiguïtés entre objets similaires via des relations contextuelles, ce que les mémoires de niveau objet seul ne permettent pas. FARM structure explicitement les contraintes spatiales par des prédicats relationnels plutôt qu'en les laissant implicites dans un raisonnement end-to-end sur des historiques de frames. Pour les intégrateurs et décideurs B2B, c'est une brique critique: les robots de service, de picking ou de logistique doivent être pilotables par instruction verbale sans expertise technique. Les gains à +224 % sur Recall@10 sont significatifs, bien que les conditions précises de benchmark, scènes contrôlées ou environnements non-stagés, ne soient pas détaillées dans la publication. Ce travail se situe à l'intersection de la cartographie sémantique 3D (systèmes type ConceptFusion ou OpenScene), des graphes de scène neuronaux et des VLM multimodaux. La combinaison mémoire open-vocabulary et prédicats relationnels explicites distingue FARM des approches end-to-end qui saturent dans les scènes denses. Sur le plan concurrentiel, des acteurs comme Boston Dynamics, Unitree et des laboratoires tels que Stanford ou CMU explorent des approches similaires pour la navigation sémantique. En Europe, des projets de robots de service ou d'assistance, dont des initiatives françaises liées à l'ANR ou des spin-offs comme Enchanted Tools travaillant sur l'interaction homme-robot, pourraient directement intégrer ce type de composant. La prochaine étape décisive sera de valider FARM dans des environnements dynamiques où les objets se déplacent et les relations spatiales évoluent en continu.

UEDes projets européens de robotique de service et des acteurs comme Enchanted Tools pourraient intégrer FARM comme brique de perception sémantique, mais aucun déploiement direct en France/UE n'est confirmé à ce stade.

💬 Ce qui m'accroche, c'est pas les chiffres, c'est que le robot comprend "la lampe sous la cible de fléchettes". C'est exactement ce qui plantait tous les systèmes de mémoire objet précédents, ils encodaient les objets mais pas les relations spatiales entre eux, et c'est pourtant ce qu'on exprime naturellement quand on parle à un robot. Les +224% sur les benchmarks sont solides, bon, reste à voir si ça tient dans une vraie usine où les objets bougent en permanence.

IA physiqueOpinion
1 source
Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts
69arXiv cs.RO 

Suivi binaire pour la QA spatiale et la navigation avec des modèles vision-langage ouverts

Une équipe de chercheurs publie sur arXiv (référence 2606.16902) un agent de localisation spatiale open-source baptisé BinTrack, conçu pour permettre à des robots de service de répondre à des questions du type « où puis-je trouver un pressing sur le chemin du retour ? » et de retourner une coordonnée métrique exploitable directement par les modules de navigation. Le système s'appuie sur un robot quadrupède réel déployé dans des rues publiques de Séoul pour constituer GangnamLoop, un nouveau benchmark multi-trajets en extérieur. BinTrack atteint une amélioration de précision allant jusqu'à 22,8 % par rapport aux autres implémentations open-source sur SpaceLocQA, le benchmark de référence du domaine, et égale les résultats des agents basés sur GPT-4o sur la catégorie « global », la plus difficile. Il offre par ailleurs un gain de vitesse d'inférence supérieur à 1,5x par rapport aux approches précédentes. L'intérêt principal de BinTrack pour les intégrateurs et les décideurs industriels tient à son architecture entièrement embarquée et déconnectée. Les approches existantes de Spatial Question Answering s'appuyaient sur des modèles fermés comme GPT-4o via des agents RAG (retrieval-augmented generation), ce qui implique une dépendance réseau, une latence de communication et des coûts d'API prohibitifs pour une flotte de robots en production. BinTrack remplace cela par une recherche binaire sur les segments de trajectoire entre deux repères spatiaux extraits de la requête, en exploitant l'ordre temporel du trajet. Ce faisant, le travail démontre qu'un modèle de vision-langage open-source peut rivaliser avec GPT-4o sur un benchmark spatial de référence, sans connexion cloud, une hypothèse que beaucoup dans le secteur considéraient non résolue à ce stade. GangnamLoop se distingue des benchmarks indoor habituels : il capture les mêmes lieux sous différentes conditions extérieures et croise le point de vue bas du robot quadrupède avec celui de son propriétaire humain, ce qui en fait un jeu de données plus réaliste pour la navigation piétonne en ville. La recherche spatiale embarquée reste un domaine peu exploré par rapport aux approches cloud-first ; des acteurs comme Boston Dynamics, Unitree ou les équipes robotique de Google DeepMind travaillent sur des problèmes connexes, mais rarement avec une contrainte d'inférence locale aussi explicite. Le code et les données de GangnamLoop sont disponibles publiquement sur GitHub, ce qui ouvre la voie à des évaluations indépendantes et à des intégrations dans des pipelines de navigation autonome en contexte réel.

RechercheOpinion
1 source
L'IA et les modèles du monde : pourquoi la Chine a une longueur d'avance
70SCMP Tech 

L'IA et les modèles du monde : pourquoi la Chine a une longueur d'avance

Les modèles de monde ("world models") sont désormais identifiés comme la prochaine rupture technologique en intelligence artificielle, dépassant les grands modèles de langage (LLM) en leur ajoutant une capacité de simulation de l'environnement physique. Contrairement aux LLM qui traitent du texte, ces architectures apprennent les lois de la physique, la causalité et la géométrie de l'espace réel, ce qui permet d'entraîner des systèmes à intelligence incarnée (embodied AI) : robots humanoïdes, véhicules autonomes, bras industriels. La Chine a déjà déployé ces systèmes à une échelle nettement supérieure à celle des États-Unis, avec des entreprises comme Baidu Apollo (plusieurs dizaines de millions de kilomètres d'autonomie sur route réelle), Unitree et ses robots humanoïdes en production, ainsi que des modèles de monde propriétaires développés par Tencent (HunyuanWorld) et ByteDance. Cet avantage chinois est structurel autant que technologique : le cadre réglementaire y autorise des déploiements massifs en conditions réelles, là où les États-Unis maintiennent des restrictions plus strictes sur les tests d'autonomie. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que le gap sim-to-real, longtemps considéré comme le principal frein à l'adoption robotique, est en train d'être résolu plus vite en Chine qu'ailleurs. Les world models permettent de générer des données synthétiques d'entraînement à partir de simulations physiquement cohérentes, réduisant drastiquement le besoin de collecte en environnement réel. Côté contexte, le concept de world model remonte aux travaux de Yann LeCun chez Meta (architecture JEPA, 2022-2024), mais sa concrétisation industrielle s'est accélérée en 2025-2026 avec l'émergence de modèles dédiés à la robotique comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et les plateformes chinoises. En Europe, des acteurs comme Enchanted Tools (Paris) travaillent sur des approches similaires mais à bien plus petite échelle. La prochaine étape sera probablement la standardisation des benchmarks de world models, un domaine où le leadership de définition reste encore ouvert.

UEL'Europe accuse un retard structurel face à la Chine dans la course aux world models pour la robotique incarnée, avec seulement Enchanted Tools (Paris) identifié comme acteur actif à petite échelle, là où Pékin bénéficie d'un cadre réglementaire autorisant des déploiements massifs en conditions réelles qui accélèrent la résolution du gap sim-to-real.

Chine/AsieOpinion
1 source
MPC d'impédance avec estimation des perturbations pour le contrôle de main dextérique
71arXiv cs.RO 

MPC d'impédance avec estimation des perturbations pour le contrôle de main dextérique

Des chercheurs ont soumis en juin 2026 sur arXiv (réf. 2606.14606) un cadre de contrôle baptisé Impedance MPC pour doigts robotiques dextres, actuateur-agnostique, couvrant transmissions hydrauliques, câblées, pneumatiques, à corde torsadée et série-élastiques. Un préfiltrage algébrique réduit la dynamique tendineuse à un double intégrateur à coefficients constants, dont l'inverse du coût QP est précalculé hors ligne ; un horizon glissant de 10 pas tourne à 500 Hz avec contraintes dures sur les forces de contact (ISO/TS 15066), les limites d'actionnement et le jerk. Un filtre de Kalman augmenté, alimenté uniquement par encodeurs, annule l'erreur statique sous charge constante. Sur un prototype de doigt à actionnement hydraulique, le contrôleur atteint 0,5 mrad RMS, 0,1 mrad en régime permanent et 6,6 mrad en pic sous 1,5 Nm de couple de contact, soit 183×, 1500× et 23× meilleur que l'impédance classique à gain fixe ; la raideur réalisée s'étend de 18 à 323 Nm/rad selon la fréquence de mise à jour. En simulation MuJoCo, le cadre s'étend à une main LEAP à 16 DOF, récupérant en 0,7 s après une perturbation de saisie de 2,5 N. L'actuateur-agnosticisme est le principal atout pour les intégrateurs : une seule loi de commande couvre des architectures mécaniquement très hétérogènes sans retuning, réduisant le coût d'intégration sur des plateformes multi-actionneurs. La conformité native à l'ISO/TS 15066 dans la formulation du problème simplifie les validations pour le déploiement cobotique en environnement humain, là où les forces de contact sont réglementées. Il faut cependant relativiser les gains annoncés, dont le plus élevé atteint 1500× : la référence est un contrôleur à gain fixe, choix délibérément défavorable, et des benchmarks contre du MPC adaptatif ou du contrôle par apprentissage sont absents de l'article. La main dextre reste le maillon faible de la robotique humanoïde : Shadow Robotics, Inspire Robots et d'autres ont progressé sur le plan mécanique, mais le contrôle fin sous contact demeure un problème ouvert. Les mains LEAP, issues de Carnegie Mellon, constituent la plateforme open-source de référence pour la recherche en manipulation. Les approches concurrentes privilégient l'apprentissage par renforcement et les architectures VLA (vision-langage-action), qui court-circuitent le contrôle classique au prix des garanties formelles ; cet article occupe l'angle inverse, avec des propriétés de stabilité et de faisabilité récursive héritées du cadre pHRI (interaction physique humain-robot). Aucun partenaire industriel ni calendrier de transfert n'est mentionné ; la contribution reste académique, mais elle outille directement les équipes intégrant des mains dextres sur des humanoïdes commerciaux comme ceux de Figure AI ou Unitree.

UELa conformité native à l'ISO/TS 15066 inscrite dans la formulation du contrôleur simplifie les validations réglementaires pour le déploiement cobotique en environnements humains en Europe, où les forces de contact sont normativement encadrées.

RecherchePaper
1 source
L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes
72arXiv cs.RO 

L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes

Une étude publiée sur arXiv le 11 juin 2026 (réf. 2606.11891) présente une comparaison rigoureuse de deux architectures de critique en apprentissage par renforcement multi-objectifs pour robots humanoïdes : un critique unifié (un seul réseau estimant la valeur combinée de tous les objectifs) contre des critiques duaux (deux réseaux distincts, chacun associé à un signal de récompense séparé, l'un pour la locomotion, l'autre pour la manipulation). Les expériences ont été conduites sur le Unitree G1, un humanoïde à 23 degrés de liberté actifs, dans le simulateur NVIDIA Isaac Lab, via un curriculum séquentiel de 13 niveaux progressant de l'atteinte stationnaire jusqu'à la marche avec des cibles à orientation variable. Résultat : les politiques entraînées avec critiques duaux atteignent leurs cibles 3,5 fois plus vite (6,5 pas de simulation contre 22,6), affichent un débit deux fois supérieur (14,3 contre 7,0 atteintes validées pour 1 000 pas), et un taux de réussite validé de 65,2 % contre 53,8 % pour le critique unifié. Ce que l'étude démontre, c'est que le choix de l'architecture du critique est un levier de conception primaire, souvent négligé, dont l'impact surpasse celui du reward engineering. Fait notable : l'ajout de mécanismes anti-gaming, conçus pour empêcher la politique d'exploiter les failles de la fonction de récompense, ne produit aucun gain au-delà du changement architectural seul (60,9 % contre 65,2 %). L'implication la plus immédiate concerne le fine-tuning RL de politiques pré-entraînées par imitation : lorsqu'on affine un modèle de manipulation déjà appris (style Pi-0 ou GR00T N2), un critique unifié risque de supprimer les comportements acquis par interférence des gradients de locomotion. Pour les équipes qui cherchent à spécialiser des modèles de fondation robotiques par RL, cette mise en garde est directement opérationnelle. Le Unitree G1, vendu autour de 16 000 dollars, est devenu un banc de test standard pour la recherche en humanoïde abordable, face aux plateformes de Figure AI, Agility Robotics ou 1X Technologies qui opèrent sur des gammes de prix bien supérieures. NVIDIA Isaac Lab, successeur d'Isaac Gym, s'est imposé comme l'environnement de référence pour l'entraînement sim-to-real. La question du découplage locomotion/manipulation en RL multi-objectifs est au coeur de plusieurs groupes de recherche (Stanford, CMU, ETH Zurich), et les résultats de cette étude, issus d'un cadre contrôlé et reproductible, offrent une base solide pour orienter les choix d'architecture avant tout entraînement coûteux sur robot réel.

RecherchePaper
1 source
Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes
73arXiv cs.RO 

Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes

Des chercheurs ont publié sur arXiv (référence 2602.05791) un framework baptisé XHugWBC, conçu pour entraîner un contrôleur de locomotion whole-body universel sur une large distribution de morphologies humanoïdes, puis le déployer en zero-shot sur des robots non vus durant l'entraînement. Les expériences couvrent douze humanoïdes simulés et sept robots réels. Le système repose sur trois briques techniques : une randomisation morphologique physiquement cohérente (masse des segments, longueur des membres, inertie), des espaces d'observation et d'action alignés sémantiquement entre châssis hétérogènes, et une architecture de politique qui encode explicitement les propriétés morphologiques et dynamiques de chaque instance. L'entraînement est unique, "one-time training" : aucun fine-tuning par robot n'est requis à l'inférence. L'enjeu industriel est direct. Aujourd'hui, chaque équipe robotique entraîne ses contrôleurs de locomotion depuis zéro pour chaque châssis, ce qui représente des semaines de simulation et d'itérations sim-to-real. XHugWBC déplace ce coût vers une phase d'entraînement généraliste unique, ouvrant la voie à un modèle de déploiement où un intégrateur peut adopter un nouveau châssis humanoïde sans reconstruire l'intégralité de sa stack de contrôle. La validation sur sept robots physiques est plus convaincante que les résultats purement simulés habituels, même si la nature exacte des tâches testées et les taux de succès détaillés ne figurent pas dans le résumé disponible. La capacité de transfert zero-shot sur morphologies inédites renforce l'hypothèse que les biais structuraux appris sur distributions larges surpassent les politiques spécialisées sur certains régimes de locomotion, ce que le secteur débattait encore il y a dix-huit mois. Ce travail s'inscrit dans un mouvement vers les contrôleurs dits "fondation" pour la robotique incarnée. En manipulation, des systèmes comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont déjà exploré la généralisation cross-embodiment sur bras et effecteurs; l'extension à la locomotion whole-body humanoïde est plus contrainte par la stabilité dynamique. Les acteurs du secteur, Figure Robotics (Figure 03), Unitree (G1, H1), Agility Robotics (Digit), Fourier Intelligence et 1X Technologies, maintiennent tous des pipelines de contrôle propriétaires et spécialisés. Si XHugWBC tient ses promesses à l'échelle, il réduirait significativement la barrière à l'entrée pour les nouveaux constructeurs, notamment les acteurs européens comme Enchanted Tools (Mirokaï) ou Wandercraft, qui ne disposent pas des ressources d'entraînement des géants américains. Le preprint n'a pas encore fait l'objet d'une évaluation par les pairs.

UELes constructeurs humanoïdes français Wandercraft et Enchanted Tools (Mirokaï) sont explicitement identifiés comme bénéficiaires potentiels, ce framework pouvant réduire significativement leurs coûts d'entraînement de locomotion sans nécessiter les ressources des géants américains.

💬 C'est le genre de papier qui résout un vrai problème industriel : chaque robot humanoïde qui sort oblige aujourd'hui à tout réentraîner depuis zéro. Sept robots physiques en zero-shot, c'est pas du tout la même chose que des résultats simulés, ça valide quelque chose de sérieux. Pour Wandercraft ou Enchanted Tools, bien plus contraints en ressources que Figure ou Unitree, ce type de contrôleur généraliste c'est du concret.

IA physiqueOpinion
1 source
YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle
74arXiv cs.RO 

YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle

Des chercheurs ont publié le 10 juin 2026 YUBI (Yielding Universal Bidigital Interface), un préhenseur bi-digital conçu pour la collecte de données bimanuelle dextère à grande échelle. Contrairement aux systèmes pistol-grip comme l'UMI (Universal Manipulation Interface), YUBI adopte un principe d'actionnement dit "yielding" : les mouvements des doigts de l'opérateur sont transcrits directement en mouvement des mâchoires du préhenseur, sans intermédiaire mécanique rigide. Le système intègre un tracking 6 DOF basé sur la réalité virtuelle pour une acquisition de trajectoires haute fidélité. L'équipe a constitué un dataset d'une ampleur inédite dans la littérature : 8 434 heures de démonstrations, 1,20 million d'épisodes répartis sur 119 tâches. Un politique unique entraîné sur ce corpus a été validée sur trois plateformes robotiques bimanuelle distinctes : UR, Franka et ELEY, via simple montage du préhenseur. Ce résultat a une portée directe pour quiconque travaille sur les fondation models robotiques : le bottleneck historique n'est plus le modèle mais la donnée, et YUBI apporte une réponse concrète sur la scalabilité de la collecte. Le fait qu'une seule politique transfère sur trois robots hétérogènes confirme que l'interface impose une représentation suffisamment générique pour servir de supervision directe, sans fine-tuning plateforme-spécifique. C'est un argument fort en faveur de l'approche "data-centric" face aux pipelines sim-to-real, souvent coûteux à valider en conditions industrielles. L'ergonomie améliorée réduit aussi la fatigue opérateur sur les tâches fines, un point non-trivial pour des sessions de collecte longues et répétitives que les démonstrateurs UMI rendaient problématiques. L'UMI, développé à l'Université de Columbia et largement adopté pour sa simplicité et son coût, reste la référence low-cost pour la collecte de données manipulation, mais son grip pistolet montrait ses limites sur les tâches bimanuelle complexes. YUBI s'inscrit dans un mouvement plus large visant à démocratiser la collecte de données pour les robot foundation models, en parallèle d'initiatives comme ACT, Diffusion Policy ou les efforts open-data de Physical Intelligence (Pi-0). L'ensemble du stack est publié en open source : hardware du préhenseur, logiciel de collecte, et dataset complet, ce qui représente une contribution substantielle pour les laboratoires ne disposant pas des moyens de Unitree, Figure AI ou Boston Dynamics pour constituer leurs propres corpus propriétaires. Les prochaines étapes probables incluent l'extension du dataset et l'intégration avec des architectures VLA plus récentes.

UELes laboratoires européens (INRIA, CEA-List, universités) et PME robotiques peuvent directement exploiter le dataset open-source YUBI (8 434 h, 1,2M épisodes) et l'interface hardware pour entraîner des politiques de manipulation sans constituer de corpus propriétaire, avec validation native sur Franka (allemand) et UR (danois).

RechercheOpinion
1 source
PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
75arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
Apprentissage de la représentation du contact pour l'odométrie des jambes
76arXiv cs.RO 

Apprentissage de la représentation du contact pour l'odométrie des jambes

Une équipe de chercheurs a publié sur arXiv (référence 2606.05501) une approche d'apprentissage de représentation auto-supervisée pour la détection de contact dans les robots à pattes, visant à améliorer l'odométrie locomotrice sans recourir à des capteurs de force aux extrémités. Le système repose exclusivement sur les encodeurs articulaires standard, présents sur la quasi-totalité des plateformes commerciales existantes. En modélisant les phases d'appui et de vol (stance et swing) de façon probabiliste, le framework permet d'estimer la vitesse du corps principal à partir de la chaîne cinématique des membres, en s'appuyant sur l'hypothèse classique que la vitesse du pied par rapport au monde est nulle en phase d'appui. Les résultats expérimentaux indiquent des performances supérieures aux méthodes supervisées nécessitant des capteurs additionnels et aux approches probabilistes de référence. Le code est publié en open source. L'enjeu est concret : l'odométrie par jambes est une brique fondamentale pour la navigation autonome des robots quadrupèdes et bipèdes, notamment lorsque le GNSS ou la vision sont dégradés. Or, les capteurs de réaction au sol (GRF sensors) alourdissent les pieds, augmentent la complexité mécanique et sont souvent aveugles aux glissements en contact, ce qui produit des dérives d'estimation même lorsque le pied est techniquement "posé". En éliminant cette dépendance sensorielle, cette approche ouvre la voie à un déploiement sur des plateformes à budget contraint, et surtout améliore la robustesse sur surfaces glissantes ou irrégulières, scénario typique des environnements industriels ou d'inspection. La nature auto-supervisée supprime également le coût d'annotation de données, un frein classique dans les pipelines de locomotion. Le problème de la détection fiable de la phase d'appui est étudié depuis l'essor des robots quadrupèdes comme ANYmal (ANYbotics) et Go1/Go2 (Unitree), ainsi que des bipèdes comme Spot (Boston Dynamics) ou Atlas. La majorité des stacks d'odométrie actuels, y compris ceux utilisés dans des frameworks open source comme Legged Gym ou OCS2, conservent une dépendance aux GRF sensors ou à des heuristiques de seuillage. Cette contribution s'inscrit dans une tendance plus large visant à rendre la locomotion avancée accessible sur des plateformes sans instrumentation de pointe, une direction également explorée par des labos européens comme le DLR ou l'INRIA. La prochaine étape naturelle sera la validation sur plusieurs morphologies de robots et dans des conditions de terrain dégradé, un benchmark que les auteurs n'ont pas encore publié.

UEL'approche intéresse directement des équipes comme l'INRIA qui travaillent sur la locomotion avancée, et pourrait être intégrée sans modification matérielle sur des plateformes européennes à budget contraint.

RecherchePaper
1 source
Stardust Intelligence lève plus d'un milliard de yuans en série B, sa valorisation dépasse 10 milliards
7736Kr 

Stardust Intelligence lève plus d'un milliard de yuans en série B, sa valorisation dépasse 10 milliards

Astribot (星尘智能), startup shenzhenoise spécialisée dans les humanoïdes à transmission par câble, a bouclé une série B représentant plus d'un milliard de yuans (environ 125 millions d'euros) en trois tours sur trois mois. Sa valorisation dépasse désormais 10 milliards de yuans, la hissant au rang de licorne shenzhenoise de l'embodied intelligence. Le tour réunit des fonds régionaux (Liangxi Tech Innovation Fund géré par Bohua Capital, Yangzhou Longtou Xinli), l'industriel ThinkTech (中科创达), GUOKE Investment, et confirme le réinvestissement d'actionnaires historiques liés à Tencent, Alibaba et ByteDance. Sur le plan commercial, Astribot signe une commande de l'ordre du millier d'unités avec ThinkTech pour des applications industrielles et de services, avec expansion à l'export, ainsi que la co-construction d'un centre d'application de 100 millions de yuans avec la zone de développement économique de Jiangdu pour l'hôtellerie et le tourisme culturel. La gamme T1, lancée à 89 900 yuans (environ 11 500 euros), exécute des tâches en séquence continue : cuisson, service en bar, tri de pièces automobiles, manipulation chimique. Des livraisons à l'échelle du millier d'unités ont démarré fin 2025. Ce qui distingue Astribot sur le plan technique, c'est son choix de la transmission tendineuse par câble (rope-driven), imitant la biomécanique musculaire humaine : moteurs déportés, câbles tractant les articulations, avec un couplage rigide-souple qui préserve la rigidité opérationnelle tout en absorbant les chocs. L'entreprise revendique être la première au monde à avoir industrialisé cette approche en production de masse pour des humanoïdes IA. Pour les intégrateurs, cela signifie un meilleur rapport charge utile/masse, moins de backlash mécanique, et des données de force proprioceptives de haute qualité transmises fidèlement au modèle, un avantage critique pour l'apprentissage de la physique réelle. L'intelligence embarquée repose sur DuoCore, une architecture bicéphale rapide/lente inspirée du double système cognitif humain, structurellement convergente avec l'architecture Helix de Figure dévoilée quasi simultanément, ce qui constitue une validation indépendante de cette direction. Le système rapide gère la compliance articulaire et l'évitement d'obstacles en temps réel ; le système lent planifie les tâches longues et coordonne les deux bras. Le modèle de fondation VLA maison, Lumo, entraîné par pré-entraînement puis alignement sur robot physique, affiche une généralisation à des objets inconnus et des environnements non vus. DuoCore est déjà déployé en conditions réelles dans la distribution au détail dans six villes chinoises, ce qui constitue un déploiement opérationnel, pas une démonstration en laboratoire. Astribot a été fondée en 2022 par Lai Jie, qui cumule 17 ans d'expérience en IA et robotique : il a été le premier employé et architecte du laboratoire de robotique de Tencent, puis directeur de l'équipe robot Xiaodu chez Baidu. Sa philosophie "Design for AI" consiste à concevoir d'abord un corps adapté à l'apprentissage par un grand modèle, puis à y adjoindre l'algorithme, structurant ainsi toute l'architecture produit. L'entreprise s'inscrit dans un secteur très concurrentiel face à Unitree (G1, H1), Figure (02, Helix), Boston Dynamics (Atlas électrique), Agility Robotics (Digit), et côté chinois, Fourier Intelligence et Galbot. Sa différenciation repose sur la transmission câblée et une stratégie de données axée sur l'efficacité plutôt que le volume brut. Les prochaines étapes annoncées incluent l'internationalisation des commandes ThinkTech et l'intégration de capacités de modèle du monde (world model) dans les futures versions de Lumo.

UELa montée en puissance d'Astribot renforce la pression concurrentielle sur les acteurs européens de l'humanoïde (Wandercraft, Enchanted Tools) ; l'internationalisation annoncée des commandes ThinkTech pourrait atteindre l'Europe, mais aucun déploiement ou partenariat européen n'est confirmé à ce stade.

Chine/AsieOpinion
1 source
LEGS : affinage de VLA sans téléopération pour la loco-manipulation humanoïde dans un monde Gaussian Splatting incarné
78arXiv cs.RO 

LEGS : affinage de VLA sans téléopération pour la loco-manipulation humanoïde dans un monde Gaussian Splatting incarné

Des chercheurs présentent LEGS (Loco-manipulation via Embodied Gaussian Splatting), un simulateur hybride qui combine un avant-plan en maillage 3D avec un arrière-plan photoréaliste en Gaussian Splatting 3D (3DGS) pour entraîner des politiques vision-langage-action (VLA) sur humanoïdes sans téleopération humaine. Un générateur procédural de primitives de mouvement produit automatiquement des démonstrations annotées à grande échelle, tandis qu'une calibration colorimétrique à deux étapes aligne le rendu simulé avec la caméra réelle du robot. Sur un Unitree G1, sur trois tâches de saisie-dépose de difficulté croissante et avec trois architectures VLA (ψ₀, π₀.5 et GR00T N1.6), une politique entraînée exclusivement sur données LEGS égale ou dépasse, selon les auteurs, une politique entraînée sur démonstrations téleopérées. La couverture d'une nouvelle scène coûterait plus de quinze fois moins qu'une collecte par téleopération, une affirmation à vérifier hors du cadre expérimental : les résultats restent au stade de préprint arXiv (2606.01458) non soumis à revue par les pairs. Le résultat le plus structurant est la réduction effective du fossé simulation-réalité pour la loco-manipulation humanoïde corps entier, un problème que les simulateurs à maillage seul n'avaient pas résolu jusqu'ici. L'ablation le confirme : supprimer le fond 3DGS au profit d'un environnement mesh-only dégrade significativement les transferts, établissant le rendu photoréaliste comme facteur déterminant et non accessoire. Sous variations combinées d'apparence d'objet et de scène (scénario LEGS-AUG), la politique LEGS maintient son taux de succès tandis que la politique téleopérée échoue entièrement, ce qui valide empiriquement que les VLA nécessitent une diversité visuelle synthétique pour généraliser. Pour les intégrateurs et équipes robotiques, cela ouvre une voie scalable vers de nouveaux environnements industriels sans mobiliser d'opérateurs dédiés. LEGS s'appuie sur la technique 3DGS, popularisée en 2023 pour la reconstruction photoréaliste de scènes à partir d'images, et l'adapte en fond simulé pour l'entraînement de politiques. Les architectures testées incluent π₀.5 de Physical Intelligence et GR00T N1.6 de NVIDIA, deux acteurs centraux de l'espace VLA humanoïde, aux côtés desquels Boston Dynamics, Figure AI, Agility Robotics et Tesla Optimus avancent sur leurs propres pipelines de données synthétiques. Le Unitree G1, l'un des humanoïdes commerciaux les plus accessibles du marché, ancre les expériences dans un contexte potentiellement déployable. Les suites logiques incluent l'extension au-delà du pick-and-place, la publication du code et des données, et des tests en environnements industriels réels pour valider la robustesse hors laboratoire.

UELes équipes européennes en robotique humanoïde (CEA-List, INRIA, startups FR) pourraient adopter cette approche pour réduire drastiquement les coûts de collecte de données VLA sans téleopération, mais aucun acteur européen n'est impliqué dans l'étude.

IA physiqueOpinion
1 source
7 robots inspirés du vivant qui relèvent de vrais défis d'ingénierie
79Interesting Engineering 

7 robots inspirés du vivant qui relèvent de vrais défis d'ingénierie

Six familles de robots à morphologie animale concentrent une part croissante des efforts en robotique appliquée, couvrant des secteurs aussi divers que l'inspection industrielle, le sauvetage en catastrophe, la maintenance offshore et l'aquaculture. Le quadrupède Spot, commercialisé par Boston Dynamics, est déjà opérationnel dans des centrales électriques, des installations pétrolières et des chantiers pour des missions de surveillance en environnement dangereux. Les robots serpents, dotés de corps segmentés articulés, ont été testés par des équipes de recherche et des équipes de secours pour localiser des survivants dans des décombres post-séisme, là où les plateformes conventionnelles ne peuvent pas pénétrer. Des robots grimpeurs reproduisent les micro-structures adhésives des pattes de gecko pour inspecter verticalement ponts et infrastructures. En milieu offshore, le robot Eelume, développé par la spin-off NTNU éponyme soutenue par Equinor et Kongsberg, adopte la locomotion ondulatoire de l'anguille pour inspecter pipelines et plateformes en restant déployé durablement sous l'eau. Des chercheurs du CIRTESU (Centre de recherche en robotique et technologies sous-marines) de l'Universitat Jaume I ont récemment testé à PortCastelló un poisson-robot biomimétique à propulsion par nageoires, sans hélices, équipé de sonar et de systèmes de vision, pour surveiller les filets de fermes aquacoles. Le laboratoire CREATE de l'EPFL a par ailleurs présenté un bras souple reposant sur une structure d'hélicoïde tronqué (trimmed helicoid), inspirée de la trompe d'éléphant et des tentacules de pieuvre, qui module rigidité et flexibilité localement pour permettre une manipulation délicate en contexte co-robotique. Ces plateformes répondent à des problèmes industriels documentés, pas à des curiosités de laboratoire. Eelume modifie structurellement l'économie de la maintenance offshore : là où un ROV traditionnel nécessite un navire de surface et dépend de la météo, un système résident opère en continu, réduisant les coûts d'intervention. La propulsion par nageoires du robot valencien surpasse les hélices en discrétion et efficacité énergétique dans les milieux aquacoles. Spot constitue le cas commercial le plus avancé de la tendance, Boston Dynamics ayant livré plusieurs centaines d'unités à des industriels. Pour les autres familles, notamment les robots serpents, les tests restent majoritairement conduits en environnements contrôlés : le fossé sim-to-real pour des décombres réels n'est pas résolu. L'approche soft robotics de l'EPFL illustre une stratégie alternative : intégrer la compliance mécanique dans la conception plutôt que de la gérer par contrôle actif, ce qui simplifie considérablement l'implémentation en environnement co-robotique. Boston Dynamics développe Spot depuis les travaux fondateurs de Marc Raibert au MIT ; l'entreprise a été rachetée par Hyundai en 2021 pour 1,1 milliard de dollars. Sur le segment quadrupède, la concurrence est vive : ANYbotics (ANYmal), Unitree (Go2, H1) et Ghost Robotics (Vision 60) ciblent les mêmes marchés industriels avec des positionnements prix différenciés. Eelume opère sur le marché oil & gas depuis plusieurs années avec le soutien de majors du secteur. En Europe, Pollen Robotics et Enchanted Tools développent des architectures à inspiration biologique, mais restent peu positionnés sur ces créneaux applicatifs précis. L'aquaculture robotisée bénéficie de financements croissants dans le cadre du Blue Deal européen, ce qui devrait accélérer les déploiements à l'image du projet de l'Universitat Jaume I. L'intégration de modèles VLA (vision-language-action) pour la compréhension contextuelle des tâches et la certification ATEX pour les robots industriels constituent les prochains jalons pour plusieurs de ces familles.

UEPlusieurs acteurs européens figurent parmi les leaders des niches couvertes, Eelume/NTNU (soutenu par Equinor et Kongsberg) sur la maintenance offshore résidente, l'EPFL sur la soft robotics co-robotique, l'Universitat Jaume I sur l'aquaculture, et le financement croissant via le Blue Deal européen devrait accélérer les déploiements dans ce secteur, créant des opportunités pour les startups françaises Pollen Robotics et Enchanted Tools si elles se positionnent sur ces créneaux applicatifs.

IndustrielActu
1 source
ORBBEC s'étend au-delà de la vision robotique vers l'IA physique et l'impression 3D
80Pandaily 

ORBBEC s'étend au-delà de la vision robotique vers l'IA physique et l'impression 3D

ORBBEC (688322.SH), fabricant chinois de capteurs de vision 3D, annonce un élargissement stratégique vers quatre segments: Physical AI, vision IA généraliste, impression 3D et acquisition de données volumétriques. La société revendique plus de 70% de part de marché en Chine et en Corée du Sud sur le créneau vision robotique de service, s'appuyant sur une décennie de R&D qui lui a permis de taper une douzaine de puces propriétaires couvrant lumière structurée, iToF (temps de vol indirect), dToF et LiDAR. Ces capteurs sont d'ores et déjà intégrés dans les chaînes d'approvisionnement des fabricants d'humanoïdes AgiBot, UBTech et Unitree. Le 29 mai 2026, ORBBEC a élargi son partenariat avec Creality 3D, récemment introduite en bourse à Hong Kong, pour co-créer un centre d'innovation en scanners 3D et lancer une plateforme commune baptisée "3D Printing AI Vision Intelligent Platform". Financièrement, le premier trimestre 2026 affiche 203 millions de RMB de chiffre d'affaires, avec un bénéfice net retraité en hausse de 531% sur un an -- chiffre spectaculaire qui s'explique probablement par un faible niveau de base et qui reste à confirmer dans la durée. La portée industrielle de ce repositionnement tient à trois leviers combinés. En Physical AI, les capteurs ORBBEC alimentent les world models de simulation via une intégration confirmée dans NVIDIA Isaac Sim, ce qui positionne la société comme fournisseur de données réelles pour le cycle sim-to-real -- un noeud critique que peu d'acteurs hardware maîtrisent de bout en bout. Sur l'impression 3D, le contexte est porteur: les exports chinois du secteur ont progressé de 119% en glissement annuel sur les quatre premiers mois de 2026, rendant le partenariat Creality stratégiquement opportuniste. Enfin, la transition de "fournisseur de composants" vers "perception-as-a-service" signifie une montée vers les couches logicielles (reconnaissance, décision), ce qui modifie structurellement le profil de marges -- les analystes anticipent une amélioration du mix produit et une expansion des marges brutes tout au long de 2026. ORBBEC prend pied dans un marché longtemps dominé par des acteurs occidentaux aujourd'hui en retrait: Intel a arrêté sa gamme RealSense en 2023, Microsoft a mis fin à l'Azure Kinect la même année, laissant un vide que Stereolabs (ZED Camera), Photoneo ou Zivid cherchent à combler sur le segment industriel haut de gamme. ORBBEC se présente comme une alternative chinoise à coût compétitif, avec un ancrage fort sur le marché asiatique des robots de service et une ambition d'intégration verticale puce-algorithme-optique. Les prochaines étapes déclarées incluent le déploiement effectif du centre d'innovation commun avec Creality et le lancement commercial de la plateforme impression 3D. Les projections sectorielles évoquent un marché combiné scan-impression-modélisation 3D approchant les mille milliards de dollars sur la décennie -- une estimation à prendre avec précaution, mais qui illustre l'amplitude de la thèse de croissance que la société cherche à incarner.

UELe repositionnement d'ORBBEC intensifie la pression concurrentielle sur Stereolabs (France/ZED Camera) et Photoneo dans le segment capteurs 3D pour robotique industrielle, alors qu'Intel et Microsoft ont abandonné ce marché en 2023.

Chine/AsieOpinion
1 source
La Chine déploie des robots humanoïdes capables de trier 1 200 colis par heure dans un grand centre postal
81Interesting Engineering 

La Chine déploie des robots humanoïdes capables de trier 1 200 colis par heure dans un grand centre postal

La Chine a déployé des robots humanoïdes dans le centre logistique de Jianggao, rattaché au hub postal de Guangzhou (province du Guangdong), pour trier les colis à une cadence annoncée de 1 200 unités par heure. Des images diffusées cette semaine par l'agence Xinhua montrent ces systèmes humanoïdes travaillant en parallèle avec des bras robotiques et des chariots élévateurs autonomes dans un entrepôt fortement automatisé opéré par China Post Group. Le site traite en moyenne 6,5 millions de pièces de courrier par jour, avec des pics dépassant 10 millions. Les robots filmés saisissent des colis depuis des conteneurs et les déposent sur des lignes de tri, tandis que des véhicules autonomes assurent les flux au sol. À noter : les chiffres de cadence (1 200 colis/heure) émanent des médias d'État et n'ont pas été vérifiés de manière indépendante, et les vidéos publiées ne montrent que des séquences sélectionnées dans des conditions optimales. Ce déploiement marque une inflexion notable dans la stratégie d'automatisation logistique. Les robots humanoïdes présentent un avantage structurel par rapport à l'automatisation industrielle fixe : ils peuvent théoriquement opérer dans des infrastructures conçues pour les humains, sans nécessiter de refonte complète de l'entrepôt. Pour les intégrateurs et les décideurs B2B, cela réduit la barrière à l'entrée par rapport aux systèmes dédiés qui exigent une architecture entrepôt repensée de zéro. La logistique devient ainsi le premier secteur à tester à grande échelle la promesse de la robotique humanoïde en conditions réelles, au-delà des démos en laboratoire, dans un environnement à forte pression opérationnelle (24h/24, volumes croissants portés par l'e-commerce, pénuries de main-d'oeuvre régionales). C'est précisément ce contexte de charge élevée et continue qui permet d'évaluer si le gap sim-to-real est réellement comblé. China Post Group s'inscrit dans une dynamique nationale soutenue par des investissements publics massifs dans la robotique humanoïde, avec des acteurs comme Unitree, Fourier Intelligence et UBTECH qui cherchent à commercialiser leurs systèmes dans l'industrie, les services à la personne et la logistique. À l'international, les concurrents directs incluent Figure (avec son robot 02 déployé chez BMW), Agility Robotics (Digit chez Amazon) et 1X Technologies. La différence est que la Chine déploie à une échelle de volumes postaux nationaux, là où les déploiements occidentaux restent pour l'instant des pilotes industriels circonscrits. Des interrogations légitimes subsistent sur la fiabilité à long terme, les coûts de maintenance et la pertinence économique face à des alternatives plus simples comme les AMR (robots mobiles autonomes). Mais la décision de China Post de franchir le seuil du déploiement opérationnel à grande échelle, plutôt que de rester en mode pilote, constitue en soi un signal industriel significatif.

UELe déploiement à grande échelle de robots humanoïdes par China Post accentue le retard compétitif des intégrateurs et constructeurs européens, qui restent cantonnés à des pilotes industriels circonscrits face à une automatisation logistique humanoïde déjà opérationnelle à l'échelle nationale en Chine.

Chine/AsieOpinion
1 source
NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes
82The Robot Report 

NIST propose un benchmark de référence pour évaluer les performances des robots humanoïdes

Le National Institute of Standards and Technology (NIST) a publié en avril 2026 une proposition de référentiel de performance standardisé pour les robots humanoïdes, décrit comme un ensemble de tâches de locomotion et de manipulation à faible empreinte logistique. C'est le premier cadre d'évaluation de ce type depuis le DARPA Robotics Challenge de 2015, selon Aaron Prather, directeur du programme Robotics & Autonomous Systems chez ASTM International. Le benchmark couvre quatre dimensions : la mobilité de base (agnostic au domaine d'application), la manipulation et la dextérité, les capacités combinées loco-manipulation, le contrôle en espace contraint, et un niveau minimal de raisonnement et de compréhension de scène. Le NIST prévoit de fabriquer un nombre limité d'appareils de test physiques pour les distribuer gratuitement aux fabricants américains d'humanoïdes et aux centres de test régionaux, et de publier les plans et modèles 3D pour usage en environnement physique ou virtuel (simulateurs de training et de développement de contrôle). Les données collectées seront agrégées sous des accords de partage préapprouvés protégeant la propriété intellectuelle. L'absence de standard commun est un problème structurel pour le secteur : Tesla Optimus, Figure, Agility Robotics, Apptronik, Unitree et une douzaine d'autres plateformes humanoïdes ont attiré des milliards de dollars d'investissement ces dix dernières années sans qu'il existe de méthode consensuelle pour mesurer ce qu'elles font réellement. Comme le note Prather, "les vidéos marketing ont comblé le vide". Pour un intégrateur industriel ou un décideur B2B, l'absence de benchmarks opposables rend toute comparaison entre plateformes impossible et ralentit les décisions d'achat. Ce référentiel, s'il est adopté, permettrait d'objectiver le fossé entre démo et déploiement réel, de quantifier les progrès en loco-manipulation et en whole-body control, et d'offrir aux chercheurs une baseline reproductible. Il représente aussi un signal réglementaire potentiel : un benchmark NIST peut devenir une norme de fait pour les appels d'offres gouvernementaux américains. Ce projet s'appuie sur la collaboration antérieure du NIST avec le DARPA pour évaluer les capacités humanoïdes dans l'industrie et la recherche académique. En Europe, le Fraunhofer IPA (Stuttgart) a publié ce mois-ci son propre référentiel de sécurité et de développement pour humanoïdes, structuré autour de six critères, signalant que la course aux standards est désormais transatlantique. Aucun acteur français ou européen n'est directement impliqué dans la proposition NIST à ce stade, bien que des entreprises comme Enchanted Tools ou Wandercraft pourraient être concernées si ce cadre influence les standards ISO ou CEN. Le NIST est en phase de consultation et recherche des participants, fabricants comme labos, pour affiner la liste des tâches et tester leurs robots dans les installations NIST ou partenaires. Aucune date de finalisation n'est annoncée.

UELe Fraunhofer IPA a publié ce même mois son propre référentiel de sécurité pour humanoïdes, signalant une course transatlantique aux standards ; si le benchmark NIST influence les normes ISO/CEN, des acteurs européens comme Enchanted Tools ou Wandercraft devront adapter leur processus de qualification.

InfrastructureOpinion
1 source
MonoDuo : apprendre des politiques bimanuelles avec un seul bras robotique
83arXiv cs.RO 

MonoDuo : apprendre des politiques bimanuelles avec un seul bras robotique

Des chercheurs proposent avec MonoDuo (arXiv:2505.29298) une méthode pour entraîner des politiques de manipulation bimanuelles sans disposer de robots à deux bras. La collecte de données est hybride: un opérateur téléopère un bras unique pour exécuter un côté d'une tâche bimanuelles, un humain réalisant l'autre côté, puis les rôles sont inversés pour couvrir les deux membres. Les séquences RGB-D, capturées par une caméra de poignet et une caméra fixe, sont transformées en démonstrations synthétiques calibrées sur la cinématique du robot bimanuel cible, via estimation de pose des mains, segmentation de nuage de points et inpainting. Testé sur cinq tâches (soulèvement d'une boîte, remplissage d'un sac à dos, pliage d'un vêtement, fermeture d'une veste à glissière, passage d'une assiette), MonoDuo atteint jusqu'à 70% de taux de réussite en déploiement zero-shot sur des configurations bimanuelles non vues à l'entraînement. Avec seulement 25 démonstrations supplémentaires sur le robot cible, un fine-tuning few-shot améliore ces résultats de 65 à 70% par rapport à un entraînement depuis zéro. Le verrou adressé est structurel: les robots à deux bras coordonnés restent rares et onéreux dans les laboratoires de recherche, alors que les bras uniques sont omniprésents. Cette asymétrie crée un goulot d'étranglement dans la constitution de datasets pour les tâches bimanuelles, freinant le développement de politiques viables aussi bien pour les humanoïdes commerciaux que pour les cellules industrielles bimanuelles. MonoDuo montre qu'il est possible de bootstrapper ces politiques sans matériel dédié, réduisant considérablement le coût d'entrée. La réussite du déploiement zero-shot sur des configurations non vues est notable dans un domaine où le sim-to-real gap reste un obstacle structurel, et le gain de 65 à 70% obtenu avec seulement 25 démonstrations de fine-tuning constitue un signal positif pour les intégrateurs ne pouvant se permettre des milliers de cycles de collecte. Ce travail s'inscrit dans la lignée d'ALOHA, de UMI (Universal Manipulation Interface) et de Diffusion Policy, qui cherchent à décorréler la plateforme de collecte de la plateforme cible. L'essor des humanoïdes commerciaux (Figure 03, Tesla Optimus Gen 3, Unitree G1, 1X Eve) relance l'intérêt pour la manipulation bimanuelles à grande échelle. En Europe, Pollen Robotics avec son robot open-source Reachy et Enchanted Tools avec Miroki travaillent sur des problématiques similaires d'efficacité des démonstrations. MonoDuo reste à ce stade un preprint académique sans déploiement industriel annoncé; ses résultats devront être confirmés hors conditions de laboratoire pour valider leur transposabilité opérationnelle.

UEPollen Robotics et Enchanted Tools, qui développent des robots bimanuels en Europe, pourraient exploiter cette méthode pour constituer des datasets bimanuels à moindre coût sans dupliquer leur parc matériel.

RecherchePaper
1 source
La nouvelle usine d'ENGINEAI (12 000 m²) produit un robot humanoïde toutes les 15 minutes
84Interesting Engineering 

La nouvelle usine d'ENGINEAI (12 000 m²) produit un robot humanoïde toutes les 15 minutes

ENGINEAI, startup robotique fondée en octobre 2023 et basée à Shenzhen, a inauguré une usine de fabrication en série de robots humanoïdes dans le district de Honghualing. L'installation couvre environ 12 000 m² et intègre l'ensemble de la chaîne de valeur : contrôle qualité entrant, tests de composants, assemblage, tests pré-expédition, logistique et service après-vente. Selon l'entreprise, la cadence de production atteint un robot toutes les 15 minutes, soit potentiellement jusqu'à 35 000 unités par an en rythme continu. Chaque machine doit passer 79 contrôles qualité et 46 tests de simulation avant expédition. Les premiers exemplaires du T800, robot humanoïde polyvalent à vocation industrielle lourde, ont déjà quitté la chaîne. En parallèle, ENGINEAI prépare un second site à Zhengzhou, dans la province du Henan, dédié à une ligne de production de 10 000 unités supplémentaires, intégrée dans le Yunzhi Science Park. Cette expansion s'appuie sur une levée de fonds de série B de 200 millions de dollars clôturée en avril 2026, valorisant la société à plus de 10 milliards de yuans (environ 1,4 milliard de dollars). Le passage à une production industrielle cadencée représente un signal structurant pour le secteur. Jusqu'ici, la quasi-totalité des constructeurs d'humanoïdes, y compris des acteurs bien financés comme Figure ou 1X, opéraient en mode artisanal ou semi-série, avec des volumes annuels comptés en dizaines ou centaines d'unités. Une cadence de 1 robot toutes les 15 minutes, si elle est confirmée en régime nominal et non seulement revendiquée en pic de démo, constituerait une rupture dans le ratio coût/volume. Elle valide aussi l'hypothèse que le goulot d'étranglement de la filière n'est plus uniquement logiciel (contrôleurs, VLA, sim-to-real), mais bien industriel. Pour les intégrateurs et décideurs B2B, cela change le calcul : la question n'est plus "aura-t-on accès à des robots ?" mais "à quel prix et avec quel support ?" La précision des 79 points de contrôle et 46 tests de simulation suggère une démarche sérieuse de standardisation, même si ENGINEAI n'a pas publié de données indépendantes sur les taux de défauts ou la fiabilité terrain. ENGINEAI s'inscrit dans une vague d'industriels chinois qui accélèrent sur l'humanoïde depuis 2024, portés par des politiques publiques favorables et une base de fournisseurs actuateurs/capteurs mature dans la région de Shenzhen. La société commercialise quatre plateformes : le T800 (humanoïde lourd), le PM01 (humanoïde généraliste), le SA02 (robot compagnon léger) et le JS01 (quadrupède). Ses cibles déclarées sont l'industrie et l'inspection, soit les mêmes segments qu'Agility Robotics (Digit, déployé chez Amazon), Figure (accord BMW), Unitree ou Fourier Intelligence. Sur le plan concurrentiel, la proximité géographique avec les fournisseurs de la chaîne d'approvisionnement shenzhenoise constitue un avantage structurel face aux acteurs américains. Les prochaines étapes annoncées incluent la montée en puissance du site de Zhengzhou et l'atteinte du seuil des 10 000 unités cumulées, sans calendrier précis communiqué à ce stade.

UELa montée en capacité industrielle cadencée de la filière humanoïde chinoise accentue la pression sur les intégrateurs et constructeurs européens (ABB, KUKA, Stäubli) : si les chiffres se confirment en régime nominal, le ratio coût/volume change structurellement et les décideurs B2B européens devront revoir leurs calculs de TCO pour leurs lignes de production d'ici 2027.

Chine/AsieOpinion
1 source
Guide complet des événements du Robotics Summit & Expo 2026
85The Robot Report 

Guide complet des événements du Robotics Summit & Expo 2026

Le Robotics Summit & Expo 2026 ouvre ses portes le 27 mai à Boston, au Thomas M. Menino Convention & Exhibition Center. L'événement réunit plus de 5 000 experts de la robotique et 200 exposants sur deux jours, avec plus de 50 sessions réparties en cinq tracks : intelligence artificielle, design et développement, technologies habilitantes, santé et logistique. Plus de 70 intervenants représentent des acteurs comme Amazon Robotics, Universal Robots, Locus Robotics, Boston Dynamics, Agility, Tesla, le Toyota Research Institute, Harmonic Drive, maxon, PickNik Robotics et Intrinsic. La première journée s'ouvre à 9h par le panel "Building the Next Era of Robot Autonomy", avec Aaron Parness (directeur de la science appliquée chez Amazon Robotics), Anders Beck (VP produits AI robotics chez Universal Robots), Hamid Montazeri (SVP software et IA chez Locus Robotics) et John Wall (président de QNX). À 10h suivra le panel "The State of Humanoids", incluant Alberto Rodriguez (directeur du comportement robot pour Atlas chez Boston Dynamics) et Pras Velagapudi (CTO d'Agility Robotics). Le 28 mai, Brian Gerkey (board chair d'Open Robotics et CTO d'Intrinsic) livrera la keynote "An Open Foundation for the Age of AI-Powered Robots", et la conférence se clôturera par le témoignage de Noland Arbaugh, premier utilisateur d'un implant cérébral Neuralink. La concentration de sessions de haut niveau sur l'autonomie et les humanoïdes reflète le basculement du secteur d'une phase de démonstration vers une phase de commercialisation active. La présence d'Alberto Rodriguez (Boston Dynamics) et de Pras Velagapudi (Agility) sur le même panel humanoïde est révélatrice : ces deux entreprises sont actuellement les seules à pouvoir revendiquer des déploiements clients documentés à échelle industrielle, et leur coprésence sur scène illustre une compétition directe pour les contrats pilotes. Le thème porté par Gerkey (Intrinsic, filiale Alphabet) sur les fondations logicielles ouvertes pour robots IA pointe une tension structurelle du secteur : la fragmentation des stacks ROS freine l'interopérabilité, et plusieurs acteurs cherchent à imposer un middleware de référence avant que le marché ne se verrouille autour d'un standard propriétaire. Le Robotics Summit est organisé par The Robot Report et Peerless Media, et constitue l'un des deux grands rendez-vous professionnels de la robotique aux États-Unis avec RoboBusiness. L'édition 2026 se tient dans un contexte de forte pression concurrentielle sur le segment humanoïde : Figure AI, 1X, Apptronik, Unitree et Fourier Intelligence ont multiplié les annonces depuis dix-huit mois, tandis que les déploiements réels documentés restent rares. L'absence dans le programme de représentants de Figure AI ou de 1X peut indiquer un positionnement délibéré de ces acteurs en dehors des canaux de conférence traditionnels, ou simplement un agenda non finalisé. Les RBR50 Innovation Awards, remis lors du dîner du soir du 27 mai, constitueront un baromètre utile des projets jugés les plus significatifs par la communauté professionnelle cette année.

OCELOT : odométrie et estimation du contact pour robots à pattes
86arXiv cs.RO 

OCELOT : odométrie et estimation du contact pour robots à pattes

Une équipe de chercheurs a publié OCELOT (Odometry and Contact Estimation for Legged rObots), un pipeline complet d'odométrie pour robots à pattes reposant exclusivement sur des capteurs proprioceptifs embarqués : une centrale inertielle (IMU) solidaire du corps, des encodeurs articulaires et des capteurs de force. Le système s'appuie sur un filtre de Kalman à état d'erreur (ESEKF) dont l'état est corrigé par les pieds détectés en appui stationnaire. Sa contribution centrale est un module de détection de contact fusionnée et de quantification d'incertitude : deux détecteurs tournent en parallèle pour chaque pied, le premier combinant un modèle de mélange gaussien (GMM) avec une machine à états finis (FSM) à déclenchement anti-rebond sur les données de force, le second appliquant un test de rapport de vraisemblance généralisé (GLRT) sur la vélocité cinématique estimée du pied. Les scores continus issus des deux détecteurs sont fusionnés pour identifier les glissements. Pour valider l'approche, les auteurs ont constitué un dataset de 29 séquences couvrant 2,4 km sur des terrains variés (béton, herbe, graviers, rochers) et ont comparé OCELOT à des méthodes proprioceptives et extéroceptives. Le code et un package ROS2 temps réel sont publiés en open source. L'intérêt principal de OCELOT réside dans sa robustesse aux terrains glissants sans recourir à des capteurs extéroceptifs (caméra, lidar), qui restent coûteux, fragiles et sensibles aux conditions d'éclairage ou de poussière. Pour un intégrateur déployant un robot quadrupède en environnement industriel ou outdoor, disposer d'une odométrie fiable avec uniquement l'équipement embarqué de série réduit significativement la complexité système. La disponibilité d'un package ROS2 prêt à l'emploi abaisse la barrière d'adoption. Le benchmark face à des méthodes extéroceptives constitue un signal fort : il suggère que l'estimation de contact bien conçue peut rivaliser avec des approches visuelles sur des trajectoires courtes à moyennes. Les robots à pattes de type Spot (Boston Dynamics), ANYmal (ANYbotics) ou Unitree B2 sont les cibles naturelles de tels pipelines. L'odométrie proprioceptive pour quadrupèdes est un problème ouvert depuis des années, avec des travaux antérieurs comme Pronto (IIT) ou les pipelines d'ETH Zurich sur ANYmal. OCELOT se distingue par la combinaison explicite GMM+GLRT pour la détection de glissement, un point sensible dans les déploiements extérieurs. Les prochaines étapes probables incluent la validation sur des trajectoires longue distance et l'intégration dans des architectures SLAM proprioceptif complet.

UELa publication en open source d'un package ROS2 directement intégrable peut bénéficier aux intégrateurs et labos européens (ANYbotics/Suisse, IIT/Italie) déployant des quadrupèdes en environnements industriels ou extérieurs difficiles.

RecherchePaper
1 source
RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés
87arXiv cs.RO 

RoboJailBench : évaluation des attaques et défenses adversariales dans les agents robotiques incarnés

Des chercheurs du PurSec Lab ont publié RoboJailBench, un benchmark standardisé pour évaluer les attaques adversariales de type "jailbreak" et leurs contre-mesures dans les systèmes d'IA embarquée. Présenté sur arXiv (2605.19328), ce framework cible les agents robotiques et véhicules autonomes qui s'appuient sur des Vision-Language Models (VLMs) pour interpréter l'environnement visuel et exécuter des commandes en langage naturel. Il repose sur trois composantes: une taxonomie de sécurité dérivée des normes ISO et d'incidents documentés, couvrant 18 catégories de violations; un pipeline de données "intent contrast" associant à chaque exemple un objectif adversarial et un objectif bénin, afin de mesurer conjointement sécurité et utilité; et un dépôt évolutif de métriques standardisées. Les auteurs ont construit un dataset taxonomique, enrichi cinq datasets existants, intégré quatre types d'attaques et deux défenses, puis évalué l'ensemble sur les principaux VLMs embarqués actuels. Un leaderboard public est maintenu sur purseclab.github.io. L'enjeu dépasse la recherche académique. Un robot compromis par un jailbreak n'affiche pas une réponse textuelle inappropriée: il exécute une action physique potentiellement dangereuse. Les benchmarks existants ciblaient soit les LLMs conversationnels, soit la sécurité non-adversariale des agents incarnés, sans jamais capturer le triptyque risques adversariaux, conséquences physiques et arbitrage sécurité-utilité. Quantifier explicitement ce compromis est une contribution méthodologique significative: un système trop défensif bloque des commandes légitimes et devient inutilisable en production. Pour les intégrateurs industriels, une grille d'évaluation ancrée dans les normes ISO simplifie la qualification réglementaire avant tout déploiement réel. La montée en puissance des VLMs dans la robotique physique, illustrée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA ou les architectures de Figure AI, a considérablement élargi la surface d'attaque des systèmes autonomes. Des travaux antérieurs avaient documenté la vulnérabilité des agents embarqués aux jailbreaks visuels ou textuels, mais sans cadre d'évaluation reproductible. Alors que des fabricants comme Boston Dynamics, Unitree ou, côté européen, Enchanted Tools intègrent des VLMs en production, la robustesse adversariale est appelée à devenir une exigence réglementaire dans les secteurs logistique, manufacturier et médical. RoboJailBench pose une base commune sur laquelle industriels et académiques peuvent s'appuyer pour standardiser ces tests avant mise en service.

UELe benchmark RoboJailBench, ancré dans les normes ISO, fournit aux intégrateurs européens, dont Enchanted Tools (France) qui déploie des VLMs en production, un cadre standardisé pour qualifier la robustesse adversariale avant mise en service sous les exigences de l'AI Act.

Societe/EthiqueOpinion
1 source
Tests adversariaux des filtres de sécurité du robot humanoïde SPARK
88arXiv cs.RO 

Tests adversariaux des filtres de sécurité du robot humanoïde SPARK

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.19009) une étude de robustesse portant sur les filtres de sécurité SPARK pour robots humanoïdes. Le travail consiste en une réplication du cas de référence G1SportMode\D1\WG\SO\v1 dans le simulateur MuJoCo, puis en une batterie de tests adversariaux sur six méthodes de filtrage : RSSA, RSSS, SSA, CBF (Control Barrier Function), PFM et SMA. Les auteurs ont également construit un pipeline de post-traitement pour convertir les logs bruts SPARK en trois métriques exploitables, suivi d'objectif, distance minimale aux obstacles, et nombre de pas en collision. Résultat principal : certaines méthodes optimisent le suivi de trajectoire au détriment de l'évitement, tandis que d'autres réduisent les collisions sans maintenir l'efficacité de déplacement. L'importance de ce travail tient à un angle souvent négligé dans l'évaluation des humanoïdes : les benchmarks nominaux, ceux qui servent à comparer les méthodes en conditions idéales, ne capturent pas les modes d'échec qui émergent dans des environnements contraints. Trois types de perturbations ont été testés : densification des obstacles ("obstacle crowding"), estimation bruitée des distances, et information obstacle avec délai. Dans ces conditions, le comportement de sécurité de plusieurs filtres se dégrade significativement, un résultat qui contredit implicitement l'hypothèse que les scores de référence suffisent à valider une méthode avant déploiement terrain. Pour un intégrateur ou un responsable de sécurité industrielle, c'est un signal clair : la qualification d'un filtre de sécurité humanoïde doit inclure des scénarios de stress, pas seulement les cas nominaux. Le SPARK framework s'est imposé ces dernières années comme cadre de référence pour évaluer la sécurité des humanoïdes à corps complet, face à la complexité inhérente de ces systèmes : haute dimensionnalité, contraintes de collision multiples, proximité avec des opérateurs humains. Le cas répliqué ici est lié au robot Unitree G1, l'une des plateformes humanoïdes accessibles les plus répandues en recherche. Les concurrents directs dans cet espace incluent des travaux sur MPC avec CBF (MIT, CMU), les approches RoboSafe d'ETH Zurich, et les filtres embarqués dans Boston Dynamics Atlas. La suite logique de cette recherche serait un protocole de stress testing standardisé, intégrable dans les pipelines de CI/CD robotique avant déploiement en environnement semi-contrôlé.

RechercheOpinion
1 source
Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs
89arXiv cs.RO 

Marche, course et récupération unifiées pour robots humanoïdes via des priors de mouvement adversariaux adaptatifs

Une équipe de chercheurs a publié fin mai 2026 sur arXiv (arXiv:2605.18611) un framework d'apprentissage par renforcement unifié permettant à un seul contrôleur de faire marcher, courir et se relever après une chute le robot humanoïde Unitree G1, sans commande explicite de changement de mode au déploiement. L'approche étend les Adversarial Motion Priors (AMP) en remplaçant la distribution de référence globale par un mécanisme de routage conditionné à l'état : un seuil fixe sur la gravité projetée (|gz+1| > 0,6, soit environ 37° d'inclinaison du torse par rapport à la verticale) aiguille chaque transition d'entraînement soit vers un discriminateur dédié à la récupération, soit vers un discriminateur de locomotion conditionné par la vitesse commandée, qui couvre à la fois la marche et la course. Seuls trois clips de motion capture extraits du jeu de données LAFAN1 sont nécessaires pour régulariser l'ensemble du comportement. Sur hardware réel, la politique tourne à 50 Hz sous forme d'un fichier ONNX figé, sans aucune logique de mode à l'exécution, et valide des relevés réussis depuis les positions ventrale et dorsale ainsi que des transitions fluides marche-course. Ce résultat s'attaque directement à un problème d'intégration récurrent dans la robotique humanoïde commerciale : la fragmentation en contrôleurs spécialisés par mode, reliés par des automates à états qui génèrent des zones de transition fragiles et coûteuses à maintenir. Démontrer qu'une politique apprise par RL couvre ces régimes de façon continue sur hardware réel, et non uniquement en simulation, affaiblit l'argument du sim-to-real gap rédhibitoire pour les comportements complexes. Le coût d'annotation est lui aussi remarquablement bas : trois clips de reference suffisent là où d'autres travaux en exigent des dizaines, ce qui rend la méthode potentiellement transférable à d'autres plateformes avec un effort de données limité, qu'il s'agisse du PAL Robotics TALOS, du MIROKAÏ d'Enchanted Tools, ou de tout humanoïde léger à faible budget de motion capture. La publication s'inscrit dans une course dense à la locomotion humanoïde robuste, où Boston Dynamics (Atlas), Figure (Figure 03), Agility Robotics (Digit) et Tesla (Optimus Gen 3) investissent massivement, mais publient peu. Sur le plan académique, des approches concurrentes comme les VLA (Vision-Language-Action models) de Physical Intelligence ou les travaux de Berkeley visent des politiques encore plus générales, mais sacrifient souvent la robustesse physique au profit de la flexibilité sémantique. L'utilisation du Unitree G1, disponible à environ 16 000 dollars et largement répandu dans les laboratoires, confère à ces travaux une reproductibilité pratique supérieure aux publications sur plateformes fermées. L'article ne précise pas de timeline de déploiement industriel, mais la compatibilité ONNX et l'absence de logique embarquée à l'exécution réduisent la barrière à l'intégration pour un OEM ou un intégrateur souhaitant évaluer la méthode sur sa propre plateforme.

UELa méthode, compatible ONNX et nécessitant seulement 3 clips de motion capture, est explicitement identifiée comme transférable au MIROKAÏ d'Enchanted Tools (FR) et au TALOS de PAL Robotics (EU), réduisant le coût d'adaptation pour les équipes de recherche et les intégrateurs européens.

RecherchePaper
1 source
Derrière le marathon robotique d'Honor : 7 fournisseurs chinois au service du robot Lightning
90Pandaily 

Derrière le marathon robotique d'Honor : 7 fournisseurs chinois au service du robot Lightning

Le 19 avril, sur le parcours semi-marathon de 21,0975 kilomètres du district de Yizhuang à Pékin, le robot humanoïde "Lightning" d'Honor, engagé sous l'étiquette de l'équipe Qitian Daxiansen, a franchi la ligne d'arrivée en 50 minutes et 26 secondes nets. Ce temps réduit de près des deux tiers le record de la compétition établi l'année précédente à 2 heures 40 minutes, et passe sous la barre du record du monde du semi-marathon masculin humain, fixé à 57 minutes et 20 secondes. Ce qui retient davantage l'attention que la performance brute, c'est la chaîne d'approvisionnement entièrement domestique qui sous-tend le robot : GigaDevice (兆易创新) fournit les puces NOR Flash et MCU pour le calcul et le stockage embarqués ; Lingyi iTech (领益智造) livre les composants structuraux de précision et les boîtiers assurant la gestion thermique ; Lens Technology (蓝思科技) produit les optiques de perception visuelle ; AAC Technologies (瑞声科技) contribue aux capteurs haute précision et aux composants acoustiques. Plusieurs autres fournisseurs non nommés couvrent les systèmes de motorisation, de gestion d'énergie et de capteurs de précision. Pour les intégrateurs et décideurs industriels, ce résultat constitue un signal plus structurel que conjoncturel. Il invalide en partie l'hypothèse du "demo gap" : "Lightning" a performé sous les contraintes d'un événement chronométré public, pas en environnement lab. Plus significatif encore, l'ensemble de la chaîne de valeur critique (semi-conducteurs, optique, acoustique, mécanique de précision) provient d'acteurs cotés en Chine, indiquant une autonomie croissante vis-à-vis des fournisseurs occidentaux ou japonais pour les composants humanoides. Ce n'est pas anecdotique dans un contexte de restrictions export sur puces avancées. Honor, connu comme fabricant de smartphones et ex-marque de Huawei, s'est positionné dans la robotique humanoïde depuis 2024, période de montée en puissance massive du secteur en Chine. La compétition de Yizhuang s'inscrit dans une série de benchmarks outdoor visant à différencier les constructeurs capables d'endurance réelle des acteurs encore en phase de démonstration vidéo. Les concurrents directs dans la course humanoïde incluent Unitree, Agibot et Fourier Intelligence côté chinois, ainsi que Figure (Figure 03), Tesla (Optimus Gen 3) et Physical Intelligence (pi0) côté américain. L'article source ne précise ni roadmap de déploiement commercial pour "Lightning" ni pilotes industriels annoncés, ce qui invite à traiter ce résultat comme un jalon technique plutôt qu'un produit shipé.

UELe découplage de la chaîne d'approvisionnement humanoïde chinoise vis-à-vis des fournisseurs occidentaux (semi-conducteurs, optique, mécanique de précision) fragilise à terme la compétitivité des équipementiers européens et renforce le débat autour des contrôles à l'export sur composants avancés.

Chine/AsieOpinion
1 source
MVB-Grasp : filtrage par boîte de volume minimal des saisies par diffusion pour la manipulation frontale
91arXiv cs.RO 

MVB-Grasp : filtrage par boîte de volume minimal des saisies par diffusion pour la manipulation frontale

Une équipe de chercheurs a publié sur arXiv (référence 2505.09672) MVB-Grasp, un système de saisie robotique conçu pour le bras Unitree Z1, un manipulateur à 6 degrés de liberté (DOF) positionné en configuration frontale, c'est-à-dire face à l'objet plutôt qu'en vue surplombante. Le dispositif expérimental associe une caméra Intel RealSense D405, un détecteur d'objets YOLOv8 et le générateur de prises GraspGen basé sur la diffusion. L'innovation centrale est un filtre géométrique fondé sur la boîte englobante de volume minimal orientée (MVBB) : en analysant les normales des faces de cette boîte en temps O(N), le système élimine les candidats de saisie qui traverseraient la table ou s'aligneraient mal avec les faces accessibles de l'objet. Une fonction de re-scoring combine le score du discriminateur appris et l'alignement géométrique avec un coefficient alpha fixé à 0,85. Sur 81 épisodes de simulation MuJoCo (cylindre, boîte asymétrique, bouteille d'eau), MVB-Grasp atteint 59,3 % de succès contre 24,7 % pour GraspGen seul, soit un gain de 2,4x, confirmé ensuite en conditions réelles sans nécessiter de ré-entraînement du modèle. Ce résultat est notable parce qu'il pointe un angle mort structurel de la recherche en manipulation : les benchmarks standards comme GraspNet-1Billion ou YCB-Video sont quasi-exclusivement conçus pour des caméras en vue de dessus sur des manipulateurs haut de gamme à large espace de travail. Or une part croissante des déploiements industriels et de service implique des bras montés sur des piédestaux fixes ou des AMR, en saisie frontale, avec des contraintes cinématiques sévères. Le fait que le gain soit obtenu sans ré-entraînement, uniquement par un filtre géométrique injecté en post-traitement, démontre que le "sim-to-real gap" dans ces configurations n'est pas seulement un problème de données mais aussi de biais dans la sélection des poses candidates. C'est une piste directement exploitable pour les intégrateurs qui déploient des manipulateurs à bas coût dans des cellules contraintes. Le Unitree Z1 est un bras compact vendu autour de 4 000 à 6 000 dollars, souvent utilisé en recherche académique comme alternative économique aux UR5 ou Franka Panda. La diffusion appliquée à la génération de prises est un axe actif depuis 2022-2023 (GraspGen, SE(3)-DiffusionFields, DexGraspNet 2.0), mais la majorité des travaux optimisent pour des postures overhead. Côté concurrents directs sur les manipulateurs frontaux contraints, les approches d'Enchanted Tools et les travaux issus du LAAS-CNRS en France explorent des contraintes similaires, bien que sur des plateformes différentes. La prochaine étape logique pour cette équipe serait d'étendre le protocole à des objets articulés ou transparents, et d'intégrer le filtre MVBB dans une boucle de planification réactive plutôt qu'en sélection statique de candidats.

UELe filtre MVBB est directement exploitable sans ré-entraînement par des intégrateurs européens déployant des manipulateurs en configuration frontale sur AMR ou piédestaux fixes, et s'inscrit dans la continuité de travaux menés au LAAS-CNRS et chez Enchanted Tools en France sur des contraintes cinématiques similaires.

💬 Un filtre géométrique pur, injecté en post-traitement, qui multiplie le taux de succès par 2,4 sans ré-entraîner le modèle : c'est le genre de résultat qui devrait faire rougir pas mal d'équipes qui empilent des couches de deep learning là où une contrainte bien posée suffit. Ce qui est vraiment utile ici, c'est qu'ils pointent un biais structurel évident en retrospective : tous les benchmarks standards supposent une caméra en vue de dessus, alors que la moitié des bras déployés en prod sont en configuration frontale sur des AMR ou des piédestaux fixes. Le filtre MVBB, tu peux le brancher demain sur ton pipeline existant.

IA physiquePaper
1 source
Muninn : un modèle de diffusion de trajectoires, désormais plus rapide
92arXiv cs.RO 

Muninn : un modèle de diffusion de trajectoires, désormais plus rapide

Une équipe de chercheurs a publié Muninn (arXiv:2605.09999), un module d'accélération sans réentraînement pour les planificateurs de trajectoires basés sur la diffusion. Le système atteint jusqu'à 4,6x de gain en vitesse d'exécution sur plusieurs architectures de diffusion en espace d'état, sans dégradation mesurée des performances ni des métriques de sécurité. Muninn fonctionne comme un wrapper de cache : à chaque étape du débruitage itératif, il choisit en temps réel de recalculer la sortie du denoiser ou de réutiliser le résultat mis en cache. Cette décision repose sur deux signaux analytiques calibrés hors-ligne, une sonde légère de l'évolution de la représentation interne de la trajectoire et des coefficients de propagation d'erreur du denoiser, qui produisent ensemble un budget d'incertitude par étape. Ce budget borne formellement l'écart maximal entre la trajectoire mise en cache et celle qui aurait été calculée à pleine puissance de calcul. Les gains ont été validés sur matériel réel, en navigation en boucle fermée et en manipulation. La lenteur des modèles de diffusion en planification de trajectoires est un verrou bien identifié pour la robotique temps-réel. Les accélérations existantes imposaient jusqu'ici un compromis inévitable : modifier le sampler dégradait la qualité de trajectoire, tandis que la compression du réseau nécessitait un réentraînement coûteux. Muninn contourne ce dilemme en opérant strictement sans modifier les poids du modèle, ce qui le rend applicable immédiatement à n'importe quel planificateur diffusion déjà entraîné. Pour un intégrateur ou une équipe robotique industrielle, cela rend concrètement viables des architectures comme Diffusion Policy dans des boucles de contrôle haute fréquence. La certification analytique des bornes de déviation constitue un argument de poids pour les déploiements où la sécurité est une contrainte réglementaire. Les politiques par diffusion appliquées à la robotique ont émergé vers 2022-2023, portées notamment par Diffusion Policy (Chi et al., Columbia University), et se sont depuis déployées dans des architectures VLA et des planificateurs en espace d'état. Les méthodes d'accélération antérieures, DDIM et distillation par connaissance en tête, ne proposaient pas de cache adaptatif avec bornes certifiées, ce qui positionne Muninn comme une surcouche orthogonale et rétrocompatible avec l'existant. En tant que preprint arXiv, les résultats n'ont pas encore été soumis à revue par les pairs. Les prochaines étapes logiques concernent les stacks robotiques humanoïdes et industriels (Figure, Unitree, Boston Dynamics) qui expérimentent des politiques diffusion et cherchent à réduire la latence de planification en production. Le code est publié publiquement sur GitHub (gokulp01/Muninn).

RecherchePaper
1 source
À Silicon Valley, des entreprises d'IA incarnée chinoises et américaines échangent sur 4 problèmes clés
9336Kr 

À Silicon Valley, des entreprises d'IA incarnée chinoises et américaines échangent sur 4 problèmes clés

Le 28 avril 2026, MagicLab a tenu à San José sa Global Embodied Intelligence Summit (GEIS), en présence de représentants d'Adobe, TikTok et IBM. La société a présenté trois nouveaux produits : le modèle-monde Magic-Mix, construit sur deux moteurs, Magic-WAM pour la compréhension du monde réel et Magic-Creator pour la génération de données synthétiques en boucle fermée ; la main dextre MagicHand H01, 20 DOF et 44 capteurs tactiles 3D haute résolution ; le robot humanoïde MagicBot X1, 180 cm, 70 kg, 31 DOF actifs, couple articulaire maximal de 450 N·m, fonctionnement continu 24h/7j via double batterie. Ces annonces s'accompagnent d'un objectif commercial de 14 milliards de dollars de revenus d'ici 2036, un chiffre que la société ne détaille pas. La conférence s'inscrit dans une accélération visible du secteur : Zhiyuan Robotics a annoncé sa 10 000e unité en à peine trois mois (de 5 000 à 10 000 robots) ; Unitree affiche dans son prospectus d'IPO 1,707 milliard de RMB de chiffre d'affaires 2025, plus de 5 500 unités expédiées, et plus de 50 % du revenu réalisé à l'international. La GEIS a structuré quatre débats techniques majeurs pour le secteur. Sur la donnée d'entraînement, la stratégie dominante est le mix : MagicLab collecte environ 16 000 trajectoires réelles par jour et les amplifie d'un facteur 10 000 par synthèse, ciblant l'assemblage automobile électrique comme gisement prioritaire (60 à 70 % de processus encore manuels). Zhengyi Luo du NVIDIA GEAR Lab détaille la répartition de son équipe : 50 % données simulées, 15 % motion capture, 25 % vidéos internet, 10 % données réelles haute qualité. Haozhi Qi, chercheur à l'Amazon Frontier AI and Robotics, pose la limite de la synthèse : elle fonctionne pour les compétences élémentaires, pas pour les tâches à horizon long comme préparer un repas. Sur les architectures VLA (vision-langage-action), Qi explique leur dominance actuelle par la maturité des capteurs visuels face aux capteurs tactiles encore embryonnaires, VLA compensant ainsi le déficit sensoriel par la modalité visuelle. Sur les mains dextres, Evan Tao de Chestnut Robotics, ancien membre clé de l'équipe Tesla Optimus, défend une architecture hybride tendons plus IA, recherchant l'équilibre entre manipulation fine et robustesse industrielle. Sur la mise à l'échelle, Jan Liphardt, cofondateur d'OpenMind et professeur associé à Stanford en bioingénierie, recommande un déploiement terrain le plus précoce possible : laboratoires et simulations ne reproduisent pas lumière intense, sols humides ou charnières oxydées, conditions qui révèlent les défaillances systémiques des robots. La tenue de la GEIS en Californie traduit un repositionnement stratégique des acteurs robotiques chinois vers les marchés industriels occidentaux. MagicLab affronte Figure AI, Agility Robotics et Boston Dynamics sur le segment humanoïde industriel, tout en concurrençant Unitree et Zhiyuan sur son marché domestique. La présence de PrismaX, OpenMind et XGSynBot confirme que la commercialisation de la robotique humanoïde est désormais transatlantique. Les déploiements pilotes annoncés visent des usines d'assemblage et des environnements publics, aéroports, écoles, lieux de soins, avec pour objectif explicite d'accumuler des données d'interaction que les simulations les plus sophistiquées ne peuvent pas générer.

UEL'expansion transatlantique des constructeurs chinois (MagicLab, Unitree, Zhiyuan) vers les marchés industriels occidentaux intensifie la pression concurrentielle sur les intégrateurs et fabricants robotiques européens, sans déploiement explicite en Europe annoncé à ce stade.

💬 Zhiyuan passe de 5 000 à 10 000 robots en trois mois, Unitree fait déjà plus de la moitié de son CA à l'export. C'est ça la vraie info, pas les 14 milliards de revenus d'ici 2036 (ça, ça sent la slide investisseur non étayée). Le truc que je retiens de Liphardt : ni labo ni simulation ne reproduisent une charnière oxydée, donc déploie en usine le plus tôt possible.

HumanoïdesOpinion
1 source
Figure affirme produire un robot humanoïde par heure, soit une multiplication par 24 en quatre mois
94Interesting Engineering 

Figure affirme produire un robot humanoïde par heure, soit une multiplication par 24 en quatre mois

Figure, la startup californienne spécialisée en robotique humanoïde, a annoncé avoir atteint un rythme de production d'un robot Figure 03 par heure dans son usine BotQ, située en Californie. Ce chiffre représente une multiplication par 24 du cadence de fabrication en moins de quatre mois, partant d'un robot par jour début 2026. Plus de 350 unités ont été livrées à ce jour, plus de 500 batteries expédiées, et plus de 9 000 actionneurs produits. La ligne de fabrication s'appuie sur un logiciel propriétaire déployé sur plus de 150 postes de travail en réseau, avec plus de 50 points d'inspection intermédiaires. Le taux de réussite en fin de ligne (first-pass yield) dépasse 80 %, et le rendement de production des batteries atteint 99,3 %. Chaque unité subit plus de 80 tests fonctionnels incluant des exercices de stress mécanique (squats, jogging) avant expédition. L'objectif affiché reste de 12 000 robots par an à pleine capacité. Ce passage du stade prototype à la production industrielle est significatif dans la course aux humanoïdes, où la majorité des acteurs restent encore dans des phases de démonstrateur ou de déploiement pilote très limité. Un taux de rendement end-of-line supérieur à 80 % sur un produit mécatronique aussi complexe est un indicateur industriel crédible, bien que Figure ne précise pas la définition exacte de ce seuil ni les conditions de test. En parallèle, Figure a publié une mise à jour majeure de son modèle d'IA Helix, baptisée System 0 (S0). L'ancienne version reposait uniquement sur la proprioception (états articulaires, posture). S0 intègre désormais des caméras stéréo embarquées qui génèrent une représentation 3D de l'environnement, permettant au robot de naviguer des escaliers et des terrains variés avec une stabilité décrite comme comparable à celle d'un humain. Le système est entraîné par renforcement en simulation sur des terrains aléatoires, et les comportements appris se transfèrent directement au monde réel sans recalibration, ce qui constitue une avancée notable sur le classique problème du sim-to-real gap. Figure a été fondée en 2022 par Brett Adcock et a levé plus de 675 millions de dollars, dont une ronde notable en 2024 avec des participations de Microsoft, Nvidia, OpenAI et Samsung. Le Figure 03 est la troisième génération de son robot humanoïde, succédant au Figure 01 et 02. Dans un secteur extrêmement concurrentiel, Figure se positionne face à Tesla (Optimus Gen 2), Boston Dynamics (Atlas électrique), Agility Robotics (Digit, déployé chez Amazon), Physical Intelligence (Pi-0) et Unitree. La montée en volume de BotQ est aussi une course aux données : plus de robots déployés signifie davantage de données réelles pour entraîner Helix. Figure indique viser des déploiements dans les secteurs de la recherche, du commercial et de l'usage domestique, sans préciser de calendrier client ni de prix public pour le Figure 03.

HumanoïdesActu
1 source
Un pipeline de déploiement rapide pour la préhension autonome de robots humanoïdes basé sur des modèles fondation
95arXiv cs.RO 

Un pipeline de déploiement rapide pour la préhension autonome de robots humanoïdes basé sur des modèles fondation

Des chercheurs ont publié sur arXiv (arXiv:2604.17258, avril 2026) un pipeline de déploiement rapide permettant de préparer un robot humanoïde à manipuler un nouvel objet en environ 30 minutes, contre un à deux jours dans les approches classiques. Le système s'appuie sur trois composants à base de modèles de fondation : l'annotation automatique via Roboflow pour entraîner un détecteur YOLOv8, la reconstruction 3D par Meta SAM 3D à partir d'images standard (smartphone suffisant, pas de scanner laser), et le suivi de pose 6-DoF en zero-shot par FoundationPose, qui utilise directement le maillage généré par SAM 3D comme gabarit. Les commandes de pose alimentent un planificateur de cinématique inverse sous Unity, transmises en UDP au robot Unitree G1 via le SDK propriétaire. Les métriques annoncées : mAP@0.5 = 0,995 en détection, précision de suivi σ inférieure à 1,05 mm, et saisie réussie sur cinq positions dans l'espace de travail. Le pipeline a également été validé sur une tâche d'application de mastic sur vitre d'automobile, ce qui constitue un environnement industriel concret. L'enjeu principal est la réduction du "time-to-deployment" pour la manipulation humanoïde, un goulot d'étranglement majeur qui freine l'intégration en environnement industriel réel. Passer de deux jours à 30 minutes sans équipement spécialisé change la donne pour les intégrateurs et les PME industrielles qui ne disposent pas d'équipes robotique dédiées. Le recours au zero-shot pour FoundationPose signifie qu'aucun réentraînement n'est nécessaire pour chaque nouvel objet, ce qui valide partiellement l'hypothèse que les modèles de fondation peuvent absorber la variabilité d'objets sans collecte de données lourde. Cela dit, les résultats sont présentés sur cinq positions fixes et deux tâches seulement ; la robustesse en conditions de production non contrôlées reste à démontrer. Le robot support, le Unitree G1, est un humanoïde commercial chinois à 16 degrés de liberté vendu autour de 16 000 dollars, positionné comme plateforme de recherche accessible. Les composants logiciels mobilisés (Roboflow, Meta SAM 3D, FoundationPose de NVidia) sont tous open-source ou accessibles via API, ce qui renforce la reproductibilité. Dans le paysage actuel où Figure (Figure 03), Tesla (Optimus), Physical Intelligence (pi0) et Boston Dynamics investissent massivement dans les pipelines de manipulation apprise, cette approche modulaire et frugale en données offre une alternative pragmatique, notamment pour les déploiements pilotes dans des cellules de production à faible volume ou à variété élevée d'objets.

UELes intégrateurs robotiques et PME industrielles européens peuvent évaluer et reproduire ce pipeline open-source (Roboflow, Meta SAM 3D, FoundationPose) pour réduire drastiquement le time-to-deployment sur des cellules de production à haute variété d'objets, sans équipement spécialisé ni équipe robotique dédiée.

IA physiquePaper
1 source
Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives
96arXiv cs.RO 

Modèles fondation en robotique : revue complète des méthodes, modèles, jeux de données, défis et perspectives

Une revue systématique publiée sur arXiv (2604.15395) recense l'état de l'art des modèles de fondation appliqués à la robotique, couvrant l'ensemble du spectre allant des grands modèles de langage (LLM) aux architectures vision-langage-action (VLA). Les auteurs structurent leur analyse en cinq phases historiques distinctes, depuis les premières intégrations de modèles NLP et vision par ordinateur jusqu'aux déploiements multi-sensoriels en environnement réel. La taxonomie proposée examine six axes : les types de modèles employés (LLM, VFM, VLM, VLA), les architectures de réseaux de neurones sous-jacentes, les paradigmes d'apprentissage, les stades d'incorporation des connaissances, les tâches robotiques ciblées, et les domaines applicatifs industriels. L'étude recense également les datasets publics utilisés pour l'entraînement et l'évaluation sur ces différentes tâches. L'intérêt de ce travail pour les intégrateurs et les décideurs industriels réside dans sa cartographie des capacités réelles versus annoncées des VLA en déploiement. Le passage d'agents mono-tâche et spécialisés vers des agents adaptatifs multi-fonctions à usage général constitue le fil directeur de l'analyse. Les auteurs traitent explicitement du gap simulation-réalité (sim-to-real), de la généralisation inter-embodiment (cross-embodiment), et de la planification à horizon long, trois verrous techniques qui conditionnent la commercialisation à grande échelle. La revue identifie aussi les défis ouverts et les directions de recherche prometteuses, utiles pour orienter des feuilles de route R&D. Ce survey s'inscrit dans une accélération documentée depuis 2022, portée par des laboratoires comme Google DeepMind (RT-2, π0), Physical Intelligence, Figure AI, et Unitree, qui ont tous misé sur les VLA comme colonne vertébrale de leurs systèmes. Côté européen, des acteurs comme Enchanted Tools ou Wandercraft n'apparaissent pas dans ce corpus, ce qui reflète un déséquilibre de publication favorable aux équipes nord-américaines et asiatiques. La revue ne constitue pas un benchmark expérimental indépendant mais une synthèse bibliographique, ce qui en fait un point d'entrée solide pour un ingénieur robotique cherchant à situer une technologie ou comparer des approches, sans remplacer une évaluation terrain des solutions commerciales disponibles.

UELe déséquilibre de publication constaté, acteurs FR/EU (Enchanted Tools, Wandercraft) absents du corpus, souligne un déficit de visibilité des équipes européennes dans la recherche VLA, ce qui peut biaiser les benchmarks de référence utilisés par les industriels pour orienter leurs feuilles de route R&D.

RecherchePaper
1 source
CLAW : génération de mouvements corps entier composables et annotés en langage naturel
97arXiv cs.RO 

CLAW : génération de mouvements corps entier composables et annotés en langage naturel

Une équipe de chercheurs a publié CLAW (Composable Language-Annotated Whole-body Motion Generation), un pipeline open source conçu pour générer à grande échelle des données de mouvement annoté en langage naturel pour robots humanoïdes, appliqué ici au Unitree G1. Le système compose des primitives de mouvement paramétrées par six variables, type de déplacement, cap, vitesse, hauteur du bassin (pelvis height) et durée, et les exécute dans le simulateur MuJoCo pour produire des trajectoires physiquement cohérentes. Deux interfaces navigateur sont proposées : un mode clavier en temps réel pour l'exploration, et un éditeur de séquences en timeline pour la collecte de données en batch. En parallèle, un moteur de génération d'annotations basé sur des templates produit des descriptions en langage naturel à deux niveaux de granularité : segment individuel et trajectoire complète. Le code est disponible publiquement sur GitHub sous la référence arXiv:2604.11251. L'enjeu central est le goulot d'étranglement des données pour entraîner des contrôleurs whole-body conditionnés au langage (VLA, Vision-Language-Action). La capture de mouvement réelle est coûteuse, peu scalable et limitée en diversité ; les modèles génératifs text-to-motion existants produisent des sorties purement cinématiques, sans garantie de faisabilité physique, un écueil critique pour le déploiement réel. CLAW apporte une réponse intermédiaire : la simulation MuJoCo ancre les trajectoires dans la physique, tandis que la composition modulaire de primitives permet une diversité combinatoire élevée. C'est une approche sim-to-real pragmatique qui vise à réduire le fossé entre données d'entraînement et comportement robot en conditions réelles, sans le coût d'un studio de mocap. Le Unitree G1, robot humanoïde chinois positionné sur le segment accessible (prix catalogue autour de 16 000 USD), est une plateforme de recherche de plus en plus utilisée dans la communauté académique, notamment face aux plateformes fermées comme Figure 02 ou Apptronik Apollo. CLAW s'inscrit dans une dynamique plus large de démocratisation des pipelines de données pour la robotique humanoïde, aux côtés de travaux comme le dataset HumanoidBench ou les approches de Physical Animation de Berkeley. La mise à disposition publique du système est son principal atout différenciant : elle permet aux laboratoires sans ressources de mocap de constituer des jeux de données whole-body annotés pour leurs propres expériences de contrôle en langage. Les prochaines étapes attendues, non annoncées dans ce papier, concernent le transfert réel sur G1 et la validation des politiques entraînées sur ces données synthétiques.

UELes laboratoires européens de recherche en robotique humanoïde peuvent exploiter ce pipeline open source pour constituer des jeux de données whole-body annotés sans infrastructure de mocap coûteuse.

IA physiqueOpinion
1 source
Des robots humanoïdes franchissent le cap d'une heure au semi-marathon, réduisant rapidement l'écart avec les humains
98Pandaily 

Des robots humanoïdes franchissent le cap d'une heure au semi-marathon, réduisant rapidement l'écart avec les humains

Le 19 avril 2026, au semi-marathon de Beijing E-Town, le robot humanoïde "Lightning" développé par Honor a remporté la division robotique avec un temps net de 50 minutes et 26 secondes, soit environ 17 minutes de mieux que le meilleur coureur humain de l'épreuve, crédité d'un temps compris entre 1h07 et 1h08. Les deuxième et troisième places sont revenues aux équipes Leiting Shandian (50:56) et Xinghuo Liaoyuan (53:01), les trois robots ayant complété le parcours en navigation entièrement autonome et sous la barre des 60 minutes. Plus de 100 équipes et environ 300 robots, chinois et étrangers, se sont alignés sur les 21,0975 km d'un tracé intégrant dénivelés, virages à quasi-90 degrés et plus de dix types de terrain différents. Parmi les participants figuraient notamment le "Tien Kung Ultra" du Beijing Innovation Center of Humanoid Robotics et le H1 d'Unitree. L'an passé, le robot vainqueur avait mis 2h40 pour boucler le même type d'épreuve : le bond de performance est donc considérable, même si les conditions exactes de comparaison entre éditions restent à préciser. Ce résultat est significatif au-delà du symbole sportif. Que des robots en navigation autonome, sans téléopération, tiennent un rythme supérieur à celui du meilleur humain du jour sur un semi-marathon en conditions réelles constitue une validation système difficile à ignorer pour les intégrateurs industriels : planification de trajectoire, équilibre dynamique, dissipation thermique et endurance mécanique ont été testés simultanément, sur 21 km, en extérieur. Liu Xingliang, directeur du DCCI Internet Research Institute, identifie trois transitions en cours dans le secteur : passage du contrôle distant à l'autonomie, des laboratoires à la fiabilité d'ingénierie, et des technologies isolées vers des architectures perception-décision-contrôle intégrées. La course illustre concrètement ces trois axes. Elle tend aussi à réduire l'argument du "demo gap" : les robots n'ont pas performé dans un environnement contrôlé mais sur un parcours public, avec terrain variable et forte sollicitation thermique. Honor est entré dans la robotique humanoïde il y a moins de deux ans, via son unité d'incubation industrielle, avec des équipes couvrant les mains dextres, le software système, les algorithmes d'IA embodied et l'ingénierie de test. Lightning embarque un système de refroidissement liquide maison, des capillaires traversant les moteurs, avec une pompe haute pression circulant plus de 4 litres de liquide caloporteur par minute, et des modules d'articulation intégrés atteignant un couple crête de 400 Nm. Lens Technology, fournisseur historique de composants structurels métalliques pour smartphones, a livré plus de 130 pièces de structure pour le robot, signe que la supply chain de l'électronique grand public s'oriente activement vers la robotique. Face à Honor, les acteurs établis comme Unitree et le Beijing Innovation Center of Humanoid Robotics restent en lice, tandis qu'à l'international, Figure, Agility Robotics ou 1X Technologies n'ont pas encore exposé leurs plateformes à des épreuves d'endurance comparables en conditions réelles ouvertes. La prochaine étape pour Honor n'a pas été annoncée officiellement, mais le positionnement robotique s'inscrit clairement dans sa stratégie IA et écosystème device.

UEL'avance prise par les acteurs chinois en endurance autonome en conditions réelles accentue le retard compétitif des acteurs européens et français du secteur humanoïde, sans impact réglementaire ou commercial direct à court terme.

JD.com Launches “Robot Ambulance” Service, Targets 50 Cities in Three Years
99Pandaily 

JD.com Launches “Robot Ambulance” Service, Targets 50 Cities in Three Years

JD.com, le géant chinois du e-commerce, a lancé officiellement son service baptisé "robot ambulance", un réseau de maintenance et de réparation dédié aux robots commerciaux. Le service couvre les robots humanoïdes, quadrupèdes et robots compagnons IA, et propose une gamme complète de prestations : diagnostics de pannes, remplacement de batteries, tests de performance, maintenance esthétique et recyclage d'équipements. Déjà opérationnel à Pékin, le dispositif doit s'étendre à plus de 50 grandes villes chinoises d'ici trois ans. JD.com vise également une expansion internationale vers l'Europe, l'Amérique du Nord, le Moyen-Orient et l'Asie-Pacifique, avec des opérations déjà amorcées dans certains pays européens. Pour soutenir cette croissance, l'entreprise s'est fixé l'objectif de recruter plus de 10 000 ingénieurs spécialisés en robotique sur la même période. Ce lancement signale une mutation structurelle dans l'industrie robotique chinoise : le marché ne se limite plus à la fabrication et à la vente de robots, il génère désormais une demande de services après-vente à l'échelle industrielle. Pour les intégrateurs et les opérateurs B2B qui déploient des flottes humanoïdes ou quadrupèdes, l'absence d'infrastructure de maintenance fiable reste l'un des principaux freins à l'adoption. En positionnant une offre de service centralisée et multi-marques, JD.com comble un vide réel, tout en consolidant sa position de plateforme logistique dans l'écosystème robot. C'est aussi un signal que le volume de robots déployés en conditions réelles est désormais suffisant pour justifier une économie de la maintenance. JD.com n'est pas un acteur robotique au sens strict : c'est un opérateur logistique qui utilise des robots dans ses propres entrepôts depuis des années, et qui capitalise maintenant sur cette expertise opérationnelle pour en faire un service tiers. Les partenariats annoncés avec Unitree Robotics, Songyan Dynamics, Deep Robotics et AGIBOT, tous des acteurs majeurs du marché humanoïde et quadrupède chinois, donnent au service une couverture multi-constructeurs crédible. Aucun équivalent de cette échelle n'existe à ce jour en Europe, où des acteurs comme Enchanted Tools ou Wandercraft opèrent encore sans réseau de service structuré. La prochaine étape déclarée est l'extension internationale, dont le calendrier précis reste à confirmer.

UEJD.com ayant déjà amorcé des opérations dans certains pays européens, ce service crée une pression compétitive sur les intégrateurs européens et signale un vide structurel dans l'offre de maintenance de flottes robotiques en Europe.

L'usine Tesla de Shanghai capable de produire des robots humanoïdes, selon son président en Chine
100SCMP Tech 

L'usine Tesla de Shanghai capable de produire des robots humanoïdes, selon son président en Chine

Allan Wang Hao, président de Tesla Chine, a déclaré lors d'un briefing médias ce mardi que la Gigafactory de Shanghai, la plus grande base de production du constructeur américain, pourrait constituer une "clé en or" pour la fabrication en masse de robots humanoïdes. Wang n'a pas annoncé de calendrier précis ni de volume de déploiement, mais il a explicitement lié la capacité manufacturière exceptionnelle du site, qui produit actuellement plus de 450 000 véhicules par an, à l'ambition d'Elon Musk de commercialiser l'Optimus à grande échelle. Aucun chiffre de production cible pour le robot n'a été communiqué lors de cet événement. Cette déclaration signale une évolution stratégique notable : Tesla envisage de faire de sa chaîne automobile existante un vecteur d'industrialisation robotique, ce qui réduirait structurellement les coûts de montée en cadence. Pour les décideurs industriels, cela suggère que le vrai différenciateur dans la course humanoïde ne sera pas uniquement la performance du modèle d'IA, mais la maîtrise du scale-up manufacturier, un domaine où Tesla dispose d'un avantage reconnu. Il reste cependant à distinguer cette déclaration d'intention d'un engagement de production ferme. Tesla teste actuellement des unités Optimus Gen 2 en interne dans plusieurs de ses usines, sans déploiement commercial confirmé à ce jour. Sur le marché, les concurrents directs incluent Figure AI (Figure 02), Agility Robotics (Digit, déployé chez Amazon), et le chinois Unitree. La Gigafactory de Shanghai, implantée en Chine, donnerait également à Tesla un accès privilégié à la chaîne d'approvisionnement en composants robotiques, dominée par des fournisseurs asiatiques, ce qui constitue un levier logistique non négligeable pour atteindre les objectifs de coût évoqués par Musk.