Aller au contenu principal

Dossier Boston Dynamics — page 2

669 articles · page 2 sur 14

Boston Dynamics, pionnier de la locomotion : Atlas électrique, Spot patrouille industrielle et inspection, partenariats Hyundai et Toyota Research Institute.

51Robotics & Automation News IndustrielActu

McLaren Construction déploie des robots autonomes à grande échelle en partenariat avec FieldAI

Panneau accepte le premier drone gardien : McLaren Construction, filiale du groupe britannique de construction, a signé un partenariat avec FieldAI, développeur d'intelligence artificielle physique, pour déployer des robots quadrupèdes autonomes sur ses chantiers au Royaume-Uni. Ces robots seront chargés de capturer des images à 360 degrés des sites, de générer des nuages de points (point cloud), et de soutenir la vérification d'avancement des travaux ainsi que l'analyse des écarts entre le modèle numérique et la réalité du chantier. Ils assureront également des patrouilles de conformité sécurité et des contrôles qualité. Le communiqué ne précise pas encore de calendrier de déploiement ferme ni le nombre d'unités prévues sur le premier site. Ce partenariat illustre une tendance de fond dans le secteur du BTP : l'automatisation progressive de tâches répétitives et à risque, comme l'inspection de sécurité ou la documentation de chantier, jusque là réalisées manuellement par des équipes humaines. Pour les intégrateurs et décideurs B2B du secteur construction, ce type de déploiement teste la viabilité des robots quadrupèdes autonomes hors des environnements contrôlés d'usine, un terrain nettement plus complexe et changeant. Cela positionne aussi FieldAI comme un acteur cherchant à démontrer que son IA physique généraliste peut s'adapter à des cas d'usage concrets au delà des démonstrations en laboratoire, un enjeu clé alors que le secteur robotique traverse une phase où l'écart entre promesses marketing et déploiements réels reste scruté de près. FieldAI, société américaine spécialisée dans les modèles d'IA pour robots généralistes, cherche à se positionner face à des concurrents comme Boston Dynamics (Spot) ou Boston-based startups similaires sur le marché des robots quadrupèdes appliqués à l'inspection industrielle et au BTP. McLaren Construction, non lié à l'écurie de F1 du même nom, cherche via ce partenariat à moderniser ses processus de suivi de chantier. Les prochaines étapes attendues incluent le déploiement effectif sur un premier site pilote et la publication de résultats concrets sur les gains de temps et de fiabilité obtenus.

1 source
52arXiv cs.RO 

Locomotion agile et perceptive multi-compétences pour robots quadrupèdes en conditions réelles

Voici l'article en français : Des chercheurs présentent APT-RL (Action Pretrained Transformer-based Reinforcement Learning), un framework unifié permettant à un robot quadrupède de franchir des terrains complexes en n'utilisant que ses capteurs et son calcul embarqués, sans dépendre d'une infrastructure externe. La méthode génère d'abord des jeux de données de mouvement 2D à grande échelle via optimisation de trajectoires sur une dynamique simplifiée, ce qui permet d'entraîner des compétences de locomotion variées et réutilisables. Ces compétences servent ensuite de base solide pour apprendre des tâches plus complexes en 3D, avec transition autonome entre différentes allures. Lors des tests en conditions réelles, le robot a exécuté des manœuvres agiles à travers des obstacles intérieurs et extérieurs, y compris des sauts en descente dynamiques atteignant une vitesse de pointe instantanée de 6 mètres par seconde. Une seule politique embarquée lui a permis de franchir escaliers, haies, pierres de gué, trous et branches tombées au sol, sans changer de modèle selon le type d'obstacle. L'intérêt de ce travail réside dans sa capacité à combiner plusieurs compétences motrices en un seul système embarqué et autonome, un point de friction connu dans la robotique quadrupède où la plupart des démonstrations reposent encore sur des politiques spécialisées par terrain ou sur une assistance en calcul déporté. En s'appuyant uniquement sur la perception et le calcul embarqués, APT-RL s'attaque directement à l'écart classique entre simulation et réalité, tout en montrant que des priors de mouvement générés à moindre coût en 2D peuvent se généraliser efficacement à des environnements 3D non structurés. Pour les intégrateurs travaillant sur l'inspection industrielle, la robotique de terrain ou les interventions en environnement accidenté, cela représente une piste concrète vers des robots capables de gérer la diversité des obstacles réels sans reconfiguration manuelle entre chaque scénario. Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion des robots à pattes, un domaine où des plateformes comme Unitree Go2, Boston Dynamics Spot ou ANYbotics ANYmal servent de référence pour les capacités tout-terrain. Publié comme preprint sur arXiv, l'article ne précise ni laboratoire porteur ni calendrier de déploiement commercial : il s'agit à ce stade d'une contribution de recherche, sans indication de produit shippé ni de pilote industriel annoncé.

RecherchePaper
1 source
53arXiv cs.RO 

Understanding le champ de radiation thermique du feu pour les robots mobiles

Une équipe de chercheurs présente dans un article publié sur arXiv (2602.19108) une méthode permettant à des robots mobiles de cartographier en temps réel les champs de rayonnement thermique générés par un incendie, afin de naviguer sans danger dans un environnement affecté par le feu. Le système fusionne des images de profondeur et des images thermiques pour construire un nuage de points 3D annoté en température. À partir de ces données, l'algorithme identifie les foyers d'incendie et applique la loi de Stefan-Boltzmann pour estimer le rayonnement thermique dans les espaces vides environnants, produisant ainsi un champ thermique continu sur l'ensemble de la scène. Ce champ est ensuite intégré comme contrainte dans la carte de coûts utilisée pour la planification de trajectoire, ce qui permet de calculer des chemins évitant à la fois les collisions et les zones thermiquement dangereuses. La méthode a été validée sur un robot quadrupède Spot de Boston Dynamics, en conditions expérimentales contrôlées, où le robot a démontré sa capacité à contourner les régions à risque tout en atteignant ses objectifs de navigation. Pour le secteur de la robotique de secours, cette approche s'attaque à un problème concret : la plupart des systèmes de navigation autonome évitent les obstacles physiques mais ignorent les dangers invisibles comme le rayonnement thermique, qui peut endommager les capteurs ou l'électronique d'un robot bien avant tout contact direct avec les flammes. En transformant une grandeur physique (le flux thermique) en contrainte exploitable par un planificateur de trajectoire classique, les auteurs proposent une brique potentiellement réutilisable pour les plateformes de recherche-sauvetage et d'intervention en milieu dangereux, sans nécessiter de capteur de flux thermique dédié coûteux. Il s'agit toutefois d'un travail de recherche académique, testé en environnement contrôlé et non lors d'un incendie réel, ce qui limite pour l'instant sa portée à une preuve de concept. Le texte, republié dans une version révisée (v2) sur arXiv, ne mentionne ni partenariat industriel ni feuille de route de déploiement. Les auteurs situent leurs travaux dans la lignée plus large des efforts de robotique pour la réponse aux catastrophes, aux côtés des plateformes comme Spot déjà employées par des pompiers et équipes d'urgence pour l'inspection à distance.

RecherchePaper
1 source
GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état
54arXiv cs.RO 

GrandTour : un jeu de données de robotique à pattes en conditions réelles pour la perception multimodale et l'estimation d'état

Voici l'article : Des chercheurs publient GrandTour, un jeu de données massif dédié à la perception multimodale et à l'estimation d'état pour robots quadrupèdes, disponible sur grand-tour.leggedrobotics.com au format HuggingFace (indépendant de ROS) ainsi qu'en formats ROS. La plateforme utilisée est un ANYmal-D d'ANYbotics équipé de la charge utile capteurs Boxi, combinant LiDAR rotatif, plusieurs caméras RGB aux caractéristiques complémentaires, capteurs proprioceptifs et caméras de profondeur stéréo, le tout synchronisé temporellement. Les données ont été collectées sur des sites très variés : environnements alpins, forêts, bâtiments démolis et zones urbaines, couvrant une large gamme d'échelles, de conditions d'éclairage et de météo. Point clé pour la fiabilité scientifique : les trajectoires de référence (ground truth) proviennent de GNSS RTK par satellite et d'une station totale Leica Geosystems, offrant une précision de localisation bien supérieure aux méthodes d'estimation embarquées classiques. Selon les auteurs, il s'agit du plus grand jeu de données en accès libre jamais publié pour la robotique à pattes. Ce type de ressource comble un manque criant dans la recherche en robotique légère : jusqu'ici, aucun jeu de données public à grande échelle ne permettait de développer et de comparer rigoureusement des algorithmes de SLAM, d'estimation d'état et de fusion de capteurs pour des quadrupèdes évoluant en conditions réelles, hors laboratoire. Pour les équipes travaillant sur la navigation autonome de robots à pattes, en particulier dans des environnements non structurés (chantiers, sites industriels accidentés, terrains extérieurs), GrandTour offre un benchmark commun et une vérité terrain de précision géodésique, rare dans ce domaine. C'est un signal que la communauté cherche à standardiser l'évaluation des systèmes de perception embarqués, plutôt que de se fier à des démonstrations isolées difficiles à reproduire. Le projet s'inscrit dans la lignée des travaux du Robotic Systems Lab, à l'origine de la plateforme ANYmal, aujourd'hui commercialisée par ANYbotics, acteur suisse reconnu de la robotique quadrupède industrielle aux côtés de Boston Dynamics (Spot) et Unitree. La publication constitue une mise à jour (version 3) d'un article déposé sur arXiv sous la référence 2602.18164. Les auteurs annoncent la mise à disposition d'outils et de ressources de démonstration pour faciliter l'adoption du jeu de données par la communauté SLAM et apprentissage multimodal, sans toutefois préciser de calendrier pour d'éventuelles extensions futures du corpus.

UECe jeu de donnees en acces libre, issu du Robotic Systems Lab (ETH Zurich) et d'ANYbotics (Suisse), constitue une ressource directement utile aux equipes de recherche francaises et europeennes travaillant sur le SLAM et l'estimation d'etat pour robots a pattes.

RecherchePaper
1 source
Automate 2026 : bilan du salon
55Robotics Business Review 

Automate 2026 : bilan du salon

Voici la traduction/synthèse en français : Dans l'épisode 251 du Robot Report Podcast, les animateurs Steve Crowe et Mike Oitzman reçoivent Sarah Wynn, rédactrice en chef du site sœur Packaging OEM, pour un retour sur le salon Automate qui s'est tenu le mois dernier aux États-Unis. Sur les stands, les humanoïdes industriels Atlas (Boston Dynamics) et Digit (Agility Robotics) n'étaient présentés qu'en exposition statique, sans démonstration dynamique. Chez ABB Robotics, Craig McDonald, directeur général de la division robotique industrielle, a détaillé les avancées en IA physique, la palettisation pilotée par IA et des collaborations avec NVIDIA. FANUC a mis en avant le suivi de mouvement en temps réel pour l'assemblage, l'automatisation du traitement des protéines et la programmation de robots en langage naturel. Chez Sereact, Mason Coleman, directeur des ventes Amérique du Nord, a évoqué le "zero-shot picking", les tendances de l'e-grocery et la réaffectation de la main-d'œuvre. Mech-Mind a fait une démonstration de bin-picking sans CAO sur des bouteilles transparentes de formes variées, et Christian Kassow, fondateur de Kassow Robots, a défendu les cobots 7 axes face aux configurations 6 axes classiques pour la manipulation mobile en espace confiné. Rockwell Automation, via Ara Surenian, responsable production logistics, a présenté FactoryTalk Orchestration, dans la foulée du rachat d'OTTO Motors. Le signal principal du salon est un basculement net : après plusieurs éditions dominées par le hype humanoïde, Automate 2026 a montré une industrie qui se recentre sur le déploiement concret d'IA physique et de calcul en périphérie (edge computing), plutôt que sur des démonstrations spectaculaires mais non industrialisées. Pour les intégrateurs et décideurs B2B, le message est clair : l'orchestration logicielle, les jumeaux numériques et la cinématique avancée deviennent les vrais leviers de productivité, notamment pour compenser les pénuries de main-d'œuvre et capturer le savoir-faire des opérateurs expérimentés avant leur départ à la retraite. Le débat Schneider Electric contre Siemens sur l'architecture edge/cloud, l'un plaidant pour des systèmes ouverts agnostiques au matériel, l'autre pour une approche hybride appuyée sur NVIDIA Omniverse, illustre une bataille de standardisation encore ouverte dans l'automatisation industrielle. Ce virage s'inscrit dans une dynamique amorcée depuis plusieurs trimestres, où les grands noms de la robotique industrielle (ABB, FANUC, Rockwell) absorbent des briques d'IA générative et de vision pour rester compétitifs face à des acteurs plus agiles comme Sereact ou Mech-Mind sur le picking flexible. Des fournisseurs plus modestes, SEW-EURODRIVE, Festo, CODI Manufacturing ou Vention, misent sur des cellules compactes et accessibles pour équiper les PME industrielles. L'épisode ne donne pas de calendrier précis de déploiement pour ces technologies, mais confirme que la prochaine bataille se jouera sur l'orchestration logicielle plus que sur la forme du robot.

UEDes acteurs europeens majeurs (Schneider Electric, Siemens, SEW-EURODRIVE, Festo) sont au coeur du basculement vers l'orchestration logicielle et l'IA physique dans l'industrie.

IndustrielActu
1 source
Apptronik dévoile Apollo 2 et une nouvelle installation phare de collecte de données et d'entraînement
56Robotics Business Review 

Apptronik dévoile Apollo 2 et une nouvelle installation phare de collecte de données et d'entraînement

Apptronik a devoilé hier Apollo 2, la nouvelle version de son robot humanoïde, en meme temps que l'ouverture de Robot Park, son centre phare de collecte de donnees et d'entrainement a Austin, au Texas. Apollo 2 se decline en deux configurations modulaires: une version bipede pour se deplacer dans des espaces concus pour des humains, et une version a base roulante offrant stabilite et efficacite dans des environnements a fort debit. La base roulante a ete concue pour respecter les normes de securite existantes des robots mobiles industriels, ce qui facilite son integration dans des operations clients deja en place. Dans le cadre de son partenariat de recherche avec Google DeepMind, les donnees collectees par Apollo 2 alimentent aussi Gemini Robotics, les modeles de fondation pour la robotique de DeepMind. Apptronik affirme qu'Apollo repose sur pres d'une decennie de developpement et quinze robots precedents, dont Valkyrie de la NASA. Issue du Human Centered Robotics Lab de l'Universite du Texas a Austin, l'entreprise compte environ 300 employes et a leve 520 millions de dollars plus tot cette annee, portant son capital total a pres d'un milliard de dollars. Cette annonce illustre un repositionnement plus large de l'industrie humanoide: passer de la demonstration ponctuelle a l'exploitation reelle et repetee sur le terrain. Jeff Cardenas, cofondateur et PDG d'Apptronik, resume l'ambition en opposant explicitement les annees de demos spectaculaires a un objectif de fiabilite quotidienne au travail, une facon de reconnaitre implicitement l'ecart persistant entre les videos promotionnelles du secteur et les deploiements effectifs. La logique mise en avant, une boucle d'apprentissage continue ou le robot travaille, collecte des donnees et s'ameliore a chaque cycle, correspond a un pari repandu chez les acteurs de la robotique generaliste (dans la lignee de Pi-0 ou GR00T N2): la mise a l'echelle des donnees reelles, plutot que la seule simulation, serait la voie vers des modeles VLA veritablement robustes. Pour les integrateurs et decideurs industriels, le choix d'une architecture modulaire bipede/roulante repond a une demande concrete: pouvoir deployer une meme intelligence robotique sous une forme deja conforme aux normes de securite existantes, sans attendre la maturation complete de la locomotion bipede. Le contexte de cette annonce s'inscrit dans une accumulation de Robot Parks chez des clients et partenaires dans le monde, Austin devenant le site vitrine du dispositif. Apollo 2 sert depuis plus d'un an de cheval de bataille pour cette collecte de donnees, et Apptronik presente explicitement tout ce qui en est tire comme la base du developpement d'Apollo 3, son futur produit commercial. Barry Phillips, directeur commercial d'Apptronik, insiste sur le fait que la conception modulaire repond a une demande client pour une automatisation adaptable, un positionnement qui distingue Apptronik d'acteurs concentres sur une seule morphologie, comme Figure avec son humanoide bipede pur ou Boston Dynamics avec Atlas. Face a des concurrents comme Tesla (Optimus), Figure ou Agility Robotics, Apptronik mise sur ce continuum recherche-collecte-produit avec Google DeepMind comme axe de differenciation, sans toutefois preciser de calendrier ferme pour des pilotes clients elargis ni pour la disponibilite commerciale d'Apollo 3.

HumanoïdesOpinion
1 source
Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes
57Interesting Engineering 

Vidéo : un nouveau modèle d'IA permet aux robots humanoïdes de réussir 90 % des missions complexes

Flexion Robotics a dévoilé Reflect v1.0, une plateforme d'intelligence robotique destinée aux humanoïdes, capable d'exécuter des missions longues et multi-étapes sans intervention humaine pendant l'exécution. Pour illustrer les capacités du système, la société a présenté une démonstration en environnement de bureau : un robot humanoïde reçoit une instruction en langage naturel, récupère un colis de snacks livré au bâtiment, emprunte escaliers et ascenseur, déballe le carton à l'aide d'outils, puis range les articles dans un tiroir désigné. Selon Flexion, l'intégration du reinforcement learning sur plusieurs couches du système a fait passer le taux de complétion end-to-end d'une mission interne à 16 étapes de 38 % à 90 %, contre un modèle supervisé seul. La plateforme gère des charges comprises entre 100 grammes et 3,5 kilogrammes, et le robot est capable de repositionner un colis via des mouvements coordonnés du corps entier, d'opérer un ascenseur, de traverser des escaliers répétés et de contourner des obstacles dynamiques tout en portant des objets. Ce résultat est significatif parce qu'il s'attaque directement au problème de l'autonomie longue durée, considéré comme l'un des verrous majeurs de la robotique humanoïde commerciale. Dans une séquence de tâches, l'accumulation d'erreurs de navigation, de manipulation ou de perception finit statistiquement par faire échouer le système : c'est le "long-horizon failure mode" que les industriels connaissent bien. Reflect v1.0 le traite via un modèle vision-langage (VLM) personnalisé qui fait office de contrôleur de mission, surveille en continu l'avancement, raisonne sur l'environnement et re-planifie à la demande. La couche de mouvement combine des vision-language-action models (VLA) entraînés sur données réelles et des primitives issues du reinforcement learning, tandis qu'un contrôleur corps-entier temps réel assure équilibre et précision des gestes. Pour un COO industriel ou un intégrateur, le signal concret est le suivant : on passe de 38 % à 90 % de succès sur une mission à 16 étapes grâce au RL seul, ce qui suggère que le sim-to-real gap et la fiabilité multi-tâche sont partiellement solubles sans refonte matérielle. Flexion Robotics est une startup relativement récente dans l'écosystème humanoïde, qui se positionne comme fournisseur de couche logicielle agnostique au hardware, à l'image de ce que Apptronik ou 1X cherchent à faire sur leurs propres plateformes. L'article mentionne également ShengShu Technology et son modèle Motubrain, un "cerveau général" combinant perception, raisonnement et action, qui vise le même marché. La concurrence directe inclut Figure (Helix), Physical Intelligence (pi0), Boston Dynamics (Atlas Gen 2) et Tesla (Optimus Gen 3), tous engagés dans une course à l'autonomie longue horizon. Flexion reconnaît que Reflect v1.0 reste limité à des environnements définis, ce qui tempère le chiffre de 90 % : il s'agit d'une évaluation interne sur mission contrôlée, pas d'un déploiement industriel validé en conditions réelles. Les prochaines étapes annoncées concernent l'extension à des environnements moins structurés et la capacité à recevoir des instructions modifiées en cours de mission, deux marqueurs qui, s'ils sont confirmés en production, rapprocheraient Reflect d'une utilisabilité opérationnelle sérieuse.

IA physiqueOpinion
1 source
AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires
58arXiv cs.RO 

AnyBody : contrôle libre du corps entier d'un humanoïde par points-clés arbitraires

Des chercheurs ont publié le 30 juin 2026 AnyBody (arXiv:2606.29209), un contrôleur unitaire pour humanoïdes capables de piloter l'ensemble du corps à partir d'un sous-ensemble arbitraire de keypoints (points de repère anatomiques) défini au moment du déploiement. La méthode articule trois briques : un tracker "enseignant" entraîné sur un large corpus de mouvements humains non structurés, distillé vers un student encodeur-décodeur déterministe dont l'espace latent est une sphère unitaire, puis un encodeur transformer par keypoints exploitant le masked self-attention pour accepter n'importe quelle combinaison de marqueurs corporels. Un correcteur résiduel léger dans l'espace latent permet ensuite d'adapter le décodeur figé à des tâches aval spécifiques. Les expériences couvrent le suivi de mouvements humains à grande échelle depuis des keypoints partiels, la télé-opération flexible, la locomotion, l'écriture dans les airs et l'atteinte d'obstacles. Ce travail s'attaque à deux verrous majeurs du contrôle physique des humanoïdes. Les pipelines classiques de retargeting depuis la capture plein corps (full-body mocap) sont coûteux et sujets aux erreurs, ce qui freine la collecte de données à l'échelle nécessaire à l'apprentissage par renforcement. Les architectures hiérarchiques qui dissocient contrôle du haut et du bas du corps sacrifient quant à elles la coordination globale indispensable à la loco-manipulation, c'est-à-dire la capacité à marcher et manipuler simultanément. AnyBody résout les deux en apprenant une représentation latente unique interrogeable par n'importe quel sous-ensemble de keypoints, sans retraining. Pour les intégrateurs, cela ouvre la voie à une télé-opération allégée (quelques marqueurs suffisent) et à des interfaces variées : vision monoculaire, IMU ou exosquelette partiel. Le contrôle physique des humanoïdes se partage aujourd'hui entre approches simulation-retargeting (PHC, OmniH2O, HOVER) et modèles vision-langage-action (VLA). AnyBody s'inscrit dans la première famille mais supprime la contrainte du mocap complet, convergeant vers des travaux comme HumanVid qui exploitent des supervisions partielles. Cette publication académique n'implique pas directement d'acteur commercial, mais ses enjeux concernent Figure AI (Figure 03), Agility Robotics (Digit), Boston Dynamics (Atlas), Apptronik (Apollo), et côté français Wandercraft, dont le contrôle de marche assistée repose précisément sur ce type de coordination corps entier. La validation sur hardware réel à grande échelle reste la prochaine étape critique avant tout transfert industriel.

UEWandercraft (France), dont la pile de contrôle repose précisément sur la coordination corps entier pour la marche assistée, est l'acteur européen le plus directement concerné par les apports méthodologiques d'AnyBody.

💬 Le vrai verrou du contrôle humanoïde, c'était le mocap complet, coûteux et obligatoire à chaque nouvelle tâche. AnyBody coupe là-dedans : quelques points arbitraires suffisent, le contrôleur s'adapte sans réentraînement, et ça débloque enfin la collecte à l'échelle dont le RL avait besoin depuis longtemps. Wandercraft devrait y regarder de près.

IA physiquePaper
1 source
FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde
59arXiv cs.RO 

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde

Des chercheurs du LECAR Lab (Learning, Computing and Autonomous Robots) ont publié le 30 juin 2026 sur arXiv (référence 2506.28476) un préprint décrivant FADA, un cadre d'adaptation en quelques exemples pour le contrôle de robots humanoïdes. L'architecture, baptisée Planner-IDM (Planner–Inverse Dynamics Model), fonctionne en trois étapes : entraînement d'une politique oracle avec accès à des informations privilégiées (état complet du simulateur), distillation de ce comportement dans un modèle étudiant déployable via DAgger, puis fine-tuning ciblé du seul module IDM à partir d'environ deux minutes de données collectées dans l'environnement réel. La supervision ne requiert ni démonstrations expertes ni signal de récompense : uniquement les paires (actions, observations) enregistrées lors de ces brefs rollouts. Les expériences montrent que FADA surpasse les baselines d'adaptation in-context et d'adaptation end-to-end sur des tâches whole-body à haute précision exécutées sur robot physique. L'enjeu pratique est réel : le "dynamics mismatch", écart entre les dynamiques simulées et celles du domaine cible dues aux variations de terrain, de charge utile ou de réponse actionneur, reste l'un des principaux freins au déploiement industriel des humanoïdes. Les approches actuelles forcent un compromis inconfortable entre la randomisation de domaine (zero-shot, mais sous-spécialisée) et le recalibrage complet du modèle ou le ré-entraînement de politique (précis, mais coûteux en données et en temps). Deux minutes de rollouts pour aligner un IDM représentent un point d'équilibre opérationnellement crédible pour des intégrateurs qui ne peuvent pas interrompre une ligne de production plusieurs heures. Cela dit, les vidéos hardware présentées sur le site du projet sont sélectionnées par les auteurs ; aucune évaluation statistique robuste sur variété de terrains ou charges n'est encore disponible dans ce préprint non relu par les pairs. Le sim-to-real gap est un problème structurel que l'ensemble de l'écosystème humanoïde, Figure (02/03), Tesla Optimus, Boston Dynamics Atlas, Physical Intelligence (pi-zero), tente de résoudre, principalement par randomisation massive en simulation ou par apprentissage en contexte (in-context RL). FADA s'inscrit dans une troisième voie, plus proche des travaux sur l'adaptation rapide de politiques (MAML, RMA) mais appliquée à l'architecture Planner-IDM. Le LECAR Lab, affilié à l'Université de Californie San Diego, capitalise ici sur des travaux antérieurs en locomotion et manipulation whole-body. Prochaine étape attendue : validation sur une plus large variété de dynamiques et de morphologies robotiques, ainsi qu'une soumission à conférence (ICRA ou CoRL) pour passer le filtre de la revue par les pairs.

RecherchePaper
1 source
Au programme de la #RoboCup2026
60Robohub 

Au programme de la #RoboCup2026

La RoboCup 2026 se tiendra à Incheon, en Corée du Sud, du 2 au 6 juillet. L'édition marque une évolution notable du format de compétition : les ligues de football adoptent désormais les robots humanoïdes comme axe principal, une décision structurante dans un contexte d'essor commercial du bipède. Les équipes concourront dans plusieurs divisions : RoboCupSoccer (Humanoid, Middle Size, Small Size et Simulation), RoboCupRescue (Robot et Simulation), RoboCup@Home, Industrial et RoboCupJunior (Soccer, Onstage et Rescue). Un atelier spécifique, le WEROB, est réservé à la robotique éducative, ciblant étudiants, mentors et formateurs. Le symposium du 6 juillet accueillera deux conférences plénières : Hyun Myung interviendra sur l'intelligence spatiale pour la navigation autonome en environnement non structuré, et Gentiane Venture, chercheuse française en poste au Japon, traitera de la question de doter les robots d'une capacité à comprendre et à s'inscrire dans un contexte humain. Ce pivot vers les humanoïdes dans les ligues football ne relève pas du symbolique. Il intervient alors que le marché des robots humanoïdes s'emballe, avec Figure AI, Tesla (Optimus Gen 3), Boston Dynamics (Atlas) et Agility Robotics positionnés sur les mêmes métriques de locomotion bipède, de manipulation et d'adaptation à l'environnement réel. La RoboCup, en tant que banc de test académique et compétitif normalisé, devient un outil pertinent pour mesurer l'écart réel entre systèmes de recherche et plateformes commerciales. Le choix de focaliser les ligues football sur l'humanoïde signale que la locomotion bipède robuste est jugée suffisamment mature pour être testée dans des conditions structurées et exigeantes, au-delà des démonstrations contrôlées en laboratoire. Fondée en 1997 à l'initiative de chercheurs japonais, la RoboCup vise à aligner, d'ici 2050, une équipe de robots autonomes capable de battre les champions du monde FIFA en conditions réelles. Depuis ses premières éditions à Nagoya et Paris, la compétition a accompagné chaque génération de ruptures en robotique : navigation réactive, vision profonde, apprentissage par renforcement, puis architectures VLA. La tenue de l'édition 2026 en Corée du Sud n'est pas neutre : le pays abrite Rainbow Robotics (acquis par Samsung début 2024), Hyundai Robotics et plusieurs laboratoires académiques actifs sur l'humanoïde. L'annonce officielle reste à ce stade une communication événementielle, sans détail technique sur les règles révisées des nouvelles ligues humanoïdes ni sur les critères d'évaluation retenus pour cette transition.

UEGentiane Venture, chercheuse française basée au Japon, intervient en plenière sur la cognition contextuelle des robots, seul lien direct avec la France dans un événement sud-coréen sans retombée opérationnelle immédiate pour l'écosystème robotique français ou européen.

HumanoïdesPaper
1 source
Nous savons construire des robots plus intelligents, il reste à apprendre à mieux les tester
61Robotics Business Review 

Nous savons construire des robots plus intelligents, il reste à apprendre à mieux les tester

Un robot humanoïde est aujourd'hui accessible à l'achat pour 14 000 dollars, sans certification de sécurité standardisée ni protocole de validation comportementale obligatoire. L'auteur de cet article, chercheur en robotique, a co-publié deux travaux récents qui convergent vers un même constat : les méthodologies de test n'évoluent pas au même rythme que les architectures de contrôle autonome. Pour cartographier ce décalage, il propose une taxonomie en cinq niveaux, classifiant les robots non pas selon le degré d'attention humaine (comme le fait la norme SAE pour les véhicules), mais selon le mode de traitement de l'information et de génération du comportement par la machine elle-même. Niveau 0 : téléopération pure. Niveau 1 : imitation par behavior cloning, fragile dès que les conditions terrain s'écartent légèrement des données d'entraînement. Niveau 2 : apprentissage supervisé en temps réel, où le robot détecte son incertitude, se met en pause et intègre une correction humaine via inverse reinforcement learning. Niveau 3 : apprentissage auto-supervisé, le robot générant ses propres signaux d'entraînement par essais-erreurs sans intervention humaine. Niveau 4 : reinforcement learning complet, le robot reformulant chaque tâche comme un problème d'optimisation résolu en interaction continue avec son environnement. Ce que cette taxonomie révèle est structurellement important pour les intégrateurs et les décideurs industriels : chaque niveau supplémentaire introduit un type de défaillance fondamentalement différent, qui rend les approches de test existantes insuffisantes. Aux niveaux 0 et 1, les outils sont matures et les comportements testables de façon exhaustive. Dès le niveau 2, il faut valider non seulement le comportement mais aussi le mécanisme de détection d'incertitude et l'intégrité de chaque mise à jour d'apprentissage. Au niveau 3, le robot réécrit continuellement sa propre politique : tester une performance instantanée ne suffit plus, il faut auditer le processus d'apprentissage lui-même. Au niveau 4, l'espace comportemental est trop vaste et trop dynamique pour une énumération exhaustive des cas de test. La thèse centrale est que les garanties formelles de sécurité doivent remplacer l'énumération de cas tests aux niveaux élevés d'autonomie, et que l'évaluation de robustesse adversariale doit devenir aussi systématique que les tests fonctionnels. Cette réflexion s'inscrit dans un moment charnière de l'industrie : les laboratoires et industriels (Figure, Boston Dynamics, Agility, 1X, Unitree côté hardware ; Physical Intelligence, DeepMind, NVIDIA côté fondations VLA) poussent vers une autonomie croissante, mais le cadre réglementaire reste absent pour les systèmes à prise de décision autonome en environnement non contrôlé. L'absence de standards équivalents aux normes ISO 10218 pour les robots industriels fixes crée un vide que comblent actuellement les constructeurs eux-mêmes, avec des métriques internes difficiles à auditer. Les prochaines étapes identifiées par l'auteur pointent vers l'intégration de méthodes de vérification formelle et de red-teaming adversarial comme pratiques standard de validation, avant que des déploiements à grande échelle dans des environnements non structurés ne rendent ces lacunes coûteuses.

UELe vide réglementaire identifié, absence de normes équivalentes aux ISO 10218 pour les robots à décision autonome, concerne directement le marché européen, où l'AI Act devra s'appliquer à des systèmes dont les méthodes de validation restent aujourd'hui définies unilatéralement par les constructeurs.

RechercheOpinion
1 source
Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes
62arXiv cs.RO 

Un système pour des comportements loco-manipulatoires rapides, résilients et adaptatifs sur les robots humanoïdes

Des chercheurs de l'IHMC (Institute for Human and Machine Cognition) ont publié une thèse présentant un système de pilotage comportemental pour robots humanoïdes, conçu pour combiner locomotion et manipulation d'objets en temps réel dans des environnements industriels non structurés. Le système, déployé sur cinq plateformes distinctes, le DRC Atlas de Boston Dynamics, le Valkyrie de la NASA, le Nadia d'IHMC et Boardwalk Robotics, le H1-2 d'Unitree et l'Alex d'IHMC, permet à un opérateur de créer, modifier et superviser des comportements directement pendant l'exécution, sans arrêt du robot. La bibliothèque de comportements couvre plus de vingt variantes de tâches réelles : ouverture de portes à poignée rotative, barre anti-panique ou levier, séquences d'exploration multi-étapes, désencombrement d'obstacles et manipulation réactive de surface à surface. Ce travail s'attaque à l'un des verrous fondamentaux de la robotique humanoïde commerciale : la fragilité des comportements face à la variabilité du monde réel. En combinant des "Affordance Templates" centrés sur les objets, une logique inspirée des Behavior Trees et une couche de perception éditable à l'exécution, l'architecture permet d'adapter, d'étendre ou de composer des comportements existants en quelques minutes à quelques heures. C'est une rupture significative par rapport aux pipelines d'apprentissage bout-en-bout, type VLA (Vision-Language-Action), qui nécessitent des cycles d'entraînement longs pour toute nouvelle tâche. Le système repose sur un contrôleur corps-entier autorisant le mouvement des bras pendant la marche, avec un algorithme de superposition d'actions concurrentes pour accélérer les cycles. Le contexte académique est celui du DARPA Robotics Challenge (2013-2015), dont les principes de "Coactive Design", observabilité maximale, prédictibilité, directivité, ont structuré toute l'architecture. Cette thèse constitue une capitalisation de plusieurs années de déploiements multi-robots au sein de l'IHMC, laboratoire fédéral américain historiquement centré sur la locomotion bipède. Face aux approches concurrentes purement end-to-end de Figure AI, Physical Intelligence (pi0) ou Tesla Optimus, ce système positionne un pôle alternatif : contrôle symbolique hybride, intervention opérateur en boucle courte, portabilité multi-plateforme. La prochaine étape naturelle serait une intégration avec des politiques apprises pour les sous-tâches de manipulation fine, comblant le gap sim-to-real que ni l'approche symbolique ni l'apprentissage seul ne résolvent pleinement à ce stade.

RecherchePaper
1 source
TaskNPoint : apprendre à un humanoïde à frapper un revers en quelques minutes
63arXiv cs.RO 

TaskNPoint : apprendre à un humanoïde à frapper un revers en quelques minutes

Des chercheurs publient sur arXiv (juin 2026) TaskNPoint, un protocole d'entraînement qui enseigne des compétences dynamiques à un humanoïde à partir d'une seule démonstration humaine par compétence, avec moins d'une heure de calcul sur un seul GPU standard. Le système repose sur quatre entrées fournies par un coach humain : un ensemble discret de compétences à acquérir, une démonstration vidéo par compétence, l'identification d'une "fenêtre d'interaction" critique (les ~20 cm de déplacement de raquette autour du contact balle-raquette, par exemple) et l'objectif cible. L'apprentissage par renforcement en simulation physique prend le relais pour générer les trajectoires complètes et, via un échantillonnage aléatoire des positions cibles pendant l'entraînement, assure une généralisation zero-shot à des objectifs inédits. L'approche est validée sur un humanoïde Unitree G1 : coups droits et revers face à des balles lancées par un humain, tirs de football et pick-and-place de cartons depuis des positions arbitraires, sans ajustement manuel de fonction de récompense. L'enjeu est la scalabilité de l'apprentissage sur des compétences dynamiques, où les méthodes actuelles butent soit sur le volume de démonstrations requis, soit sur le coût du reward engineering. TaskNPoint réduit les deux à presque rien : une seule démo par compétence suffit, sans réglage de récompense par tâche. L'argument structurel est que le résultat d'un mouvement dynamique est déterminé par un court segment de la trajectoire, la fenêtre d'interaction critique, et non par sa totalité ; calibrer ce segment en coordination avec la physique du robot et son architecture mécanique permet de généraliser le reste automatiquement. C'est un argument direct contre la thèse selon laquelle les humanoïdes nécessitent des milliers d'heures de données pour performer sur des gestes non triviaux. Il s'agit toutefois d'un preprint arXiv, testé en conditions contrôlées ; la robustesse en milieu industriel non scénarisé reste à établir. Le Unitree G1, humanoïde chinois vendu autour de 16 000 dollars, s'est imposé depuis 2024 comme la plateforme de recherche ouverte de référence, alternative accessible aux Boston Dynamics Atlas et Agility Digit. TaskNPoint s'inscrit dans un courant cherchant à réconcilier imitation et renforcement simulé, face aux diffusion policies de Physical Intelligence (Pi-0) ou aux politiques visuomotrices universelles de type VLA. Son positionnement distinctif est la parcimonie en données d'entrée, une démo par compétence là où d'autres méthodes en exigent des centaines, avec un coût de calcul suffisamment bas pour être accessible à des équipes sans infrastructure GPU lourde. Aucun pilote industriel ni partenariat de déploiement n'est annoncé avec cette publication.

IA physiqueOpinion
1 source
Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes
64arXiv cs.RO 

Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2606.25179) une étude portant sur la conception de contrôleurs de locomotion universels pour robots quadrupèdes, capables de s'adapter à plusieurs morphologies de robots différents tout en intégrant de la perception en temps réel. Les auteurs s'appuient sur le cadre MorAL (Morphology-Aware Locomotion), qu'ils étendent en comparant trois architectures : un contrôleur aveugle (baseline sans perception), MorAL+ (perception intégrée uniquement dans le critique du réseau, pas dans l'acteur), et PPAL (acteur-critique entièrement perceptif). Les politiques ont été évaluées en simulation sur terrains plats et accidentés, puis déployées sur du matériel réel via le robot ANYmal d'ANYbotics. Résultat principal : MorAL+ surpasse les deux autres configurations en robustesse et en cohérence de suivi de trajectoire, notamment parce qu'un acteur entièrement perceptif se révèle sensible au bruit de capteur, tandis qu'un acteur aveugle manque de conscience du terrain. Ce résultat va à contre-courant d'une intuition répandue dans la communauté robotique : intégrer plus de perception n'est pas toujours meilleur. Le fait que la perception placée uniquement dans le critique (et non dans l'acteur) améliore la robustesse sans fragiliser la politique face au bruit de capteur est une contribution architecturale concrète. Pour les intégrateurs industriels qui déploient des quadrupèdes en environnements non structurés (entrepôts, sites industriels, inspection d'infrastructures), cette distinction a des implications directes sur la conception des pipelines de contrôle. Elle indique aussi que le problème du sim-to-real pour la locomotion quadrupède n'est pas uniquement une question de quantité de données perceptives, mais de leur positionnement dans l'architecture d'apprentissage par renforcement. ANYmal, développé par ANYbotics (spin-off de l'ETH Zurich), est l'un des robots quadrupèdes les plus utilisés en recherche académique et en déploiements industriels pilotes, aux côtés de Spot de Boston Dynamics et des modèles Unitree (Go2, B2) qui dominent le segment prix bas. Le cadre MorAL, sur lequel s'appuie ce travail, visait déjà à entraîner des politiques transférables entre morphologies de robots différents, un problème ouvert dans la course à la généralisation inter-robots (cross-embodiment). Ce papier reste pour l'instant un preprint académique sans déploiement industriel annoncé ; les suites naturelles seraient une validation sur un ensemble plus large de morphologies quadrupèdes et des tests en conditions réelles prolongées, en dehors du cadre contrôlé d'un labo.

UEANYbotics étant un spin-off suisse de l'ETH Zurich, les conclusions architecturales sur MorAL+ intéressent directement les intégrateurs européens qui déploient des quadrupèdes en inspection industrielle ou en environnements non structurés.

RecherchePaper
1 source
Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA
65Interesting Engineering 

Des robots humanoïdes chinois relèvent le défi du penalty alors que Messi et Ronaldo illuminent la Coupe du Monde FIFA

Le 24 juin 2026, à l'ouverture du MWC Shanghai 2026, la Mobile AI Innovation Frontiers Zone du Shanghai New International Expo Centre a accueilli le Humanoid Robot Football Penalties Challenge, une compétition de tirs au but mettant en scène des robots humanoïdes en conditions semi-autonomes. D'après les images diffusées en ligne, des modèles de Booster Robotics et Unitree Robotics participent à l'épreuve. Le format est structuré : chaque robot doit interpréter indépendamment la position du ballon et les déplacements du gardien, puis déclencher le tir en effectuant des corrections en temps réel sur la base de ses capteurs, sans séquences pré-programmées ni intervention humaine externe. Les demi-finales et la finale sont prévues le 25 juin, avec des contraintes progressivement durcies pour simuler la pression compétitive. En parallèle, Hyundai Motor, maison mère de Boston Dynamics, a publié une vidéo de son robot Atlas réalisant des exercices de football dans le cadre d'une initiative baptisée "School of Football" : le robot observe des séquences vidéo de matchs, puis reproduit immédiatement dans un espace d'entraînement les gestes observés, passes incluses, imitation de célébration de but et simulation de blessure au genou compris. Hyundai évoque une possible présence d'Atlas et du quadrupède Spot à la Coupe du monde 2026, sans préciser leurs rôles. L'intérêt technique de l'exercice réside dans ce qu'un tir au but exige : perception en temps réel, équilibre dynamique lors du transfert de poids et de l'extension de jambe, et planification motrice adaptative dans un environnement non contrôlé. En faisant d'un moment sportif universellement compris un banc d'essai robotique, l'événement sert de point de comparaison public entre plateformes. Pour les intégrateurs et décideurs industriels, il convient cependant de distinguer soigneusement une démonstration scénarisée d'un déploiement opérationnel : les conditions restent contrôlées, les métriques publiées sont limitées, et les vidéos disponibles proviennent de flux non officiels. La valeur réelle réside moins dans la performance sportive que dans la capacité à enchaîner perception, décision et exécution physique sans intervention humaine, un sous-problème direct du sim-to-real transfer et de la robustesse des VLA (Vision-Language-Action models) en environnement ouvert. Unitree Robotics et Booster Robotics s'inscrivent dans la vague de constructeurs chinois d'humanoïdes qui ont considérablement accéléré depuis 2024, aux côtés de Zhiyuan Robotics et Fourier Intelligence, dans un contexte de forte pression concurrentielle avec les Américains Figure AI, Agility Robotics et Tesla Optimus. Du côté de Boston Dynamics, la campagne football intervient après une série de démonstrations industrielles d'Atlas Gen 2 en environnement d'usine automobile, et sert manifestement à repositionner le robot sur le terrain de la dextérité et de l'apprentissage par imitation plutôt que sur la seule force brute. La Coupe du monde 2026, dont les matchs se tiennent aux États-Unis, au Canada et au Mexique à partir du 11 juin, fournit un calendrier marketing opportun, mais aucune intégration fonctionnelle concrète n'a été annoncée pour l'instant.

UELa progression rapide des humanoïdes chinois accentue la pression compétitive sur les constructeurs et intégrateurs robotiques européens, sans déploiement ni annonce ciblant directement le marché européen.

Chine/AsieOpinion
1 source
Vidéo : un chien robot effectue 33 000 inspections dans une cimenterie vieille de 150 ans
66Interesting Engineering 

Vidéo : un chien robot effectue 33 000 inspections dans une cimenterie vieille de 150 ans

Depuis début 2025, le robot quadrupède ANYmal d'ANYbotics est déployé en exploitation nocturne autonome à l'usine de ciment Vigier Ciment en Suisse, un site vieux de 150 ans abritant plus de 1 000 machines réparties sur six niveaux et trois unités de broyage. En seize mois d'exploitation, l'ANYmal a réalisé plus de 33 000 inspections couvrant 450 points de contrôle prédéfinis, sans intervention humaine. Pesant 50 kilogrammes, le robot embarque une caméra haute résolution pour la détection visuelle d'anomalies structurelles, une caméra thermique pour le suivi des températures sur roulements, moteurs et engrenages, un capteur de gaz mesurant les taux d'ammoniac, et un imageur acoustique capable de localiser des fuites d'air comprimé jusqu'à 50 mètres de distance. Ces capteurs ont permis quatre découvertes documentées : une fissure dans la fondation d'un concasseur détectée avant qu'elle ne provoque un arrêt estimé à 630 000 dollars de production perdue ; une montée en température d'un roulement vers 140 °C interceptée grâce à une réparation planifiée de huit heures ; des niveaux d'exposition à l'ammoniac identifiés dans des zones de déchargement jusque-là non mesurées ; et des fuites d'air dans des systèmes de filtration à cinquante mètres du sol localisées par imagerie acoustique. Ce déploiement constitue l'un des rares cas industriels documentés où un robot mobile autonome dépasse les 30 000 cycles opérationnels sans panne mécanique sur un site de production actif. Pour les responsables maintenance et les décideurs B2B, c'est moins la technologie embarquée qui retient l'attention que le modèle économique : ANYbotics affirme que l'ANYmal a récupéré plus que le coût total du programme sur la période, sans chiffrer précisément ce ratio. La capacité à détecter en amont des défaillances sur équipements rotatifs (roulements surchauffés, fondations fissurées) transforme l'inspection robotisée d'un outil de conformité HSE en levier direct de continuité de production. L'argument tient particulièrement pour les environnements à fort risque HSE et forte contrainte de disponibilité : chimie, ciment, pétrochimie, fonderies. L'ANYmal opère également les nuits et week-ends, intervalles que les rondes manuelles couvrent rarement, ce qui augmente structurellement la fréquence de détection des dérives thermiques ou mécaniques. ANYbotics est un spin-off de l'ETH Zurich fondé en 2016 ; le robot ANYmal y est développé depuis les premiers travaux du Robotic Systems Lab, publiés dès 2014. Les données collectées lors des patrouilles sont agrégées dans la plateforme logicielle Data Navigator d'ANYbotics. Sur ce segment de l'inspection robotique industrielle quadrupède, le principal concurrent est Boston Dynamics avec Spot, déployé chez des groupes pétroliers et chimiques comme BP, Aker BP ou BASF ; Ghost Robotics (États-Unis) et Unitree (Chine) sont également présents, mais avec peu de références industrielles lourdes en Europe. En France, aucun acteur comparable n'opère sur ce créneau spécifique, même si Exotec (AMR logistique) et Enchanted Tools (manipulation collaborative) adressent des niches adjacentes. Aucun calendrier d'extension du déploiement Vigier à d'autres sites n'a été officiellement annoncé.

UECe retour d'expérience suisse, avec métriques documentées sur 16 mois, constitue une référence exploitable pour les opérateurs industriels européens (ciment, chimie, pétrochimie) qui évaluent le ROI de l'inspection quadrupède autonome face à Boston Dynamics Spot.

IndustrielOpinion
1 source
NVIDIA Halos pour la robotique : un système de sécurité fonctionnelle à pile complète pour l'IA physique
67NVIDIA Developer Blog 

NVIDIA Halos pour la robotique : un système de sécurité fonctionnelle à pile complète pour l'IA physique

NVIDIA a dévoilé Halos for Robotics lors du GTC 2025, un système de sécurité fonctionnelle couvrant l'ensemble de la pile technologique des robots autonomes. Conçu pour les environnements industriels, médicaux et logistiques où des robots évoluent sans cage aux côtés d'humains, Halos intègre trois couches : la sécurité matérielle (SoC certifiés comme l'Orin), la sécurité logicielle (middleware temps réel), et la validation des modèles d'IA embarqués. Le système vise la conformité aux normes IEC 61508 (industrie) et ISO 26262 (automobile), des référentiels qui définissent les niveaux SIL et ASIL exigés par les intégrateurs pour tout déploiement à risque humain. L'enjeu industriel est concret : les approches classiques de safety-by-isolation, robots en cellule fermée, arrêts sur barrière lumineuse, ne tiennent plus dès que le robot doit percevoir un environnement non structuré et adapter son comportement en temps réel. Halos tente de combler le fossé entre la validation de modèles en simulation et leur certification en conditions réelles, un problème que l'industrie robotique qualifie de "sim-to-real safety gap". Pour les décideurs B2B, c'est potentiellement un déblocage commercial : sans certification fonctionnelle, nombre d'hôpitaux et d'usines ne peuvent pas légalement déployer des robots collaboratifs. NVIDIA s'appuie sur sa plateforme Isaac, utilisée par des constructeurs d'humanoïdes (Agility, Figure, 1X) et d'AMR (Boston Dynamics, Kion). Sur ce segment, les concurrents directs incluent les stacks safety de Pilz et SICK côté capteurs, et les middlewares certifiés comme ROS 2 avec l'extension Safety Working Group. L'absence de chiffres de déploiement concrets dans l'annonce initiale invite à traiter Halos pour l'instant comme un framework d'intégration en phase de qualification, pas encore un produit certifié expédié en volume.

UELa conformité visée aux normes européennes IEC 61508 et ISO 26262 pourrait débloquer des déploiements de robots collaboratifs dans les usines et hôpitaux européens ; Kion (Allemagne), déjà partenaire de la plateforme Isaac, figure parmi les premiers intégrateurs potentiellement concernés.

InfrastructureOpinion
1 source
Le robot Proxie Gen 2 de Cobot intègre l'automatisation des tâches et la manipulation mobile
68Robotics Business Review 

Le robot Proxie Gen 2 de Cobot intègre l'automatisation des tâches et la manipulation mobile

Collaborative Robotics (Cobot), basée à Santa Clara en Californie, a dévoilé la deuxième génération de son robot mobile Proxie lors de l'Automate 2026. Ce Proxie Gen 2 embarque une capacité de traction de carts jusqu'à 680 kg, un système de levage vertical pouvant soulever 100 kg, des batteries auto-interchangeables, et une option de manipulation bimanuell, deux bras articulés montés sur la colonne vertébrale du robot. La plateforme compte 40 % de pièces en moins que la génération précédente, avec un gabarit réduit pour naviguer dans des couloirs étroits et des ascenseurs. Cobot annonce également une fonctionnalité d'"autotasking" : le robot identifie et génère ses propres tâches sans intégration avec un WMS ni intervention humaine. Chez le client Maersk, 95 % des déplacements de carts auraient été initiés de façon autonome sur la période mesurée, le robot lisant des inscriptions sur des tableaux blancs fixés aux chariots grâce à un modèle multimodal embarqué. Ces chiffres sont présentés par Cobot sans audit tiers, ce qui mérite d'être noté. L'enjeu principal est la réduction de la barrière à l'intégration, longtemps le goulot d'étranglement des déploiements de robots mobiles manipulateurs (MMR) en environnements non structurés. Si l'autotasking tient ses promesses à l'échelle, il invaliderait le modèle dominant, des mois de développement logiciel pour connecter le robot aux systèmes ERP, WMS et MES existants. Pour un COO industriel ou un responsable logistique hospitalier, cela signifie potentiellement un déploiement en semaines plutôt qu'en trimestres. La capacité de Proxie à lire des informations non structurées (tableaux blancs, étiquettes ad hoc) représente une forme de robustesse opérationnelle réelle, à condition que les taux de reconnaissance soient validés dans des conditions dégradées, ce que la démo ne précise pas. La manipulation bimanuell ouvre par ailleurs l'accès à des tâches jusqu'ici réservées aux manipulateurs fixes, comme le déchargement de cartons ou l'alimentation de lignes. Cobot a été fondée par Brad Porter, ancien VP Engineering robotics chez Amazon Robotics, et a levé des fonds auprès d'investisseurs industriels. La société a délibérément maintenu un profil bas depuis 2022, accumulant 13 000 heures d'exploitation sur 28 robots dans des environnements réels, hôpitaux dont la Mayo Clinic, logistique et industrie, avant de communiquer publiquement. Ses concurrents directs incluent Boston Dynamics avec Spot et Stretch, Vecna Robotics, et des acteurs comme Apptronik ou 1X qui misent sur l'humanoïde. En Europe, des entreprises comme Enchanted Tools (Miroki) ou Pollen Robotics (Reachy) ciblent des segments adjacents mais restent en phase pré-déploiement à grande échelle. Cobot ne publie pas de tarif public ; les prochaines étapes annoncées portent sur l'extension des déploiements en santé et en logistique, avec la certification de sécurité comme prochaine étape technique critique pour le Gen 2.

UESi Cobot étend ses déploiements en Europe, cela accentue la pression concurrentielle sur Enchanted Tools et Pollen Robotics, encore en phase pré-commerciale, tout en offrant aux industriels et hôpitaux européens une option de manipulation mobile sans intégration WMS.

IndustrielActu
1 source
Vendredi vidéo : les robots ont-ils vraiment besoin de jambes ?
69IEEE Spectrum Robotics 

Vendredi vidéo : les robots ont-ils vraiment besoin de jambes ?

Dans la compilation robotique hebdomadaire publiée le 13 juin 2026 par IEEE Spectrum, plusieurs démonstrations se distinguent par leur portée industrielle. Sanctuary AI annonce les résultats les plus précis : l'entreprise canadienne revendique un taux de réussite validé de 99,5 % sur une tâche d'insertion de connecteurs filaires en production réelle, avec un temps de cycle de 2,54 secondes, chez un équipementier automobile mondial de rang 1 non nommé. ANYbotics, fabricant suisse de robots quadrupèdes, documente de son côté un déploiement de l'ANYmal dans une cimenterie : une fissure sur le châssis d'un concasseur a été détectée avant qu'elle ne provoque un arrêt de production estimé à 630 000 dollars. Sur le front spatial, JPL-NASA teste ERNEST (Exploration Rover for Navigating Extreme Sloped Terrain) dans le désert du Colorado près de Plaster City (Californie) pour valider un logiciel de navigation autonome longue portée destiné à de futures missions lunaires et martiennes. Genesis présente Eno, décrit comme un "robot agentique" combinant IA et manipulation physique dans un châssis délibérément non humanoïde, construit intégralement par la startup. ABB Robotics annonce une collaboration avec PSYONIC pour intégrer les données tactiles de la prothèse Ability Hand dans son cobot GoFa, afin d'améliorer la préhension d'objets irréguliers ou fragiles. Le résultat de Sanctuary AI sur l'insertion de connecteurs est notable : cette tâche à haute précision, avec contraintes d'orientation et de force, constitue précisément le type d'opération qui résiste à l'automatisation standard et bloque la robotisation de nombreuses lignes d'assemblage automobile. Un taux de 99,5 % avec un cycle inférieur à 3 secondes correspond aux benchmarks exigés en production série, et non en conditions laboratoire. À noter toutefois que la démonstration vidéo reste sélective et qu'aucun chiffre de volume cumulé ni de durée de déploiement n'est communiqué. Le cas ANYbotics illustre la valeur économique directe de l'inspection robotique autonome : la détection préventive d'un défaut mécanique justifie à elle seule plusieurs années de leasing d'un quadrupède. La collaboration ABB-PSYONIC soulève une question plus structurelle : le fait de récupérer des données de préhension humaine via des prothèses portées au quotidien pour entraîner des robots industriels représente une approche originale du sim-to-real qui contourne partiellement la rareté des datasets de manipulation. Sanctuary AI, fondé à Vancouver en 2018, développe Phoenix, un humanoïde à vocation industrielle, mais cette démonstration implique son architecture "Physical AI" sur une plateforme non spécifiée. Genesis est un acteur récent qui positionne explicitement Eno comme un rejet du paradigme anthropomorphe dominant chez Figure, Tesla (Optimus) ou Agility Robotics, pariant sur la performance fonctionnelle plutôt que sur la ressemblance humaine. ANYbotics, spin-off de l'ETH Zurich, concurrence Boston Dynamics Spot et Exodigo sur le marché de l'inspection industrielle. Du côté spatial, GITAI (startup japonaise) prépare une mission de maintenance de satellite en orbite. Les prochaines conférences du secteur incluent RSS 2026 (Sydney, juillet), Actuate 2026 (San Francisco, août) et IROS 2026 (Pittsburgh, octobre), où plusieurs de ces travaux devraient être détaillés.

UEANYbotics (spin-off ETH Zurich, Suisse) et ABB Robotics (Suisse) sont deux acteurs européens majeurs dont les avancées, inspection autonome avec ROI documenté et nouvelle approche haptique pour cobots GoFa, renforcent directement la compétitivité de l'industrie robotique européenne.

IndustrielActu
1 source
Vidéo : un système robotique atteint 99,5 % de réussite dans le câblage rapide en usine automobile
70Interesting Engineering 

Vidéo : un système robotique atteint 99,5 % de réussite dans le câblage rapide en usine automobile

La société canadienne Sanctuary AI a annoncé avoir atteint un taux de succès supérieur à 99,5 % sur une tâche d'insertion de connecteurs de câbles flexibles pour un équipementier automobile Tier 1 mondial non identifié. L'opération s'est déroulée sur une ligne de production active, avec un temps de cycle de 2,54 secondes validé contre les exigences de cadence du client. La difficulté intrinsèque de cette tâche tient à la nature des câblages souples : ils peuvent se tordre, se déformer et changer de position de façon imprévisible lors du transport sur convoyeur. Le système est piloté par la plateforme "Physical AI" de Sanctuary AI, qui combine perception en temps réel via caméras et capteurs, planification de trajectoire et contrôle adaptatif pour détecter, suivre, aligner et insérer les connecteurs sans arrêt de ligne. Olivia Norton, co-fondatrice et CTO, a résumé l'enjeu : "Manipuler un câble flexible sur une cible en mouvement sur un convoyeur en direct est exactement le type de problème de dextérité à contact riche qui a maintenu ce type de tâches hors de portée de l'automatisation traditionnelle." Ce résultat mérite attention à plusieurs égards. Le contexte est une ligne de production réelle, non un environnement de démonstration contrôlé, ce qui donne davantage de poids au taux annoncé. Le chiffre de 2,54 secondes n'est pas une métrique absolue mais un temps calibré contre les benchmarks opérationnels du client, distinction qu'il faut garder à l'esprit pour ne pas généraliser hors contexte. Pour les intégrateurs et les responsables industriels, l'approche de Sanctuary AI est notable : plutôt que d'attendre la maturité commerciale des humanoïdes, l'entreprise déploie son IA sur des systèmes industriels existants via une architecture agnostique du hardware. Ce positionnement réduit le risque d'adoption, préserve les investissements en infrastructure existants et produit des données de production sur des tâches d'assemblage restées historiquement inaccessibles à l'automatisation classique, notamment dans les industries automobile et électronique où la manipulation de câblages flexibles représente un volume de travail manuel encore considérable. Fondée à Vancouver, Sanctuary AI développe le robot humanoïde Phoenix mais mise d'abord sur la valorisation de son IA sur des plateformes existantes avant le passage à l'échelle des humanoïdes. Elle s'inscrit dans une course qui implique Figure AI (Figure 02), Tesla (Optimus Gen 3), Boston Dynamics (Atlas), 1X Technologies et Agility Robotics (Digit), ainsi que des acteurs de niche comme Enchanted Tools en France sur le segment hospitalier. L'équipementier Tier 1 impliqué n'a pas été nommé publiquement, ce qui limite la vérification indépendante des performances annoncées. Aucun volume de déploiement ni calendrier d'extension n'ont été précisés, des données qui permettraient de mieux qualifier l'ampleur réelle du projet au-delà de cette première validation en conditions de production.

UEL'approche hardware-agnostique de Sanctuary AI pour l'assemblage de câbles flexibles pourrait accélérer l'automatisation de tâches manuelles encore courantes dans les usines automobiles et électroniques européennes (Stellantis, Valeo, Bosch), sans nécessiter de remplacement d'infrastructure existante.

IndustrielOpinion
1 source
Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel
71arXiv cs.RO 

Estimation d'état proprioceptive invariante pour robots humanoïdes sur sol non inertiel

Des chercheurs proposent sur arXiv (2606.19512) un filtre de Kalman étendu invariant (InEKF) pour estimer en temps réel l'état d'un robot humanoïde se déplaçant sur un sol en mouvement, sans aucun capteur externe. L'approche exploite uniquement les IMU montées aux pieds et la cinématique du robot pour estimer la position et la vitesse de la base dans le référentiel d'un sol non-inertiel, qu'il tangue, oscille ou pivote. Testée sur le robot Digit d'Agility Robotics en station debout avec tangage et oscillation latérale, puis en marche sur un sol en rotation uni-axiale, la méthode affiche une accélération de 96 % du taux de convergence et une réduction de 80 % des erreurs de position face aux InEKF classiques. En déplacement, l'erreur moyenne reste inférieure à 9 cm pour une erreur initiale pouvant atteindre 1 mètre. L'intérêt est immédiat pour tout déploiement hors sol fixe : bateaux, véhicules logistiques, quais portuaires, plateformes vibrantes d'usine. Reposer entièrement sur la proprioception embarquée supprime la dépendance aux systèmes de localisation externe (LIDAR, caméras, motion capture) souvent absents ou peu fiables dans ces contextes. L'analyse formelle d'observabilité démontre les conditions sous lesquelles position et vitesse relatives demeurent estimables malgré l'accélération du sol, ce qui dépasse le simple résultat empirique. Les expériences ont été conduites en conditions physiques réelles plutôt qu'en simulation seule, ce qui renforce la validité des métriques, même si les scénarios restent relativement contrôlés (mono-axial, uni-directionnel). Digit est développé par Agility Robotics, spin-off de l'Oregon State University rachetée par Amazon, qui déploie l'humanoïde dans des entrepôts logistiques. La méthode InEKF pour humanoïdes s'inscrit dans un corpus académique centré sur les groupes de Lie appliqués à l'estimation en robotique de terrain. Dans la course commerciale, Tesla (Optimus), Figure (Figure 03), Boston Dynamics (Atlas) et Unitree (H1, G1) investissent massivement dans la locomotion en milieux variés, mais le sol non-inertiel demeure un angle mort des pipelines de contrôle actuels. Ce preprint est vraisemblablement soumis à IROS 2026 ou ICRA 2027 et ne représente pas encore une capacité déployée en production.

RecherchePaper
1 source
Étude comparative sur l'agilité, l'efficacité et l'absorption des chocs des robots bipèdes à orteils actifs
72arXiv cs.RO 

Étude comparative sur l'agilité, l'efficacité et l'absorption des chocs des robots bipèdes à orteils actifs

Des chercheurs ont publié sur arXiv en juin 2026 (2606.19699) une étude comparative portant sur un robot bipède à 14 degrés de liberté (DOF) équipé d'orteils actifs, conçus pour reproduire les caractéristiques humaines de légèreté, fort couple et robustesse. Pour évaluer objectivement l'apport des orteils, l'équipe a développé un environnement de simulation haute fidélité modélisant avec précision les actionneurs réels à transmissions couplées et la consommation électrique effective. Une fonction de récompense minimale en apprentissage par renforcement (RL) a été appliquée de manière identique aux deux configurations -- avec et sans orteils actifs -- pour garantir une comparaison équitable. À une vitesse de marche de 1,33 m/s, la configuration avec orteils réduit le coût de transport (CoT) de 17,5 % et la force de réaction au sol (GRF) lors de l'attaque du talon de 5,0 %. Sur les tests d'agilité, la déviation moyenne par rapport à la trajectoire cible chute de 25,0 % et la déviation maximale de 34,0 %. Ces résultats, bien qu'issus uniquement de simulation, apportent une validation quantitative rigoureuse là où la littérature précédente se contentait souvent de démonstrations qualitatives. La réduction du CoT est directement pertinente pour les déploiements industriels, où l'autonomie énergétique conditionne la durée des cycles opérationnels. La diminution du GRF au talon suggère par ailleurs une meilleure durabilité mécanique à long terme, un paramètre critique pour les intégrateurs industriels qui dimensionnent la maintenance préventive. La progression sur les métriques d'agilité confirme une hypothèse souvent avancée mais rarement chiffrée : les orteils contribuent significativement au contrôle dynamique en virage et sur trajectoires complexes, au-delà de la simple marche en ligne droite. Le débat sur l'utilité des orteils dans la robotique humanoïde est ancien. La majorité des plateformes commerciales actuelles -- Figure 02/03, Optimus Gen 2 ou Atlas de Boston Dynamics -- optent pour des pieds plats ou semi-rigides, privilégiant la simplicité mécanique et la robustesse. Des travaux antérieurs sur des robots comme ASIMO ou Cassie avaient exploré des pieds articulés sans aboutir à un consensus sur le gain réel. Cette étude repositionne la question en proposant un cadre d'évaluation reproductible et des métriques comparables. La prochaine étape critique sera la validation sim-to-real : les gains simulés tiennent rarement à l'identique sur hardware, notamment en raison du jeu mécanique et des effets de compliance non modélisés. Aucun déploiement physique ni partenaire industriel n'est annoncé à ce stade.

RecherchePaper
1 source
Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique
73Pandaily 

Alibaba et ByteDance redoublent d'efforts sur l'IA incarnée : l'apport des géants d'internet à la robotique

Le 16 juin 2026, Alibaba a lancé Qwen-Robot, sa première famille complète de modèles d'IA incarnée intégrée à la série Qwen. Elle regroupe trois composants distincts : Qwen-RobotManip pour la manipulation physique, Qwen-RobotNav pour la navigation autonome, et Qwen-RobotWorld comme modèle de monde, c'est-à-dire un moteur de raisonnement contextuel sur l'environnement physique. Ces modules peuvent être déployés séparément ou en coordination, selon le type de robot ciblé. Le positionnement d'Alibaba est explicitement logiciel : l'entreprise ne vise pas à construire des corps robotiques, mais à fournir le "cerveau intelligent" à des fabricants tiers. Simultanément, ByteDance a réorganisé ses efforts en robotique incarnée en élevant Seed Robotics au rang de division stratégique principale, désormais sous la supervision de Zhou Chang, responsable multi-modal du groupe. ByteDance a déjà produit plus de 1 000 robots, majoritairement des robots mobiles à roues pour la logistique en entrepôt et en usine, et compte parmi ses clients externes SF Express et BYD Electronics. Ce double mouvement illustre un changement structurel dans la course aux humanoïdes et à la robotique généraliste : les géants de l'internet entrent dans le secteur non par la mécanique, mais par la donnée et l'intelligence. La valeur qu'ils apportent repose sur trois piliers. D'abord, leurs grands modèles de langage compressent le temps d'adaptation à de nouvelles tâches : là où un ingénieur robotique traditionnel passerait plusieurs semaines à reprogrammer un bras ou un AGV pour un nouveau scénario, une approche VLA (vision-language-action) peut réduire cette itération à quelques jours. Ensuite, leur infrastructure opérationnelle génère des données d'entraînement à une échelle inaccessible aux startups : le réseau de livraison instantanée de Meituan, les entrepôts de JD Logistics, les chaînes d'approvisionnement e-commerce de ByteDance accumulent chaque jour des millions d'interactions physiques réelles. Enfin, et c'est peut-être le facteur le plus sous-estimé, ces entreprises sont leurs propres premiers clients. JD a validé ses robots logistiques dans ses propres entrepôts "Asia No.1" avant de les commercialiser. ByteDance fait circuler ses AMR sur de vraies routes opérationnelles avant de les vendre. Ce raccourci entre laboratoire et déploiement à l'échelle est ce qui manque le plus aux startups hardware-first. Pour autant, les analystes du secteur rappellent que l'avantage logiciel ne dissout pas les contraintes physiques. Les composants critiques comme les actionneurs, les capteurs de force ou les joints à haute précision restent des goulots d'étranglement de supply chain qui ne s'effacent pas parce qu'un géant tech entre dans la pièce. Alibaba et ByteDance font face à une concurrence à deux niveaux : d'un côté les acteurs hardware-first américains comme Figure AI, 1X, Boston Dynamics ou Agility Robotics qui avancent en parallèle sur la couche IA ; de l'autre les constructeurs chinois comme Unitree ou Fourier Intelligence qui maîtrisent déjà la chaîne de fabrication. La prochaine étape pour évaluer ces annonces sera de mesurer si les modèles Qwen-Robot passent l'épreuve du déploiement industriel répété en dehors des environnements contrôlés d'Alibaba, ce qui reste à ce stade une démonstration en cours, pas un produit livré.

Chine/AsieOpinion
1 source
Les robots humanoïdes à l'épreuve des tâches de finition de surface
74Robotics Business Review 

Les robots humanoïdes à l'épreuve des tâches de finition de surface

Dans les applications de traitement de surface, qu'il s'agisse de ponçage, polissage, sablage, meulage, revêtement ou peinture, les conditions de travail sont parmi les plus pénibles de l'industrie manufacturière : exposition aux poussières, vibrations prolongées, postures contraignantes. Depuis l'essor des robots humanoïdes, la question revient régulièrement dans les cercles industriels : ces plateformes bipèdes à mains articulées pourraient-elles automatiser le traitement de grandes pièces, là où un bras fixe ne suffit pas à couvrir toute la surface ? L'analyse systématique des composants d'un humanoïde face aux exigences réelles de ces procédés aboutit à une réponse sans ambiguïté : non. Les jambes, peu efficaces sur les sols plats d'usine et incompatibles avec un câblage nécessaire pour alimenter les outils de process, n'apportent aucune valeur par rapport à des rails au sol ou à une base mobile dédiée. Les mains multi-doigts, coûteuses et conçues pour la manipulation d'objets, offrent une prise insuffisante pour tenir un disque de meulage à haute vitesse : un connecteur direct outil-bras est plus robuste et moins onéreux. Les caméras intégrées dans la tête d'un humanoïde sont trop rapprochées pour une couverture de scène efficace ; des capteurs positionnés dans la cellule ou au plus près de l'outil sont systématiquement plus performants. Seuls les bras doubles présentent un intérêt réel, mais leur espacement optimal sur une grande pièce est fondamentalement différent de la morphologie humanoïde. L'argument économique souvent avancé pour justifier l'humanoïde, celui des économies d'échelle, ne résiste pas à l'examen. Une cellule de traitement de surface bien conçue repose sur des bras industriels polyvalents, des rails, des caméras et des capteurs d'effort, soit des composants déjà produits en grandes séries et bénéficiant pleinement des effets de volume. L'humanoïde n'est pas nécessaire pour accéder à ces économies. Plus fondamentalement, les robots industriels actuels opèrent à des vitesses quatre à cinq fois supérieures aux capacités humaines, avec des forces d'application significativement plus élevées, et leur fiabilité dans des environnements abrasifs et contraignants est éprouvée depuis des décennies. Dans une logique de réduction des temps de cycle et d'amélioration du débit, le robot industriel configuré dans la bonne géométrie spatiale reste la solution dominante, et l'analyse ne relève aucun avantage compensatoire de la morphologie humanoïde dans ces cas d'usage précis. Cette conclusion intervient dans un contexte de forte pression médiatique autour des humanoïdes : Figure, Tesla Optimus, Agility Robotics, Boston Dynamics Atlas ou encore 1X accumulent les démonstrateurs et les levées de fonds, avec le narratif que la forme humaine permettrait de déployer des robots dans n'importe quel environnement conçu pour l'humain, y compris l'usine. Les acteurs traditionnels du robot industriel, FANUC, KUKA, ABB ou Universal Robots, répondent implicitement avec des configurations duales sur base mobile sans prétention bipède. Le vrai terrain de jeu des humanoïdes reste les environnements non structurés, la logistique de dernière rangée ou les tâches générales en entrepôt, là où la polyvalence morphologique compense le déficit de performance brute. Pour les process de surface en milieu manufacturier, le débat semble tranché en faveur des solutions spécialisées, un verdict que les pilotes industriels des prochaines années auront la charge de confirmer ou d'infirmer à l'échelle.

UELes fabricants européens de robotique industrielle (KUKA, ABB, Universal Robots) sont implicitement confortés par cette analyse qui conclut à la supériorité des bras spécialisés sur rails face aux humanoïdes pour les traitements de surface en milieu manufacturier.

IndustrielOpinion
1 source
Le secret des robots humanoïdes victorieux en marathon
75IEEE Spectrum Robotics 

Le secret des robots humanoïdes victorieux en marathon

Le 19 avril 2026, le robot humanoïde Honor Lightning a complété un semi-marathon en 50 minutes et 26 secondes, battant le record mondial humain de 7 minutes et le meilleur temps robotique enregistré en 2025 de près de deux heures. Cette performance a été réalisée à une vitesse moyenne de 7 m/s, avec une consommation énergétique totale estimée à environ 400 W pour les membres inférieurs. L'élément distinctif du Lightning n'est ni une architecture de contrôle radicalement nouvelle ni une puissance moteur exceptionnelle : c'est un système de refroidissement liquide intégré directement dans chacun des quatre moteurs d'entraînement des membres inférieurs. Selon Honor, ces circuits liquides pénètrent les moteurs comme des capillaires, avec un débit d'échange thermique supérieur à 4 litres par minute et un circuit indépendant par moteur. Les actionneurs de hanche et de genou affichent un diamètre extérieur d'environ 110 à 150 mm, avec un rapport de réduction estimé à 45:1, optimisé pour la vitesse de course cible. La contrainte que cette architecture résout est strictement thermique. Faire courir un humanoïde de gabarit humain à 7 m/s génère inévitablement environ 150 W de chaleur dissipée au niveau du genou, quelle que soit l'efficacité du reste du système, et ce flux ne peut pas être évacué par convection naturelle de manière continue sur la durée d'un semi-marathon. C'est précisément ce verrou qu'illustre la performance d'Unitree lors de la même épreuve : le constructeur chinois, plus établi commercialement, a dû recourir à un sac à dos de glace pour tenter de terminer la course sans surchauffe. Apptronik avait exploré le refroidissement liquide sur plusieurs prototypes, mais ne l'intègre pas à son humanoïde principal Apollo. Pour les intégrateurs industriels et les décideurs B2B, ce résultat signale que l'endurance à haute cadence sera conditionnée moins par la puissance de calcul ou l'IA embarquée que par la gestion thermique des actionneurs, un critère rarement mis en avant dans les fiches produit des fabricants. Honor, fabricant de smartphones reconverti à la robotique humanoïde, reste discret sur la feuille de route commerciale du Lightning : aucun pilote industriel ni calendrier de mise sur le marché n'a été communiqué, et les spécifications moteur détaillées ne sont pas publiées. Cette course du 19 avril positionne néanmoins le Lightning directement face aux acteurs chinois Unitree et Agibot, ainsi qu'aux plateformes occidentales comme Figure (Figure 03), Boston Dynamics (Atlas) et Agility Robotics (Digit). Dans un secteur où l'écart entre démonstration contrôlée et déploiement réel reste souvent considérable, la nature ouverte et chronométrée de l'épreuve -- un vrai semi-marathon public, pas un parcours en laboratoire -- donne à ce résultat un caractère de benchmark difficile à relativiser. La prochaine étape logique pour Honor serait de publier les données thermiques détaillées et d'annoncer des collaborations industrielles pour valider le Lightning en conditions de production réelle, seul terrain qui transforme un record sportif en argument commercial.

HumanoïdesOpinion
1 source
Xiaosai : un constructeur automobile chinois dévoile un robot humanoïde pour l'inspection et la production
76Interesting Engineering 

Xiaosai : un constructeur automobile chinois dévoile un robot humanoïde pour l'inspection et la production

Seres, constructeur automobile chinois connu pour ses SUV électriques sous la marque AITO, a présenté son premier robot humanoïde, baptisé Xiaosai. L'annonce a été faite par Kang Bo, directeur et vice-président du groupe, via une vidéo officielle. Le robot embarque des capacités de reconnaissance visuelle, d'accueil autonome de visiteurs et d'interaction vocale. L'usine Seres intègre déjà deux variantes spécialisées : Xiaosai 01, chargé de l'inspection qualité pour l'assemblage de châssis, et Xiaosai 02, dédié au contrôle de la configuration extérieure des véhicules finis. L'installation est coordonnée par un hub intelligent gérant plus de 1 600 dispositifs connectés, avec plus de 3 000 robots industriels opérant en synchronisation dans un écosystème combinant IoT, big data, jumeaux numériques, 5G et IA. Plusieurs autres robots d'intelligence incarnée sont annoncés pour le second semestre 2025. L'entrée de Seres dans la robotique humanoïde illustre une tendance structurelle : les constructeurs automobiles chinois mobilisent leur maîtrise de la fabrication de masse, des chaînes d'approvisionnement et de l'automatisation pour s'imposer sur le marché de l'IA incarnée. Le déploiement des variantes Xiaosai 01 et 02 en production réelle, et non en phase pilote, constitue un signal du passage du stade démonstrateur à celui de l'intégration opérationnelle. Cela dit, les données techniques du robot humanoïde généraliste restent absentes du communiqué : aucun chiffre de charge utile, de degrés de liberté ou de temps de cycle n'est fourni, ce qui invite à nuancer le niveau de maturité réel du système. La communication de Seres mélange robots spécialisés déjà en service et humanoïde généraliste encore en développement, sans toujours distinguer clairement les deux catégories. Ce virage s'appuie sur un partenariat signé en octobre 2024 avec Volcengine, filiale de ByteDance, portant sur les systèmes de décision, le contrôle de robots et la collaboration homme-machine en mode cloud-edge multimodal. Seres n'est pas seul dans cette course : Xpeng a récemment placé son PDG He Xiaopeng à la tête de la division robotique du groupe pour accélérer la commercialisation ; BYD confirme développer des humanoïdes et envisage leur distribution via son réseau de concessionnaires ; Aimoga, soutenu par Chery, commercialise déjà un humanoïde grand public à 285 800 yuans (environ 42 260 dollars). À l'international, Hyundai a annoncé le déploiement de plus de 25 000 robots Atlas aux États-Unis, visant 30 000 unités annuelles d'ici 2028 avec des composants fabriqués localement. La robotique humanoïde s'impose comme le prochain terrain de compétition des constructeurs automobiles, transformant des industriels établis en nouveaux entrants sur un marché encore en formation.

UELa montée en puissance des constructeurs automobiles chinois (Seres, BYD, Xpeng) dans la robotique humanoïde industrielle intensifie la pression concurrentielle sur les acteurs européens de l'automatisation, sans impact direct immédiat sur le marché français ou une réglementation UE.

Chine/AsieOpinion
1 source
OmniRetarget : génération de données préservant les interactions pour la loco-manipulation corps entier des humanoïdes
77arXiv cs.RO 

OmniRetarget : génération de données préservant les interactions pour la loco-manipulation corps entier des humanoïdes

OmniRetarget est un pipeline de génération de données pour l'apprentissage par renforcement (RL) sur robots humanoïdes, présenté dans un préprint arXiv (2509.26633, v3). Face au problème du retargeting, qui consiste à convertir des captures de mouvement humain en références cinématiques exploitables par un robot, les méthodes existantes produisent des artefacts physiquement incohérents comme le glissement des pieds (foot-skating) ou la pénétration de surfaces, et ignorent les interactions humain-objet et humain-environnement. OmniRetarget introduit un "interaction mesh", un maillage intermédiaire qui modélise et préserve explicitement les relations spatiales et de contact entre l'agent, le terrain et les objets manipulés, via une minimisation par déformation laplacienne sous contraintes cinématiques. Évalué sur les datasets OMOMO, LAFAN1 et des données MoCap propriétaires, il génère plus de 8 heures de trajectoires de meilleure qualité que les baselines de référence. Appliqué au robot humanoïde Unitree G1, il permet d'exécuter des tâches de parkour et de loco-manipulation sur des horizons allant jusqu'à 30 secondes, entraîné avec seulement 5 termes de récompense et sans curriculum d'apprentissage. L'intérêt pour les chercheurs et intégrateurs réside dans deux apports combinés : la qualité cinématique améliorée réduit le sim-to-real gap, tandis que la préservation des interactions permet d'augmenter une démonstration unique vers différentes morphologies de robots, terrains et configurations d'objets, multipliant l'efficacité de la donnée. Plus significatif encore, l'obtention de comportements de loco-manipulation longs et complexes avec seulement 5 termes de récompense partagés entre toutes les tâches contredit l'hypothèse sectorielle selon laquelle ce type de compétences exige un reward engineering élaboré ou un curriculum progressif. Le paradigme dominant pour l'apprentissage humanoïde repose sur le retargeting MoCap vers des références RL, aux côtés de la télé-opération et de l'imitation directe. Le Unitree G1, produit par le fabricant chinois Unitree Robotics, s'est imposé comme plateforme académique de facto dans ce domaine, face à l'Atlas de Boston Dynamics, aux humanoïdes de Figure AI et d'Agility Robotics. OmniRetarget reste à ce stade une contribution de recherche sans annonce de déploiement industriel ; sa robustesse dans des environnements non structurés, où la géométrie de contact est imprévisible, reste à démontrer hors laboratoire.

RecherchePaper
1 source
Genesis AI lance Eno, son robot polyvalent
78Robotics Business Review 

Genesis AI lance Eno, son robot polyvalent

Genesis AI a dévoilé le 16 juin 2026 Eno, son robot à usage général, accompagné de GENE, le modèle de fondation développé en interne pour piloter le système. Contrairement aux approches humanoïdes bipedaleset bipèdes dominantes dans le secteur, Eno repose sur une base roulante surmontée d'une colonne articulée dont la hauteur est ajustable en temps réel, permettant au robot de se replier pour le stockage ou d'étendre sa portée selon la tâche. Ses bras sont équipés de mains propriétaires à cinq doigts conçues pour manipuler des outils et objets calibrés pour des utilisateurs humains. Le robot intègre en option un écran affichant en temps réel l'état cognitif du système, c'est-à-dire les intentions et raisonnements en cours, un choix de design rare dans l'industrie. La société, basée à San Carlos en Californie et financée à hauteur de 105 millions de dollars en seed en 2025, prévoit de lancer la production et les premiers déploiements clients d'ici fin 2026, en ciblant en priorité les secteurs industriels (manufacturing, logistique, laboratoires), avant d'adresser l'hôtellerie, les hôpitaux, puis le grand public. L'annonce est notable non pas tant pour les performances revendiquées que pour le positionnement architectural choisi. En optant pour une base mobile sur roues plutôt que la locomotion bipedaleet bipède, Genesis AI fait le pari de la fiabilité opérationnelle sur des sols industriels plats plutôt que de la polyvalence locomotrice, ce qui réduit la complexité mécanique et le risque de chute tout en simplifiant l'intégration en entrepôt et en laboratoire. La transparence cognitive via l'écran intégré est un signal adressé aux opérateurs et intégrateurs, chez qui la confiance dans les décisions autonomes du robot reste un frein réel au déploiement. GENE est présenté comme un système capable de gérer des tâches longues et séquentielles en raisonnant sur le contexte, sans se limiter à des commandes isolées, ce qui correspond à la catégorie des VLA (Vision-Language-Action models) appliqués à la manipulation. Les affirmations de "précision au millimètre" et de "manipulation au niveau humain" restent à valider indépendamment : aucune métrique de benchmark externe n'est citée dans l'annonce. Genesis AI arrive sur un marché déjà très occupé. Figure AI (Figure 03), Physical Intelligence (Pi-0), Boston Dynamics (Atlas), Agility Robotics (Digit) et Tesla (Optimus Gen 3) sont déjà en phase de déploiement pilote ou de production limitée. Nvidia pousse GR00T N2 comme socle commun pour les VLA humanoïdes. Dans ce contexte, Eno se distingue par son format non humanoïde et son interface de transparence, deux paris qui tranchent avec la convergence du secteur vers le robot bipède anthropomorphe. La co-conception corps-cerveau revendiquée par Genesis, où le hardware et le modèle GENE auraient été développés conjointement dès l'origine, reste une tendance lourde que l'on retrouve chez 1X Technologies ou Apptronik. Les prochaines étapes annoncées restent vagues : "déploiements ciblés" fin 2026 sans noms de clients ni volumes. L'annonce est pour l'instant une présentation publique de concept, pas un produit en livraison.

IA physiqueOpinion
1 source
FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle
79arXiv cs.RO 

FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle

Des chercheurs ont publié FARM (Find Anything using Relational Spatial Memory), un système de mémoire spatiale pour robots capable de localiser des objets en temps réel via des requêtes en langage naturel exprimant des relations contextuelles, du type "la grande lampe sous la cible de fléchettes et à gauche de l'affiche". Le système construit une carte sémantique compacte à 5-10 Hz intégrant géométrie, descripteurs visuels-linguistiques et indices de point de vue. Évalué sur 44 000 requêtes couvrant 67 scènes intérieures et extérieures de 15 à 15 000 m², FARM améliore le Recall@5 de 164 % et le Recall@10 de 224 % par rapport aux méthodes existantes. Une étape de réordonnancement par VLM améliore encore l'Accuracy@1 de 35 %. Le système tourne en temps réel et a été validé en boucle fermée sur un robot quadrupède fonctionnant uniquement avec capteurs et calcul embarqués. L'enjeu dépasse la simple localisation d'objet: dans des entrepôts, habitations ou espaces industriels, un robot doit résoudre des ambiguïtés entre objets similaires via des relations contextuelles, ce que les mémoires de niveau objet seul ne permettent pas. FARM structure explicitement les contraintes spatiales par des prédicats relationnels plutôt qu'en les laissant implicites dans un raisonnement end-to-end sur des historiques de frames. Pour les intégrateurs et décideurs B2B, c'est une brique critique: les robots de service, de picking ou de logistique doivent être pilotables par instruction verbale sans expertise technique. Les gains à +224 % sur Recall@10 sont significatifs, bien que les conditions précises de benchmark, scènes contrôlées ou environnements non-stagés, ne soient pas détaillées dans la publication. Ce travail se situe à l'intersection de la cartographie sémantique 3D (systèmes type ConceptFusion ou OpenScene), des graphes de scène neuronaux et des VLM multimodaux. La combinaison mémoire open-vocabulary et prédicats relationnels explicites distingue FARM des approches end-to-end qui saturent dans les scènes denses. Sur le plan concurrentiel, des acteurs comme Boston Dynamics, Unitree et des laboratoires tels que Stanford ou CMU explorent des approches similaires pour la navigation sémantique. En Europe, des projets de robots de service ou d'assistance, dont des initiatives françaises liées à l'ANR ou des spin-offs comme Enchanted Tools travaillant sur l'interaction homme-robot, pourraient directement intégrer ce type de composant. La prochaine étape décisive sera de valider FARM dans des environnements dynamiques où les objets se déplacent et les relations spatiales évoluent en continu.

UEDes projets européens de robotique de service et des acteurs comme Enchanted Tools pourraient intégrer FARM comme brique de perception sémantique, mais aucun déploiement direct en France/UE n'est confirmé à ce stade.

💬 Ce qui m'accroche, c'est pas les chiffres, c'est que le robot comprend "la lampe sous la cible de fléchettes". C'est exactement ce qui plantait tous les systèmes de mémoire objet précédents, ils encodaient les objets mais pas les relations spatiales entre eux, et c'est pourtant ce qu'on exprime naturellement quand on parle à un robot. Les +224% sur les benchmarks sont solides, bon, reste à voir si ça tient dans une vraie usine où les objets bougent en permanence.

IA physiqueOpinion
1 source
VENOM : réseau polyvalent de suivi de mouvement pour toutes morphologies corporelles
80arXiv cs.RO 

VENOM : réseau polyvalent de suivi de mouvement pour toutes morphologies corporelles

Des chercheurs ont publié sur arXiv (référence 2606.16696) VENOM, un modèle de suivi de mouvement corps entier conçu pour fonctionner sur plusieurs plateformes humanoïdes distinctes sans adaptation spécifique à chaque châssis. L'architecture repose sur un transformeur de type GPT entraîné sur le VENOM dataset, un jeu de données multi-humanoïdes constitué par l'équipe, qui rassemble états, actions et récompenses issus de plusieurs morphologies robotiques. L'originalité principale réside dans l'abandon du découplage classique haut/bas du corps : VENOM produit une politique unifiée qui contrôle simultanément l'ensemble des degrés de liberté. Les évaluations, conduites en simulation, montrent que le modèle surpasse un perceptron multicouche (MLP) entraîné par apprentissage supervisé sur les mêmes données et qu'il égale les performances d'experts formés par renforcement asymétrique acteur-critique, sans jamais avoir eu accès aux signaux de récompense pendant l'entraînement. L'enjeu est structurant pour la filière humanoïde : la majorité des politiques de suivi de mouvement publiées à ce jour segmentent le corps en sous-problèmes distincts, ce qui complique le transfert entre robots aux cinématiques différentes. Une politique cross-embodiment unifiée réduit le coût d'adaptation lorsqu'un intégrateur doit passer d'un châssis à un autre, ou lorsqu'un constructeur révise sa plateforme mécanique. Plus significatif encore, VENOM démontre qu'une architecture de type language model peut absorber la diversité des morphologies sans supervision par récompense explicite, simplifiant ainsi le pipeline d'entraînement. Il faut néanmoins souligner que toutes les expériences restent confinées à la simulation : l'écart sim-to-real n'est pas abordé, et les métriques annoncées ne valident pas encore un comportement physique sur robot réel. Ce travail s'inscrit dans un courant actif qui cherche à généraliser les politiques de contrôle au-delà d'un seul robot, dans la lignée de travaux comme Universal Humanoid Controller ou ExBody. Sur le front industriel, les grands déploiements humanoïdes actuels (Boston Dynamics Atlas, Agility Robotics Digit, Figure 02, Unitree H1) imposent chacun leurs propres pipelines de contrôle propriétaires, ce qui rend le problème du cross-embodiment économiquement pertinent pour tout intégrateur multi-plateforme. VENOM est un preprint non encore évalué par les pairs, le terme "letter" employé dans le texte suggérant une soumission vers une revue IEEE telle que RA-L ; la suite logique serait une validation sur au moins deux plateformes physiques pour établir la robustesse du transfert sim-to-real.

RecherchePaper
1 source
Le robot humanoïde Pemba vise le sommet de l'Everest après une ascension historique à 6 191 m
81Interesting Engineering 

Le robot humanoïde Pemba vise le sommet de l'Everest après une ascension historique à 6 191 m

Le 5 juin 2026, un robot humanoïde Unitree G1 baptisé Pemba a atteint une altitude de 6 193 mètres (20 312 pieds) sur le mont Chimborazo en Équateur, dans le cadre d'une expédition menée par Geologic Dome et sponsorisée par Eastworlds Labs, l'initiative robotique d'intelligence artificielle de Virtuals Protocol. Le robot pèse 35 kg et se compacte à 690 mm, ce qui a permis à l'équipe de le démonter et de le transporter entre les camps avant de le réassembler à chaque étape. Pour résister aux conditions extrêmes du Chimborazo, températures descendant à -15 °C et rafales atteignant 90 km/h, Pemba a été équipé de vestes thermiques sur mesure, d'enceintes grillagées et de pieds composites. Son système d'autonomie a été entraîné dans NVIDIA Isaac Sim à 1 620 fois la vitesse réelle, avec un taux de transfert sim-to-réel de 85 % sur terrain accidenté déclaré par Eastworlds Labs. Les communications étaient assurées par un réseau maillé propriétaire entre les camps, avec une connexion satellite affichant une latence de 25 ms, sous le seuil de 50 ms requis pour la télé-opération en direct via le logiciel Reflex. Cette mission sur le Chimborazo est présentée comme un test préliminaire avant une expédition planifiée sur l'Everest à l'automne 2026, avec une collaboration documentaire confirmée avec l'équipe de production derrière le documentaire Netflix "14 Peaks: Nothing Is Impossible". Ces résultats, présentés dans un communiqué de presse soigneusement mis en scène, méritent d'être lus avec prudence : le taux de transfert sim-to-réel de 85 % reste un chiffre auto-déclaré, sans peer review ni protocole de test publié. Cela dit, parvenir à faire fonctionner un humanoïde en autonomie partielle à plus de 6 000 mètres d'altitude, dans des conditions de froid et de vent sévères, constitue un test de robustesse matérielle et logicielle non trivial. L'enjeu industriel réel dépasse la performance sportive : il s'agit de valider que des plateformes humanoïdes de taille commerciale (le G1 est vendu autour de 16 000 dollars) peuvent être déployées dans des environnements non structurés et extrêmes, sans infrastructure dédiée. Pour les intégrateurs et les décideurs B2B opérant dans des secteurs comme l'énergie en zone isolée, la surveillance environnementale ou l'intervention d'urgence, c'est une preuve de concept pertinente, même partielle. Geologic Dome est une organisation de conservation qui construit des infrastructures autonomes pour les zones protégées : relais de communication, monitoring écologique par IA, plateformes robotiques indépendantes en énergie. L'expédition Chimborazo s'inscrit dans un programme plus large incluant trois sites d'expérimentation : forêt équatoriale en République démocratique du Congo, forêts de nuages en Équateur et le gradient altitudinal complet de l'Himalaya au Népal. Le Unitree G1 utilisé pour l'Everest sera donné à la communauté sherpa locale, une décision de positionnement symbolique autant que logistique. Aucun concurrent direct n'est explicitement cité dans cette expédition, mais le choix du G1 plutôt que de plateformes comme le Boston Dynamics Spot ou l'Atlas illustre la montée en maturité des humanoïdes bon marché face aux quadrupèdes établis pour les missions de terrain. La prochaine étape attendue est la confirmation de la date et du parcours de l'expédition Everest, ainsi que la publication de données techniques sur les performances autonomes en conditions réelles.

HumanoïdesOpinion
1 source
GAIT : estimation proprioceptive de l'état d'un robot à pattes par attention sur tokens inertiels
82arXiv cs.RO 

GAIT : estimation proprioceptive de l'état d'un robot à pattes par attention sur tokens inertiels

Une équipe de chercheurs a publié sur arXiv (2606.14160) une nouvelle méthode d'estimation d'état proprioceptive pour robots à pattes, baptisée GAIT. L'approche repose sur une tokenisation inertielle-jambe (Inertial-Leg, IL) couplée à un réseau d'attention : plutôt que de concaténer l'ensemble des données capteurs en un seul vecteur plat, l'architecture représente les mesures inertielles et les mesures par jambe comme des tokens distincts, puis utilise un mécanisme d'attention pour pondérer dynamiquement chaque source selon les conditions de contact courantes. La méthode a été validée sur un robot quadrupède Unitree Go1, sur des terrains encombrés de débris absents de la simulation d'entraînement, et sur des allures (gait patterns) non présentées lors de l'apprentissage. L'enjeu de GAIT est de résoudre un problème central des estimateurs à pattes : la fiabilité des mesures de cinématique directe dépend du contact effectif du pied avec le sol. Les estimateurs classiques "contact-aided" contournent ce problème via un module de détection de contact explicite et l'hypothèse d'un appui stationnaire, ce qui les rend fragiles sur terrains irréguliers ou lors de transitions d'allure. GAIT apprend ce comportement de repondération directement depuis les données, sans estimateur de contact dédié, éliminant une source d'erreur en cascade. Les résultats montrent une supériorité sur les estimateurs d'apprentissage existants pour des allures non vues, ainsi qu'une amélioration par rapport aux méthodes modèles contact-aided, confirmant que les architectures à attention peuvent réduire le gap sim-to-real sur l'estimation proprioceptive bas-niveau. L'estimation d'état proprioceptive reste un défi persistant en robotique à pattes : les filtres de Kalman étendu (EKF) et variantes invariantes dominent en production chez Boston Dynamics et Unitree, mais peinent sur terrains non structurés. Les approches d'apprentissage antérieures traitaient généralement les capteurs comme un vecteur plat homogène, sans différenciation structurelle entre inertielles et cinématiques. GAIT s'inscrit dans la tendance 2024-2026 d'appliquer des mécanismes d'attention aux données robotiques bas-niveau, une direction convergente avec les architectures VLA (Vision-Language-Action) pour la commande motrice. Le code n'est pas encore publié ; la prochaine étape naturelle serait une validation sur plateformes bipèdes telles que l'Unitree H1 ou le Boston Dynamics Atlas, où la phase de vol rend l'estimation d'état encore plus critique.

RecherchePaper
1 source
X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques
83arXiv cs.RO 

X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques

Publié sur arXiv (2603.03733) en 2025, X-Loco est un framework d'entraînement d'une politique de locomotion généraliste basée sur la vision pour robots humanoïdes. L'approche repose sur une distillation synergétique : plusieurs politiques expertes sont entraînées séparément pour des compétences distinctes - locomotion bipède stable, récupération après chute, coordination corps entier, franchissement de terrains variés - puis une politique unique guidée par entrée visuelle est distillée à partir de ces experts via un mécanisme de sélection adaptative au cas par cas. X-Loco opère uniquement sur des commandes de vitesse, sans recours à des mouvements de référence issus de captures de mouvement. Les auteurs revendiquent une première dans l'intégration simultanée de toutes ces compétences dans une seule politique vision - affirmation à prendre avec les précautions d'usage pour un preprint non encore évalué par les pairs. Ce travail s'attaque à un verrou technique central : entraîner une politique unique qui maîtrise des comportements aux dynamiques radicalement différentes et aux objectifs de contrôle parfois contradictoires. Une telle politique simplifie le déploiement opérationnel en éliminant les modules de commutation entre comportements. L'absence de dépendance aux données de mocap rend également le pipeline d'entraînement plus scalable, puisqu'il ne requiert pas de bibliothèques de mouvements spécifiques à chaque compétence cible. Les études d'ablation incluses renforcent la crédibilité des choix architecturaux, mais les résultats restent cantonnés à la simulation et au laboratoire, sans validation sur hardware réel à grande échelle. X-Loco s'inscrit dans une dynamique de recherche intense sur la locomotion humanoïde, portée par des équipes comme Berkeley Humanoid, CMU et les labos gravitant autour d'Unitree. La distillation enseignant-étudiant est un paradigme établi en apprentissage par renforcement, mais son application à un spectre aussi large de compétences reste un défi ouvert. Côté commercialisation, Tesla (Optimus Gen 2), Figure AI, Boston Dynamics (Atlas) et 1X Technologies travaillent sur des problèmes similaires avec des ressources bien supérieures. La suite logique pour X-Loco serait une validation sim-to-real convaincante sur hardware physique, étape non encore franchie selon le papier.

RecherchePaper
1 source
YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle
84arXiv cs.RO 

YUBI : interface bidigitale universelle pour la manipulation dextérique bimanuelle à grande échelle

Des chercheurs ont publié le 10 juin 2026 YUBI (Yielding Universal Bidigital Interface), un préhenseur bi-digital conçu pour la collecte de données bimanuelle dextère à grande échelle. Contrairement aux systèmes pistol-grip comme l'UMI (Universal Manipulation Interface), YUBI adopte un principe d'actionnement dit "yielding" : les mouvements des doigts de l'opérateur sont transcrits directement en mouvement des mâchoires du préhenseur, sans intermédiaire mécanique rigide. Le système intègre un tracking 6 DOF basé sur la réalité virtuelle pour une acquisition de trajectoires haute fidélité. L'équipe a constitué un dataset d'une ampleur inédite dans la littérature : 8 434 heures de démonstrations, 1,20 million d'épisodes répartis sur 119 tâches. Un politique unique entraîné sur ce corpus a été validée sur trois plateformes robotiques bimanuelle distinctes : UR, Franka et ELEY, via simple montage du préhenseur. Ce résultat a une portée directe pour quiconque travaille sur les fondation models robotiques : le bottleneck historique n'est plus le modèle mais la donnée, et YUBI apporte une réponse concrète sur la scalabilité de la collecte. Le fait qu'une seule politique transfère sur trois robots hétérogènes confirme que l'interface impose une représentation suffisamment générique pour servir de supervision directe, sans fine-tuning plateforme-spécifique. C'est un argument fort en faveur de l'approche "data-centric" face aux pipelines sim-to-real, souvent coûteux à valider en conditions industrielles. L'ergonomie améliorée réduit aussi la fatigue opérateur sur les tâches fines, un point non-trivial pour des sessions de collecte longues et répétitives que les démonstrateurs UMI rendaient problématiques. L'UMI, développé à l'Université de Columbia et largement adopté pour sa simplicité et son coût, reste la référence low-cost pour la collecte de données manipulation, mais son grip pistolet montrait ses limites sur les tâches bimanuelle complexes. YUBI s'inscrit dans un mouvement plus large visant à démocratiser la collecte de données pour les robot foundation models, en parallèle d'initiatives comme ACT, Diffusion Policy ou les efforts open-data de Physical Intelligence (Pi-0). L'ensemble du stack est publié en open source : hardware du préhenseur, logiciel de collecte, et dataset complet, ce qui représente une contribution substantielle pour les laboratoires ne disposant pas des moyens de Unitree, Figure AI ou Boston Dynamics pour constituer leurs propres corpus propriétaires. Les prochaines étapes probables incluent l'extension du dataset et l'intégration avec des architectures VLA plus récentes.

UELes laboratoires européens (INRIA, CEA-List, universités) et PME robotiques peuvent directement exploiter le dataset open-source YUBI (8 434 h, 1,2M épisodes) et l'interface hardware pour entraîner des politiques de manipulation sans constituer de corpus propriétaire, avec validation native sur Franka (allemand) et UR (danois).

RechercheOpinion
1 source
NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur
85Interesting Engineering 

NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur

NVIDIA et le groupe sud-coréen LG ont annoncé lors du Computex 2026 un partenariat stratégique multisectoriel visant à construire un écosystème d'intelligence artificielle physique couvrant la robotique industrielle, les robots domestiques, la mobilité autonome et les infrastructures de calcul. La collaboration mobilise plusieurs entités du conglomérat LG : LG Electronics, LG CNS, LG Innotek, LG Uplus et LG Energy Solution, chacune apportant un périmètre spécifique. Concrètement, LG prévoit de déployer NVIDIA Isaac Sim et Isaac Lab dans ses workflows robotique pour entraîner ses robots domestiques en environnements virtuels avant tout déploiement physique, et d'explorer le modèle de fondation GR00T pour renforcer leurs capacités de raisonnement. LG Electronics construit par ailleurs ce qu'il appelle une "data factory pour l'IA physique", utilisant les world models NVIDIA Cosmos pour générer des datasets synthétiques destinés à la robotique et à l'automatisation industrielle. Sur le volet infrastructure, LG Uplus s'engage à construire des centres de données à grande échelle compatibles avec les dernières générations de GPU NVIDIA, LG Electronics travaillera sur des technologies de refroidissement liquide alignées avec la plateforme NVIDIA DSX, et LG Energy Solution évalue des architectures d'alimentation en courant continu 800 volts pour les installations nouvelle génération. L'intérêt de ce partenariat pour les décideurs industriels tient moins à l'annonce elle-même qu'à ce qu'elle révèle sur la maturité du cycle de développement robotique. L'adoption d'Isaac Sim comme environnement d'entraînement primaire signale que le sim-to-real gap, longtemps le principal obstacle au déploiement à grande échelle, est considéré comme suffisamment maîtrisé pour structurer une chaîne industrielle dessus. La création d'une data factory synthétique répond à l'un des goulots d'étranglement les plus critiques du secteur : la rareté des données labellisées de qualité pour entraîner des VLA (Vision-Language-Action models). Pour les intégrateurs et les COO industriels, le message est que les outils de simulation et les modèles de fondation convergent vers une stack unifiée, ce qui devrait réduire les coûts et délais de portage de nouvelles applications robotiques. Il convient toutefois de noter que l'annonce reste au stade de la feuille de route : aucun chiffre de déploiement, aucun timeline de livraison ni prix n'ont été communiqués. Le contexte de ce rapprochement est celui d'une course mondiale à l'IA physique dans laquelle NVIDIA cherche à s'imposer comme couche d'infrastructure universelle face à des concurrents comme Boston Dynamics Atlas (désormais intégré chez Hyundai), Figure AI avec son modèle Helix, ou encore Physical Intelligence (pi-0) côté recherche. LG, de son côté, investit depuis plusieurs années dans la robotique de service avec ses robots CLOi, sans avoir encore atteint une adoption commerciale significative. Le groupe fait aussi face à la pression de concurrents coréens comme Samsung, qui développe ses propres robots domestiques avec Ballie. Les prochaines étapes annoncées incluent l'intégration des technologies NVIDIA DRIVE dans les systèmes ADAS de LG Electronics pour les véhicules définis par logiciel, et le déploiement de la plateforme d'automatisation industrielle de LG CNS enrichie de briques NVIDIA. La concrétisation de ces engagements sur les 12 à 24 prochains mois sera le véritable indicateur de la profondeur du partenariat.

UECe partenariat accélère la convergence vers une stack NVIDIA (Isaac Sim, GR00T, Cosmos) comme infrastructure d'entraînement robotique de référence, forçant les intégrateurs et OEM européens à évaluer leur alignement avec cet écosystème dans leurs roadmaps 2026-2027.

💬 Le truc intéressant, c'est pas le deal NVIDIA-LG, c'est ce qu'il révèle : le sim-to-real gap est maintenant considéré comme suffisamment sous contrôle pour construire une filière industrielle dessus. Isaac Sim comme environnement d'entraînement primaire dans une data factory à l'échelle d'un conglomérat coréen, ça signale un vrai changement de maturité, pas juste un POC de plus. Sur le papier, du moins, parce qu'aucun chiffre ni calendrier n'a filtré.

IA physiqueOpinion
1 source
Récupération après chute sur terrains variés par apprentissage à phases et terrains découplés
86arXiv cs.RO 

Récupération après chute sur terrains variés par apprentissage à phases et terrains découplés

Des chercheurs proposent une méthode de récupération après chute pour robots humanoïdes sur terrains variés, publiée en juin 2026 sur arXiv (identifiant 2606.08922). Baptisée PTDL (Phase-Terrain Decoupled Learning), elle cible un problème concret : un humanoïde tombé sur du gravier, une pente ou un sol inégal doit non seulement se relever, mais reprendre immédiatement une marche dirigée par commande de vitesse, sans capteurs externes ni étiquettes de terrain fournies au moment de l'exécution. La validation porte sur le Unitree G1, humanoïde commercial de 29 degrés de liberté, testé en simulation et sur robot réel, sur sol plat, gravier et inclinaisons allant jusqu'à 20 degrés. L'architecture de PTDL repose sur une double décorrélation. Sur l'axe des phases, des discriminateurs de mouvement à double prior conditionnés par la gravité projetée lient la récupération post-chute à la reprise de locomotion normale. Sur l'axe des terrains, un façonnage de récompense stratifié par surface applique des supervisions d'entraînement spécifiques à chaque sol, labels qui sont ensuite retirés à la politique au déploiement : le robot développe des comportements de lever implicitement adaptés à chaque surface, sans qu'on lui indique sur quoi il repose. Les méthodes antérieures s'arrêtaient généralement au lever quasi-statique ou entraînaient une politique de compromis dégradée face à la diversité des terrains. PTDL enchaîne récupération et reprise de marche sous une seule politique proprioceptive unifiée, ce qui est directement pertinent pour tout déploiement en environnement industriel non structuré où la chute n'est pas une exception mais une probabilité réelle. Le G1 de Unitree Robotics (Shenzhen) est devenu en 2024-2025 une plateforme de référence pour la recherche en locomotion humanoïde, notamment grâce à son accessibilité tarifaire (environ 16 000 USD). La récupération après chute reste un angle mort notoire dans la course humanoïde actuelle : Figure AI (Figure 03), Boston Dynamics (Atlas), Agility Robotics (Digit) et Tesla (Optimus) se concentrent principalement sur les démonstrations de marche et de manipulation, peu sur les protocoles de résilience post-chute. Ce preprint arXiv n'annonce pas de déploiement industriel immédiat et n'a pas encore subi de révision par les pairs, mais il ouvre une piste méthodologique solide : entraîner sur des terrains stratifiés tout en maintenant une politique unifiée à l'inférence, une approche transposable à d'autres défis de robustesse en conditions réelles.

RecherchePaper
1 source
Mind Your Steps : un cadre d'apprentissage général pour le suivi précis des appuis de pas chez les robots humanoïdes
87arXiv cs.RO 

Mind Your Steps : un cadre d'apprentissage général pour le suivi précis des appuis de pas chez les robots humanoïdes

Des chercheurs ont déposé le 9 juin 2026 sur arXiv (réf. 2606.08253) un framework léger pour entraîner des politiques de locomotion humanoïde capables de suivre précisément des appuis en 3D. Les approches dominantes basées sur l'apprentissage par renforcement avec commande de vitesse produisent des humanoïdes robustes, mais sans contrôle explicite du placement des pas : le robot peut marcher sur un pied humain ou rater un appui précis, compromettant les tâches de manipulation en aval. La méthode proposée introduit un "goal sampler" dynamique qui génère des séquences d'appuis variées pendant l'entraînement, rendant la politique agnostique au terrain. Une nouvelle représentation des cibles de pas compense les imprécisions du monde réel (estimation de pose bruitée, détection de contact peu fiable). La politique fonctionne comme un contrôleur bas niveau autonome, couplable à n'importe quel planificateur haut niveau, qu'il soit basé sur des cartes 2.5D, la vision ou un agent VLA. L'intérêt pour les intégrateurs industriels est concret : la précision du placement des appuis conditionne l'ensemble des tâches loco-manipulation, soit la prochaine étape critique avant le déploiement d'humanoïdes dans les entrepôts et lignes de montage. En découplant le contrôleur bas niveau du planificateur, cette architecture permet de substituer l'algorithme de planification sans réentraîner la locomotion, un argument de modularité fort pour des déploiements multi-environnements. Les expériences en simulation et en transfert sim-to-real sur terrains complexes sont présentées comme concluantes, mais ce preprint non encore évalué par les pairs ne fournit pas de benchmark comparatif public ni de métriques de précision standardisées. Ce framework s'inscrit dans la continuité des travaux sur la locomotion bipède précise issus d'ETH Zurich, du MIT et de CMU, que les équipes commerciales (Boston Dynamics Atlas, Agility Robotics Digit, Unitree H1, Figure AI) cherchent à industrialiser. L'abstract ne précise pas la plateforme matérielle utilisée lors des tests réels, ce qui limite la reproductibilité des résultats. La prochaine étape logique serait une évaluation ouverte sur des robots nommément identifiés, assortie de métriques comparables aux approches concurrentes en planification de pas développées à l'EPFL ou à Carnegie Mellon.

UEL'EPFL est citée comme référence concurrente pour la planification de pas, ce qui signale la compétitivité des labos européens dans ce domaine, mais sans impact direct sur des acteurs ou institutions français.

HumanoïdesPaper
1 source
OASIS : de la collecte de données en simulation à la loco-manipulation humanoïde en conditions réelles
88arXiv cs.RO 

OASIS : de la collecte de données en simulation à la loco-manipulation humanoïde en conditions réelles

Une équipe de chercheurs publie sur arXiv (juin 2026) le framework OASIS, une approche pour entraîner des robots humanoïdes à des tâches de loco-manipulation, combinaison de locomotion et de manipulation d'objets, en s'appuyant exclusivement sur des données de simulation. Le système reconstruit automatiquement des assets 3D réalistes à partir d'images du monde réel via un modèle génératif, puis collecte des trajectoires par télé-opération dans ce simulateur. Ces trajectoires sont ensuite augmentées par randomisation de domaine : variations d'éclairage, de textures et de configuration environnementale. Une politique visuomotrice hiérarchique, entraînée sur ces données simulées, est déployée en zero-shot sur un robot humanoïde physique, sans fine-tuning sur données réelles. Les résultats publiés indiquent que cette politique dépasse, sur la majorité des tâches testées, les performances d'une politique entraînée sur des données de télé-opération réelle. Ce résultat, à prendre avec prudence, le preprint n'étant pas encore soumis à peer review, va à contre-courant d'une hypothèse largement répandue : que la qualité des données terrain serait irremplaçable pour la manipulation fine. Le principal facteur explicatif avancé par les auteurs est la couverture plus large des variations d'éclairage et d'environnement dans le rendu simulé, que la collecte physique peine à égaler à grande échelle. Si le résultat se confirme, il soulage considérablement le goulot d'étranglement de la collecte terrain, qui implique aujourd'hui des resets manuels coûteux et une infrastructure dédiée par tâche. La loco-manipulation reste l'un des défis les plus complexes en robotique humanoïde, car elle exige une coordination simultanée du contrôle de marche et de la manipulation d'objets. Des plateformes comme Figure 03, l'Optimus Gen 3 de Tesla ou l'Atlas de Boston Dynamics cherchent des solutions via des approches diverses : imitation learning sur données réelles (pi-0 de Physical Intelligence), politiques VLA (GR00T N2 de Nvidia) ou RL massivement simulé (Unitree). OASIS positionne la simulation augmentée comme alternative crédible à la télé-opération physique, ce qui pourrait accélérer le bootstrapping de nouvelles tâches sans mobiliser de cellules robotiques dédiées. Les prochaines étapes attendues sont une évaluation sur un spectre plus large de tâches industrielles et une soumission à une conférence avec évaluation par les pairs.

RechercheOpinion
1 source
Le robot humanoïde biomimétique pleine taille d'UBTECH dépasse 1 000 précommandes en 3 jours
89Pandaily 

Le robot humanoïde biomimétique pleine taille d'UBTECH dépasse 1 000 précommandes en 3 jours

UBTECH Robotics, coté à Hong Kong et souvent présenté comme "la première action cotée sur le marché des humanoïdes", a lancé en précommande sur JD.com son robot humanoïde biomimétique grand format, enregistrant plus de 1 200 réservations en trois jours. Le robot se décline en deux versions: masculine (183 cm, 42 kg) et féminine (168 cm, 35,2 kg), toutes deux équipées de 88 degrés de liberté (DOF) répartis sur l'ensemble du corps et d'une autonomie batterie de 2 à 4 heures. La précommande requiert un acompte de 3 000 yuans (environ 380 euros), intégralement remboursable avant le 15 juillet. UBTECH n'a pas encore communiqué de prix définitif, mais des analystes sectoriels estiment la fourchette à plusieurs centaines de milliers de yuans, soit le prix d'un véhicule automobile de milieu de gamme en Chine. Les caractéristiques complètes du produit seront dévoilées lors d'un événement de lancement annoncé avant fin juin 2026. Plus de 150 000 internautes rien qu'à Pékin ont visité la page produit dans les trois premiers jours, signe d'un intérêt grand public notable. Sur le plan technique, 88 DOF full-body représente un niveau de granularité cinématique rarement atteint dans un produit à vocation grand public, là où la plupart des humanoïdes industriels actuels tournent entre 30 et 60 DOF. Cela dit, le DOF seul ne dit rien de la qualité des actionneurs, des boucles de contrôle ni de la latence, et UBTECH n'a pas encore publié de données de performance indépendantes. Le positionnement "compagnon émotionnel et assistant domestique", réservé aux utilisateurs adultes, marque un tournant stratégique explicite: après des années centrées sur la robotique éducative et les déploiements B2B, la société mise sur le marché résidentiel, un segment encore sans standard établi. Ce signal de demande (1 200 unités en 72 heures, sans prix final annoncé) intéresse autant les intégrateurs que les décideurs industriels cherchant à calibrer l'appétit réel pour l'humanoïde hors usine. UBTECH existe depuis 2012 et a construit sa notoriété avec Walker X, un humanoïde de démonstration, et des robots pédagogiques déployés dans les écoles chinoises. L'introduction en bourse à Hong Kong lui a conféré une visibilité unique dans un secteur dominé par des startups non cotées. Sur le marché international, les concurrents directs dans la catégorie grand format incluent Figure Robotics (Figure 02), Boston Dynamics (Atlas), Tesla (Optimus Gen 3) et Unitree (H1/G1), tous encore principalement positionnés sur des cas d'usage industriels ou de recherche. En Chine, Fourier Intelligence et Agibot représentent une concurrence locale directe. Les prochaines étapes pour UBTECH passent par la révélation du prix final et les premiers retours sur la tenue réelle des performances biomimétiques annoncées, deux éléments qui conditionneront la crédibilité de ce pivot consommateur.

UESignal de marché indirect : la validation d'une demande consommateur pour l'humanoïde grand public en Chine pourrait accélérer les arbitrages de positionnement des acteurs européens, mais aucun déploiement ni partenariat EU n'est impliqué.

Chine/AsieOpinion
1 source
PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes
90arXiv cs.RO 

PHUMA : un jeu de données pour la locomotion fiable des robots humanoïdes

Une équipe de chercheurs du laboratoire DAVIAN a publié en juin 2026 PHUMA (Physically Reliable HUMAnoid locomotion dataset), un corpus de 73 heures de données de locomotion humanoide produit via un pipeline en deux étapes : une curation physiquement consciente suivie d'un retargeting contraint par des lois physiques. La base de données agrège à la fois des données de motion capture traditionnelles et des vidéos issues d'internet, les deux étant traitées pour éliminer les artefacts physiques récurrents dans les datasets existants, notamment le flottement, la pénétration géométrique et le foot skating. Entraînées sur PHUMA, les politiques de contrôle obtiennent des taux de succès supérieurs à ceux obtenus avec AMASS et Humanoid-X sur les benchmarks de motion tracking standards, et transfèrent en zero-shot vers un Unitree G1 réel. Le code et les données sont disponibles publiquement via davian-robotics.github.io/PHUMA. Le principal verrou que PHUMA prétend lever est la qualité physique des données d'entraînement pour l'imitation de mouvement humanoide. Les approches par imitation sont attractives parce qu'elles permettent d'acquérir des comportements naturels sans reward engineering fastidieux, mais leur efficacité dépend directement de la cohérence physique des données sources. Les artefacts présents dans les datasets basés sur des vidéos internet (comme Humanoid-X) se propagent dans les politiques entraînées, produisant des robots qui glissent ou oscillent de façon instable. La démonstration de transfert zero-shot sur un Unitree G1 physique est le point le plus concret : elle suggère que le filtrage physique en amont réduit effectivement le sim-to-real gap, sans fine-tuning additionnel sur hardware. Reste à qualifier l'ampleur du gain : les métriques de benchmarks internes ne se substituent pas à des comparaisons en conditions réelles standardisées. AMASS, publié en 2019, est resté longtemps la référence en motion capture humanoide, mais sa taille limitée et son coût d'acquisition ont freiné la scalabilité des approches data-driven. Humanoid-X a tenté de combler ce vide en exploitant des vidéos YouTube à grande échelle, au prix d'une dégradation qualitative. PHUMA s'inscrit dans une dynamique plus large où plusieurs équipes cherchent à constituer des datasets de locomotion humanoide à la fois volumineux et physiquement valides, en parallèle des travaux de Figure AI (Figure 03), Boston Dynamics, et des équipes derrière GR00T N2 chez NVIDIA. La prochaine étape logique serait de tester PHUMA sur d'autres plateformes humanoïdes commerciales (H1, Digit) et d'élargir les tâches au-delà de la locomotion simple vers la manipulation en déplacement.

UELe dataset PHUMA étant en accès libre, les équipes de recherche européennes en locomotion humanoïde (INRIA, CEA-List, LAAS-CNRS) peuvent l'intégrer directement dans leurs pipelines d'entraînement sans coût d'acquisition.

RecherchePaper
1 source
Apprentissage de la représentation du contact pour l'odométrie des jambes
91arXiv cs.RO 

Apprentissage de la représentation du contact pour l'odométrie des jambes

Une équipe de chercheurs a publié sur arXiv (référence 2606.05501) une approche d'apprentissage de représentation auto-supervisée pour la détection de contact dans les robots à pattes, visant à améliorer l'odométrie locomotrice sans recourir à des capteurs de force aux extrémités. Le système repose exclusivement sur les encodeurs articulaires standard, présents sur la quasi-totalité des plateformes commerciales existantes. En modélisant les phases d'appui et de vol (stance et swing) de façon probabiliste, le framework permet d'estimer la vitesse du corps principal à partir de la chaîne cinématique des membres, en s'appuyant sur l'hypothèse classique que la vitesse du pied par rapport au monde est nulle en phase d'appui. Les résultats expérimentaux indiquent des performances supérieures aux méthodes supervisées nécessitant des capteurs additionnels et aux approches probabilistes de référence. Le code est publié en open source. L'enjeu est concret : l'odométrie par jambes est une brique fondamentale pour la navigation autonome des robots quadrupèdes et bipèdes, notamment lorsque le GNSS ou la vision sont dégradés. Or, les capteurs de réaction au sol (GRF sensors) alourdissent les pieds, augmentent la complexité mécanique et sont souvent aveugles aux glissements en contact, ce qui produit des dérives d'estimation même lorsque le pied est techniquement "posé". En éliminant cette dépendance sensorielle, cette approche ouvre la voie à un déploiement sur des plateformes à budget contraint, et surtout améliore la robustesse sur surfaces glissantes ou irrégulières, scénario typique des environnements industriels ou d'inspection. La nature auto-supervisée supprime également le coût d'annotation de données, un frein classique dans les pipelines de locomotion. Le problème de la détection fiable de la phase d'appui est étudié depuis l'essor des robots quadrupèdes comme ANYmal (ANYbotics) et Go1/Go2 (Unitree), ainsi que des bipèdes comme Spot (Boston Dynamics) ou Atlas. La majorité des stacks d'odométrie actuels, y compris ceux utilisés dans des frameworks open source comme Legged Gym ou OCS2, conservent une dépendance aux GRF sensors ou à des heuristiques de seuillage. Cette contribution s'inscrit dans une tendance plus large visant à rendre la locomotion avancée accessible sur des plateformes sans instrumentation de pointe, une direction également explorée par des labos européens comme le DLR ou l'INRIA. La prochaine étape naturelle sera la validation sur plusieurs morphologies de robots et dans des conditions de terrain dégradé, un benchmark que les auteurs n'ont pas encore publié.

UEL'approche intéresse directement des équipes comme l'INRIA qui travaillent sur la locomotion avancée, et pourrait être intégrée sans modification matérielle sur des plateformes européennes à budget contraint.

RecherchePaper
1 source
LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif
92arXiv cs.RO 

LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif

Des chercheurs ont publié le 5 juin 2026 sur arXiv (preprint 2606.05873) un système baptisé LadderMan, conçu pour permettre à des robots humanoïdes de grimper des échelles de géométries variées et d'effectuer des tâches de manipulation en position perchée. L'architecture repose sur un pipeline d'apprentissage en deux étapes : une phase de suivi de mouvement hybride extrait plusieurs politiques d'escalade expertes à partir d'une seule motion de référence, puis une phase de distillation fusionne ces experts en une politique visuomotrice unifiée, pilotée par caméra de profondeur, via une combinaison d'imitation et de renforcement. Pour combler l'écart simulation-réel sur la perception de profondeur, l'équipe exploite des modèles de vision fondationnels. La manipulation en hauteur est gérée par une formulation dite "dual-agent" : un agent dédié à la stabilité sur l'échelle, un autre à la manipulation, avec télé-opération comme signal superviseur. Les expériences rapportent un transfert zéro-shot vers le hardware réel, sans fine-tuning supplémentaire. L'escalade d'échelle constitue l'un des tests les plus discriminants pour les humanoïdes : les points d'appui sont rares et fixes, la coordination corps entier est critique, et la moindre erreur de perception ou de contrôle peut provoquer une chute. Le transfert zéro-shot réussi de la simulation au réel est ici le résultat le plus significatif : il suggère que les modèles de vision fondationnels permettent d'atténuer suffisamment le sim-to-real gap sur des tâches perceptivo-motrices contraintes, une hypothèse longtemps débattue dans la communauté. La capacité à manipuler des objets depuis une position instable ouvre des perspectives concrètes pour l'inspection industrielle, la maintenance en hauteur et les chantiers de construction. Il convient cependant de souligner qu'il s'agit d'un preprint de recherche, non d'un produit commercialisé, et que les vidéos publiées sur ladderman-robot.github.io restent sélectionnées par les auteurs. Ce travail s'inscrit dans une vague active de recherche poussant les humanoïdes vers des environnements contraints et à risque élevé. Aucune entreprise commerciale n'est identifiée dans le preprint, ce qui suggère une origine académique. Sur le plan concurrentiel, aucun constructeur humanoïde majeur, ni Boston Dynamics (Atlas), ni Figure (Figure 03), ni Tesla (Optimus Gen 3), ni Agility Robotics (Digit), n'a à ce jour publié de démonstration d'escalade d'échelle à ce niveau de robustesse et de transfert zéro-shot. Les prochaines étapes logiques seraient un test sur une gamme plus large de robots humanoïdes commerciaux et une intégration de la manipulation autonome, sans télé-opération.

RecherchePaper
1 source
BYD développe des robots humanoïdes, selon une source
93TechNode 

BYD développe des robots humanoïdes, selon une source

BYD, le géant chinois des véhicules électriques, développe des robots humanoïdes, selon une source proche du dossier citée mercredi par le média financier chinois Yicai. L'information a été confirmée la même semaine par Li Ke, vice-présidente exécutive du groupe, dans une interview où elle a déclaré explicitement : "BYD travaille également sur les robots humanoïdes." Li Ke n'a fourni ni calendrier ni spécifications techniques, et aucun prototype n'a été présenté publiquement, il s'agit donc d'une annonce de programme, pas d'un produit déployé. L'entrée de BYD dans l'humanoïde illustre une convergence industrielle qui s'accélère en Chine : les constructeurs automobiles disposant de capacités de fabrication à grande échelle, de chaînes d'approvisionnement en batteries et en électronique embarquée, et d'équipes d'IA pour les systèmes ADAS, considèrent désormais la robotique humanoïde comme une extension naturelle de leur savoir-faire. Li Ke a explicitement mentionné que les technologies d'IA automobile et robotique partagent des fondations communes, un argument similaire à celui avancé par Tesla pour justifier son programme Optimus. Si la thèse se vérifie industriellement, BYD disposerait d'un avantage structurel sur les pure-players robotiques en termes de coûts de production et d'intégration verticale. BYD rejoint ainsi un écosystème humanoïde chinois déjà dense, avec Unitree, Fourier Intelligence, Agibot et UBTECH, ainsi que les programmes étatiques liés au plan "Made in China 2025". À l'échelle internationale, la concurrence directe inclut Figure AI (Figure 03), Boston Dynamics (Atlas), Agility Robotics (Digit, déployé chez Amazon) et le programme Optimus de Tesla. Li Ke a évoqué la possibilité d'une plateforme robotique ouverte, développement interne couplé à des partenariats avec d'autres entreprises du secteur, et suggéré que le réseau de concessions BYD pourrait servir de canal de distribution si les humanoïdes atteignent le marché grand public. Les prochaines étapes concrètes (prototypes, pilotes industriels, partenaires) restent non communiquées à ce stade.

UEL'entrée de BYD dans la robotique humanoïde renforce la pression concurrentielle de l'écosystème chinois sur les acteurs européens, mais sans impact direct immédiat sur le marché européen à ce stade.

Chine/AsieActu
1 source
OpenEAI-Platform : une plateforme open source unifiée matériel-logiciel pour l'IA incarnée
94arXiv cs.RO 

OpenEAI-Platform : une plateforme open source unifiée matériel-logiciel pour l'IA incarnée

Des chercheurs ont déposé sur arXiv (2606.03392) OpenEAI-Platform, une plateforme open-source couplant un bras robotique à 6+1 degrés de liberté (DDL), OpenEAI-Arm, et un modèle vision-langage-action (VLA), OpenEAI-VLA. OpenEAI-Arm s'appuie sur des plans mécaniques ouverts et une commande conforme (compliant control) destinée à réduire le coût de fabrication tout en maintenant la précision de manipulation. OpenEAI-VLA est construit sur Qwen3-VL-4B d'Alibaba avec une tête d'action Diffusion Transformer, entraîné en deux phases sur des jeux de données exclusivement ouverts. Sur quatre tâches de manipulation réelles, il atteint des taux de réussite comparables à pi0 de Physical Intelligence, un modèle pré-entraîné à bien plus grande échelle. OpenEAI-Arm surpasse par ailleurs deux bras commerciaux 6+1 DDL évalués sous la même politique de contrôle. Plans, codes, modèles et pipelines d'entraînement seront publiés intégralement après acceptation de l'article en revue. L'intérêt de ces résultats est double. Côté hardware, un bras open-source moins coûteux qui surpasse des équipements commerciaux constitue un levier direct pour les laboratoires et intégrateurs à budget contraint. Côté VLA, approcher les performances de pi0 avec nettement moins de données de pré-entraînement conteste l'hypothèse selon laquelle des politiques de manipulation robustes nécessitent impérativement des corpus massifs et propriétaires. L'architecture combinant un modèle vision-langage compact (4 milliards de paramètres) et une tête diffusion semble offrir un rapport performance-données plus favorable que prévu, ce qui intéresse directement les équipes cherchant à déployer des robots polyvalents sans infrastructure de collecte industrielle. OpenEAI-VLA s'appuie sur Qwen3-VL-4B (Alibaba, 2025) et l'architecture Diffusion Transformer popularisée par pi0 (Physical Intelligence, 2024) pour générer des actions robotiques continues. La plateforme s'inscrit dans un segment croissant de projets ouverts pour la manipulation, aux côtés de LeRobot (Hugging Face) et ALOHA (Stanford), face à des acteurs commerciaux comme Figure AI, Boston Dynamics ou 1X Technologies. Son positionnement vise explicitement la reproductibilité et la collecte de données à l'échelle, deux goulots d'étranglement identifiés par la communauté robotique. Aucun déploiement industriel ni partenariat n'est annoncé : OpenEAI-Platform est un prétirage, et l'accès aux ressources complètes reste conditionnel à l'acceptation de l'article.

UELes équipes de recherche et laboratoires européens à budget contraint pourraient exploiter cette plateforme matériel-logiciel open source pour accélérer leurs travaux en manipulation robotique sans infrastructure de collecte de données industrielle.

💬 Un bras robot open-source qui surpasse du hardware commercial, c'est déjà solide. Ce qui m'intéresse encore plus, c'est que leur VLA s'approche des perfs de pi0 avec des datasets entièrement ouverts et un modèle à 4B paramètres, ce qui fracasse l'idée qu'il faut absolument un corpus propriétaire massif pour faire de la manipulation sérieuse. Bon, c'est un prétirage pour l'instant, les ressources complètes sortent après acceptation de l'article.

IA physiqueOpinion
1 source
PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA
95arXiv cs.RO 

PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA

Des chercheurs ont publié sur arXiv (référence 2606.03598) un framework de continual learning baptisé PHASER (Phase-Aware and Semantic Experience Replay), conçu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. L'architecture est agnostique au backbone sous-jacent et a été évaluée sur trois modèles VLA distincts dans les suites de benchmarks LIBERO, une référence du domaine. Sur le scénario LIBERO-Goal CL (continual learning), PHASER atteint un taux de succès moyen (Average Success Rate, ASR) de 87,8 % en fin d'entraînement, soit un gain de 31 points de pourcentage par rapport à l'experience replay uniforme standard avec le même budget mémoire. Le problème que PHASER attaque est celui de l'oubli catastrophique : lorsqu'un robot apprend séquentiellement de nouvelles compétences gestuelles, les représentations antérieures se dégradent rapidement dans les poids du modèle. L'experience replay classique échoue parce qu'il échantillonne uniformément, sous-représentant les sous-phases courtes mais critiques d'une trajectoire de manipulation (la saisie, le transfert, la dépose), un phénomène que les auteurs nomment "phase starvation". PHASER corrige cela avec deux mécanismes : une allocation mémoire par phase (capacity allocation) pour garantir une couverture équilibrée de tous les sous-comportements, et un routage dynamique qui priorise les phases historiques à haut risque d'oubli. Un troisième composant, Auto-PC, automatise la détection des frontières temporelles entre sous-phases par analyse non supervisée des signaux d'action, validée ensuite par un VLM, évitant ainsi l'annotation manuelle coûteuse. Les VLA, qui conditionnent les actions du robot sur du langage naturel et des images, sont devenus un axe central de la robotique généraliste, portés notamment par des modèles comme OpenVLA (UC Berkeley), pi0 (Physical Intelligence) ou RT-2 (Google DeepMind). L'un des verrous majeurs à leur déploiement industriel reste précisément la capacité à apprendre de nouvelles tâches sans régression sur les anciennes, prérequis pour tout robot polyvalent en atelier. PHASER reste pour l'instant une contribution de recherche évaluée en simulation, mais son caractère agnostique au backbone en fait un candidat naturel pour une intégration dans des pipelines d'entraînement continuel sur des plateformes hardware comme Figure 02, Unitree G1 ou Boston Dynamics Atlas.

IA physiqueOpinion
1 source
Stardust Intelligence lève plus d'un milliard de yuans en série B, sa valorisation dépasse 10 milliards
9636Kr 

Stardust Intelligence lève plus d'un milliard de yuans en série B, sa valorisation dépasse 10 milliards

Astribot (星尘智能), startup shenzhenoise spécialisée dans les humanoïdes à transmission par câble, a bouclé une série B représentant plus d'un milliard de yuans (environ 125 millions d'euros) en trois tours sur trois mois. Sa valorisation dépasse désormais 10 milliards de yuans, la hissant au rang de licorne shenzhenoise de l'embodied intelligence. Le tour réunit des fonds régionaux (Liangxi Tech Innovation Fund géré par Bohua Capital, Yangzhou Longtou Xinli), l'industriel ThinkTech (中科创达), GUOKE Investment, et confirme le réinvestissement d'actionnaires historiques liés à Tencent, Alibaba et ByteDance. Sur le plan commercial, Astribot signe une commande de l'ordre du millier d'unités avec ThinkTech pour des applications industrielles et de services, avec expansion à l'export, ainsi que la co-construction d'un centre d'application de 100 millions de yuans avec la zone de développement économique de Jiangdu pour l'hôtellerie et le tourisme culturel. La gamme T1, lancée à 89 900 yuans (environ 11 500 euros), exécute des tâches en séquence continue : cuisson, service en bar, tri de pièces automobiles, manipulation chimique. Des livraisons à l'échelle du millier d'unités ont démarré fin 2025. Ce qui distingue Astribot sur le plan technique, c'est son choix de la transmission tendineuse par câble (rope-driven), imitant la biomécanique musculaire humaine : moteurs déportés, câbles tractant les articulations, avec un couplage rigide-souple qui préserve la rigidité opérationnelle tout en absorbant les chocs. L'entreprise revendique être la première au monde à avoir industrialisé cette approche en production de masse pour des humanoïdes IA. Pour les intégrateurs, cela signifie un meilleur rapport charge utile/masse, moins de backlash mécanique, et des données de force proprioceptives de haute qualité transmises fidèlement au modèle, un avantage critique pour l'apprentissage de la physique réelle. L'intelligence embarquée repose sur DuoCore, une architecture bicéphale rapide/lente inspirée du double système cognitif humain, structurellement convergente avec l'architecture Helix de Figure dévoilée quasi simultanément, ce qui constitue une validation indépendante de cette direction. Le système rapide gère la compliance articulaire et l'évitement d'obstacles en temps réel ; le système lent planifie les tâches longues et coordonne les deux bras. Le modèle de fondation VLA maison, Lumo, entraîné par pré-entraînement puis alignement sur robot physique, affiche une généralisation à des objets inconnus et des environnements non vus. DuoCore est déjà déployé en conditions réelles dans la distribution au détail dans six villes chinoises, ce qui constitue un déploiement opérationnel, pas une démonstration en laboratoire. Astribot a été fondée en 2022 par Lai Jie, qui cumule 17 ans d'expérience en IA et robotique : il a été le premier employé et architecte du laboratoire de robotique de Tencent, puis directeur de l'équipe robot Xiaodu chez Baidu. Sa philosophie "Design for AI" consiste à concevoir d'abord un corps adapté à l'apprentissage par un grand modèle, puis à y adjoindre l'algorithme, structurant ainsi toute l'architecture produit. L'entreprise s'inscrit dans un secteur très concurrentiel face à Unitree (G1, H1), Figure (02, Helix), Boston Dynamics (Atlas électrique), Agility Robotics (Digit), et côté chinois, Fourier Intelligence et Galbot. Sa différenciation repose sur la transmission câblée et une stratégie de données axée sur l'efficacité plutôt que le volume brut. Les prochaines étapes annoncées incluent l'internationalisation des commandes ThinkTech et l'intégration de capacités de modèle du monde (world model) dans les futures versions de Lumo.

UELa montée en puissance d'Astribot renforce la pression concurrentielle sur les acteurs européens de l'humanoïde (Wandercraft, Enchanted Tools) ; l'internationalisation annoncée des commandes ThinkTech pourrait atteindre l'Europe, mais aucun déploiement ou partenariat européen n'est confirmé à ce stade.

Chine/AsieOpinion
1 source
Dyno, le premier robot humanoïde du Vietnam, cible la sécurité et les tâches domestiques
97Interesting Engineering 

Dyno, le premier robot humanoïde du Vietnam, cible la sécurité et les tâches domestiques

VinDynamics, filiale robotique du conglomérat vietnamien Vingroup (connu pour VinFast dans l'automobile et VinAI dans l'intelligence artificielle), a présenté Dyno lors de l'ICRA 2026 à Vienne et du Computex Taipei 2026, marquant l'entrée officielle du Vietnam dans la course aux humanoïdes. Le robot est conçu pour deux segments initiaux: la sécurité et la surveillance dans les espaces urbains et commerciaux, et l'assistance domestique. Un déploiement pilote a déjà eu lieu à Vinpearl Safari Phu Quoc, en conditions extérieures, où Dyno a opéré comme guide multilingue autonome, capable d'interaction en langage naturel et de perception environnementale en temps réel. Sur le plan des composants, VinDynamics expose également l'actionneur VDM 80, un joint compact de moins d'un kilogramme, tournant jusqu'à 235 rpm sous 48V, compatible CAN FD, RS485 et EtherCAT, avec une durée de vie annoncée supérieure à 10 000 heures. La main robotique associée intègre 11 articulations mobiles et 6 degrés de liberté activement contrôlés, avec capteurs de force intégrés. Les spécifications globales du robot (payload, nombre total de DOF, autonomie énergétique) n'ont pas encore été publiées. Ce lancement positionne VinDynamics comme le premier acteur sud-est-asiatique à entrer publiquement dans le segment humanoïde full-body, dans un marché jusqu'ici dominé par des entreprises américaines et chinoises. La stratégie modulaire est notable: en exposant séparément l'actionneur, la main et la plateforme d'entraînement IA, l'entreprise signale une ambition B2B de fournisseur de composants en plus du robot complet, une approche similaire à celle adoptée par des acteurs comme Robosense ou Fourier Intelligence. Le déploiement à Vinpearl constitue une preuve d'exploitation réelle en environnement non contrôlé, ce qui le distingue d'une simple démonstration de laboratoire. Cela dit, l'absence de métriques précises sur les performances du robot principal (vitesse de marche, charge utile, taux de succès sur les tâches de manipulation) rend difficile toute comparaison directe avec les plateformes concurrentes. Dyno reste à ce stade une annonce structurée autour d'un pilote et d'une roadmap de composants, pas encore un produit commercialement disponible. Vingroup est l'un des plus grands conglomérats privés d'Asie du Sud-Est, avec des investissements massifs en R&D technologique depuis 2019 via VinAI Research. VinDynamics s'inscrit dans cette diversification vers la robotique physique. Sur le marché humanoïde global, les concurrents directs incluent Figure (Figure 02 déployé chez BMW), Tesla (Optimus Gen 3 en production), Boston Dynamics (Atlas en phase commerciale), Agility Robotics (Digit chez Amazon), ainsi que les acteurs chinois Unitree, Fourier et AgiBot. La présentation à l'ICRA 2026 est une démarche de légitimation académique et industrielle internationale. Les prochaines étapes annoncées incluent des déploiements commerciaux supplémentaires, sans calendrier précis communiqué.

Chine/AsieOpinion
1 source
Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot
98arXiv cs.RO 

Gains PD adaptatifs pour un contrôle économe en énergie dans l'interaction physique humain-robot

Une équipe de chercheurs propose dans un article publié sur arXiv (2606.00459) un contrôleur proportionnel-dérivé (PD) adaptatif capable de limiter l'énergie mécanique d'un robot humanoïde lors d'interactions physiques avec des humains. Le système agit sur les deux composantes énergétiques du robot, énergie cinétique et énergie potentielle, sans nécessiter de capteurs de force externes ni d'estimation de couple articulaire. Les gains du contrôleur sont paramétrables : l'opérateur peut définir précisément le seuil d'énergie limite et la "sharpness", c'est-à-dire la brutalité de la transition entre comportement nominal et comportement contraint. Le contrôleur a été validé sur le robot humanoïde TALOS de PAL Robotics (1,75 m, 95 kg, 32 degrés de liberté), d'abord en simulation, puis sur le hardware réel, confirmant le comportement souple attendu et le respect des limites énergétiques définies. L'intérêt de cette approche réside dans son applicabilité large : la majorité des robots industriels et de service ne disposent pas de capteurs de force six axes ou de couple articulaire, conditions requises par les approches classiques de contrôle d'impédance ou de couple. Un contrôleur basé sur l'énergie, implémentable avec des encodeurs standards et un modèle cinématique, ouvre la voie à une couche de sécurité pHRI sur des plateformes à bas coût ou à architecture fermée. Les auteurs fournissent également une preuve formelle de stabilité avec une condition explicite, ce qui distingue cette contribution des schémas énergétiques antérieurs souvent sans garanties théoriques complètes, un point critique pour toute certification industrielle. PAL Robotics, entreprise barcelonaise spécialisée dans les robots de service et de recherche, fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens, notamment dans le cadre de projets H2020 et Horizon Europe. Le contrôle compliant pour la pHRI est un champ en compétition directe avec les approches à apprentissage par renforcement (RL) et les contrôleurs de type whole-body control (WBC) développés par des équipes comme le DLR, ETH Zurich ou Boston Dynamics. Ce travail s'inscrit dans une tendance plus large visant à sécuriser les humanoïdes sans alourdir leur architecture sensorielle, une contrainte clé pour le déploiement en milieu industriel partagé. La prochaine étape logique serait une validation en scénario de collaboration réelle, avec des humains non prévenus, pour éprouver la robustesse du seuil énergétique face à des contacts imprévus.

UEPAL Robotics (Barcelone) fournit TALOS comme plateforme de référence pour de nombreux laboratoires européens financés par H2020/Horizon Europe ; cette couche de sécurité pHRI sans capteurs de force pourrait être directement intégrée dans les projets de collaboration humain-robot en cours au sein de l'écosystème de recherche européen.

RecherchePaper
1 source
NVIDIA Jetson amène l'IA à base d'agents dans le monde physique
99NVIDIA Blog Robotics 

NVIDIA Jetson amène l'IA à base d'agents dans le monde physique

Lors du salon COMPUTEX à Taipei le 27 mai 2026, NVIDIA a annoncé JetPack 7.2 et le support de NemoClaw sur la plateforme Jetson, marquant une étape concrète dans le déploiement de l'IA agentique sur des systèmes embarqués physiques. JetPack 7.2 apporte le support du projet Yocto pour une distribution Linux allégée et personnalisable, CUDA 13 sur Jetson Orin, et le support MIG (Multi-Instance GPU) couplé à un noyau temps réel sur Jetson Thor, permettant de réserver des ressources GPU dédiées à des tâches déterministes comme la perception robotique. Le module Jetson AGX Orin 32 Go gagne également 20 % de performances, atteignant 241 TOPS d'inférence IA. NemoClaw, le framework agentique de NVIDIA, se déploie désormais sur Jetson en une seule commande. Deux partenaires sont déjà en production : Solomon, qui utilise NemoClaw pour coordonner raisonnement, perception, fusion de capteurs, locomotion et manipulation sur un robot humanoïde, et Advantech, qui déploie un "cerveau d'usine agentique" dans ses propres lignes de fabrication en combinant NemoClaw, Nemotron 3 et Jetson Thor pour la gestion de flottes robotiques et l'inspection de défauts. L'importance de cette annonce réside dans le passage de l'IA agentique des serveurs vers les systèmes embarqués en production industrielle, un écart que l'industrie peinait à combler. L'architecture en trois couches proposée, OS + compute en base (JetPack), skills d'automatisation développeur au milieu, et NemoClaw en orchestrateur applicatif au sommet, permet aux intégrateurs de construire des workflows agentiques complets sans infrastructure cloud. Pour un COO industriel ou un ingénieur robotique, le gain annoncé est celui du time-to-market : des tâches de déploiement et de configuration qui prenaient plusieurs semaines peuvent désormais être réduites à quelques jours grâce aux agent skills dérivées de la documentation officielle NVIDIA. Le support MIG sur Thor est particulièrement significatif pour les applications robotiques réelles, où l'inférence temps réel ne peut pas être interrompue par des tâches d'IA concurrentes. Il faut toutefois noter que les chiffres de performance et les gains de productivité annoncés proviennent du communiqué de presse NVIDIA lui-même, sans benchmark indépendant disponible à ce stade. La plateforme Jetson est déjà déployée dans des secteurs variés, notamment la robotique industrielle, les drones, les dispositifs médicaux, les machines agricoles et les systèmes humanoïdes, et constitue depuis plusieurs générations, Orin puis Thor, l'un des compute modules embarqués les plus répandus dans l'industrie. NemoClaw s'inscrit dans la stratégie d'NVIDIA de descendre son stack agentique, initialement développé pour les serveurs DGX, vers l'edge et les systèmes physiques autonomes. Sur le plan concurrentiel, cette annonce positionne NVIDIA face à des alternatives edge comme Qualcomm (RB5/RB6 pour la robotique) et Google Coral, mais aussi face aux SOC propriétaires développés par Boston Dynamics, Figure ou 1X pour leurs propres humanoïdes. Les prochaines étapes annoncées incluent l'extension des Metropolis VSS blueprint skills pour l'interprétation visuelle agentique, et la diffusion de l'événement Build-a-Claw à Taiwan, signe que NVIDIA cherche à ancrer son écosystème développeur en Asie du Sud-Est, région clé pour la fabrication électronique et robotique mondiale.

UELes intégrateurs robotiques européens sur Jetson Orin/Thor peuvent déployer des workflows agentiques complets sans cloud, réduisant potentiellement le time-to-market de plusieurs semaines à quelques jours, gain concret pour l'automatisation industrielle EU, sans validation indépendante à ce stade.

InfrastructureOpinion
1 source
NVIDIA publie de nouveaux outils et des mises à jour pour les développeurs d'IA physique
100The Robot Report 

NVIDIA publie de nouveaux outils et des mises à jour pour les développeurs d'IA physique

Lors du GTC Taipei et du Computex, NVIDIA a dévoilé un ensemble de nouveaux outils open-source rassemblés sous le nom NVIDIA Agent Toolkit, destinés aux développeurs de systèmes d'IA physique : robotique, véhicules autonomes, vision industrielle et jumeaux numériques. L'objectif affiché est de réduire le coût et la complexité des pipelines de développement en rendant l'ensemble de la pile logicielle de NVIDIA directement orchestrable par des agents IA. Les outils concernés incluent Cosmos 3, le modèle de fondation pour la compréhension du monde physique (vidéo, texte, prédiction d'états futurs), les bibliothèques Omniverse pour la simulation et les jumeaux numériques, Isaac pour la robotique, Metropolis pour la vision IA, Alpamayo pour la conduite autonome, et la plateforme Jetson pour le déploiement embarqué. Le déploiement sécurisé de ces agents est encadré par le blueprint NemoClaw et le runtime OpenShell, qui appliquent des politiques de sécurité et de confidentialité en local comme dans le cloud. L'approche "agent-ready" de NVIDIA marque un changement de paradigme dans le développement de l'IA physique : plutôt que des bibliothèques que les ingénieurs assemblent manuellement, les outils deviennent des briques directement appelables par des agents de codage, capables d'enchaîner automatiquement génération de données, simulation, entraînement et évaluation. Pour les développeurs de véhicules autonomes, cela signifie qu'un agent peut reconstruire des scènes à partir de données de flotte, générer des scénarios de conduite photoréalistes et lancer des boucles de renforcement sans intervention manuelle à chaque étape. Pour les intégrateurs robotiques, des tâches comme l'automatisation de l'entraînement à la navigation ou le tuning de systèmes Jetson deviennent théoriquement scriptables. Rev Lebaredian, vice-président pour la simulation d'IA physique chez NVIDIA, a qualifié Cosmos 3 de "modèle de fondation frontier pour l'IA physique", capable de comprendre vidéo et texte, de prédire les états futurs et de générer des actions, positionnant ce world model comme un candidat généraliste opérationnel, même si aucune métrique de benchmark indépendante n'a été communiquée à ce stade. NVIDIA consolide avec cette annonce sa position d'infrastructure de référence pour l'IA physique, un rôle qu'elle occupe via ses GPU d'entraînement et ses plateformes Isaac Sim et Jetson. La compétition dans ce segment s'intensifie : Google DeepMind pousse MuJoCo et ses dérivés, Boston Dynamics, Figure, Agility Robotics et Physical Intelligence développent leurs propres stacks de simulation et d'apprentissage, tandis que des acteurs industriels comme Siemens ou ANSYS occupent le terrain des jumeaux numériques. En Europe, des entreprises comme Wandercraft ou Enchanted Tools pourraient bénéficier de ces outils si la promesse de réduction de complexité se confirme en pratique. NVIDIA joue ici la carte de la plateforme unifiée plutôt que du modèle de fondation isolé, un positionnement cohérent avec son modèle d'affaires mais qui reste à valider au-delà des démonstrations internes. Les suites annoncées incluent des applications en santé, dont le détail n'a pas été entièrement communiqué lors de l'événement.

UELes entreprises françaises comme Wandercraft et Enchanted Tools pourraient bénéficier de la réduction de complexité annoncée, mais aucun déploiement européen concret n'est confirmé à ce stade.

InfrastructureOpinion
1 source