Aller au contenu principal

Dossier IA physique & VLA — page 2

1018 articles · page 2 sur 21

L'IA physique : modèles vision-langage-action qui contrôlent des corps robotisés. État de l'art académique (CoRL, RSS) et premières productions industrielles.

Real2Sim2Real pour la manipulation vision-langage-action : un pipeline basé sur AMD ROCm
51arXiv cs.RO InfrastructureActu

Real2Sim2Real pour la manipulation vision-langage-action : un pipeline basé sur AMD ROCm

Des chercheurs publient sur arXiv (2607.22997v1) une pile logicielle de bout en bout entièrement basée sur ROCm, l'écosystème ouvert d'AMD, pour entraîner et déployer des modèles vision-langage-action (VLA) en robotique de manipulation. L'architecture couvre trois niveaux de matériel AMD : silicium d'entraînement en datacenter, cartes Radeon PRO pour la simulation et le rendu, et puces Ryzen AI pour le calcul embarqué. Quatre démonstrations illustrent la pile : un pipeline sim-to-real entraîné avec le modèle SmolVLA et déployé sur un bras robotique Franka ; une tâche de sélection d'objet guidée par le langage baptisée « one-of-three » ; un pipeline real-to-sim qui associe des reconstructions de scènes réelles par 3D Gaussian Splatting (3DGS) au moteur physique Genesis pour générer des données d'entraînement synthétiques ; et un entraînement par renforcement à grande échelle pour la locomotion de robots quadrupèdes et humanoïdes, benchmarké sur plusieurs plateformes matérielles. L'ensemble fonctionne nativement sous ROCm et PyTorch sur des GPU RDNA4 (Radeon AI PRO R9700) et RDNA3.5 (Radeon PRO W7900), et les pipelines sont reproductibles gratuitement sur la Radeon Cloud Platform. L'enjeu dépasse la simple démonstration technique : la quasi-totalité des pipelines VLA publiés jusqu'ici, de SmolVLA à Pi-0 en passant par GR00T N2 ou Helix, s'entraînent et se déploient sur des écosystèmes CUDA de Nvidia, aujourd'hui quasi incontournable dans l'IA physique. En montrant qu'un pipeline sim-to-real complet, du rendu 3DGS à l'inférence embarquée, tient sur ROCm sans réécriture lourde, les auteurs ouvrent une alternative matérielle crédible pour les intégrateurs et laboratoires cherchant à diversifier leurs fournisseurs de calcul ou à réduire leurs coûts. Pour les décideurs B2B, le signal principal reste la reproductibilité gratuite via la Radeon Cloud Platform, qui abaisse la barrière d'entrée pour tester des politiques VLA sans investir dans du matériel Nvidia. Le papier demeure toutefois une preuve de faisabilité technique sur des tâches de manipulation limitées (un bras Franka, un tri à trois objets), sans démonstration de déploiement industriel à l'échelle ni de comparaison chiffrée de performance face aux stacks CUDA équivalentes. Cette publication s'inscrit dans la course engagée par AMD pour rattraper son retard face à Nvidia sur le marché de l'IA, et plus spécifiquement sur celui, naissant, de l'IA physique évoqué par Lisa Su au CES 2026 et par Jensen Huang lors de la GTC Paris de juin 2025. Le choix des briques logicielles, SmolVLA (Hugging Face), Genesis (moteur physique open source) et 3D Gaussian Splatting, situe les auteurs dans la mouvance open source de la robotique généraliste, aux côtés d'acteurs comme Physical Intelligence (Pi-0) ou Nvidia lui-même avec GR00T. Aucun acteur français ou européen n'apparaît dans cette publication centrée sur l'infrastructure matérielle. Les auteurs annoncent code et pipelines reproductibles dès aujourd'hui sur la Radeon Cloud Platform, sans toutefois préciser de calendrier de commercialisation ni de partenariats industriels concrets à ce stade.

1 source
2 000 robots humanoïdes déployés dans des usines textiles pour une production plus rapide et efficace
52Interesting Engineering 

2 000 robots humanoïdes déployés dans des usines textiles pour une production plus rapide et efficace

Jack Technology, fabricant chinois de machines à coudre industrielles, s'associe à Siemens pour intégrer intelligence artificielle, ingénierie numérique et robotique humanoïde dans la production textile. L'entreprise vise un gain d'efficacité d'au moins 30 % face à des délais de production plus courts, une demande consommateur de plus en plus personnalisée et une pression accrue sur les coûts. Dans ce cadre, Jack Technology a commandé 2 000 robots humanoïdes conçus pour la confection, ce qui en ferait l'un des tout premiers déploiements massifs de ce type dans le secteur textile. En parallèle, un essai a été mené sur le site Siemens d'Erlangen, en Allemagne, avec le robot humanoïde à roues HMND 01 de la startup allemande Neura Robotics, propulsé par la pile logicielle d'IA physique de NVIDIA. Pendant deux semaines, le robot a manipulé des caisses de deux formats différents, les plaçant sur un convoyeur avant de les acheminer vers un poste de reprise humaine, à raison de 60 caisses par heure, plus de huit heures par jour, avec un taux de réussite en préhension et positionnement supérieur à 90 %. Siemens associe aussi à cette offensive le robot quadrupède ANYmal d'ANYbotics, utilisé pour l'inspection de sites chimiques et énergétiques dangereux, capable de cartographier des installations en 3D et de détecter fuites de gaz ou surchauffes via capteurs acoustiques et caméras infrarouges, en s'appuyant sur la plateforme de Roboverse Reply. Cette annonce illustre un test grandeur nature de l'écart habituel entre démonstration marketing et réalité opérationnelle: un cycle de deux semaines avec un taux de succès mesuré au dessus de 90 % pèse davantage qu'une vidéo de présentation isolée, même si l'ampleur exacte de la commande de 2 000 unités reste à confirmer dans son calendrier de livraison réel. Pour les intégrateurs et décideurs industriels, l'intérêt des humanoïdes tient surtout à leur capacité à s'insérer dans des ateliers existants sans réaménagement lourd, contrairement aux robots industriels fixes classiques. Cela renforce l'hypothèse que la manutention répétitive de charges, plutôt que les tâches fines de couture elles-mêmes, sera le premier terrain d'adoption rentable des humanoïdes dans le textile. Le volet quadrupède, lui, consolide le glissement du secteur vers une maintenance prédictive plutôt que réactive sur les sites à risque. Cette initiative s'inscrit dans la stratégie plus large de Siemens, qui cherche à fournir l'infrastructure numérique (jumeaux numériques, interfaces robots-automates, gestion de flotte, réseaux industriels) permettant de transformer des robots isolés en composants coordonnés d'une usine connectée. Sur le marché des humanoïdes industriels, Jack Technology et Neura Robotics viennent ainsi se positionner face à des acteurs comme Figure ou Agility Robotics, davantage focalisés sur la logistique et l'entrepôt, tandis qu'ANYbotics affronte la concurrence de Boston Dynamics sur l'inspection quadrupède. Les prochaines étapes attendues concernent le calendrier réel de déploiement des 2 000 unités commandées par Jack Technology et l'extension des pilotes Siemens à d'autres usines du groupe.

UELe pilote mené sur le site Siemens d'Erlangen (Allemagne) avec le robot humanoïde allemand HMND 01 de Neura Robotics illustre une adoption industrielle concrète de l'IA physique en Europe, portée par des acteurs européens (Siemens, Neura Robotics), même si aucune entreprise française n'est impliquée à ce stade.

FR/EU ecosystemeOpinion
1 source
Modèle Vision-Langage-Action pour la manipulation multi-mains via recherche dans les espaces d'assignation et nuls
53arXiv cs.RO 

Modèle Vision-Langage-Action pour la manipulation multi-mains via recherche dans les espaces d'assignation et nuls

Des chercheurs publient sur arXiv (arXiv:2607.22020, nouvelle soumission) une méthode pour résoudre un problème d'exécution resté largement irrésolu dans la robotique par apprentissage : les politiques de manipulation entraînées produisent aujourd'hui des trajectoires pour des « mains » abstraites, indépendantes de toute plateforme physique, ce qui facilite la collecte de démonstrations et le transfert d'un robot à l'autre. Mais transposer ces sorties sur un robot réel à plusieurs bras pose trois contraintes simultanées : assigner chaque trajectoire de main à un bras physique, faire en sorte que chaque bras suive dans l'espace des configurations la trajectoire prescrite de son effecteur, et respecter les limites cinématiques tout en évitant les collisions entre bras. En l'absence d'algorithme dédié, les équipes bricolent aujourd'hui des pipelines de cinématique inverse (IK) mono-bras étendus ad hoc, sans garantie de faisabilité ni de sécurité. Les auteurs proposent un planificateur fondé sur le Conflict-Based Search (CBS), qui recherche conjointement dans l'espace discret d'assignation des trajectoires aux bras et dans l'espace continu des espaces nuls jacobiens des bras redondants, exploitant cette redondance pour éviter les collisions inter-bras tout en suivant les mouvements prescrits. Le projet est documenté sur omcbsa.github.io. Ce travail s'attaque directement au maillon faible entre les politiques génératives type VLA (Pi-0, GR00T N2, Helix) et leur déploiement effectif sur des plateformes multi-bras ou humanoïdes bi-manuelles. Il illustre un écart typique du secteur : une politique peut être excellente en simulation ou sur une seule paire de bras, sans qu'il existe de méthode garantissant sa transposition sûre et complète à un robot physique concret. Pour les intégrateurs, disposer d'un cadre théoriquement complet, plutôt que d'heuristiques IK non garanties, réduit le risque d'échecs d'exécution ou de collisions lors du passage du laboratoire au déploiement industriel. CBS est historiquement un algorithme de planification multi-agents pour la recherche de chemins sans collision entre plusieurs robots mobiles ; son adaptation ici à l'espace nul des manipulateurs redondants est la contribution centrale. Il s'agit pour l'instant d'un travail de recherche publié en preprint, sans annonce de pilote industriel ni de partenaire ; la suite naturelle serait une validation sur des plateformes multi-bras réelles au-delà des démonstrations du site du projet.

RecherchePaper
1 source
Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement
54Interesting Engineering 

Robots peuvent désormais apprendre des tâches d'usine à haute dextérité par la vidéo, avec un minimum d'entraînement

Mimic Robotics, société suisse de robotique physique, a dévoilé FLUX-mimic, un modèle vidéo-action de nouvelle génération développé avec Black Forest Labs, capable d'enseigner à des robots industriels des tâches de manipulation fine à partir de simples démonstrations vidéo. Le système s'appuie sur FLUX 3, le modèle de génération vidéo de Black Forest Labs, associé à un décodeur d'actions qui traduit les prédictions visuelles en mouvements robotiques exécutables. Selon Mimic Robotics, FLUX-mimic peut être affiné pour certaines tâches avec seulement 30 minutes de démonstrations robotiques, contre 30 heures ou plus pour les pipelines d'apprentissage conventionnels, un écart présenté par l'entreprise elle-même et donc à prendre avec la prudence habituelle réservée aux chiffres communiqués par le fournisseur. La technologie est actuellement déployée chez le constructeur automobile Audi, dans le cadre d'une évaluation portant sur l'automatisation de tâches à haute dextérité impliquant des matériaux flexibles et une manipulation fine. Cette annonce s'inscrit dans un débat plus large sur la viabilité des modèles vidéo-action (VAM) face aux modèles vision-langage-action (VLA) désormais dominants, à l'image de Pi-0 ou GR00T N2. Contrairement à ces derniers, pré-entraînés sur des paires image-texte statiques et devant apprendre la physique quasi exclusivement via des démonstrations robotiques coûteuses, FLUX-mimic part d'un modèle vidéo déjà entraîné à grande échelle sur la dynamique des objets et des mouvements, ce qui réduirait drastiquement le volume de données spécifiques à collecter. Si la promesse se vérifie en production, elle répond directement à l'un des principaux obstacles à la commercialisation de la robotique industrielle par apprentissage: le coût et la lenteur de la collecte de démonstrations pour chaque nouvelle tâche. Une réduction du cycle de déploiement de plusieurs mois à quelques semaines, telle qu'annoncée, changerait significativement le calcul économique pour les intégrateurs face à des tâches variables et peu standardisées, typiquement délaissées par l'automatisation classique programmée manuellement. FLUX-mimic prolonge les travaux antérieurs de Mimic Robotics sur les modèles vidéo-action, avec une architecture désormais pensée spécifiquement pour l'IA physique en environnement industriel. Le partenariat avec Audi, dont les usines affichent déjà un fort taux d'automatisation, sert de banc d'essai pour mesurer si ces systèmes d'apprentissage tiennent la route hors laboratoire, un test que beaucoup d'approches VLA ou VAM concurrentes n'ont pas encore passé à cette échelle. Les deux partenaires évoquent des perspectives d'extension à d'autres opérations de fabrication et de logistique, sans toutefois communiquer de calendrier précis ni de métriques de performance en production, ce qui place pour l'instant cette collaboration au stade du pilote d'évaluation plutôt que du déploiement industriel validé.

UEAudi teste FLUX-mimic dans ses usines allemandes pour automatiser des tâches de manipulation fine, un cas concret d'adoption industrielle en Europe qui pourrait influencer d'autres constructeurs automobiles de l'UE si le pilote se confirme.

FR/EU ecosystemeActu
1 source
« FabriVLA de Youibot, modèle 1 milliard de paramètres, dépasse Pi-Zero et prend la tête du classement en IA incarnée »
55Pandaily 

« FabriVLA de Youibot, modèle 1 milliard de paramètres, dépasse Pi-Zero et prend la tête du classement en IA incarnée »

Youibot a annoncé que son modèle FabriVLA, doté d'à peine 1 milliard de paramètres, s'est hissé en tête du classement Evo-SOTA sur le benchmark Meta-World MT50, avec un taux de réussite moyen de 90,0%, devançant ainsi Pi-Zero de Physical Intelligence. MT50 évalue la maîtrise simultanée de 50 tâches de manipulation distinctes, un test jugé représentatif des exigences multi-tâches du secteur industriel. L'innovation revendiquée par Youibot ne tient pas à la taille du modèle mais à son architecture, pensée spécifiquement pour la manipulation robotique plutôt que calquée sur la course générale au nombre de paramètres. Deux mécanismes sont mis en avant : une fusion de caractéristiques visuelles profondes et superficielles, censée permettre au modèle de saisir à la fois l'objectif sémantique global d'une tâche et le positionnement spatial fin, et un mécanisme d'auto-attention à portes qui relie chaque étape d'une séquence d'actions aux étapes précédentes et suivantes pour fluidifier les transitions. Une étude d'ablation fournie par l'entreprise indique que retirer la fusion profonde/superficielle fait chuter le score moyen de 90,0% à 82,9%, l'auto-attention à portes étant présentée comme le composant le plus déterminant de la tête d'action. Youibot revendique par ailleurs plus de 800 déploiements industriels réels dans les secteurs des semi-conducteurs, de l'énergie et des batteries, ainsi que 4 000 commandes enregistrées dès le lancement de son robot humanoïde Fengxi. L'enjeu commercial de ce résultat, s'il se confirme au-delà du seul classement, tient à la taille du modèle. Un modèle plus compact consomme moins de puissance de calcul, réduit la latence et peut fonctionner directement sur le matériel embarqué du robot sans dépendre du cloud, un facteur clé dans des usines où la connectivité réseau n'est pas garantie. Cela vient contredire l'hypothèse dominante selon laquelle la performance en intelligence embarquée passerait nécessairement par une montée en échelle massive des paramètres, à l'image des modèles VLA les plus lourds du marché. Il convient toutefois de noter que les classements de type Evo-SOTA reposent sur des benchmarks en simulation, dont la représentativité vis-à-vis de conditions industrielles réelles reste à démontrer au cas par cas. Ce résultat s'inscrit dans une compétition de plus en plus vive entre modèles VLA (vision-langage-action), aux côtés d'acteurs comme Physical Intelligence, Nvidia avec GR00T N2, ou Figure AI avec Helix. Youibot, déjà présent industriellement en Chine, affiche un objectif de déploiement sur 10 000 sites, un chiffre que la légèreté de FabriVLA rendrait, selon l'entreprise, plus atteignable qu'auparavant faute d'infrastructure de calcul massive à installer sur chaque site.

IA physiqueActu
1 source
AMD dévoile le module Kria pour le contrôle en temps réel et la mémoire unifiée des robots
56Robotics Business Review 

AMD dévoile le module Kria pour le contrôle en temps réel et la mémoire unifiée des robots

AMD a dévoilé sa nouvelle gamme Ryzen AI Embedded X100, associée à la plateforme Kria AI Robotics, pour cibler les charges de calcul de l'IA physique. Le fabricant promet un contrôle temps réel déterministe, une mémoire unifiée entre CPU, GPU et NPU, et une pile logicielle ouverte non liée à un fournisseur unique. Le X100 succède au P100 et devient le SoC phare de la gamme robotique d'AMD. Il vise le temps réel "ferme" via des optimisations Linux et BIOS, avec une latence d'interruption ciblée sous 7 microsecondes, complétées par des fonctions de qualité de service AMD (réservation de cache L3, allocation de bande passante mémoire, isolation des threads). Pour le temps réel "dur", AMD recommande une virtualisation par hyperviseur Zen, une machine virtuelle FreeRTOS et l'isolation de VM. Le module Kria AI SoM, bâti sur ce SoC, adopte le format standard COM-HPC plutôt qu'un connecteur propriétaire, avec une fermeture de boucle de contrôle annoncée à 1,5 microseconde. Selon Rob Bauer, responsable produit chez AMD pour le portefeuille APU embarqué x86, la puce délivrerait trois fois la puissance de calcul FP32 du NVIDIA Thor sur des charges de traitement du signal, un segment où AMD dit rester compétitif malgré l'optimisation poussée de Thor pour l'inférence. Cette annonce vise directement la position dominante de NVIDIA sur l'IA physique, incarnée par ses puces Orin et Thor, en offrant aux intégrateurs une alternative capable, selon AMD, de mettre la pression sur les prix. La mémoire unifiée réduit les copies de données entre unités de calcul, un point sensible pour la perception, la fusion de capteurs et la planification de trajectoire, tâches critiques pour les bras industriels, les robots mobiles autonomes et les humanoïdes. Un stack logiciel ouvert, non verrouillé, répond aussi à une demande croissante des intégrateurs de ne pas dépendre d'un seul écosystème propriétaire. Les chiffres avancés (3,4 fois la performance temps réel du Thor T5000, 1,6 fois de capacité de calcul disponible, 2,3 fois de capacité pour l'IA agentique) restent toutefois des mesures internes d'AMD, sans benchmark indépendant publié à ce stade, ce qui invite à la prudence sur leur portée réelle en conditions de déploiement. L'offensive s'accompagne du lancement du Robotics Development Kit, de la suite logicielle open source AMD Robotics Sophie Suite, et d'un réseau de partenaires robotique. Cette stratégie plein-stack doit être présentée plus en détail lors du salon RoboBusiness 2026. Il s'agit pour l'instant d'une annonce de plateforme et de composants, pas encore de déploiements industriels documentés à grande échelle, un point que le secteur devra vérifier une fois les premiers intégrateurs équipés du Kria AI SoM.

InfrastructureActu
1 source
Ropedia lève 22 millions de dollars pour développer la collecte de données servant à l'entraînement des robots
57Robotics Business Review 

Ropedia lève 22 millions de dollars pour développer la collecte de données servant à l'entraînement des robots

Ropedia, jeune pousse basée à Singapour et Mountain View (Californie) et fondée en 2025, a levé 22 millions de dollars en pre-Série A, portant son financement total à 30 millions avec son tour de seed. L'argent doit servir à industrialiser HOMIE, un dispositif porté sur la tête équipé de quatre caméras offrant une vision à 360 degrés, d'un capteur audio capable de reconstruire la source et la direction des sons, et d'une unité de mouvement qui suit les déplacements du porteur ; la batterie est interchangeable. Ce casque capture le mouvement humain à la première personne, l'interaction avec les objets et le contexte spatial, données ensuite traitées et annotées par les modèles internes de Ropedia. Selon Zhaoxi Chen, cofondateur et PDG, les fonds financeront le recrutement dans le hardware, le software, l'infrastructure de données et le développement de modèles, ainsi que l'expansion commerciale vers l'Amérique du Nord, où se trouve déjà la majorité des clients de l'entreprise. Ropedia prévoit aussi d'étoffer sa plateforme avec des outils d'annotation, de l'analyse qualité et une infrastructure de conformité. Ce tour de table illustre un pari plus large sur l'IA physique : plutôt que de dépendre de la téléopération de robots réels, limitée à des morphologies spécifiques et coûteuse en matériel, Ropedia mise sur des données égocentriques humaines pour entraîner des modèles capables de généraliser des compétences physiques. L'entreprise revendique une réduction des coûts de collecte de données allant jusqu'à 50 fois par rapport aux méthodes traditionnelles, un chiffre à prendre avec prudence puisqu'il n'est pas détaillé ni vérifié indépendamment. L'argument central de Chen, qui consiste à dire que l'intelligence robotique de niveau humain passe par l'imitation de l'apprentissage humain en vision première personne, rejoint une thèse de plus en plus répandue dans le secteur des modèles vision-langage-action (VLA), où la rareté des données d'entraînement reste un goulot d'étranglement majeur pour les acteurs comme Figure, Physical Intelligence ou NVIDIA. Ropedia se distingue des prestataires classiques d'annotation, qui travaillent sur des données déjà possédées par leurs clients, en générant et structurant lui-même ses données de bout en bout, de la capture jusqu'au fine-tuning aligné sur les modèles. Le hardware de HOMIE est en grande partie développé en interne, à l'exception des composants de base comme les capteurs CMOS, ce qui inclut la carte électronique et la synchronisation des différents capteurs. Pour l'instant, la collecte se limite à des environnements informels, l'entreprise affirmant vouloir élargir progressivement l'éventail de tâches capturées. Aucun partenaire industriel ni volume de données précis n'a été communiqué à ce stade.

IA physiqueActu
1 source
Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
58arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
Les fabricants chinois de robots déplorent : « Il nous faudrait un meilleur cerveau, et plus de données »
59SCMP Tech 

Les fabricants chinois de robots déplorent : « Il nous faudrait un meilleur cerveau, et plus de données »

Lors de la World Artificial Intelligence Conference (WAIC), qui s'est achevée lundi à Shanghai, plusieurs représentants du secteur chinois de la robotique ont dressé un constat commun : leurs entreprises manquent à la fois de données suffisantes et d'un "cerveau" IA suffisamment performant pour que leurs machines interagissent correctement avec le monde physique. Wang Xiaogang, cofondateur de SenseTime et président de sa division robotique, a résumé le défi central de l'industrie de l'IA incarnée (embodied AI) comme la nécessité de "relier matériel, données, modèles et scénarios réels dans un système itératif en boucle fermée". Ce diagnostic, partagé par plusieurs intervenants du salon, souligne un goulot d'étranglement technique plutôt qu'un simple retard industriel. Cet aveu est significatif car il vient contredire le discours dominant sur l'avance chinoise en robotique humanoïde, portée par des volumes de production et des annonces de déploiement impressionnants. Il révèle que la couche logicielle, les modèles de type VLA (vision-language-action) capables de généraliser à partir de données réelles, reste le principal verrou, un problème que rencontrent aussi les acteurs américains comme Figure ou Physical Intelligence. Pour les intégrateurs et décideurs B2B, ce constat invite à distinguer les capacités matérielles, souvent matures chez les fabricants chinois, de l'intelligence embarquée réelle, encore largement en phase de recherche. Le WAIC, principal rendez-vous chinois sur l'IA, sert traditionnellement de baromètre des priorités stratégiques de Pékin, qui pousse fortement le secteur de la robotique incarnée comme relais de croissance industrielle. La reconnaissance publique de ce manque de données et de modèles fiables laisse présager de nouveaux investissements chinois dans la collecte de données réelles et les architectures de type "world model", pour combler l'écart avec les meilleurs systèmes de contrôle actuels.

Chine/AsieOpinion
1 source
BrainCo dévoile une plateforme robotique "contrôlée par la pensée" à la Conférence mondiale sur l'IA en Chine
60SCMP Tech 

BrainCo dévoile une plateforme robotique "contrôlée par la pensée" à la Conférence mondiale sur l'IA en Chine

BrainCo, licorne technologique chinoise spécialisée dans les interfaces cerveau-machine, a dévoilé vendredi à Shanghai sa "Brain-Controlled Robot AI Platform", présentée par l'entreprise comme la première plateforme intégrée permettant de piloter un robot par la pensée, sans le moindre mouvement musculaire. L'annonce a eu lieu lors de la World Artificial Intelligence Conference (WAIC), le rendez-vous phare de l'IA en Chine. Le communiqué de BrainCo revendique un système de contrôle cerveau-vers-robot inédit, mais aucune donnée technique précise (latence de commande, nombre de commandes reconnues, plateforme robotique associée, taux de fiabilité) n'a été communiquée à ce stade, ce qui invite à traiter la démonstration comme une vitrine plutôt qu'un produit validé en conditions réelles. Pour l'industrie robotique, cette annonce s'inscrit dans la course mondiale à l'IA incarnée (embodied AI), où les grands acteurs cherchent à coupler perception, cognition et contrôle moteur dans des systèmes de plus en plus autonomes. Une interface cerveau-machine capable de piloter un robot ouvrirait des usages potentiels en assistance aux personnes à mobilité réduite, en téléopération industrielle ou en environnements dangereux, mais l'écart entre une démonstration de conférence et un déploiement commercial fiable reste généralement important dans ce secteur, notamment sur les questions de robustesse du signal neuronal et de généralisation hors laboratoire. BrainCo s'est bâtie ces dernières années sur les technologies de casques et prothèses à interface cerveau-ordinateur, avant d'élargir son positionnement vers la robotique incarnée, un mouvement suivi par plusieurs laboratoires chinois et américains investissant dans les modèles vision-langage-action (VLA) et le contrôle neuronal. La WAIC de Shanghai, vitrine annuelle des ambitions chinoises en IA, sert régulièrement de tremplin à ce type d'annonce ; les prochaines étapes attendues concernent la publication de spécifications techniques et d'éventuels partenariats industriels pour valider la plateforme au-delà de la démonstration.

Chine/AsieActu
1 source
Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots
61TechNode 

Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots

Xiaomi a dévoilé mercredi Xiaomi-Robotics-U0, un modèle de fondation multimodal autorégressif de 38 milliards de paramètres conçu pour l'IA incarnée (embodied AI). L'entreprise affirme que ce modèle unifie quatre capacités au sein d'un même framework : la génération de scènes pour robots, le transfert de comportements robotiques, la génération de vidéos d'interaction robot-environnement, et la génération et l'édition d'images à usage général. Concrètement, le système peut créer des environnements exploitables par des robots à partir de simples prompts textuels, adapter des trajectoires robotiques existantes à de nouvelles scènes tout en préservant le mouvement d'origine, produire des vidéos d'interaction à partir d'instructions de tâches, et exploiter des connaissances visuelles à l'échelle d'internet pour des applications d'IA incarnée. L'annonce a été rapportée par TechNode. Cette annonce s'inscrit dans une tendance de fond du secteur robotique : l'utilisation de modèles génératifs pour produire des données d'entraînement synthétiques et combler l'écart entre simulation et réalité, un problème central pour les acteurs du VLA (vision-language-action) comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. Si la promesse de générer des environnements et trajectoires synthétiques à la demande tient ses promesses, elle pourrait réduire le coût de collecte de données réelles, un goulot d'étranglement majeur pour l'entraînement des robots humanoïdes et bras manipulateurs. Toutefois, à ce stade, il s'agit d'une annonce de capacités techniques, sans démonstration publique détaillée ni benchmark comparatif, ni précision sur un déploiement matériel réel. Xiaomi investit depuis plusieurs années dans la robotique, avec son robot quadrupède CyberDog et des incursions dans les véhicules autonomes et l'IA embarquée. Ce modèle de 38 milliards de paramètres le positionne face aux laboratoires spécialisés en IA incarnée tels que Physical Intelligence, Figure AI ou Nvidia, ainsi que face aux géants chinois de la tech comme Baidu ou Alibaba, également actifs sur les modèles fondation pour la robotique. Aucune date de disponibilité, de partenariat industriel ou de déploiement pilote n'a été précisée à ce stade.

Chine/AsieActu
1 source
JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou
62Pandaily 

JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou

JD.com a posé la première pierre de son site "Robot Base" à Guangzhou, marquant l'entrée officielle du géant chinois du e-commerce dans l'IA incarnée (embodied AI). L'investissement, estimé à environ 1 milliard de RMB, doit être achevé en 2028 pour une pleine production visée en 2030, avec une valeur de production annuelle projetée à 1,75 milliard de RMB. Le site accueillera des acteurs de l'IA incarnée, de la robotique industrielle et de service, ainsi que des entreprises de la chaîne d'approvisionnement amont et aval. Le fondateur Richard Liu a annoncé un plan de plus de 80 sites RoboBase à travers le pays, tandis que la filiale JD Logistics prévoit d'acquérir 3 millions de robots, 1 million de véhicules autonomes et 100 000 drones sur cinq ans pour automatiser l'ensemble de sa chaîne logistique, de l'entreposage à la livraison du dernier kilomètre. Les partenaires du site de Guangzhou incluent Zhiyuan Robot, Leju Robot, Qingtong Vision et GAC Huilun Technology. JD.com ne fabrique pas de robots lui-même mais se positionne comme orchestrateur de plateforme, un choix stratégique qui mérite d'être souligné plutôt que pris pour argent comptant. L'entreprise met en avant quatre leviers : l'intégration à son écosystème de distribution pour réduire les coûts et donner accès au marché, ses modèles open-source et centres de collecte de données à grande échelle, des terrains de test réels via ses magasins JD MALL, parcs logistiques et pharmacies, et enfin un accès au capital via ses fonds d'investissement et JD Finance. Ce modèle répond directement aux trois blocages classiques du secteur robotique identifiés par l'industrie : l'absence de scénarios de déploiement réels, l'absence de canaux de vente stables, et le manque de capital de développement soutenu. La déclaration selon laquelle Songyan Power aurait vendu plus de 500 robots en deux jours sur la plateforme JD reste toutefois un chiffre communiqué par JD lui-même, sans vérification indépendante, et JD vise 10 milliards de RMB de ventes de robots sur sa plateforme cette année, avec l'objectif de faire dépasser 1 milliard de RMB de ventes à une centaine de marques d'ici trois ans. JD investit dans des startups de robotique incarnée depuis 2025, dont LimX Dynamics (locomotion humanoïde), Zhiyuan Robot (robots humanoïdes généralistes), Zhongqing Robot, Pasini et RoboScience. Le directeur des opérations de Zhiyuan Robot a confirmé que des robots de l'entreprise sont déjà déployés dans des stations de métro de Guangzhou, dans le cadre d'une coentreprise avec l'opérateur local. JD s'attaque aussi au service après-vente, un angle mort classique du secteur, en s'appuyant sur son réseau JD Service+ de plusieurs milliers de techniciens formés pour bâtir un maillage national de maintenance. Le 11 juillet, le gouvernement provincial du Guangdong a signé un accord stratégique global avec le groupe JD couvrant l'économie numérique, la logistique intelligente et la fabrication robotique, signe d'un soutien politique appuyé à ce modèle de plateforme au moment où le secteur robotique chinois cherche à transformer ses démonstrations technologiques en déploiements commerciaux réels.

Chine/AsieOpinion
1 source
De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert
63arXiv cs.RO 

De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert

Publié sur arXiv le 14 juillet 2026 (arXiv:2607.11689), cet article de synthèse dresse un état des lieux des modèles d'action pour la robotique et propose une feuille de route vers ce que les auteurs nomment le « cerveau incarné » (embodied brain). Le texte retrace l'évolution des politiques vision-langage-action (VLA) vers les World Action Models (WAM), des systèmes qui relient une intervention candidate à ses conséquences prédites avant exécution. Trois failles couplées freinent le secteur selon les auteurs: des espaces d'action et cibles de prédiction incompatibles d'un modèle à l'autre, une absence de standardisation des jeux de données et des protocoles d'évaluation, et des interfaces d'exécution trop fermées pour permettre la réutilisation entre systèmes. Plutôt qu'un nouveau modèle entraîné, le papier propose une architecture cible: le cerveau incarné intégrerait un contexte multimodal, comparerait plusieurs interventions candidates, puis émettrait des requêtes de transition d'état ou de capacité plutôt que des commandes moteur directes, les WAM servant de prototypes pour ces fonctions prédictives. Pour les intégrateurs et décideurs en robotique, ce travail nomme un problème concret: chaque laboratoire, qu'il s'agisse de Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure avec Helix, construit son propre espace d'action et son propre format de données, rendant quasi impossible la comparaison directe des performances ou la réutilisation d'un modèle entre un bras robotique et un humanoïde. En proposant des contrats partagés entre modèles, données, tâches et morphologies, et un post-entraînement en boucle fermée transformant les interactions vérifiées en expérience réutilisable, la feuille de route vise à sortir la robotique généraliste du stade de la démonstration isolée. C'est une contribution méthodologique plus qu'un résultat expérimental: elle ne prouve pas qu'un tel système fonctionne à l'échelle, mais formalise ce qui manque pour y parvenir, un constat qui recoupe les critiques récurrentes sur l'écart entre vidéos de démonstration sélectionnées et déploiements robustes en conditions réelles. Le papier s'inscrit dans la continuité des travaux sur les modèles d'action et les world models, qui ont convergé avec l'essor des VLA avant que des approches hybrides, combinant prédiction du monde et politique d'action, ne donnent naissance aux WAM. Les auteurs ne mentionnent aucun déploiement propre mais positionnent leur cadre face aux systèmes existants de Physical Intelligence, NVIDIA et Figure, sans citer d'acteur français ou européen dans cette revue. La suite annoncée est l'adoption progressive de ces contrats partagés par la communauté de recherche, préalable jugé nécessaire à l'émergence d'agents physiques réellement adaptatifs et auto-améliorants hors laboratoire.

RecherchePaper
1 source
IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle
64arXiv cs.RO 

IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle

Article traduit et résumé en français, prêt à publier : Une équipe de recherche propose une méthodologie inédite pour concevoir la peau tactile des robots humanoïdes destinés à l'interaction physique et sociale avec l'humain (spHRI), en partant des données d'usage plutôt que des contraintes matérielles. Publiée sur arXiv (2607.11690v1), l'étude s'appuie sur une plateforme de réalité virtuelle à retour haptique pour collecter des cartes de contact haute résolution sur l'ensemble du corps d'un robot, à travers plusieurs scénarios sociaux (accolade, tape sur l'épaule, poignée de main, etc.). Neuf gestes tactiles sociaux récurrents ont été identifiés, dont huit ont ensuite fait l'objet d'une collecte contrôlée avec 18 participants, produisant un jeu de données ouvert de 5 520 essais. L'analyse des distributions de contact et de simulations d'encodage tactile fournit des repères quantitatifs sur la couverture cutanée nécessaire et la densité de capteurs à installer sur une plateforme humanoïde donnée. L'enjeu dépasse la simple curiosité académique : jusqu'ici, la conception des capteurs tactiles pour l'interaction sociale suivait une logique matérielle d'abord, où l'emplacement et la résolution des capteurs étaient fixés en amont, limitant de fait la palette de gestes reconnaissables. Cette approche inverse la démarche en dérivant les exigences de capteurs directement des données d'interaction réelles, ce qui pourrait éviter aux fabricants de robots sociaux ou compagnons un surdimensionnement coûteux de la peau tactile, ou au contraire une couverture insuffisante qui dégraderait la reconnaissance des gestes. Pour les intégrateurs et décideurs qui évaluent des robots destinés au contact physique humain (assistance, santé, accueil), disposer de seuils quantitatifs de densité et de placement avant la fabrication du hardware représente un gain de temps et de coûts d'ingénierie concret, plutôt qu'une promesse marketing. Le travail s'inscrit dans une limite bien identifiée de la recherche en robotique tactile : la plupart des peaux artificielles actuelles sont conçues sans données préalables sur la façon dont les humains touchent réellement un robot dans un contexte social, ce qui explique des écarts entre capacités annoncées et usage terrain. Bien que la démonstration ait été menée sur une seule plateforme robotique, les auteurs présentent la méthode comme transférable à d'autres morphologies de robots, ouvrant la voie à des exigences de capteurs spécifiques à chaque design avant même le prototypage physique. Les prochaines étapes attendues concernent la validation de cette méthodologie sur d'autres architectures de robots et son intégration dans des cycles de conception industriels, mais aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
65arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
66arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Voici l'article en français, sans titres ni séparateurs : Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
67arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
Usine de robots soudeurs : « Shengshi Weisheng » lève plusieurs centaines de millions de yuans en série B avec son modèle d'IA incarnée pour le soudage
6836Kr 

Usine de robots soudeurs : « Shengshi Weisheng » lève plusieurs centaines de millions de yuans en série B avec son modèle d'IA incarnée pour le soudage

La société chinoise 3Srobotics (昇视唯盛), spécialisée dans les robots industriels à intelligence incarnée pour le soudage, a bouclé un tour de série B de plusieurs centaines de millions de yuans (数亿元), mené par Shanghai Semiconductor Industry Investment et le Jinqiao Fund, avec la participation de Zero1 Ventures, Xinding Capital, Zhongguancun Dinghua et de son investisseur historique Weiguang Capital. Fondée en 2020, certifiée entreprise de haute technologie en 2023 puis reconnue entreprise pionnière "spécialisée, précise et innovante" et entreprise robotique de référence à Shanghai en 2024, la société en est à sa troisième génération de robots soudeurs. Son architecture repose sur un modèle "cerveau" multimodal entraîné sur des dizaines de millions de données de production réelles, couplé à un "cervelet" de contrôle moteur temps réel développé par sa filiale Harbin Institute of Technology Modern (哈工现代). Selon le fondateur Wang Dezhao, un robot 3Srobotics remplace en moyenne 1,5 à 2 soudeurs humains, avec un retour sur investissement de 1 à 1,5 an ; l'entreprise vise plusieurs centaines de millions de yuans de chiffre d'affaires en 2026. Le pari de 3Srobotics illustre une bascule stratégique du secteur robotique chinois : passer d'une automatisation générique, programmée à l'avance et incapable de s'adapter à des pièces non standard, vers des systèmes capables de percevoir en 3D, de raisonner sur une géométrie de soudure inconnue et d'ajuster en temps réel courant, tension et vitesse de déplacement, y compris sans plan technique fourni au préalable. C'est un signal pour les intégrateurs industriels et les décideurs B2B occidentaux : la Chine revendique une pénurie de plusieurs millions de soudeurs qualifiés d'ici 2025, sur un bassin d'environ dix millions de soudeurs enregistrés dont l'âge moyen dépasse 45 ans, et anticipe un marché du soudage intelligent dépassant les 100 milliards de yuans sur dix ans. Reste que les chiffres avancés, notamment ce ratio de remplacement de 1,5 à 2 soudeurs ou le gain d'efficacité de 2,88 fois annoncé pour son offre de "main-d'œuvre robotique" facturée au mètre soudé, proviennent uniquement de la société elle-même et méritent d'être vérifiés en conditions réelles indépendantes. L'entreprise, initialement positionnée sur la robotique industrielle généraliste, s'est recentrée sur le soudage en misant sur un modèle intégré combinant corps robotique, IA et procédé de soudage, avec une usine de fabrication propre garantissant une capacité de production et une chaîne d'approvisionnement maîtrisées, contrairement aux fournisseurs purement logiciels. Sa distribution passe majoritairement par des revendeurs et intégrateurs (les clients finaux directs ne pèsent que 10 à 20 % du chiffre d'affaires), sur des marchés comme la construction métallique, les ponts, le naval, le ferroviaire, les équipements électriques et, dans une moindre mesure, l'aérospatial et les nouvelles énergies. Les fonds levés serviront à faire évoluer les modèles "cerveau" et "cervelet", augmenter la capacité de son usine et étendre les équipes R&D et commerciales, avant une diversification annoncée vers le meulage, la découpe, l'assemblage et la manutention.

Chine/AsieActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot
69Robotics Business Review 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot

NVIDIA et Hugging Face annoncent l'intégration d'Isaac GR00T 1.7 et du framework Isaac TeleOp dans LeRobot, la bibliothèque open-source de robotique de Hugging Face. Isaac GR00T 1.7 est présenté comme le premier modèle de fondation robotique open-source et commercialement exploitable, une architecture vision-langage-action (VLA) permettant de post-entraîner et déployer des politiques de contrôle sur des robots humanoïdes réels. Isaac TeleOp est un framework de collecte de données par téléopération, qui capture des démonstrations humaines depuis des dispositifs externes dans des formats standardisés et interopérables, facilitant le partage de jeux de données au sein de la communauté. Les deux entreprises annoncent également l'arrivée prochaine de NVIDIA Cosmos 3, un modèle de monde frontière pour l'IA physique, sans donner de date précise. LeRobot compte déjà plus de 15 millions de téléchargements pour son jeu de données ouvert, qui regroupe plus de 350 000 trajectoires réelles et simulées ainsi que 57 millions de préhensions ("grasps"), en complément des frameworks de simulation Isaac Sim et Isaac Lab, dont Isaac Lab-Arena, désormais référencé dans le LeRobot Environment Hub. Cette annonce illustre la tentative de NVIDIA de reproduire, dans la robotique, la dynamique qui a fait le succès de l'IA générative open-source: mutualiser modèles, données et outils pour accélérer l'innovation collective plutôt que de la laisser fragmentée entre acteurs isolés. Pour les intégrateurs et développeurs robotique, l'enjeu concret est l'accès à un pipeline standardisé bout-en-bout, de la collecte de données jusqu'au déploiement, sans avoir à recomposer des briques propriétaires coûteuses. Le rapprochement entre les 3 millions de développeurs robotique de NVIDIA et les 16 millions d'utilisateurs IA de Hugging Face vise à fluidifier le passage entre recherche en IA générale et applications physiques. Toutefois, l'ampleur réelle de l'adoption d'Isaac GR00T 1.7 sur des déploiements industriels reste à démontrer: l'annonce reste pour l'instant centrée sur la disponibilité des outils et des frameworks, pas sur des cas d'usage chiffrés en production, et la mention de Cosmos 3 relève encore de la feuille de route plutôt que d'un produit livré. Ce partenariat s'inscrit dans la continuité de la stratégie NVIDIA autour de sa plateforme Isaac dédiée à la robotique et à l'IA physique, engagée depuis plusieurs années à travers Isaac Sim et Isaac Lab pour la simulation, puis étendue à des modèles de fondation comme GR00T. Hugging Face, de son côté, a positionné LeRobot comme l'équivalent robotique de ses bibliothèques Transformers pour le NLP, avec pour ambition de devenir le hub de référence pour les datasets et modèles robotiques ouverts. Sur le plan concurrentiel, cette annonce se situe face aux approches propriétaires de modèles VLA développés par d'autres laboratoires, à l'image de Pi-0 (Physical Intelligence) ou GR00T N2 concurrencés indirectement par des architectures fermées comme Helix (Figure AI). Thomas Wolf, cofondateur et directeur scientifique de Hugging Face, présente cette intégration comme une étape pour ancrer un cycle collaboratif ouvert dans la robotique, avec Cosmos 3 comme prochaine brique pour générer et simuler des données lorsque la collecte réelle est trop coûteuse ou limitée.

IA physiqueActu
1 source
Course à l'IA physique : l'Europe peut-elle rivaliser avec la Chine et les États-Unis en robotique humanoïde ?
70SCMP Tech 

Course à l'IA physique : l'Europe peut-elle rivaliser avec la Chine et les États-Unis en robotique humanoïde ?

The article text you pasted cuts off mid-sentence after "said David Kehr, president...", I only have the headline and the opening lines, not the actual facts (numbers, deployment sites, competitor positioning, etc.) needed to write the 3-paragraph piece per your brief. Can you paste the full article text? I don't want to fabricate the concrete details (payload, DOF, cycle times, dates, company names) the brief specifically calls for, that would go against the "decoder, pas relayer" posture and the accuracy requirement.

FR/EU ecosystemeOpinion
1 source
Lumos Robotics domine un test de référence mondial pour l'IA incarnée en zero-shot
71Robotics & Automation News 

Lumos Robotics domine un test de référence mondial pour l'IA incarnée en zero-shot

Lumos Robotics, société chinoise de robotique, affirme que son modèle d'IA incarnée industrielle Prime R0 a obtenu le meilleur score global du classement MolmoSpaces, devançant des modèles bien plus volumineux signés Nvidia et plusieurs équipes de recherche américaines. Avec seulement 2,8 milliards de paramètres, un format compact au regard des standards du secteur, Prime R0 se classe premier à la fois sur les tâches de manipulation fine à un bras et sur les tâches de collaboration coordonnée à deux bras, deux catégories jugées parmi les plus exigeantes pour évaluer la capacité d'un modèle "zero-shot" à généraliser sans réentraînement spécifique. Ce résultat, s'il se confirme, va à contre-courant de l'hypothèse dominante selon laquelle la performance en manipulation robotique nécessite des modèles massifs et coûteux à faire tourner en embarqué. Un modèle de moins de 3 milliards de paramètres capable de rivaliser avec des architectures plus lourdes intéresserait directement les intégrateurs industriels, pour qui le coût de calcul et la latence d'inférence sur site conditionnent la viabilité économique d'un déploiement. Reste que le classement provient d'un benchmark tiers dont la méthodologie et l'indépendance vis-à-vis des fournisseurs testés ne sont pas détaillées ici, ce qui invite à la prudence avant de valider la portée réelle de l'annonce. Lumos Robotics s'inscrit dans une compétition chinoise de plus en plus dense sur l'IA incarnée industrielle, où plusieurs acteurs cherchent à concurrencer Nvidia et les laboratoires américains sur le terrain des modèles vision-langage-action (VLA) appliqués à la manipulation. L'entreprise n'a pour l'instant pas communiqué de calendrier de déploiement industriel ni de partenariats concrets associés à Prime R0, l'annonce restant à ce stade centrée sur la performance benchmark plutôt que sur une mise en production vérifiable.

IA physiqueActu
1 source
Une université américaine renforce sa recherche en robotique et IA physique avec les systèmes OptiTrack
72Interesting Engineering 

Une université américaine renforce sa recherche en robotique et IA physique avec les systèmes OptiTrack

Carnegie Mellon University (CMU) a inauguré le 27 février 2026 son nouveau Robotics Innovation Center (RIC), un bâtiment de 150 000 pieds carrés (environ 14 000 m²) implanté à Hazelwood Green, sur l'ancien site de l'aciérie Jones & Laughlin à Pittsburgh. Pour équiper ce centre, l'université a signé un partenariat technologique pluriannuel avec la société américaine OptiTrack, spécialiste de la capture de mouvement, qui a installé 92 caméras haute performance réparties sur deux installations. Le Motion Capture Studio intérieur compte 28 caméras PrimeX41 et quatre caméras de référence Prime Color, offrant une précision de suivi de l'ordre du micron sur un volume de capture de 2 800 pieds carrés. La Drone Cage extérieure embarque 60 caméras VersaX120, le système le plus haute résolution du catalogue d'OptiTrack pour l'extérieur, certifiées IP66 pour résister aux intempéries, dans une enceinte de 38 pieds de haut sur 6 000 pieds carrés au sol. Les deux installations reposent sur la technologie propriétaire ActiveIO Tracking, capable d'identifier et de suivre simultanément des centaines d'objets en mouvement, avec une précision annoncée jusqu'à 50 microns. « Que ce soit pour suivre des systèmes multi-robots, des essaims de drones ou des mouvements humains, la gamme de caméras et de capteurs d'OptiTrack permettra une nouvelle génération de découvertes », a déclaré Martial Hebert, doyen de la School of Computer Science de CMU. Pour les intégrateurs et chercheurs en robotique, ce type d'infrastructure de capture de mouvement joue un rôle clé mais souvent sous-estimé dans le développement de l'IA physique: elle fournit la vérité terrain nécessaire pour valider les algorithmes de navigation autonome, de coordination multi-robots ou d'apprentissage par imitation, avant tout déploiement réel. Disposer d'un volume de test couvrant à la fois intérieur et extérieur avec une précision submillimétrique permet de tester des essaims de drones ou des robots humanoïdes dans des conditions proches du terrain, sans les risques ni les coûts d'essais en environnement non contrôlé. C'est un signal supplémentaire que la recherche académique américaine structure ses moyens autour de la robotique et de l'IA physique à une échelle industrielle, avec un centre dédié plutôt que des laboratoires dispersés. Pour les décideurs B2B, l'enjeu est de suivre où se construisent les futurs standards de validation et de benchmarking des systèmes autonomes, ces infrastructures universitaires servant souvent de terrain d'essai avant transfert vers l'industrie. Le RIC comprend, outre les deux installations OptiTrack, un plateau d'essais robotiques de 50 000 pieds carrés et un laboratoire de recherche aquatique. Il s'inscrit dans le Physical AI Accelerator de CMU, une initiative soutenue par l'État visant à faire converger robotique, capteurs et intelligence artificielle. Les nouveaux systèmes profiteront notamment à l'AirLab de l'université, qui travaille sur les robots aériens autonomes et la coordination multi-robots, ainsi qu'aux recherches sur l'apprentissage par imitation et la modélisation de l'activité humaine. OptiTrack a par ailleurs rejoint, en tant que sponsor industriel, le Extended Reality Technology Center (XRTC) de CMU, créé en 2023, qui réunit chercheurs, entreprises technologiques et utilisateurs finaux autour de la réalité virtuelle et augmentée. Les chercheurs comptent utiliser ces systèmes de capture pour reconstituer des mouvements réels dans des environnements virtuels immersifs, au service d'études sur l'interaction homme-machine. Aucun montant financier du partenariat n'a été communiqué.

InfrastructureActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte
73NVIDIA Blog Robotics 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte

NVIDIA et Hugging Face annoncent l'intégration du modèle NVIDIA Isaac GR00T 1.7 et du framework NVIDIA Isaac Teleop dans LeRobot, la bibliothèque open source de Hugging Face pour la robotique, avec l'arrivée prochaine de NVIDIA Cosmos 3, un modèle monde pour l'IA physique. Isaac Teleop capture des démonstrations humaines via des dispositifs externes dans des formats standardisés, directement dans LeRobot, pour constituer et partager des jeux de données. Isaac GR00T 1.7, présenté par NVIDIA comme le premier modèle fondation robotique open source et commercialement exploitable, facilite le post-entraînement et le déploiement via les workflows LeRobot sur de nouvelles morphologies de robots, avec des benchmarks publiés. Ces briques s'appuient sur des ressources déjà connectées à LeRobot: le plus grand jeu de données open source d'IA physique, téléchargé plus de 15 millions de fois, avec plus de 350 000 trajectoires réelles et simulées et 57 millions de prises (grasps); les frameworks de simulation Isaac Sim et Isaac Lab; Isaac Lab-Arena, intégré au LeRobot Environment Hub pour prototyper des environnements et entraîner des politiques généralistes comme GR00T, Pi ou SmolVLA; et l'intégration de Jetson Thor avec le robot humanoïde open source Reachy 2 pour déployer des modèles VLA (vision-langage-action). Thomas Wolf, cofondateur et chief science officer de Hugging Face, décrit cette collaboration comme un moyen de faire passer la recherche avancée à un stade où la communauté peut l'étudier, l'adapter et la faire évoluer. Pour les intégrateurs et équipes R&D, l'enjeu est de standardiser un pipeline jusque-là fragmenté, collecte de données, entraînement, évaluation, déploiement, en connectant les 3 millions de développeurs robotique de NVIDIA aux 16 millions de builders IA de Hugging Face. Cela réduit le coût d'entrée pour tester des modèles VLA sur du matériel réel sans dépendre d'une pile propriétaire fermée. La mise en avant du caractère "commercialement viable" de GR00T 1.7 tranche avec des modèles concurrents (Pi de Physical Intelligence, Helix de Figure) souvent montrés en démonstration mais rarement publiés en open source avec benchmarks vérifiables. Coupler cela à un futur modèle monde comme Cosmos 3, censé générer des données synthétiques quand les données réelles sont trop chères ou rares à collecter, répond directement à l'un des goulots d'étranglement les plus documentés du secteur humanoïde. Cette annonce prolonge un partenariat plus ancien entre NVIDIA et Hugging Face autour de LeRobot, devenu une référence pour le partage ouvert de données et de politiques robotiques. Elle s'inscrit dans la stratégie de verticalisation physical AI de NVIDIA, de la simulation (Isaac Sim, Isaac Lab) au calcul embarqué (Jetson Thor) en passant par les modèles fondation et, prochainement, les modèles monde. Elle positionne NVIDIA face à des acteurs misant sur des piles intégrées fermées, comme Figure ou Physical Intelligence, en jouant la carte de l'infrastructure ouverte et mutualisée. Aucun acteur français n'apparaît directement, mais Reachy 2 est développé par Pollen Robotics, racheté par Hugging Face, ce qui donne une visibilité indirecte à cet acteur français dans l'écosystème. Les prochaines étapes annoncées restent pour l'instant limitées à la sortie de Cosmos 3 dans LeRobot, sans calendrier de déploiement industriel précisé.

UEImpact indirect: Reachy 2, developpe par Pollen Robotics (racheté par Hugging Face), gagne en visibilité via l'integration Jetson Thor, mais aucun acteur francais n'est directement implique dans cette annonce NVIDIA/Hugging Face.

IA physiqueActu
1 source
Simplexity Robotics : une start-up d'IA incarnée de 11 mois déploie 100 robots sur des lignes de production
74Pandaily 

Simplexity Robotics : une start-up d'IA incarnée de 11 mois déploie 100 robots sur des lignes de production

Simplexity Robotics, startup chinoise spécialisée en IA incarnée fondée il y a moins d'un an, a annoncé la livraison d'un premier lot de 100 unités de son robot polyvalent i7 Pro, ainsi que la mise en service d'une ligne de production robotisée dédiée à l'usinage CNC. Ces 100 robots n'ont pas été livrés à un seul client mais répartis sur plusieurs scénarios réels, selon Jia Peng, PDG et directeur technique de la startup, ancien cadre de Li Auto avec une solide expérience en fabrication automobile intelligente. Le plus gros déploiement concerne des clients industriels fabriquant des composants robotiques, tandis que des livraisons significatives ont aussi été effectuées vers des lignes de production de modules optiques et de circuits imprimés flexibles, des installations liées aux infrastructures IA, ainsi qu'auprès d'instituts de recherche, de partenaires d'écosystème et de développeurs. Dans les ateliers CNC, les i7 Pro assurent le chargement et déchargement continu de pièces sur plusieurs machines-outils, des tâches qui exigent précision de mouvement, manipulation fine et fonctionnement stable prolongé sous des contraintes de sécurité strictes. Chez le fabricant Leaderdrive, plusieurs unités naviguent entre différentes machines pour réaliser des opérations de chargement, positionnement et insertion. Au-delà des usines, les robots sont aussi testés en logistique, où ils localisent et prélèvent des articles commandés sur des rayonnages pour les livrer, et en tri de colis, où deux unités collaborent pour déplacer et retourner des paquets. Cette annonce illustre un changement de phase pour le secteur des robots polyvalents : le passage de la démonstration en laboratoire au déploiement réel à l'échelle industrielle, un cap que peu d'acteurs ont franchi concrètement malgré une abondance de communiqués promettant des ruptures. Le fait que Simplexity répartisse ses 100 unités sur des scénarios variés, usinage, logistique, tri de colis, plutôt que de les concentrer chez un seul client, est présenté comme une preuve de généralisation, un argument central dans le débat sur la capacité réelle des modèles VLA (vision-langage-action) à s'adapter au-delà de tâches démontrées en conditions contrôlées. Pour les intégrateurs et décideurs industriels, l'enjeu n'est pas la performance brute mais le coût d'intégration : Simplexity revendique un déploiement opérationnel en une heure, ce qui, si vérifié en conditions réelles et non lors de démonstrations sélectionnées, romprait avec les cycles d'ingénierie et de débogage habituellement longs pour ce type d'équipement. Simplexity mise sur une intégration verticale complète, de son modèle fondation LaST0, à compréhension et génération multimodale native, à LaST-R1, qui intègre de l'apprentissage par renforcement dans le raisonnement en espace latent et revendique 99,9% de réussite sur le benchmark LIBERO, une métrique à interpréter avec prudence tant les protocoles d'évaluation varient d'un laboratoire à l'autre. Son modèle LaST-HD vise à transférer les données de manipulation humaine vers les robots de manière industrialisable. Le robot i7 Pro suit une philosophie où le modèle définit le matériel, conçue selon des standards d'ingénierie inspirés de l'automobile, intégrant mobilité, manipulation, perception à 360 degrés et calcul dans une architecture modulaire, livrée avec une plateforme de développement complète. Sur un marché dominé par les annonces de Figure, Tesla Optimus, Agility Robotics ou Physical Intelligence, Jia Peng défend une vision différente de la compétition à venir : non une rupture technologique unique, mais la capacité à entrer rapidement dans de nouveaux scénarios et générer de la valeur, l'adaptation cross-scénario primant sur la polyvalence universelle.

Chine/AsieOpinion
1 source
ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents
75arXiv cs.RO 

ACE-Brain-0.5 : un modèle fondation incarné unifié pour l'IA physique à base d'agents

Voici l'article en français : Une équipe de recherche présente ACE-Brain-0.5, un modèle de fondation embarqué unifié pour l'IA physique agentique, dans un article publié sur arXiv début juillet 2026. Le système s'appuie sur un backbone unique de 8 milliards de paramètres qui assure quatre fonctions simultanées : ancrage des objets et des affordances dans la scène, raisonnement spatial en 3D et en vue égocentrique, décomposition d'instructions en sous-objectifs, génération d'actions de navigation et de manipulation, et estimation de la progression pour vérifier ou corriger l'exécution. Une cinquième fonction, l'auto-amélioration, repose sur un cadre externe qui met à jour les schémas de tâches, la mémoire spatiale et les cas de récupération d'échec à partir des données de déploiement. Le modèle s'appuie sur un prédécesseur, ACE-Brain-0, et introduit une méthode nommée SSR+ (Scaffold-Specialize-Reconcile avec une étape de Réactivation après fusion des vecteurs de tâches) pour combiner ces capacités sans qu'elles n'interfèrent entre elles. Sur quinze bancs d'essai, ACE-Brain-0.5 surpasse son prédécesseur sur 14 des 18 tests de perception spatiale et d'ancrage, tout en restant compétitif en navigation et manipulation. Cette approche illustre une tendance de fond dans la robotique humanoïde et les agents physiques : le passage de politiques bout-en-bout, souvent dépourvues de raisonnement spatial explicite, vers des architectures qui unifient perception, planification, action et auto-évaluation dans une représentation partagée. C'est un pari différent de celui des modèles VLA généralistes type Pi-0 ou GR00T N2, qui privilégient l'apprentissage direct d'une politique d'action : ici, l'accent est mis sur la boucle fermée complète, avec vérification et récupération d'erreur intégrées, un point souvent négligé dans les démonstrations spectaculaires mais peu robustes du secteur. Le papier ne précise pas de partenariat industriel ni de déploiement sur plateforme commerciale à ce stade : il s'agit d'un travail de recherche fondamentale, positionné comme une étape vers une IA physique agentique plus générale, sans calendrier de mise en production annoncé.

RechercheOpinion
1 source
Imperio, smolVLA : les conséquences de l'empoisonnement des données pour la robotique open source
76arXiv cs.RO 

Imperio, smolVLA : les conséquences de l'empoisonnement des données pour la robotique open source

Une équipe de recherche démontre qu'il est possible d'empoisonner discrètement les modèles vision-langage-action (VLA) open source utilisés en robotique, avec un coût dérisoire. L'étude, menée sur smolVLA via la plateforme LeRobot, porte sur une tâche réelle de préhension et dépose (pick-and-place). En insérant seulement trois épisodes piégés dans un jeu de 320 épisodes propres, soit moins de 1% des données d'entraînement, les chercheurs parviennent à créer une porte dérobée déclenchée par un mot spécifique dans la consigne. Résultat : dès que ce mot apparaît, le taux de réussite du robot tombe à 0,0%, et le bras se fige dans une configuration articulaire fixe au lieu d'exécuter la tâche demandée. Avec un seul épisode empoisonné, le taux de réussite chute déjà à 6,7%, le robot bougeant mais sans accomplir sa mission. Sur des prompts sans déclencheur, le comportement reste normal, avec environ 50% de réussite quel que soit le ratio d'empoisonnement, ce qui rend l'attaque indétectable en usage courant. Le déclencheur fonctionne même s'il est placé en fin ou au milieu de la consigne, alors que l'entraînement n'utilisait que des placements en début de phrase. Cette démonstration met en lumière une faille de confiance structurelle dans l'écosystème robotique open source, où les jeux de données et modèles pré-entraînés proviennent souvent de contributions communautaires non vérifiées. Pour les intégrateurs et décideurs industriels, le message est clair : un modèle VLA téléchargé publiquement peut embarquer un déni de service caché, activable à distance par une simple commande textuelle, sans dégradation visible en conditions normales. Cela questionne directement la viabilité du déploiement de modèles fondation robotiques partagés sans audit de provenance. Ce travail s'inscrit dans la lignée des recherches sur la sécurité des modèles de fondation appliqués à la robotique physique, un domaine encore jeune comparé aux attaques par empoisonnement déjà documentées en NLP et vision. Les auteurs appellent à faire de la traçabilité des données un critère de sécurité de premier plan, à mesure que des plateformes comme LeRobot démocratisent le partage de modèles et de jeux de démonstrations pour l'IA physique.

Societe/EthiqueActu
1 source
Zhijian Dongli, start-up d'IA incarnée de 11 mois, livre 100 robots sur des lignes de production
77Pandaily 

Zhijian Dongli, start-up d'IA incarnée de 11 mois, livre 100 robots sur des lignes de production

Zhijian Dongli (至简动力), startup chinoise d'IA incarnée fondée il y a moins d'un an, a livré son premier lot de 100 unités de son robot polyvalent i7 Pro, en parallèle de la mise en service d'une ligne de production robotisée dédiée à l'usinage CNC. Ces 100 robots ne sont pas allés à un seul client : la plus grosse part équipe des industriels fabricant des composants robotiques, d'autres unités ont rejoint des lignes de production de modules optiques et de circuits imprimés flexibles (des usines d'infrastructure IA), le reste se répartissant entre instituts de recherche, partenaires d'écosystème et développeurs. Sur les postes CNC, les i7 Pro assurent le chargement et déchargement continu de pièces entre plusieurs machines-outils, une tâche qui exige précision de mouvement, manipulation fine et endurance sous contraintes de sécurité strictes ; chez le fabricant Leaderdrive, plusieurs unités naviguent ainsi entre machines pour positionner et insérer des pièces. Le fondateur, Jia Peng, ancien cadre de Li Auto passé par l'industrie automobile intelligente, occupe à la fois les postes de CEO et CTO. Des essais sont aussi menés en logistique et distribution, où les robots localisent et récupèrent des articles en rayon pour les livrer, et sur des lignes de tri colis où deux i7 Pro coopèrent pour déplacer et retourner des paquets. Cette annonce illustre une bascule que le secteur de la robotique humanoïde peine encore à documenter : le passage de la démonstration en laboratoire au déploiement industriel répété, chez plusieurs clients et sur des tâches différentes. C'est précisément ce que le marché attend pour juger si les modèles vision-langage-action (VLA) tiennent leurs promesses hors des vidéos soigneusement montées. Le chiffre de 99,9% de réussite sur le benchmark LIBERO, mis en avant par Zhijian Dongli pour son modèle LaST-R1, doit être lu avec la prudence habituelle réservée aux métriques de benchmark communiquées par le fabricant lui-même, sans détail sur les conditions de test. Le point réellement notable pour les intégrateurs et décideurs B2B est ailleurs : la promesse d'un déploiement en une heure sans modification d'ingénierie lourde, si elle se vérifie en usage réel répété, réduirait un des principaux freins à l'adoption des robots humanoïdes en usine, à savoir le coût et la durée d'intégration. Zhijian Dongli mise sur une intégration verticale complète, du modèle fondationnel LaST₀ jusqu'au matériel, conçu selon une philosophie où le modèle définit le hardware et développé aux standards d'ingénierie automobile. L'entreprise revendique aussi LaST-HD, une méthode de transfert de données de manipulation humaine vers le robot, destinée à accélérer l'apprentissage de nouvelles tâches. Le robot est livré avec une plateforme de développement intégrée (framework d'agents, bibliothèque de compétences, SDK bas niveau, simulation). Jia Peng défend une thèse de positionnement claire face à des concurrents comme Figure, Unitree ou Agility Robotics : la compétition à venir ne se jouera pas sur une percée technologique isolée, mais sur la capacité à s'adapter rapidement à de nouveaux environnements et à générer de la valeur sur des scénarios variés, plutôt que sur la recherche d'une capacité universelle.

Chine/AsieOpinion
1 source
Des diplômés de Tsinghua créent une start-up d'IA incarnée, lèvent des centaines de millions de yuans pour l'automobile
7836Kr 

Des diplômés de Tsinghua créent une start-up d'IA incarnée, lèvent des centaines de millions de yuans pour l'automobile

La startup chinoise Guangxiang Technology, fondée en avril 2025 et incubée par les écoles de véhicules et d'intelligence artificielle de l'université Tsinghua, a bouclé fin juin 2026 un tour d'amorçage cumulé de plusieurs centaines de millions de yuans, mené par des investisseurs comme Zhuhai Technology Industry Group, Xingzheng Capital et Songhe Capital, aux côtés des actionnaires historiques Yiyi Chuangtou et L2F. L'entreprise est dirigée par Zhang Tao, ex-responsable de la perception spatiale chez Amap (Gaode), et co-fondée par le professeur Li Shengbo, expert en apprentissage par renforcement crédité de plus de 30 000 citations, avec une équipe issue d'Alibaba, Tencent, Huawei, KUKA et Geek+. En juin 2026, elle a présenté Phi-Bot X1, un robot industriel à 27 degrés de liberté monté sur un châssis omnidirectionnel à quatre roues capable de déplacement latéral, doté d'une taille télescopique couvrant 0 à 2,5 mètres et de bras à contrôle de force cadencés à 1 kHz. Par proprioception seule, il atteint 10 mm de précision de positionnement et 0,05 mm de répétabilité en bout de bras, avec un échange de batterie en une minute. Lors du salon ATC 2026, le robot a fonctionné 21,5 heures sur trois jours sur une vraie ligne automobile pour du chargement au poste de soudure, sans erreur ni interruption revendiquées, avec une précision angulaire de 0,3° en alignement dynamique. Guangxiang défend une architecture dite "physique native", opposée aux modèles VLA (vision-langage-action) dominants et aux modèles du monde prédictifs au niveau pixel: son système apprendrait les lois physiques par interaction directe en simulation plutôt que par imitation de démonstrations humaines. Ces performances restent toutefois auto-rapportées par l'entreprise lors d'un entretien avec le média chinois Yingke (36Kr), sans validation indépendante, et la démonstration ATC, bien que menée sur une ligne réelle, demeure un test ponctuel plutôt qu'un déploiement industriel généralisé. Le fondateur évalue le marché chinois des robots de ligne automobile à environ 100 milliards de yuans et cible le "gap des 30%" de tâches que bras robotisés et automates n'ont jamais couvertes, comme le chargement à risque de brûlure ou le contrôle qualité en fin de chaîne. Il cite l'échec d'un concurrent humanoïde bipède chez un constructeur automobile de luxe, où les vibrations de marche provoquaient une chute de pièces dans 80% des cas, comme preuve que le choix de la plateforme mécanique compte autant que le modèle embarqué. Guangxiang revendique une stratégie inverse de celle de nombreux acteurs de la robotique humanoïde: valider les usages industriels avant toute communication produit plutôt que l'inverse. L'entreprise dit avoir déjà signé des accords commerciaux avec plusieurs constructeurs automobiles chinois et étrangers autour des postes de chargement et de contrôle qualité, et prévoit de consolider sa position dans l'automobile avant d'étendre son modèle à d'autres secteurs industriels sur trois à cinq ans, sans projet grand public ni introduction en bourse à court terme. Zhang Tao positionne son approche comme complémentaire des initiatives de Tesla ou XPeng, qu'il juge tournées vers le grand public plutôt que vers l'usine, et estime que 2026 marque, pour le secteur de l'IA incarnée, un tournant où l'accent bascule des démonstrations vers des preuves de déploiement réel.

Chine/AsieActu
1 source
X Square Robot mise sur une approche full-stack pour l'IA incarnée et la robotique polyvalente
79Robotics & Automation News 

X Square Robot mise sur une approche full-stack pour l'IA incarnée et la robotique polyvalente

Le fabricant chinois de robots humanoïdes X Square Robot, basé à Shenzhen, a récemment bouclé quatre levées de fonds consécutives, confirmant l'intérêt soutenu des investisseurs pour l'IA incarnée (embodied AI). La société développe une approche "full-stack" du robot généraliste, c'est-à-dire qu'elle conçoit à la fois le matériel (actionneurs, capteurs, plateforme mécanique) et les modèles d'IA qui pilotent la perception et la manipulation, plutôt que de s'appuyer sur des briques tierces assemblées. L'objectif affiché est de produire des machines capables d'exécuter une large variété de tâches réelles, à l'opposé des robots historiquement programmés pour une application unique et rigide. Cette stratégie d'intégration verticale illustre un basculement plus large du secteur robotique : la course ne se joue plus seulement sur le hardware, mais sur la capacité à faire tenir un modèle d'IA généraliste (de type VLA, vision-language-action) à l'échelle industrielle, du laboratoire jusqu'au déploiement en usine ou en entrepôt. Pour les intégrateurs et décideurs B2B, le succès ou l'échec de ce pari conditionne directement l'arbitrage entre acheter une plateforme fermée type Optimus ou Figure, ou miser sur des acteurs émergents proposant une pile technologique propriétaire complète. Le nombre de tours de financement consécutifs, sans que les montants précis soient encore détaillés publiquement, signale une pression concurrentielle et une conviction des investisseurs chinois sur ce segment. X Square Robot s'inscrit dans un paysage chinois de plus en plus dense sur l'IA incarnée, aux côtés d'acteurs comme Unitree ou UBTech, dans un contexte où Pékin pousse activement la robotique humanoïde comme filière stratégique. Face à elle, la scène occidentale reste dominée par Tesla (Optimus), Figure AI ou encore Physical Intelligence (Pi-0), tandis qu'en Europe des acteurs comme Wandercraft ou Enchanted Tools explorent des approches plus spécialisées. Les prochaines étapes à surveiller pour X Square Robot concernent la divulgation des montants levés, l'identité des investisseurs, et surtout la transition entre démonstrations en laboratoire et déploiements pilotes vérifiables chez des clients industriels, seul indicateur qui permettra de distinguer l'annonce marketing du produit réellement opérationnel.

Chine/AsieOpinion
1 source
IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)
80arXiv cs.RO 

IA physique : modèle du monde 3D fondé sur les principes physiques pour la manipulation d'objets dynamiques (PhysMani)

Des chercheurs présentent PhysMani, un framework qui couple un modèle du monde en Gaussiennes 3D fondé sur la physique avec un modèle de politique d'action anticipatif, pour la manipulation d'objets rapides et dynamiques en environnement 3D non structuré. Le modèle du monde apprend un champ de vitesse gaussien à divergence nulle par optimisation en ligne, ce qui permet une prédiction rapide et physiquement cohérente de la dynamique future de la scène. Le modèle de politique intègre ensuite ces prédictions via un module d'attention croisée à base de tokens appris. Les auteurs introduisent également PhysMani-Bench, un nouveau benchmark de manipulation dynamique composé de 16 tâches, et rapportent un taux de réussite supérieur à des baselines solides, aussi bien en simulation que lors d'expériences avec un robot réel. Le papier, publié sur arXiv (2607.01938), ne précise ni la plateforme robotique utilisée ni de métriques chiffrées exactes (taux de réussite, temps de cycle, charge utile), ce qui en fait à ce stade une contribution de recherche plutôt qu'un produit ou un déploiement commercial. Pour l'industrie robotique, ce travail s'attaque à un point faible connu des modèles vision-langage-action (VLA) et des world models existants: leur difficulté à représenter une géométrie 3D précise et à anticiper une dynamique physiquement plausible pour des objets en mouvement rapide. La manipulation de cibles dynamiques, objets qui tombent, glissent ou sont lancés, reste l'un des angles morts des démonstrations actuelles de bras robotiques et d'humanoïdes, la plupart des systèmes généralistes étant surtout validés sur de la manipulation quasi statique. Si les résultats de PhysMani se confirment au-delà du cadre académique, cela ouvrirait une piste pour réduire l'écart entre démonstration en laboratoire et usage réel en logistique ou en industrie, où la prise d'objets en mouvement est fréquente sur convoyeur ou en tri à cadence élevée. Mais tant que l'étude reste limitée à un benchmark maison et sans comparaison indépendante, il s'agit d'une preuve de concept à confirmer, pas d'une solution prête à intégrer. Ce travail s'inscrit dans la lignée des world models 3D construits sur des représentations en Gaussiennes, une technique héritée du rendu de scènes et de plus en plus utilisée en robotique pour modéliser des environnements denses. Ces approches se positionnent face aux modèles VLA de bout en bout entraînés sur de larges corpus de démonstrations, popularisés par des acteurs comme Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T N2, ainsi qu'aux world models déjà exploités par d'autres équipes de recherche en manipulation. Aucun partenaire industriel ni acteur français ou européen n'est mentionné dans l'abstract. La suite logique pour les auteurs serait d'étendre le benchmark, de tester la méthode sur des plateformes robotiques variées, et de la comparer directement aux VLA généralistes pour situer PhysMani face aux solutions déjà commercialisées.

RechercheOpinion
1 source
Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes
81arXiv cs.RO 

Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes

Des chercheurs publient sur arXiv (référence 2607.02501v1) un runtime d'inférence baptisé Embodied.cpp, conçu pour exécuter des modèles d'IA incarnée directement sur des robots physiques. Écrit en C++, il cible spécifiquement les modèles vision-langage-action (VLA) et les modèles monde-action (WAM), deux familles d'architectures qui équipent aujourd'hui la plupart des humanoïdes et bras robotiques pilotés par apprentissage. Le système s'organise en cinq couches, des adaptateurs d'entrée jusqu'aux adaptateurs de déploiement, en passant par la construction de séquences, l'exécution du backbone et des modules de tête interchangeables. Les auteurs l'ont testé sur deux modèles VLA, HY-VLA et pi0.5, obtenant des taux de réussite de tâches en boucle fermée de 100,0% et 91,0% respectivement. Sur un benchmark préliminaire de modèle WAM utilisant un bloc Transformer LingBot-VA, la mémoire consommée par bloc chute de 312,2 MiB à 88,1 MiB. Cette publication s'attaque à un problème très concret pour les intégrateurs robotiques: le déploiement des modèles d'IA incarnée reste aujourd'hui fragmenté entre piles Python spécifiques à chaque modèle, hypothèses matérielles disparates et code de liaison écrit à la main pour chaque robot. Les runtimes d'inférence existants sont pensés pour du serving requête-réponse classique, pas pour les contraintes réelles du contrôle robotique: exécution multi-fréquence dans une boucle fermée, inférence batch-1 en priorité latence sur du matériel hétérogène, et interfaces au-delà du simple flux de tokens. Si les résultats se confirment à plus grande échelle, un runtime portable unique capable de faire tourner plusieurs familles de VLA et de WAM sur des appareils edge variés réduirait significativement le travail d'ingénierie nécessaire pour passer d'un prototype en simulation à un déploiement réel sur robot, un des goulots d'étranglement les plus cités du secteur. Le travail s'inscrit dans la course actuelle autour des modèles génériques de contrôle robotique, aux côtés d'architectures comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, qui cherchent toutes à unifier perception, langage et action dans un seul modèle déployable sur du matériel varié. En proposant une couche d'abstraction backend commune plutôt qu'un modèle de plus, Embodied.cpp se positionne comme brique d'infrastructure plutôt que comme concurrent direct, un signe que la standardisation de l'inférence embarquée devient un enjeu aussi important que la performance des modèles eux-mêmes.

InfrastructureActu
1 source
Transport discrepancy : un signal fiable pour évaluer les modèles vision-langage-action
82arXiv cs.RO 

Transport discrepancy : un signal fiable pour évaluer les modèles vision-langage-action

Article n'a pas d'entreprise/robot associé (papier arXiv académique), je m'en tiens aux faits rapportés, sans inventer d'affiliation ou de déploiement. Des chercheurs ont publié une version révisée sur arXiv (identifiant 2512.01715v2) d'un papier proposant DiG (Discrepancy Gate), un module additionnel destiné aux modèles vision-langage-action (VLA) qui génèrent leurs séquences de mouvement via flow matching. Le problème visé est concret : ces modèles n'ont aujourd'hui aucun moyen interne de savoir si une prédiction d'action est fiable, alors qu'un changement de distribution des données ou une tâche longue peuvent faire dériver les représentations internes du réseau loin de la zone où la tête d'action décode correctement. Les auteurs montrent que le coût de transport (mesuré via une distance de Wasserstein tranchée, ou sliced Wasserstein) entre les features de l'encodeur et la projection d'entrée de l'expert d'action augmente précisément au moment de cette dérive. DiG exploite ce signal : il le fait passer par une porte exponentielle qui module à la fois un raffinement résiduel des features et la fonction de perte à l'entraînement. À l'inférence, cette porte active un mécanisme baptisé DiG-Refine, qui corrige itérativement les séquences d'action avant leur exécution. Testé en simulation et en conditions réelles, DiG améliore de façon constante le taux de réussite des tâches, avec les gains les plus marqués sur les scénarios de changement de distribution et les tâches à long horizon. L'enjeu dépasse le seul confort académique : les architectures VLA à flow matching, sur lesquelles s'appuient plusieurs modèles de fondation robotique actuels générant des chunks d'action continus, fonctionnent aujourd'hui en boîte noire, sans jauge de confiance embarquée. Pour un intégrateur ou un opérateur industriel, l'absence d'un tel signal signifie qu'un robot peut exécuter une action erronée sans que le système sache qu'il est en train de dériver, un problème critique dès qu'on sort du cadre démo pour aller vers un déploiement en usine ou en entrepôt. DiG répond directement au fossé entre démonstration et fiabilité réelle en offrant un mécanisme d'auto-correction sans supervision supplémentaire ni réentraînement lourd, ce qui en fait un candidat pour être greffé sur des politiques existantes plutôt qu'une refonte d'architecture. Le papier s'inscrit dans la lignée des travaux récents sur le flow matching comme méthode de génération d'actions continues, une approche de plus en plus répandue dans les politiques robotiques génératives modernes en remplacement des méthodes de diffusion classiques ou du apprentissage par imitation discret. Il ne s'agit pas ici d'un produit commercial ni d'un déploiement annoncé, mais d'une contribution méthodologique destinée à la communauté recherche, publiée en tant que "replace" d'une version antérieure du même travail. Les suites logiques attendues sont une adoption potentielle par des équipes développant des politiques VLA en production, ainsi que des comparaisons futures avec d'autres approches de détection d'incertitude pour les modèles d'action continue.

RecherchePaper
1 source
VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire
83arXiv cs.RO 

VLSA : modèle vision-langage-action avec couche de contrainte de sécurité modulaire

Des chercheurs universitaires publient une architecture baptisée AEGIS, décrite dans un article arXiv (identifiant 2512.11891, version 2) consacré aux modèles vision-langage-action (VLA), ces systèmes qui permettent à un robot de traduire une instruction en langage naturel et une image en mouvement physique. AEGIS ajoute une couche de contrainte de sécurité "plug-and-play", construite à partir de fonctions de barrière de contrôle (control barrier functions), que l'on peut greffer sur un modèle VLA existant sans le réentraîner ni dégrader ses performances d'origine. Pour évaluer l'approche, les auteurs ont conçu un benchmark dédié, SafeLIBERO, qui multiplie les scénarios de manipulation avec des obstacles et des niveaux de complexité spatiale variables. Résultat annoncé: plus de 50% d'amélioration du taux d'évitement d'obstacles et près de 10% de hausse du taux de réussite des tâches, comparé aux meilleures méthodes existantes. Code et données sont publiés en accès libre. L'enjeu dépasse la prouesse technique isolée. Les modèles VLA généralistes, popularisés par des architectures comme Pi-0, GR00T N2 ou Helix, excellent à généraliser des instructions à de nouvelles tâches de manipulation, mais leur talon d'Achille reste la sécurité physique: rien ne garantit qu'un bras robotique évite une collision en environnement non structuré, un frein majeur au déploiement en usine ou en logistique. En proposant une couche de sécurité modulaire avec garanties théoriques plutôt qu'un simple filtrage heuristique, AEGIS répond directement à ce point de blocage identifié par les intégrateurs, sans nécessiter de repenser chaque modèle VLA au cas par cas. Ce travail s'inscrit dans la vague de recherche qui a suivi l'essor des VLA depuis RT-2 et OpenVLA, où l'accent s'est progressivement déplacé de la généralisation pure vers la fiabilité et la certifiabilité. Il faut toutefois noter que ces résultats proviennent d'un benchmark de simulation dérivé de LIBERO, pas d'un déploiement industriel réel: le passage à l'échelle sur du matériel physique et dans des environnements réellement non structurés reste l'étape suivante à observer, comme pour la plupart des publications de ce type avant adoption commerciale.

RechercheActu
1 source
Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique
84Robotics Business Review 

Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique

Blattner Co. et Built Robotics ont annoncé un contrat de 75 millions de dollars pour déployer à grande échelle les systèmes de construction autonome de Built Robotics sur l'ensemble des chantiers de Blattner aux États-Unis. Cet accord prolonge un partenariat noué l'an dernier et s'appuie sur sept déploiements déjà réalisés sur des projets solaires à l'échelle utility, totalisant plus d'un gigawatt de capacité installée. Fondée en 2016 à San Francisco et soutenue par Founders Fund, NEA et Tiger Global, Built Robotics propose une technologie qui convertit des engins de chantier existants (excavatrices, bulldozers, chargeuses) en machines à autonomie de niveau 4, c'est-à-dire sans opérateur dans la cabine, et compatible avec le matériel des principaux fabricants OEM. Blattner, basée à Avon (Minnesota), revendique plus de 115 ans d'expérience dans la construction d'infrastructures et affirme avoir installé plus de 20% de la capacité éolienne, solaire et de stockage d'énergie à l'échelle utility aux États-Unis. L'entreprise est une filiale du groupe Quanta Services, aux côtés de Blattner Energy et D.H. Blattner & Sons. Ce contrat illustre un mouvement de fond dans la construction d'infrastructures énergétiques: la demande en électricité liée aux data centers et à l'IA pousse à accélérer la construction solaire et de stockage par batteries, un secteur où Built Robotics situe déjà plus de 80% des nouvelles capacités de production. Face à une pénurie persistante de main-d'œuvre qualifiée dans le BTP, l'automatisation de niveau 4 permet, selon les deux entreprises, de maintenir les chantiers actifs de nuit et par mauvais temps, réduisant les délais de mise en service et limitant l'exposition des ouvriers aux engins lourds. Pour l'industrie de la robotique de construction, l'opération confirme que l'IA physique dépasse le stade de la démonstration isolée: il s'agit ici d'un déploiement répété et facturé à l'échelle, sur un client industriel réel, ce qui distingue ce cas des simples annonces de prototypes encore en phase pilote. Reste que les chiffres avancés (plus d'un gigawatt cumulé, 75 millions de dollars) proviennent des communiqués des deux parties et ne sont pas vérifiés de façon indépendante. Le partenariat s'inscrit dans la stratégie de Built Robotics visant le marché de la construction solaire à l'échelle utility, évalué à 300 milliards de dollars, et complète une collaboration récente avec le Safe Autonomous Systems Lab (xLAB) de l'université de Pennsylvanie, destinée à transformer les chantiers en terrain d'expérimentation pour l'IA physique. Brandon Bruski, vice-président senior solaire chez Blattner, présente cet approfondissement technologique comme un moyen de consolider la position de l'entreprise sur un marché en forte croissance, tandis que Noah Ready-Campbell, cofondateur et PDG de Built Robotics, situe l'enjeu dans une bascule plus large du secteur électrique américain vers le solaire et les batteries. Aucun calendrier précis de déploiement des nouveaux chantiers n'a été communiqué, mais l'accord signale une intensification attendue des investissements dans l'automatisation des grands chantiers d'infrastructure énergétique aux États-Unis dans les prochains mois.

IndustrielActu
1 source
IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique
85arXiv cs.RO 

IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique

Un article publié sur arXiv (2607.00836) dresse un état des lieux conceptuel des "world models" utilisés en robotique et en simulation générative, un terme dont le périmètre varie fortement selon les communautés de recherche. Les auteurs proposent une définition unifiée : un modèle du monde est un système conditionné par l'action qui prédit l'évolution future des observations ou des états pertinents pour une tâche donnée. Ils distinguent deux grandes familles : les modèles dans l'espace des observations, qui prédisent des images ou vidéos brutes, et les modèles dans l'espace des états, qui travaillent sur des représentations compactes. Chaque approche est comparée selon quatre critères : fidélité visuelle, structuration spatiale, interprétabilité physique et facilité d'usage pour le contrôle. Le papier introduit ensuite les "world action models", qui relient ces prédictions du futur à des actions robotiques exécutables, avec quatre paradigmes identifiés : imaginer puis exécuter, prédiction d'action conditionnée par des features vidéo, modélisation conjointe vidéo-action, et prédiction vidéo auxiliaire pour l'apprentissage de politiques. Cette clarification terminologique a une portée pratique pour les équipes qui développent des politiques robotiques : elle aide à choisir entre un modèle générateur de pixels, coûteux en calcul mais riche visuellement, et un modèle d'état plus léger, plus proche du contrôle temps réel mais moins interprétable. Elle formalise aussi un débat de fond du secteur : les modèles de génération vidéo produisent des démonstrations spectaculaires, mais leur utilité réelle pour piloter un bras ou un humanoïde reste à prouver, faute de garanties physiques strictes, ce qui rejoint les critiques récurrentes sur l'écart entre démo et déploiement réel. En distinguant explicitement l'approche "imaginer puis exécuter" des méthodes qui apprennent directement une politique conjointe vidéo-action, le tutoriel donne aux intégrateurs une grille de lecture pour évaluer les annonces commerciales selon ce qu'elles modélisent vraiment, plutôt que sur la seule qualité de leurs vidéos. Ce travail arrive alors que les world models occupent une place croissante dans la course aux modèles vision-langage-action, portée par des systèmes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui combinent tous, à des degrés divers, prédiction du futur et génération d'actions. Sans analyser directement ces produits commerciaux, la taxonomie proposée offre un cadre académique pour resituer ces systèmes les uns par rapport aux autres, à un moment où la recherche universitaire tente de structurer conceptuellement un domaine dont la vitesse de publication industrielle a largement dépassé la théorie.

RecherchePaper
1 source
IA incarnée : jeu de données de graphes de scène spatiaux pour l'évaluation de modèles vision-langage sur des trajectoires de manipulation robotique
86arXiv cs.RO 

IA incarnée : jeu de données de graphes de scène spatiaux pour l'évaluation de modèles vision-langage sur des trajectoires de manipulation robotique

Traduction avec le style demandé, en 3 paragraphes fluides sans titres. Une équipe de recherche présente EmbodimentSemantic, un jeu de données et un benchmark conçus pour évaluer la capacité des modèles vision-langage-action (VLA) à comprendre l'organisation spatiale des scènes en robotique manipulatrice. Le dataset représente chaque scène sous forme de graphe orienté objet-relation-objet, où chaque triplet encode une relation spatiale précise (support, contenance, ordre, occlusion, profondeur) entre deux objets. Il combine des observations réelles collectées avec le bras robotique low-cost SO101, accompagnées de graphes de scène générés automatiquement, ainsi qu'un benchmark simulé bâti sur l'environnement LIBERO comptant plus de 60 000 images de manipulation et plus de 120 000 graphes de scène spécifiques à chaque caméra, couvrant à la fois des vues à la troisième personne et des vues embarquées au poignet. Dans ce volet simulé, les relations de référence sont dérivées automatiquement de la géométrie MuJoCo, des coordonnées monde, des projections caméra et des contraintes de visibilité, ce qui garantit une annotation fiable sans intervention humaine. Ce travail met le doigt sur une faiblesse structurelle des systèmes VLA actuels: si ces modèles savent reconnaître des objets et suivre des instructions en langage naturel, ils peinent à représenter explicitement comment ces objets sont disposés les uns par rapport aux autres, en particulier sur les relations dépendantes de la profondeur ou du point de vue. Les expériences menées sur des VLM open source et commerciaux montrent que les modèles prédisent souvent des relations plausibles mais échouent sur la structure spatiale exacte, un écart qui rejoint le constat plus large d'un fossé entre démonstrations impressionnantes et robustesse réelle en conditions de manipulation. Pour les intégrateurs et équipes R&D, ce résultat suggère que l'injection explicite de graphes de scène dans les prompts des politiques VLA pourrait améliorer le contrôle en aval, une piste que les auteurs testent directement dans leurs expériences. EmbodimentSemantic s'inscrit dans la lignée des efforts récents visant à combler l'écart entre perception sémantique et contrôle moteur chez les modèles de type Pi-0, GR00T N2 ou Helix, qui reposent tous sur une compréhension fine de la géométrie de la scène pour planifier des trajectoires de manipulation fiables. En proposant un cadre unifié et reproductible pour diagnostiquer le grounding spatial, à la fois en environnement réel low-cost et en simulation contrôlée, les auteurs offrent un outil de benchmarking que les laboratoires de robotique pourront utiliser pour comparer objectivement leurs architectures VLA sur ce point précis, plutôt que de se fier aux seules démonstrations vidéo souvent sélectives des annonces commerciales.

RecherchePaper
1 source
Top 10 des avancées en robotique de juin 2026
87The Robot Report 

Top 10 des avancées en robotique de juin 2026

Traduction et résumé rédigés. Le Robot Report a publié son classement des dix actualités robotiques les plus lues de juin 2026, dominé par les levées de fonds et les déploiements de robots humanoïdes. En tête, Collaborative Robotics a dévoilé la deuxième génération de son robot mobile Proxie, avec une capacité de charge augmentée, des batteries à échange autonome et une option de manipulation à deux bras, visant la santé, la logistique et l'industrie. General Intuition a levé 320 millions de dollars en série A pour entraîner des modèles d'IA à partir de données de jeux vidéo plutôt que de téléopération classique. BMW a annoncé le déploiement du Figure 03 de Figure AI sur son site de Spartanburg, en Caroline du Sud, après une première phase avec le Figure 02. NEURA Robotics, fabricant allemand de "robots cognitifs", vise une série C pouvant atteindre 1,4 milliard de dollars sous conditions d'investisseurs non précisées. Agility Robotics a annoncé une fusion avec la SPAC Churchill Capital Corp. XI pour entrer en bourse. Standard Bots a bouclé une série C de 200 millions de dollars, valorisant l'entreprise à 1 milliard de dollars, pour étendre sa production à New York. AGIBOT a franchi la barre des 15 000 robots produits. RealSense a présenté sa caméra de profondeur D585 Pro à Automate, et NVIDIA a dévoilé de nouveaux outils open source pour l'IA physique lors du GTC Taipei et de Computex. Ce palmarès illustre surtout l'accélération du passage des humanoïdes de la démonstration vers le déploiement industriel réel, et l'appétit toujours vif des investisseurs pour l'IA physique. Le cas BMW est révélateur: reconduire un déploiement avec une génération suivante après une phase pilote réussie suggère un début de preuve de valeur opérationnelle, plutôt qu'un simple coup de communication, même si l'ampleur exacte du déploiement (nombre d'unités, tâches réalisées) reste à préciser par les sources primaires. La marche vers les marchés publics via SPAC pour Agility, tout comme les tours de financement de Standard Bots et NEURA, confirment que les investisseurs traitent désormais la robotique humanoïde comme un secteur de commercialisation, pas seulement de recherche. L'approche de General Intuition, qui parie sur les données de jeux vidéo pour entraîner la perception et l'action des robots, illustre aussi une diversification des stratégies d'entraînement face aux limites connues du sim-to-real et de la téléopération à grande échelle. Cette accumulation d'annonces s'inscrit dans la continuité des trajectoires déjà engagées: Figure AI construit sur son historique avec BMW depuis le Figure 02, AGIBOT poursuit sa montée en cadence de production en Chine, et NEURA Robotics, basée en Allemagne, cherche à s'imposer comme l'un des rares acteurs européens de poids face aux groupes américains et chinois. Agility, de son côté, mise sur son statut de pionnier américain coté en bourse avec des déploiements commerciaux actifs pour se différencier. Le Robot Report ouvre par ailleurs les propositions de sessions pour son événement RoboBusiness 2026, signe que ces tendances de financement et de déploiement devraient continuer d'alimenter les débats du secteur dans les mois à venir.

UENEURA Robotics, fabricant allemand de robots cognitifs, vise une levée pouvant atteindre 1,4 milliard de dollars pour s'imposer comme l'un des rares acteurs européens de poids face aux groupes américains et chinois.

HumanoïdesActu
1 source
MVP-Nav : navigateur planificateur avec carte de valeur multicouche
88arXiv cs.RO 

MVP-Nav : navigateur planificateur avec carte de valeur multicouche

Une équipe de recherche présente MVP-Nav, un système de navigation qui permet à un robot de trouver un objet cible dans un environnement inconnu en utilisant uniquement une caméra RGB, sans capteur de profondeur dédié (lidar ou caméra stéréo). Le problème visé est le "Zero-shot Object Goal Navigation" : un agent doit localiser un objet qu'il n'a jamais rencontré, dans un lieu qu'il découvre en temps réel. Sans mesure directe de la profondeur, les méthodes existantes souffrent soit d'un raisonnement sémantique de haut niveau déconnecté de la géométrie réelle, soit de politiques de bout en bout sans contrainte physique explicite, ce qui produit des trajectoires plausibles sur le papier mais dangereuses en pratique (collisions, chemins irréalisables). MVP-Nav répond à ce problème en reconstruisant une occupation physique explicite à partir d'images monoculaires : des modèles de fondation 3D projettent les instances sémantiques détectées en 2D vers des boîtes englobantes orientées en 3D, formant une carte spatiale globale. Une "Multi-layer Value Map" combine ensuite ces priorités sémantiques avec la géométrie reconstruite dans un espace de coût unique, permettant une planification à la fois sémantiquement pertinente et physiquement viable. L'intérêt pour le secteur de la robotique mobile et des agents embarqués (embodied AI) est direct : la dépendance à des capteurs de profondeur coûteux (lidar, stéréo, temps de vol) reste un frein majeur au déploiement à grande échelle de robots autonomes, notamment mobiles ou humanoïdes évoluant dans des environnements non cartographiés. Un système capable d'atteindre l'état de l'art sur les benchmarks de navigation zero-shot avec une simple caméra RGB représenterait une réduction significative du coût matériel et de la complexité d'intégration, tout en comblant l'écart classique entre "démo qui a l'air de marcher" et comportement réellement sûr sur le terrain, un problème récurrent dans les approches purement sémantiques ou apprises de bout en bout. Ces travaux s'inscrivent dans la lignée des approches combinant modèles de fondation visuels et planification robotique, où l'essor des modèles 3D pré-entraînés (reconstruction monoculaire, détection d'objets orientés) ouvre la voie à des architectures hybrides entre perception sémantique et contraintes physiques classiques. Il est important de noter que ce travail, publié sur arXiv, reste à ce stade une contribution de recherche validée sur des benchmarks de simulation standards pour la navigation d'objectif, sans mention de déploiement sur robot physique réel ni de partenaire industriel. Les prochaines étapes attendues pour ce type d'approche seraient sa validation en conditions réelles, hors simulateur, et son intégration éventuelle dans des piles de navigation de robots mobiles commerciaux.

RecherchePaper
1 source
Z-1 : apprentissage par renforcement efficace pour les modèles vision-langage-action
89arXiv cs.RO 

Z-1 : apprentissage par renforcement efficace pour les modèles vision-langage-action

Des chercheurs présentent Z-1, un framework de post-entraînement par apprentissage par renforcement (RL) pour les modèles Vision-Language-Action (VLA) à base de flow matching, décrit dans un article publié sur arXiv (2606.31846v1). Construit sur l'architecture π0.5 de Physical Intelligence, Z-1 s'appuie uniquement sur les démonstrations publiques RoboCasa pour la phase de fine-tuning supervisé (SFT), puis applique une stratégie de Group Relative Policy Optimization (GRPO) tâche par tâche sur 24 tâches standard du benchmark RoboCasa. Pour rendre cette optimisation en ligne plus stable et efficace, les auteurs combinent quatre techniques: construction de rollouts à préfixe partagé, branchement arborescent des trajectoires, calibration des récompenses tenant compte de la complétion des tâches, et entraînement conjoint sélectif du modèle vision-langage et de l'"Action Expert". Résultat: un taux de réussite moyen de 80,6% sur les 24 tâches, soit un gain de 13,2 points par rapport au modèle SFT de départ, et une performance supérieure aux meilleurs modèles publiés jusqu'ici. L'enjeu dépasse le simple gain de benchmark. La grande majorité des politiques VLA actuelles restent bridées par le behavior cloning ou le SFT sur données figées, une approche qui plafonne dès que le robot rencontre une situation absente des démonstrations. En montrant qu'un post-entraînement RL structuré peut améliorer significativement une politique flow-based sans données de démonstration privées supplémentaires, Z-1 apporte un argument concret en faveur du RL comme étape standard après le SFT, plutôt qu'une simple option de recherche. Pour les équipes qui entraînent des VLA pour la manipulation robotique, cela suggère une voie pour corriger les échecs récurrents d'une politique sans repasser par une collecte de données coûteuse. Le travail s'inscrit dans la lignée des modèles génération π (π0, π0.5 de Physical Intelligence) et fait écho aux efforts similaires chez GR00T N2 (NVIDIA) ou Helix (Figure AI), qui cherchent tous à faire passer les VLA du stade de la démonstration à celui d'une robustesse exploitable en conditions réelles. GRPO, popularisé dans l'entraînement de modèles de langage, est ici adapté aux contraintes du contrôle continu. Les auteurs présentent Z-1 comme une preuve de concept méthodologique, sans annoncer de déploiement matériel ni de calendrier commercial.

IA physiqueOpinion
1 source
L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen
90TechNode 

L'expansion des recrutements de NVIDIA en robotique en Chine, avec des postes à Pékin, Shanghai et Shenzhen

NVIDIA a lancé une campagne de recrutement d'ampleur pour son équipe robotique, avec des postes ouverts à Pékin, Shanghai et Shenzhen dans quatre domaines clés : IA incarnée (embodied AI), simulation, déploiement et architecture de solutions. L'équipe IA incarnée se concentrera sur la manipulation dextre, la modélisation du corps humain via capteurs portables, la manipulation mobile du corps entier et le contrôle corporel global, avec pour objectif le développement de robots généralistes de nouvelle génération. L'équipe simulation bâtira l'infrastructure de simulation et d'entraînement permettant aux robots d'apprendre efficacement en environnement virtuel avant de transférer ces capacités vers le monde réel de façon plus rapide et fiable. L'équipe déploiement optimisera les algorithmes pour robots humanoïdes et systèmes d'IA incarnée en vue d'accélérer leur mise en service concrète, tandis que l'équipe architecture de solutions adaptera les technologies NVIDIA à des secteurs comme l'industrie manufacturière et les services. Cette offensive de recrutement confirme la stratégie de NVIDIA : s'imposer comme fournisseur d'infrastructure (puces, simulation, frameworks type Isaac ou GR00T) plutôt que comme constructeur de robots, y compris sur le marché chinois malgré les restrictions américaines à l'export de puces IA vers la Chine. Le choix de Pékin, Shanghai et Shenzhen, hubs historiques de l'électronique et de la robotique chinoise, place l'entreprise en position de collaborer étroitement avec des acteurs locaux comme Unitree, AgiBot, Fourier Intelligence ou UBTech, tous engagés dans la course aux humanoïdes généralistes. Pour les intégrateurs et décideurs industriels, ce mouvement souligne l'importance croissante du transfert sim-to-real et des architectures VLA (vision-langage-action) comme verrou technologique central du secteur. Cette expansion s'inscrit dans la continuité des investissements de NVIDIA en robotique depuis 2024, autour de plateformes comme Isaac Sim, Jetson Thor et les modèles GR00T. En renforçant sa présence locale en Chine plutôt qu'en se limitant à l'export de matériel, l'entreprise cherche à ancrer sa pile logicielle dans un écosystème manufacturier en pleine effervescence, où plusieurs constructeurs déploient déjà des humanoïdes en usine.

Chine/AsieOpinion
1 source
Cellules robotiques souples de Morph : l'IA physique intégrée directement dans le matériel
91Robotics Business Review 

Cellules robotiques souples de Morph : l'IA physique intégrée directement dans le matériel

La startup londonienne morph développe des cellules robotiques souples dans lesquelles l'intelligence artificielle est intégrée directement dans le matériau, et non ajoutée par couche logicielle distincte. Fondée par le Dr Jean Nehme, ancien chirurgien reconstructeur et créateur de Digital Surgery, une société d'IA chirurgicale qu'il a ensuite cédée, morph conçoit des cellules déformables capables de modifier en temps réel leur morphologie, leur rigidité et leur comportement mécanique en réponse à des données sensorielles. Ces cellules embarquent des modèles d'IA physique (physical AI) qui reçoivent des informations de capteurs, les interprètent, puis génèrent des changements de forme, de mouvement ou de résistance pour s'adapter à leur environnement ou à leur tâche. L'entreprise s'appuie sur l'apprentissage par renforcement couplé à une simulation physique haute-fidélité pour accélérer le passage du prototype au produit, et prévoit de déployer ces cellules dans de multiples facteurs de forme robotiques. Le positionnement de morph conteste un axiome bien ancré dans l'industrie : celui qui traite le hardware comme une plateforme passive sur laquelle vient s'asseoir le logiciel intelligent. Nehme soutient qu'un robot dont le substrat physique est fixe atteindra toujours ses limites dans des environnements non structurés, notamment hors des entrepôts industriels où évoluent la plupart des humanoïdes actuels (Figure, Tesla Optimus, Boston Dynamics). Les matériaux souples permettent des interactions plus sûres avec les humains, réduisent les risques de blessure au contact, et offrent des coûts de fabrication potentiellement inférieurs à ceux des systèmes rigides articulés. La boucle d'apprentissage continu intégrée dans les modèles déployés est également notable : une fois les cellules en production, elles continueraient à affiner leur comportement à partir de données réelles, réduisant ainsi le gap simulation-réalité (sim-to-real gap) qui plombe encore de nombreux systèmes robotiques. Reste à nuancer : l'article ne fournit ni métriques de performance (payload, temps de cycle, répétabilité), ni dates de déploiement commercial, ni clients identifiés, ce qui maintient morph au stade de l'annonce technologique plutôt que du produit shipé. La robotique souple est un champ de recherche actif depuis une décennie, porté notamment par des laboratoires comme le Soft Robotics Toolkit de Harvard ou l'EPFL, mais sa commercialisation reste marginale comparée aux systèmes rigides. morph entre sur ce marché avec un angle "physical AI embarqué", là où des acteurs comme Soft Robotics Inc. (racheté par ABB en 2023) misaient plutôt sur les effecteurs pneumatiques pour la préhension industrielle. L'inspiration revendiquée par Nehme est biologique : le poulpe, capable de reconfigurer sa forme sans squelette rigide. En Europe, des startups comme Enchanted Tools (France) ou Wandercraft explorent également des voies alternatives à la robotique rigide, mais sur des architectures différentes. Les prochaines étapes de morph ne sont pas précisées dans cette publication, et l'entreprise n'a pas encore communiqué sur ses levées de fonds ni sur des pilotes industriels en cours.

UEStartup londonienne sans déploiement ni partenariat européen annoncé ; le concept pourrait éventuellement concurrencer des acteurs FR comme Enchanted Tools sur le segment de la robotique souple adaptative, mais aucun impact concret identifiable à ce stade.

IA physiquePaper
1 source
DRIVE-Nav : raisonnement directionnel, inspection et vérification pour une navigation efficace à vocabulaire ouvert
92arXiv cs.RO 

DRIVE-Nav : raisonnement directionnel, inspection et vérification pour une navigation efficace à vocabulaire ouvert

Des chercheurs ont publié DRIVE-Nav, un framework pour la navigation en vocabulaire ouvert (OVON, Open-Vocabulary Object Navigation), qui permet à un agent robotique de localiser un objet désigné en langage naturel dans un environnement inconnu. La méthode structure l'exploration autour de "directions persistantes" plutôt que de frontières brutes classiques, en restreignant les décisions à un champ de vue frontal de 240 degrés. Les candidats directionnels sont extraits via une méthode Fast Marching Method (FMM) pondérée, combinée à un enrichissement de prompts vision-langage et une vérification inter-frames pour améliorer la fiabilité du grounding sémantique. Sur le benchmark HM3D-OVON, DRIVE-Nav atteint 50,2 % de taux de succès (SR) et 32,6 % de SPL (Success weighted by Path Length, mesure d'efficacité du chemin), surpassant la meilleure méthode précédente de 1,9 points SR et 5,6 points SPL. Le système obtient également le meilleur SPL sur trois autres benchmarks standard : HM3Dv1, HM3Dv2 et MP3D. Une validation sur robot humanoïde physique est mentionnée. Le gain de 5,6 points de SPL est le résultat le plus structurellement significatif : il indique que l'agent atteint ses cibles non seulement avec succès, mais via des chemins plus courts, ce qui est directement pertinent pour les applications industrielles où le temps de cycle est un critère opérationnel. L'approche s'attaque à un problème récurrent des méthodes zero-shot : la redondance des candidats frontières et les re-visites coûteuses. En maintenant un registre de directions déjà inspectées, DRIVE-Nav réduit l'overhead panoramique que l'on reproche aux méthodes topology-aware. Le déploiement sur humanoïde, bien que brièvement mentionné sans détails de conditions ni métriques, suggère une transférabilité sim-to-real partielle. La navigation OVON est un sous-domaine de l'embodied AI en croissance rapide depuis 2022, porté par les progrès des modèles vision-langage de type CLIP et LLaVA. Les méthodes concurrentes incluent ESC, OpenFMNav et diverses approches zéro-shot basées sur LLM. DRIVE-Nav s'inscrit comme une amélioration incrémentale mais solide de cette famille, sans rupture architecturale majeure. Les benchmarks HM3D et MP3D sont les standards de facto du domaine, développés par Meta Research. Ce travail est une preprint arXiv (2603.28691v2, version révisée), non encore peer-reviewed au moment de la publication. Aucun laboratoire ou industriel européen n'est impliqué.

RecherchePaper
1 source
TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)
93arXiv cs.RO 

TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2606.29089) une méthode appelée TAP-VLA (Tactile Annotation Prompting for Vision-Language-Action models) visant à doter les modèles vision-langage-action du sens du toucher sans modifier leur architecture. Sur quatre tâches de manipulation à contacts complexes (vissage, insertion, assemblage de précision), TAP-VLA atteint un taux de succès de 78 %, contre moins de 50 % pour un fine-tuning purement visuel et pour les approches alternatives de fusion tactile, certaines de ces baselines ne faisant pas mieux qu'un résultat aléatoire. Le principe repose sur des capteurs visuo-tactiles capables de mesurer les champs de cisaillement (shear fields) à la surface de contact ; ces champs sont ensuite superposés sous forme de vecteurs spatialement alignés directement sur les images RGB multi-vues que le modèle consomme déjà, sans ajouter de modalité d'entrée distincte. L'enjeu est réel : les VLAs de génération actuelle, comme π0 de Physical Intelligence, OpenVLA ou RT-2 de Google DeepMind, offrent un raisonnement robuste sur les variations visuelles, sémantiques et spatiales grâce à leur pré-entraînement à grande échelle, mais restent aveugles aux forces de contact, pourtant centrales dans toute manipulation industrielle sérieuse (emboîtement de précision, vissage, gestion d'objets déformables). Intégrer le toucher comme nouvelle modalité d'entrée détériore précisément ce pré-entraînement, car les données tactiles sont absentes des corpus à grande échelle sur lesquels ces modèles sont construits, un problème de distribution shift bien documenté dans la littérature. TAP-VLA contourne l'obstacle en restant dans l'espace d'observation natif du modèle : pas de modification architecturale, pas de pré-entraînement tactile spécifique, surcoût computationnel négligeable. Ce travail s'inscrit dans une course active autour de l'embodied AI pour la manipulation de précision, où Physical Intelligence (π0, π0-FAST), Figure AI ou Apptronik cherchent à étendre les capacités de leurs humanoïdes et bras industriels au-delà du pick-and-place visuel. La question du sim-to-real pour les contacts reste l'un des derniers verrous majeurs avant un déploiement industriel à l'échelle. En évitant la refonte architecturale, TAP-VLA propose une voie d'intégration compatible avec les VLAs existants, ce qui simplifie son adoption par des équipes qui travaillent à partir de modèles déjà entraînés. La publication sur arXiv sans conférence associée indique que ce travail est encore en cours d'évaluation par les pairs ; aucun déploiement réel ou pilote industriel n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Les coulisses du rachat de Kinisi par Bear Robotics
94The Robot Report 

Les coulisses du rachat de Kinisi par Bear Robotics

Bear Robotics, fabricant américain de robots de service connu pour son robot de restauration Servi, a annoncé l'acquisition de Kinisi Robotics, startup britannique spécialisée dans l'automatisation industrielle par apprentissage par renforcement. Les modalités financières de la transaction n'ont pas été divulguées. Kinisi, basée à Bristol (Royaume-Uni), développe le KR1, un prototype conçu pour automatiser des tâches industrielles répétitives et pénibles en collaboration avec des opérateurs humains, sans recourir à l'automatisation hardcodée traditionnelle. La société est fondée par Bren Pierce, titulaire d'un doctorat en robotique humanoïde de la Technische Universität München (TUM) et fort d'une décennie de recherche internationale. À son actif au fil de ses ventures précédentes : plus de 180 millions de dollars levés et plus de 10 000 robots déployés à l'échelle mondiale. L'acquisition illustre une dynamique de consolidation qui s'accélère dans le secteur, où les acteurs établis cherchent à intégrer des capacités d'IA physique plutôt que de les développer en interne. Bear Robotics, historiquement ancré dans la robotique de service en restauration, élargit son portefeuille vers l'industrie grâce à la technologie de Kinisi, qui substitue au pipeline de règles figées des politiques motrices apprises par reinforcement learning (RL). Cette approche permet une adaptation aux variations d'environnement sans reprogrammation manuelle, un avantage décisif pour les tâches non structurées ou insalubres que rejettent les systèmes classiques. L'annonce intervient dans la même semaine qu'une autre nouvelle structurante : Agility Robotics, fabricant du robot humanoïde Digit déployé chez Amazon, a confirmé son entrée en bourse via une fusion SPAC, signal supplémentaire d'une industrie qui cherche des voies de financement à grande échelle. Bear Robotics a été fondée en 2017 à Redwood City, en Californie, avec des investisseurs comme SoftBank Vision Fund, LG Electronics et Naver. Son robot Servi est déployé dans des centaines de restaurants aux États-Unis, en Corée du Sud et au Japon. Kinisi est une startup plus récente, mais portée par le profil éprouvé de Pierce. La course aux capacités d'IA physique mobilise aujourd'hui Figure AI, 1X Technologies, Apptronik ou encore Enchanted Tools en Europe, tous en train de lever des centaines de millions pour accélérer le passage du prototype au déploiement industriel réel. C'est précisément ce sim-to-real gap que Kinisi prétend adresser avec le KR1, mais les détails de performance publiés restent pour l'instant limités aux annonces d'acquisition : la démonstration à l'échelle, en conditions industrielles réelles, reste le critère que le marché attendra avant de valider la thèse.

UELe rachat d'une startup britannique en RL industriel par un acteur américain illustre la pression d'acquisition qui s'exerce sur les startups européennes de robotique, renforçant l'urgence d'une stratégie de consolidation autonome au sein de l'écosystème EU face aux capitaux extra-européens.

BusinessOpinion
1 source
Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area
95Pandaily 

Zhipingfang valorisé à 2,8 milliards : première licorne d'IA incarnée de la Greater Bay Area

Zhipingfang, startup d'IA incarnée basée à Shenzhen, a bouclé une levée de fonds d'environ 5 milliards de yuans (700 millions de dollars), portant sa valorisation à plus de 20 milliards de yuans (2,8 milliards de dollars). L'opération en fait le premier licorne de l'IA incarnée de la Greater Bay Area à franchir ce seuil. Le tour réunit un spectre inhabituellement large d'investisseurs : fonds publics nationaux (National SME Development Fund, China Cultural Industry System Fund), fonds provinciaux dédiés à l'IA, compagnies d'assurance et maisons de titres, et investisseurs industriels dont CP Group (China Biologic Products), Pharmaron, Moutai Group et China Merchants Capital. La société commercialise une architecture baptisée NeuroVLA, présentée par son fondateur et CEO, Guo Yandong, au Summer Davos Forum de juin 2026, où le Premier ministre Li Qiang a expressément cité le Shenzhen Robot Valley comme vitrine de l'écosystème d'innovation chinois. NeuroVLA organise le traitement en trois couches hiérarchiques calquées sur le système nerveux humain : un module cortical pour le raisonnement sémantique de haut niveau, un module cérébelleux pour le contrôle moteur coordonné, et un module spinal pulsé pour les boucles de rétroaction à ultra-faible latence. L'intérêt industriel de cette architecture réside dans l'efficacité computationnelle, problème structurel des systèmes robotiques actuels. Les architectures VLA (Vision-Language-Action) conventionnelles mobilisent l'intégralité de la puissance de calcul quelle que soit la complexité de la tâche, ce qui se traduit par des coûts d'inférence prohibitifs et des latences incompatibles avec le contrôle temps réel. NeuroVLA prétend résoudre cela par un routage événementiel : les boucles rapides (réflexes, stabilisation) sont traitées en couches basses, libérant le "cortex" pour le raisonnement symbolique. Le modèle biologique invoqué est le cerveau humain, 86 milliards de neurones fonctionnant à environ 20 watts, soit une densité de calcul que les GPU actuels n'approchent pas à consommation équivalente. Il faut cependant noter que les performances opérationnelles de NeuroVLA en conditions industrielles réelles ne sont pas documentées publiquement au-delà des communications de la société, et que l'affirmation de "première mondiale" reste invérifiable en l'absence de benchmark comparatif indépendant. La trajectoire financière de Zhipingfang est en elle-même un signal de marché : 12 tours de financement bouclés en un an, et une valorisation doublée de 10 à 20 milliards de yuans en quatre mois seulement, ce qui en fait, selon ses propres déclarations, la startup d'IA incarnée la plus rapide à lever à ce rythme et à cette échelle. L'entreprise est implantée au Shenzhen Robot Valley, pôle qui concentre également des acteurs comme Unitree, et s'inscrit dans une dynamique nationale où Pékin oriente massivement les fonds souverains vers l'IA incarnée pour concurrencer Figure AI (valorisé à 2,6 milliards de dollars fin 2024), Physical Intelligence et 1X côté américain, et Agility Robotics côté déploiements industriels. Aucune timeline de déploiement commercial ni volume de commandes n'ont été communiqués ; la levée reste pour l'instant une étape de financement de R&D et d'industrialisation, pas une annonce de mise en production à grande échelle.

UELa levée de 700 M$ consolide la position de la Chine dans la course à l'IA incarnée, renforçant la pression concurrentielle indirecte sur les acteurs français et européens sans impact direct sur le marché UE à ce stade.

Chine/AsieOpinion
1 source
S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon
96arXiv cs.RO 

S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon

Un groupe de chercheurs a publié S²-VLA (State-Space Guided Vision-Language-Action), une architecture destinée à résoudre l'une des limitations structurelles des modèles VLA en manipulation robotique : la dégradation des performances sur les tâches longues due à la propagation cumulative des erreurs. Le coeur du système est le mécanisme SSGAA (State-Space Guided Adaptive Attention), qui maintient un "état de croyance" (belief state) actualisé à chaque étape de la tâche et génère des poids de fusion dynamiques, là où les architectures VLA existantes utilisent des poids fixes. Ces poids adaptatifs combinent trois sources : les caractéristiques visuelles pour la perception spatiale, les intentions de haut niveau pour la planification, et les séquences d'actions temporelles pour la cohérence d'exécution. Avec 2 milliards de paramètres seulement, S²-VLA surpasse des modèles de 7 milliards sur les benchmarks LIBERO et SimplerEnv, deux références pour l'évaluation des tâches de manipulation longue séquence. Le résultat le plus saillant est l'efficacité paramétrique : battre des modèles 7B avec un modèle 2B remet en question l'hypothèse selon laquelle la performance sur des tâches complexes serait avant tout une affaire de scaling. Pour les intégrateurs industriels et les équipes déployant des robots manipulateurs, cela ouvre la voie à une inférence embarquée sur des plateformes aux ressources limitées. Sur le plan de la recherche, le papier formalise un point de friction bien identifié : la fusion statique des représentations visuelles, linguistiques et motrices crée une rigidité qui amplifie les erreurs au fil des étapes. L'emprunt aux modèles d'espace d'états (State Space Models, d'où "S²") pour introduire une mémoire adaptative dans la fusion est l'apport architectural central. Les modèles VLA ont connu une accélération significative depuis 2024, avec Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA) comme jalons récents, tous confrontés à la même limite sur les longs horizons de tâches. S²-VLA s'inscrit dans un courant de recherche cherchant à résoudre ce "long-horizon gap" par l'architecture plutôt que par l'échelle. Le papier est disponible sur arXiv (référence 2606.27872v1) et reste un preprint non évalué par les pairs : les résultats annoncés sont à confirmer indépendamment. Aucun code ni dataset n'est encore annoncé publiquement, et les affiliations institutionnelles des auteurs ne figurent pas dans le résumé disponible.

💬 Un modèle de 2 milliards qui bat des modèles de 7 milliards sur les tâches longues, c'est le genre de résultat qui remet en question l'obsession du scaling. L'astuce : une attention adaptative qui maintient un état de croyance continu entre chaque étape de la tâche, là où les VLA existants utilisent encore des poids fixes et accumulent les erreurs au fil des actions. C'est un preprint sans code pour l'instant, mais si ça se confirme, les robots embarqués sur hardware limité deviennent soudainement une option sérieuse.

IA physiqueOpinion
1 source
StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique
97arXiv cs.RO 

StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique

Des chercheurs ont publié sur arXiv (référence 2512.21970v2) StereoVLA, un modèle Vision-Language-Action (VLA) qui intègre la stéréovision dans les pipelines de manipulation robotique généraliste. L'architecture repose sur un encodeur visuel GeoSem (Geometric-and-Semantic), qui extrait en parallèle des indices géométriques issus des disparités entre vues stéréoscopiques et des représentations sémantiques classiques à partir des pixels RGB. Le modèle intègre deux objectifs de co-entraînement : l'Interaction-Region Depth Estimation, pour affiner le raisonnement spatial lors des saisies, et la Camera Parameter Estimation, pour aligner implicitement les repères de perception et d'action du robot. Entraîné sur des données stéréo synthétiques à grande échelle, StereoVLA atteint un gain absolu de 33,4 points de pourcentage en taux de succès en conditions réelles par rapport aux baselines monoculaires, et démontre une robustesse marquée à des angles de caméra proches de l'hémisphère supérieur. Ce gain de 33,4 % est substantiel dans un domaine où les progrès incrémentaux dominent la littérature. Il confirme une hypothèse structurelle : les encodeurs visuels préentraînés sur lesquels s'appuient les VLA actuels (CLIP, SigLIP) sont optimisés pour l'alignement sémantique, au détriment de la représentation géométrique 3D indispensable à la manipulation fine. Pour un intégrateur ou un COO industriel, cette démonstration repositionne le choix du capteur (stéréo vs monoculaire) comme décision architecturale critique dans toute cellule robotisée guidée par VLA. La robustesse aux angles hémisphériques est également un signal de maturité opérationnelle : en déploiement réel, la posture du bras et les contraintes d'encombrement imposent des perspectives de caméra qui mettent en défaut les VLA classiques. Les VLA (Pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA) constituent depuis 2024 le nouveau paradigme de contrôle généraliste pour la manipulation, mais reposent tous sur des encodeurs conçus pour la vision sémantique, non géométrique. StereoVLA adresse directement ce goulot d'étranglement en exploitant la stéréovision, technologie éprouvée dans les AMR et les caméras industrielles de profondeur (RealSense, ZED), mais restée jusqu'ici absente des pipelines VLA. L'étude demeure au stade de la recherche académique : aucun déploiement industriel ni partenariat constructeur n'est annoncé. La validité externe du gain de 33,4 % devra être éprouvée sur des bras commerciaux variés (Franka, UR, xArm) et dans des environnements moins contrôlés avant de conclure à une transférabilité industrielle.

IA physiqueOpinion
1 source
Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed
9836Kr 

Li Hongyang (HKU) lance une startup d'IA incarnée corps entier et lève des centaines de millions en seed

Archon Robotics (源策未来, "Yuance Weilai"), startup fondée en avril 2026 et basée dans la zone de développement de Caohejing à Shanghai, vient de boucler un tour de table seed de plusieurs centaines de millions de yuans. La levée réunit des fonds de premier plan dont Zhenge Fund, Gaorong Capital, IDG Capital et Wuyuan Capital, auxquels s'ajoutent le fonds conjoint Gobi Ventures / Université de Hong Kong, Miracle Plus et le Shanghai AI Innovation Institute. Light Source Capital agissait comme conseiller financier exclusif. Les fonds serviront à accélérer le développement d'un modèle fondateur humanoïde "whole-body", à constituer des jeux de données multimodaux de mouvements plein corps, et à ouvrir plusieurs centres de R&D. L'entreprise vise la publication d'un modèle open-source avant fin 2026. La société est dirigée par Li Hongyang, actuellement assistant professor et vice-doyen à l'Université de Hong Kong, dont le projet de conduite autonome end-to-end UniAD a remporté le Best Paper au CVPR 2023, seul travail d'une institution académique continentale à décrocher ce prix depuis dix ans. Il a également reçu en 2026 le RSS Early Career Award, première distinction de ce type décernée à un chercheur chinois en vingt ans d'existence du prix. Le CEO Li Tianyu, docteur de Fudan University, a co-développé le moteur "World Engine" de la solution de conduite autonome ADS 4.0 de Huawei. Le co-fondateur Chen Li, premier auteur d'UniAD, est issu du programme d'excellence Zhiyuan de l'Université Jiao Tong de Shanghai. Le pari technique d'Archon Robotics répond à une limite structurelle largement ignorée : les datasets actuels en robotique incarnée reposent quasi exclusivement sur des vidéos en vue première personne du poste de travail, enregistrant uniquement des trajectoires de bras ou de préhenseurs. Ces données ne capturent ni les déplacements du centre de gravité, ni la coordination tronc-membres, ni le transfert de force des membres inférieurs vers les membres supérieurs, c'est-à-dire précisément ce qui permet à un humain d'ouvrir une porte lourde en inclinant le corps plutôt qu'en tirant simplement le bras. La conséquence directe est que la quasi-totalité des robots actuels reste cantonnée à des préhensions sur surface plane à position fixe, incapable d'adaptation en environnement domestique non préétabli. Li Tianyu résume : "une donnée plein corps intégrant le déplacement du centre de gravité et l'angle du tronc a une densité d'information bien supérieure à cent enregistrements de trajectoire de main." La société construit donc une architecture tri-couche propriétaire : un "grand cerveau" pour la planification longue portée, un "mésencéphale" apprenant des représentations de mouvement plein corps transferrables d'un châssis à l'autre, et un "cervelet" assurant le suivi de pose et l'équilibre en temps réel. L'output n'est pas une liste d'angles articulaires spécifiques à un modèle de robot, mais une trajectoire de mouvement plein corps compatible avec plusieurs morphologies. Le contexte sectoriel est porteur mais saturé : au premier semestre 2026, le secteur de la robotique incarnée en Chine a enregistré 288 opérations de financement pour un total déclaré de plus de 46 milliards de yuans, proche du niveau annuel 2025 (55,4 milliards). Archon se positionne sur un créneau encore peu occupé en ciblant directement le modèle fondateur humanoïde généraliste plutôt que les solutions hybrides à châssis roulant avec bras manipulateurs, qui dominent actuellement le marché faute de savoir-faire en locomotion bipède. Li Hongyang compare l'état actuel de l'industrie à un niveau "L1,5" par analogie avec les grades de conduite autonome : les démos publiques relèvent encore majoritairement du contrôle à distance ou de scénarios entièrement scriptés, sans capacité autonome réelle sur des tâches multi-étapes en environnement ouvert. Les concurrents directs sur la brique modèle fondateur incluent Physical Intelligence (Pi-0), NVIDIA (GR00T N2), et Figure AI côté occidental, ainsi que plusieurs équipes chinoises moins bien documentées. Archon se différencie en ciblant explicitement les données "human-centric" incluant posture complète et marqueurs de force, avec une collecte mixte alliant données humaines dans des scènes réelles et données de téléopération sur robots physiques, dans une boucle ferme collecte-entraînement-retour d'erreur destinée à constituer une barrière concurrentielle durable.

Chine/AsieOpinion
1 source
Affinage par renforcement des politiques de flux pour les modèles vision-langage-action (VLA)
99arXiv cs.RO 

Affinage par renforcement des politiques de flux pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (papier 2510.09976v2) un algorithme baptisé Flow Policy Optimization (FPO), conçu pour affiner par renforcement les modèles Vision-Language-Action (VLA) basés sur le flow-matching, en particulier le modèle π₀ (Pi-0) de Physical Intelligence. L'évaluation porte sur deux benchmarks de simulation robotique standards : LIBERO et ALOHA. FPO intègre quatre composants : une attribution de crédit sensible à la structure du réseau (structure-aware credit assignment), des objectifs surrogate clippés à la manière de PPO, une exploration latente multi-étapes, et un ensemble de Q-functions (Q-ensemble) pour estabiliser l'estimation de valeur. Les résultats montrent des gains constants sur le prior d'imitation et sur des baselines concurrentes, dont π₀-FAST, des approches RL autorégressive et diffusion, dans un régime de récompenses éparses. Le verrou technique résolu par FPO est fondamental : les méthodes de policy gradient classiques (PPO, GRPO) requièrent le calcul explicite de ratios de probabilité entre l'ancienne et la nouvelle politique (importance sampling), ce qui est mathématiquement intractable pour les modèles à flow-matching continu comme π₀. FPO contourne ce problème en reformulant l'importance sampling à partir des variations par échantillon de l'objectif conditionnel de flow-matching. C'est un déblocage algorithmique, pas un simple réglage d'hyperparamètres. Cela signifie que la famille de modèles la plus performante actuellement pour la manipulation généraliste, les VLA basées sur des politiques diffusion/flow, devient désormais accessible au fine-tuning par RL en ligne, sans qu'il faille revenir à des architectures autorégressive ou gaussiennes moins expressives. Le contexte est celui d'une course intense pour convertir la généralisation des grands modèles VLA en performance réelle sur tâches industrielles. π₀, développé par Physical Intelligence (ex-chercheurs de Google DeepMind et Stanford, fondée en 2023), a démontré une polyvalence remarquable sur données multi-robot, mais reste contraint par la qualité de ses démonstrations supervisées. FPO s'inscrit dans une tendance plus large, après RFT sur LLMs (DeepSeek-R1, Qwen), d'appliquer le fine-tuning par renforcement aux politiques robotiques. Les concurrents directs incluent OpenVLA (Berkeley), Octo (également Berkeley), et les approches RL sur modèles diffusion comme DPPO. Le papier reste pour l'instant en simulation ; le transfert sim-to-real sur π₀ avec FPO n'est pas encore documenté, ce qui constitue la prochaine étape critique avant tout déploiement industriel.

💬 Ce qui bloquait le fine-tuning par RL sur π₀, c'était mathématiquement intractable, pas un détail de tuning. FPO contourne ça proprement, et le résultat c'est que la famille de modèles VLA la plus expressive devient enfin accessible au renforcement en ligne, sans avoir à rétrograder vers des architectures moins capables. La prochaine étape, c'est le sim-to-real, et là j'attends de voir.

IA physiqueOpinion
1 source
ForesightSafety-VLA : un benchmark unifié de diagnostic de sécurité pour les modèles vision-langage-action (VLA)
100arXiv cs.RO 

ForesightSafety-VLA : un benchmark unifié de diagnostic de sécurité pour les modèles vision-langage-action (VLA)

Une équipe de recherche a publié sur arXiv (réf. 2606.27079) un benchmark diagnostique baptisé ForesightSafety-VLA, conçu pour évaluer spécifiquement la sécurité des modèles vision-langage-action (VLA) en robotique incarnée. Le système propose une taxonomie de 13 catégories réparties en trois blocs : Safe-Core (sécurité lors des interactions physiques), Safe-Lang (sécurité côté instruction) et Safe-Vis (sécurité côté perception). Les évaluations portent sur 66 scénarios de base augmentés de contraintes de sécurité, déployés dans le simulateur RoboTwin sur 5 morphologies robotiques distinctes. Les politiques sont testées selon trois axes de variation contrôlée : structure de la scène, commande en langage naturel et observation visuelle. Au-delà du simple taux de succès binaire, le benchmark mesure le risque au niveau processus via deux métriques : le coût de sécurité cumulatif (CC) et le temps d'exposition au risque (RET), complétés par une décomposition en quatre quadrants distinguant succès et échecs sûrs ou dangereux. Les résultats révèlent une lacune structurelle dans l'évaluation des VLA actuels : même les politiques les plus performantes accumulent des coûts de sécurité non négligeables et réussissent des tâches nominales via des trajectoires dangereuses. Plus significatif encore, les variations de structure de scène et d'observation visuelle dégradent la sécurité beaucoup plus fortement que les variations de commandes en langage naturel. Ce résultat contredit l'hypothèse implicite selon laquelle la sécurité serait avant tout un problème de compréhension d'instructions : elle est en réalité étroitement couplée à la perception, à l'ancrage sensorimoteur et à la compétence de contrôle bas niveau. Cela suggère que les filtres de sécurité post-hoc ne suffisent pas à compenser les déficits de perception et de planification. Ce travail s'inscrit dans un contexte où les VLA progressent rapidement vers des capacités généralistes, portés par des modèles comme pi-zéro (Physical Intelligence), OpenVLA ou RT-2 (Google DeepMind), dont les limites de sécurité restent mal documentées dans la littérature. ForesightSafety-VLA tente de combler ce vide méthodologique en imposant la sécurité comme cible principale d'évaluation, plutôt qu'un indicateur secondaire. La publication reste au stade de benchmark de recherche, sans déploiement industriel ni partenariat annoncé. Les suites naturelles concernent l'extension à des environnements réels, à des robots mobiles, et l'intégration du benchmark dans les pipelines d'entraînement pour orienter l'apprentissage vers des comportements intrinsèquement sûrs.

RecherchePaper
1 source