Aller au contenu principal

Dossier IA physique & VLA

904 articles

L'IA physique : modèles vision-langage-action qui contrôlent des corps robotisés. État de l'art académique (CoRL, RSS) et premières productions industrielles.

1Robotics & Automation News Chine/AsieOpinion

Fujitsu s'associe à Fanuc, Yaskawa et Kawasaki pour faire progresser l'IA physique avec la technologie Nvidia

Voici l'article traduit et résumé : Fujitsu a lancé un partenariat avec les trois grands fabricants japonais de robotique Fanuc, Yaskawa Electric et Kawasaki Heavy Industries pour développer et déployer l'IA physique dans la fabrication, la logistique et la santé. L'initiative intègre également les technologies d'IA physique de Nvidia, les partenaires cherchant à construire une plateforme de contrôle collaborative capable de relier systèmes numériques et robots. L'annonce reste à ce stade programmatique : aucune date de déploiement, aucun chiffre de performance (payload, DOF, temps de cycle) ni calendrier de commercialisation n'a été communiqué. Il s'agit pour l'instant d'un cadre de collaboration technologique plutôt que d'un produit ou d'un pilote industriel concret. Ce rapprochement illustre la consolidation en cours entre géants industriels japonais autour de l'IA physique, un secteur jusqu'ici dominé dans le discours public par les humanoïdes américains et chinois (Figure, Tesla Optimus, Unitree) et les plateformes VLA de Nvidia (GR00T) ou Physical Intelligence (Pi-0). Pour les intégrateurs et décideurs B2B, le signal est celui d'une réponse défensive des fabricants historiques de robots industriels, qui cherchent à ne pas se laisser distancer par les nouveaux entrants sur le terrain de l'IA appliquée à la robotique, plutôt qu'une percée technique immédiate. L'absence de métriques concrètes invite à la prudence : il s'agit d'une annonce d'intention, pas d'un déploiement vérifiable. Fanuc, Yaskawa et Kawasaki comptent parmi les plus anciens et plus importants fournisseurs mondiaux de bras robotiques industriels, avec des décennies de présence dans l'automobile et l'électronique. Fujitsu, de son côté, apporte son expertise en intégration de systèmes numériques et en IA d'entreprise, tandis que Nvidia fournit la brique technologique physique AI (simulation, entraînement, inférence embarquée). La suite attendue concerne la publication de spécifications techniques, d'éventuels pilotes clients et un calendrier de mise sur le marché, aucun de ces éléments n'étant encore public à ce stade.

1 source
2Interesting Engineering 

L'entreprise américaine mise sur des robots industriels plus intelligents et plus rapides avec un nouvel accord sud-coréen

Le fabricant américain Grid Dynamics a annoncé un partenariat stratégique avec le sud-coréen Doosan Robotics pour accélérer le déploiement de "physical AI" dans l'industrie manufacturière et la logistique. Grid Dynamics va fournir aux clients des cobots Doosan sa plateforme GAIN (Grid Dynamics AI-Native), une pile logicielle combinant manipulation robotique pilotée par modèles Vision-Language-Action (VLA), jumeaux numériques NVIDIA Omniverse, vision par ordinateur et supervision IoT. Doosan, l'un des grands fabricants mondiaux de cobots, propose une gamme allant de la série A polyvalente à la série H pour charges lourdes jusqu'à 25 kg, en passant par la série P certifiée NSF pour l'agroalimentaire et le pharmaceutique. Les cobots Doosan, équipés de capteurs de force et de couple, travaillent sans cage de sécurité aux côtés d'opérateurs humains et couvrent des tâches comme le pick-and-place, le tending machine, la palettisation, le soudage ou l'inspection qualité. Grid Dynamics revendique des gains de cycles d'inspection jusqu'à 1000 fois plus rapides et une détection d'anomalies 24 fois plus véloce, des chiffres qui restent à prendre avec prudence en l'absence de méthodologie ou de cas d'usage précisés. L'enjeu du partenariat dépasse le simple ajout logiciel : il vise les tâches qui résistent encore à l'automatisation classique, comme l'inspection d'objets de forme complexe, l'assemblage de composants variables ou l'emballage d'articles déformables ou jamais vus auparavant. C'est justement le type de scénario où les approches VLA sont censées apporter une généralisation que les robots programmés tâche par tâche n'offrent pas. Pour les intégrateurs et décideurs industriels, l'accord illustre une tendance de fond : les fabricants de cobots cherchent à externaliser la couche IA plutôt qu'à la développer en interne, pariant sur des plateformes tierces pour combler l'écart entre démonstrations en laboratoire et déploiements réels en usine. Doosan Robotics s'est construit depuis plusieurs années une position de leader des cobots collaboratifs, avec une architecture logicielle ouverte facilitant l'intégration de systèmes de vision tiers, un choix qui rend ce type de partenariat possible sans refonte matérielle. Grid Dynamics, de son côté, positionne GAIN comme une couche d'orchestration transversale pour l'automatisation industrielle, en concurrence avec d'autres piles logicielles physical AI émergentes aux États-Unis et en Asie. Les modalités précises de déploiement, calendrier de disponibilité et sites pilotes concernés par ce partenariat n'ont pas été détaillées dans l'annonce.

IndustrielActu
1 source
3arXiv cs.RO 

SafeRelBench : un benchmark sensible aux relations spatiales pour la sécurité au niveau des processus dans les agents incarnés pilotés par VLM

Voici l'article traduit et résumé : Des chercheurs présentent SafeRelBench, un nouveau benchmark évaluant la sécurité des agents robotiques pilotés par des modèles vision-langage (VLM), avec un focus sur les relations spatiales entre objets plutôt que sur la simple reconnaissance de risques statiques. Le jeu de données comprend 507 échantillons d'évaluation exécutables, répartis entre 248 échantillons centrés sur des relations spatiales (support, confinement, proximité) et 259 échantillons de contrôle non spatiaux. L'équipe a testé sept agents robotiques différents, combinant des VLM open-source et propriétaires, pour mesurer non seulement s'ils accomplissent une tâche demandée, mais s'ils respectent des contraintes de sécurité tout au long du processus d'exécution, avant même que des actions risquées ne soient entreprises. Le résultat principal est préoccupant pour l'industrie : les chercheurs observent un écart important entre la réussite d'une tâche et la conformité en matière de sécurité au niveau du processus. Concrètement, les agents testés parviennent souvent à terminer la tâche demandée tout en violant des règles de sécurité intermédiaires, par exemple en manipulant un objet posé de façon instable ou en ignorant un risque de renversement pendant le mouvement. Ce constat remet en question l'hypothèse répandue dans le secteur selon laquelle un modèle VLA qui réussit une tâche a nécessairement raisonné correctement sur les risques physiques associés. Pour les intégrateurs et décideurs B2B déployant des robots domestiques ou humanoïdes en environnement réel, cela signifie que les métriques de succès de tâche classiques ne suffisent pas à garantir un déploiement sûr, et que l'évaluation doit désormais intégrer explicitement le raisonnement sur les relations spatiales entre objets. Ce travail s'inscrit dans un mouvement plus large de recherche sur la sécurité des agents incarnés (embodied AI), où les benchmarks existants se limitaient jusqu'ici à la reconnaissance de dangers statiques, au refus d'instructions dangereuses, ou à la vérification de l'état final d'une tâche, sans examiner la trajectoire du processus. SafeRelBench se distingue en testant explicitement si les conditions de sécurité sont respectées avant l'exécution d'actions à risque, plaçant les relations spatiales au cœur de l'évaluation. Les auteurs concluent qu'une intelligence incarnée véritablement sûre nécessite, au-delà de meilleures capacités de perception et de planification, un raisonnement fiable sur la manière dont les relations entre objets façonnent le risque pendant l'interaction, un axe de recherche qui devrait gagner en importance à mesure que les déploiements de robots humanoïdes et domestiques s'accélèrent.

RecherchePaper
1 source
4arXiv cs.RO 

Action QFormer : structuration des représentations guidée par la supervision des actions dans les modèles vision-langage-action

Des chercheurs publient sur arXiv (2607.14635v1) une étude sur les modèles vision-langage-action (VLA), remettant en question la manière dont la supervision par action est utilisée pour entraîner ces systèmes. Traditionnellement traitée comme un simple objectif d'apprentissage en aval pour prédire les actions, cette supervision agit en réalité comme une force qui remodèle les représentations multimodales héritées des modèles vision-langage préentraînés. Les auteurs montrent que cet effet est double : il est indispensable pour construire des représentations compatibles avec l'action, mais lorsqu'il est appliqué trop directement sur le flux multimodal hérité, il déstabilise aussi les capacités de traitement du langage et d'ancrage des objets. Pour résoudre cette tension, l'équipe introduit Action QFormer, une interface à base de requêtes conditionnées par les instructions, qui réorganise les informations multimodales héritées en représentations orientées action avant la génération des commandes. En navigation zero-shot sim-to-real, cette architecture fait bondir le taux de réussite moyen des tâches en boucle fermée de 18,8% à 56,3%, la justesse de génération d'action à instruction fixe de 22,5% à 75,5%, et réduit quasiment à zéro les générations d'instructions hors distribution. Ce résultat touche un point sensible du secteur robotique : l'écart persistant entre démonstrations impressionnantes et performances réelles en conditions variables, souvent attribué au fossé sim-to-real. En multipliant par trois le taux de succès en navigation zero-shot, Action QFormer suggère que les gains de performance des VLA ne viendront pas uniquement de backbones préentraînés plus puissants, à la manière de Pi-0, GR00T N2 ou Helix, mais aussi de la façon dont l'information multimodale héritée est sélectionnée et organisée avant d'être exposée à la supervision par action. Pour les intégrateurs et équipes de recherche robotique, ce travail envoie un signal clair : le simple passage à l'échelle des données d'action ou le fine-tuning direct sur des architectures VLM existantes comporte un risque de dégradation silencieuse des capacités de compréhension du langage et de perception, un compromis rarement documenté dans les communications commerciales. Ce travail s'inscrit dans la lignée des modèles VLA apparus depuis RT-2 et OpenVLA, qui adaptent des architectures vision-langage préentraînées à la prédiction directe d'actions robotiques, approche depuis reprise par des laboratoires comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix. La question de la préservation des capacités multimodales sous supervision d'action rejoint des préoccupations déjà observées ailleurs dans le secteur, où l'écart entre vidéos de démonstration sélectionnées et déploiement réel reste un sujet de vigilance éditoriale. Les auteurs positionnent Action QFormer comme une brique architecturale plutôt qu'un produit fini, validée pour l'instant sur des tâches de navigation en environnement simulé puis réel ; la suite logique serait son extension à des tâches de manipulation avec davantage de degrés de liberté, ainsi que sa validation sur des backbones VLA de plus grande échelle.

IA physiqueActu
1 source
5arXiv cs.RO 

DiMaS : mise en correspondance des distributions pour piloter les modèles vision-langage-action

Des chercheurs presentent DiMaS (Distribution-Matching Steering), une methode pour orienter finement le comportement des modeles vision-langage-action (VLA) bases sur le flow matching, sans reentrainement complet. Publie sur arXiv sous la reference 2607.14280, le travail s'attaque a un manque identifie dans le controle comportemental fin des robots: la capacite d'intervenir directement sur les representations internes d'un modele pour modifier la maniere dont il execute une tache. Le "representation steering" est un outil deja bien etabli en interpretabilite pour les grands modeles de langage et les modeles vision-langage, ou les traits comportementaux s'encodent generalement comme des directions lineaires dans l'espace latent. Les auteurs montrent que ces methodes classiques echouent sur les VLA. DiMaS remplace le simple decalage le long d'une direction fixe par un transport entre distributions de representations, et l'equipe demontre son efficacite sur deux VLA de pointe non nommes dans le resume. Elle etudie aussi la generalisation de la methode a mesure que les taches d'apprentissage et d'evaluation divergent, en cartographiant ou le controle comportemental se transfere et ou il s'affaiblit. Code et resultats, avec des videos de demonstration, sont disponibles publiquement sur GitHub (pegah-kh/dimas) et sur une page projet dediee. Pour les equipes qui developpent ou integrent des politiques robotiques generatives, cette avancee ouvre une piste de personnalisation fine et peu couteuse: ajuster un comportement (prudence, vitesse d'execution, style de prehension) sans reentrainer le modele complet. L'apport le plus significatif est cependant diagnostique. En montrant que les traits comportementaux de l'"action expert", le module qui genere les trajectoires du robot, sont lineairement decodables mais pas lineairement pilotables, l'etude remet en question une hypothese importee telle quelle des LLM: qu'un concept identifiable lineairement peut aussi etre manipule lineairement. Une nuance utile face a l'engouement actuel pour les VLA generalistes dans la lignee de Pi-0 ou GR00T N2, ou expliquer une decision robotique ne garantit pas la capacite a la corriger simplement. Ces travaux s'inscrivent dans la montee en puissance des politiques VLA a base de flow matching pour la manipulation, une famille de modeles qui a progressivement supplante des architectures de clonage comportemental plus rigides. Le champ de l'interpretabilite dont s'inspirent les auteurs est bien documente cote texte et vision, avec des methodes de steering deja utilisees pour orienter le ton ou la securite des grands modeles de langage; DiMaS transpose cette logique au domaine visuomoteur, ou elle n'avait pas encore ete validee rigoureusement. Aucun acteur francais ou europeen de la robotique (Wandercraft, Pollen Robotics, Enchanted Tools) n'est implique: il s'agit d'un travail de recherche fondamentale, pas d'une annonce produit. Les auteurs annoncent vouloir etendre l'etude de generalisation a des taches encore plus eloignees, pour mieux cerner les limites du transfert comportemental entre contextes.

RecherchePaper
1 source
6arXiv cs.RO 

Sécurité de nuit VLA : détecter l'invisible grâce à des modèles vision-langage-action à perception thermique pour la manipulation critique

Des chercheurs présentent Safe-Night VLA, un framework de manipulation robotique qui ajoute la perception thermique infrarouge longue longueur d'onde à un modèle vision-langage-action (VLA) pré-entraîné, publié en version corrigée sur arXiv (2603.05754v2). Contrairement aux VLA classiques qui reposent uniquement sur des caméras RGB, ce système fait remonter un raisonnement sémantique fondé sur les propriétés thermodynamiques des objets et des surfaces, ce qui lui permet de percevoir des signaux invisibles pour une caméra couleur standard. Pour limiter la fragilité connue des politiques génératives face à des scénarios hors distribution d'entraînement, les auteurs ajoutent un filtre de sécurité basé sur des fonctions de barrière de contrôle (control barrier functions), garantissant un respect déterministe des contraintes de l'espace de travail pendant l'exécution. Les tests ont été menés sur un bras manipulateur Franka, avec un protocole d'évaluation inédit combinant manipulation conditionnée par la température, localisation de cibles sous une surface opaque, et désambiguïsation de reflets visuels. Résultat annoncé: le système surpasse les baselines RGB seules sur ces trois tâches, tout en maintenant l'exécution sous contrainte de sécurité. L'intérêt pour l'industrie tient moins à la démo qu'au principe qu'elle teste: peut-on faire dire à un modèle fondation pré-entraîné sur du RGB des choses pertinentes sur une modalité physique qu'il n'a jamais vue à l'entraînement, simplement en injectant un flux thermique dans son backbone vision-langage. Si ce principe se généralise, cela ouvre la voie à des VLA capables de manipuler dans le noir, de détecter des objets chauds ou cachés sous une surface, ou de distinguer un vrai objet d'un reflet trompeur, des cas d'usage utiles en logistique nocturne, en environnements industriels à faible visibilité ou en inspection. L'ajout d'un filtre de sécurité formel plutôt que purement appris répond aussi à une critique récurrente des politiques VLA end-to-end: l'absence de garanties dures sur les collisions ou les dépassements de zone de travail, un point sensible pour tout déploiement en environnement partagé avec des humains. Le travail s'inscrit dans la vague actuelle des VLA généralistes (type GR00T N2, Pi-0, Helix) qui cherchent à étendre la perception au-delà du RGB pour combler l'écart entre démonstrations en laboratoire et robustesse réelle. Il reste à ce stade une validation académique sur un seul bras fixe en conditions contrôlées, sans indication de déploiement industriel ni de partenaire commercial, et les auteurs eux-mêmes ne revendiquent qu'une preuve de concept sur l'exploitation de modalités physiques non visibles.

RecherchePaper
1 source
7arXiv cs.RO 

GPUSimBench : vers des simulateurs GPU évolutifs et fiables pour l'IA incarnée

Une équipe de recherche a publié GPUSimBench, un banc d'essai destiné à évaluer la fiabilité des simulateurs robotiques accélérés par GPU comme Isaac Lab (NVIDIA) et Genesis, dans un article déposé sur arXiv (2607.13059v1) le 16 juillet 2026. Le benchmark repose sur trois axes de mesure. D'abord, une évaluation de l'ancrage physique via une tâche contrôlée de plan incliné, qui quantifie l'écart de distribution entre la dynamique simulée et son équivalent réel. Ensuite, un test de scalabilité parallèle mesurant débit et empreinte mémoire à mesure que le nombre d'environnements simulés augmente. Enfin, et c'est le point central de l'étude, les auteurs quantifient le non-déterminisme inhérent à l'exécution par lots sur GPU: des variations significatives d'une exécution à l'autre, et même entre environnements exécutés simultanément dans des conditions initiales identiques. L'équipe identifie quatre régimes empiriques de stochasticité dans les architectures de simulateurs actuelles. Ce travail remet en question un présupposé central de l'IA incarnée actuelle: que la simulation massivement parallèle sur GPU, utilisée pour entraîner des politiques robotiques à grande échelle, est fiable et reproductible par construction. En montrant qu'une mise à l'échelle non maîtrisée peut compromettre la reproductibilité des résultats, l'étude pointe un risque concret pour les équipes qui s'appuient sur ces simulateurs pour l'apprentissage par renforcement ou le transfert sim-to-réel: des politiques entraînées sur des runs non déterministes peuvent donner des performances difficiles à comparer ou à répliquer d'un laboratoire à l'autre, un problème critique pour la validation avant déploiement sur robot physique. Cette publication s'inscrit dans la vague de simulateurs GPU nés dans le sillage d'Isaac Gym, qui a popularisé l'entraînement massivement parallèle pour la robotique, avant l'arrivée d'Isaac Lab et du projet open-source Genesis comme alternatives concurrentes. Jusqu'ici, la course portait surtout sur le débit brut et la fidélité physique; GPUSimBench ajoute un troisième critère, le déterminisme, largement ignoré par les benchmarks existants. Les auteurs ne précisent pas de calendrier de suite, mais présentent leur outil comme une base d'évaluation destinée à orienter le développement de simulateurs plus fiables pour la recherche en apprentissage robotique.

RecherchePaper
1 source
8arXiv cs.RO 

Modèle vision-langage-action, développé pour la robotique, capable de généraliser à des tâches inédites

Les chercheurs à l'origine de cette étude, publiée sur arXiv le 13 juillet 2026, ont développé un nouveau type d'actionneur pour exosquelettes de membre inférieur baptisé Limb-Encircling Actuator (LEA). Contrairement aux exosquelettes classiques, dont les moteurs sont placés sur le côté de la jambe ou déportés à la taille ou dans le dos, ce composant encercle directement le membre dans un plan perpendiculaire à son axe. L'équipe a construit un banc d'essai dédié pour caractériser les propriétés électromécaniques du dispositif, qui intègre également une nouvelle configuration de roulement radial pensée comme alternative plus légère et moins coûteuse aux roulements de grand diamètre habituellement utilisés. Résultat mesuré : une densité de couple continue de 7,5 Nm/kg pour une masse de 894 grammes. Cette architecture s'attaque à un frein connu à l'adoption des exosquelettes : l'encombrement. Les designs actuels dépassant souvent de l'enveloppe naturelle du corps, ils restent intrusifs au quotidien et peu compatibles avec un usage grand public, en particulier pour l'assistance à la mobilité hors contexte médical ou industriel lourd. Un actionneur capable de conserver une forte densité de couple tout en épousant mieux la jambe ouvrirait la voie à des exosquelettes plus discrets, potentiellement intégrables dans des vêtements du quotidien plutôt que dans des harnais visibles, un enjeu commercial autant que technique pour le secteur. Le travail reste toutefois à un stade de caractérisation en laboratoire, pas de produit fini : malgré la densité de couple obtenue, les auteurs reconnaissent que le système demeure difficile à contenir près du corps, révélant des limites persistantes dans le dimensionnement et la géométrie de l'actionneur. L'étude se positionne ainsi comme une exploration de piste architecturale plutôt qu'une solution aboutie, dans un domaine où la miniaturisation et la conformité corporelle des actionneurs restent un verrou majeur, aux côtés d'autres approches déjà explorées comme les actionneurs déportés ou les transmissions à câble.

ExosquelettesPaper
1 source
9TechNode 

Xiaomi présente Xiaomi-Robotics-U0 pour l'IA incarnée et la génération de robots

Xiaomi a dévoilé mercredi Xiaomi-Robotics-U0, un modèle de fondation multimodal autorégressif de 38 milliards de paramètres conçu pour l'IA incarnée (embodied AI). L'entreprise affirme que ce modèle unifie quatre capacités au sein d'un même framework : la génération de scènes pour robots, le transfert de comportements robotiques, la génération de vidéos d'interaction robot-environnement, et la génération et l'édition d'images à usage général. Concrètement, le système peut créer des environnements exploitables par des robots à partir de simples prompts textuels, adapter des trajectoires robotiques existantes à de nouvelles scènes tout en préservant le mouvement d'origine, produire des vidéos d'interaction à partir d'instructions de tâches, et exploiter des connaissances visuelles à l'échelle d'internet pour des applications d'IA incarnée. L'annonce a été rapportée par TechNode. Cette annonce s'inscrit dans une tendance de fond du secteur robotique : l'utilisation de modèles génératifs pour produire des données d'entraînement synthétiques et combler l'écart entre simulation et réalité, un problème central pour les acteurs du VLA (vision-language-action) comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. Si la promesse de générer des environnements et trajectoires synthétiques à la demande tient ses promesses, elle pourrait réduire le coût de collecte de données réelles, un goulot d'étranglement majeur pour l'entraînement des robots humanoïdes et bras manipulateurs. Toutefois, à ce stade, il s'agit d'une annonce de capacités techniques, sans démonstration publique détaillée ni benchmark comparatif, ni précision sur un déploiement matériel réel. Xiaomi investit depuis plusieurs années dans la robotique, avec son robot quadrupède CyberDog et des incursions dans les véhicules autonomes et l'IA embarquée. Ce modèle de 38 milliards de paramètres le positionne face aux laboratoires spécialisés en IA incarnée tels que Physical Intelligence, Figure AI ou Nvidia, ainsi que face aux géants chinois de la tech comme Baidu ou Alibaba, également actifs sur les modèles fondation pour la robotique. Aucune date de disponibilité, de partenariat industriel ou de déploiement pilote n'a été précisée à ce stade.

Chine/AsieActu
1 source
10Interesting Engineering 

IA incarnée : le MIT forme des robots grâce à des environnements virtuels 3D réalistes

Des chercheurs du MIT ont dévoilé SceneSmith, un système d'intelligence artificielle capable de générer automatiquement des environnements intérieurs 3D réalistes pour entraîner des robots. La plateforme s'appuie sur trois agents IA complémentaires fonctionnant en boucle: un "designer" qui construit la disposition de la pièce et place meubles et objets, un "critique" qui vérifie le réalisme de la scène et signale les incohérences (un objet qui n'a rien à faire dans cette pièce, par exemple), et un "orchestrateur" qui pilote l'ensemble du processus et décide quand la scène est terminée ou doit être révisée. Ces agents s'appuient sur GPT-5.2, le modèle vision-langage d'OpenAI, pour comprendre comment les espaces réels sont agencés. Un utilisateur peut simplement décrire une pièce en langage naturel, par exemple un garage avec voiture, établi, pneus empilés et échelle contre le mur, et SceneSmith en génère une version virtuelle détaillée. L'équipe a produit plus de 1300 environnements virtuels (cuisines, hôtels, bureaux, commerces, espaces à thème), dans lesquels des robots se sont entraînés à des tâches domestiques courantes: poser des fruits sur une assiette, déplacer des canettes entre étagères et table, ouvrir des placards, ranger des tasses dans un évier. Sur 100 environnements testés, un agent IA a évalué la réussite des tâches, avec un taux d'accord de plus de 99% avec des évaluateurs humains. Une étude auprès de plus de 200 personnes a montré que plus de 90% jugeaient les scènes de SceneSmith plus réalistes que celles produites par les méthodes précédentes, avec jusqu'à six fois plus d'objets interactifs par scène. L'enjeu central que vise SceneSmith est le principal goulot d'étranglement de la robotique actuelle: contrairement aux chatbots qui apprennent sur du texte, les robots ont besoin de données d'interaction physique variées, coûteuses et lentes à collecter en conditions réelles. En automatisant la création de mondes virtuels riches et crédibles, le MIT cherche à réduire cette dépendance aux essais physiques tout en accélérant l'itération sur les stratégies de contrôle. Le test le plus révélateur reste celui d'un contrôleur robotique entraîné principalement sur des données réelles, qui a réussi des tâches (saisir une pomme dans un bol, la poser sur une planche à découper) dans des environnements SceneSmith qu'il n'avait jamais vus, un indice de transfert sim-to-real qui intéressera directement intégrateurs et équipes R&D cherchant à réduire les coûts de collecte terrain. Le projet s'inscrit dans la course plus large à la génération de données synthétiques pour la robotique, où plusieurs laboratoires tentent de contourner la rareté des données physiques réelles. Le MIT ne communique pas, à ce stade, de calendrier de déploiement commercial ni de partenariat industriel annoncé: il s'agit d'une publication de recherche, présentée via un communiqué de l'équipe, dont l'ampleur des bénéfices en conditions réelles de production reste à confirmer au-delà des tests en laboratoire.

RecherchePaper
1 source
11Pandaily 

JD.com se lance dans l'IA incarnée : construction de la première usine de robots RoboBase à Guangzhou

JD.com a posé la première pierre de son site "Robot Base" à Guangzhou, marquant l'entrée officielle du géant chinois du e-commerce dans l'IA incarnée (embodied AI). L'investissement, estimé à environ 1 milliard de RMB, doit être achevé en 2028 pour une pleine production visée en 2030, avec une valeur de production annuelle projetée à 1,75 milliard de RMB. Le site accueillera des acteurs de l'IA incarnée, de la robotique industrielle et de service, ainsi que des entreprises de la chaîne d'approvisionnement amont et aval. Le fondateur Richard Liu a annoncé un plan de plus de 80 sites RoboBase à travers le pays, tandis que la filiale JD Logistics prévoit d'acquérir 3 millions de robots, 1 million de véhicules autonomes et 100 000 drones sur cinq ans pour automatiser l'ensemble de sa chaîne logistique, de l'entreposage à la livraison du dernier kilomètre. Les partenaires du site de Guangzhou incluent Zhiyuan Robot, Leju Robot, Qingtong Vision et GAC Huilun Technology. JD.com ne fabrique pas de robots lui-même mais se positionne comme orchestrateur de plateforme, un choix stratégique qui mérite d'être souligné plutôt que pris pour argent comptant. L'entreprise met en avant quatre leviers : l'intégration à son écosystème de distribution pour réduire les coûts et donner accès au marché, ses modèles open-source et centres de collecte de données à grande échelle, des terrains de test réels via ses magasins JD MALL, parcs logistiques et pharmacies, et enfin un accès au capital via ses fonds d'investissement et JD Finance. Ce modèle répond directement aux trois blocages classiques du secteur robotique identifiés par l'industrie : l'absence de scénarios de déploiement réels, l'absence de canaux de vente stables, et le manque de capital de développement soutenu. La déclaration selon laquelle Songyan Power aurait vendu plus de 500 robots en deux jours sur la plateforme JD reste toutefois un chiffre communiqué par JD lui-même, sans vérification indépendante, et JD vise 10 milliards de RMB de ventes de robots sur sa plateforme cette année, avec l'objectif de faire dépasser 1 milliard de RMB de ventes à une centaine de marques d'ici trois ans. JD investit dans des startups de robotique incarnée depuis 2025, dont LimX Dynamics (locomotion humanoïde), Zhiyuan Robot (robots humanoïdes généralistes), Zhongqing Robot, Pasini et RoboScience. Le directeur des opérations de Zhiyuan Robot a confirmé que des robots de l'entreprise sont déjà déployés dans des stations de métro de Guangzhou, dans le cadre d'une coentreprise avec l'opérateur local. JD s'attaque aussi au service après-vente, un angle mort classique du secteur, en s'appuyant sur son réseau JD Service+ de plusieurs milliers de techniciens formés pour bâtir un maillage national de maintenance. Le 11 juillet, le gouvernement provincial du Guangdong a signé un accord stratégique global avec le groupe JD couvrant l'économie numérique, la logistique intelligente et la fabrication robotique, signe d'un soutien politique appuyé à ce modèle de plateforme au moment où le secteur robotique chinois cherche à transformer ses démonstrations technologiques en déploiements commerciaux réels.

Chine/AsieOpinion
1 source
12arXiv cs.RO 

De l'IA du monde à l'IA incarnée : une feuille de route pour l'intelligence physique en monde ouvert

Publié sur arXiv le 14 juillet 2026 (arXiv:2607.11689), cet article de synthèse dresse un état des lieux des modèles d'action pour la robotique et propose une feuille de route vers ce que les auteurs nomment le « cerveau incarné » (embodied brain). Le texte retrace l'évolution des politiques vision-langage-action (VLA) vers les World Action Models (WAM), des systèmes qui relient une intervention candidate à ses conséquences prédites avant exécution. Trois failles couplées freinent le secteur selon les auteurs: des espaces d'action et cibles de prédiction incompatibles d'un modèle à l'autre, une absence de standardisation des jeux de données et des protocoles d'évaluation, et des interfaces d'exécution trop fermées pour permettre la réutilisation entre systèmes. Plutôt qu'un nouveau modèle entraîné, le papier propose une architecture cible: le cerveau incarné intégrerait un contexte multimodal, comparerait plusieurs interventions candidates, puis émettrait des requêtes de transition d'état ou de capacité plutôt que des commandes moteur directes, les WAM servant de prototypes pour ces fonctions prédictives. Pour les intégrateurs et décideurs en robotique, ce travail nomme un problème concret: chaque laboratoire, qu'il s'agisse de Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure avec Helix, construit son propre espace d'action et son propre format de données, rendant quasi impossible la comparaison directe des performances ou la réutilisation d'un modèle entre un bras robotique et un humanoïde. En proposant des contrats partagés entre modèles, données, tâches et morphologies, et un post-entraînement en boucle fermée transformant les interactions vérifiées en expérience réutilisable, la feuille de route vise à sortir la robotique généraliste du stade de la démonstration isolée. C'est une contribution méthodologique plus qu'un résultat expérimental: elle ne prouve pas qu'un tel système fonctionne à l'échelle, mais formalise ce qui manque pour y parvenir, un constat qui recoupe les critiques récurrentes sur l'écart entre vidéos de démonstration sélectionnées et déploiements robustes en conditions réelles. Le papier s'inscrit dans la continuité des travaux sur les modèles d'action et les world models, qui ont convergé avec l'essor des VLA avant que des approches hybrides, combinant prédiction du monde et politique d'action, ne donnent naissance aux WAM. Les auteurs ne mentionnent aucun déploiement propre mais positionnent leur cadre face aux systèmes existants de Physical Intelligence, NVIDIA et Figure, sans citer d'acteur français ou européen dans cette revue. La suite annoncée est l'adoption progressive de ces contrats partagés par la communauté de recherche, préalable jugé nécessaire à l'émergence d'agents physiques réellement adaptatifs et auto-améliorants hors laboratoire.

RecherchePaper
1 source
13arXiv cs.RO 

IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle

Article traduit et résumé en français, prêt à publier : Une équipe de recherche propose une méthodologie inédite pour concevoir la peau tactile des robots humanoïdes destinés à l'interaction physique et sociale avec l'humain (spHRI), en partant des données d'usage plutôt que des contraintes matérielles. Publiée sur arXiv (2607.11690v1), l'étude s'appuie sur une plateforme de réalité virtuelle à retour haptique pour collecter des cartes de contact haute résolution sur l'ensemble du corps d'un robot, à travers plusieurs scénarios sociaux (accolade, tape sur l'épaule, poignée de main, etc.). Neuf gestes tactiles sociaux récurrents ont été identifiés, dont huit ont ensuite fait l'objet d'une collecte contrôlée avec 18 participants, produisant un jeu de données ouvert de 5 520 essais. L'analyse des distributions de contact et de simulations d'encodage tactile fournit des repères quantitatifs sur la couverture cutanée nécessaire et la densité de capteurs à installer sur une plateforme humanoïde donnée. L'enjeu dépasse la simple curiosité académique : jusqu'ici, la conception des capteurs tactiles pour l'interaction sociale suivait une logique matérielle d'abord, où l'emplacement et la résolution des capteurs étaient fixés en amont, limitant de fait la palette de gestes reconnaissables. Cette approche inverse la démarche en dérivant les exigences de capteurs directement des données d'interaction réelles, ce qui pourrait éviter aux fabricants de robots sociaux ou compagnons un surdimensionnement coûteux de la peau tactile, ou au contraire une couverture insuffisante qui dégraderait la reconnaissance des gestes. Pour les intégrateurs et décideurs qui évaluent des robots destinés au contact physique humain (assistance, santé, accueil), disposer de seuils quantitatifs de densité et de placement avant la fabrication du hardware représente un gain de temps et de coûts d'ingénierie concret, plutôt qu'une promesse marketing. Le travail s'inscrit dans une limite bien identifiée de la recherche en robotique tactile : la plupart des peaux artificielles actuelles sont conçues sans données préalables sur la façon dont les humains touchent réellement un robot dans un contexte social, ce qui explique des écarts entre capacités annoncées et usage terrain. Bien que la démonstration ait été menée sur une seule plateforme robotique, les auteurs présentent la méthode comme transférable à d'autres morphologies de robots, ouvrant la voie à des exigences de capteurs spécifiques à chaque design avant même le prototypage physique. Les prochaines étapes attendues concernent la validation de cette méthodologie sur d'autres architectures de robots et son intégration dans des cycles de conception industriels, mais aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
14arXiv cs.RO 

L'efficacité du fine-tuning LoRA pour les modèles vision-langage-action dans la manipulation robotique industrielle

Voici l'article en français : Une équipe de recherche publie une étude systématique sur l'adaptation à faible rang (LoRA) appliquée à π0, un modèle Vision-Language-Action (VLA) à correspondance de flux, testé sur quatre tâches d'assemblage de précision avec un bras robotique UR5e. Les chercheurs ont balayé des rangs LoRA de 8 à 256, plusieurs stratégies d'allocation des paramètres, et testé le gel sélectif de composants du modèle. Résultat principal : aucune différence statistiquement significative de performance entre le fine-tuning complet (FFT), qui exige des GPU de datacenter, et certaines configurations LoRA. Les performances plafonnent dès un rang de 32, avec une allocation uniforme des paramètres entraînables entre le backbone vision-langage (VLM) et l'expert d'action qui suffit à égaler le FFT. Geler le VLM ou limiter le LoRA au seul encodeur visuel dégrade nettement les résultats. Avec cette configuration optimale (rang 32, encodeur visuel entièrement ajustable), la mémoire VRAM statique de pointe chute de 36,2 à 10,8 Gio, hors mémoire d'activation, sans perte de performance mesurable. Pour l'industrie robotique, ce résultat a une portée pratique directe : il abaisse fortement la barrière matérielle pour spécialiser un modèle VLA préentraîné à un cas d'usage industriel précis, sans avoir besoin d'un cluster GPU dédié à l'entraînement complet. C'est un signal utile pour les intégrateurs et PME qui veulent déployer des politiques de manipulation fine sans les moyens des grands laboratoires. L'étude apporte aussi un contrepoint méthodologique à l'hypothèse selon laquelle seul un réentraînement complet permettrait de combler le "gap d'incarnation" entre un modèle généraliste et un robot physique donné : ici, un ajustement ciblé mais bien réparti sur les couches sémantiques et visuelles suffit. π0 est le modèle VLA développé par Physical Intelligence, l'un des laboratoires de référence sur les politiques de manipulation par apprentissage à grande échelle, aux côtés d'acteurs comme NVIDIA (GR00T N2) ou Figure AI. Cette publication, un preprint arXiv, s'inscrit dans une tendance plus large de recherche sur l'efficacité des VLA plutôt que sur leur seule capacité brute. Aucun acteur français ou européen n'apparaît dans ce travail, mais ses conclusions concernent directement les intégrateurs européens qui évaluent l'adoption de VLA préentraînés sur du matériel limité.

UEAucun acteur français ou européen n'est impliqué dans cette étude, mais ses conclusions offrent une piste concrète pour les intégrateurs et PME européens qui veulent spécialiser des modèles VLA sur du matériel limité sans cluster GPU dédié.

RechercheActu
1 source
15arXiv cs.RO 

Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut

Les chercheurs à l'origine de ce rapport technique publié sur arXiv proposent un nouveau pipeline pour l'entraînement post-hoc des modèles Vision Language Action (VLA), ces systèmes qui permettent à un robot de traduire une consigne en langage naturel en actions physiques. Le constat de départ est simple: un seul cycle de collecte de données ne suffit jamais à corriger toutes les faiblesses d'un modèle, ce qui impose plusieurs rounds successifs de réentraînement. L'équipe organise le travail humain autour de deux rôles distincts, un téléopérateur formé qui intervient à distance uniquement sur les cas à forte valeur ajoutée et les démonstrations de récupération après échec, et un opérateur de terrain qui surveille plusieurs robots simultanément, déclenche les prises de contrôle et effectue les réinitialisations physiques. À cela s'ajoute VLAC CUT, un outil de curation automatique qui découpe les trajectoires autonomes des robots en segments utiles, en distinguant les portions qui font progresser la tâche, les phases d'inactivité, celles qui provoquent l'échec et celles de récupération, pour ne conserver que les données exploitables. Sur quatre tâches réelles de manipulation, les politiques finales atteignent entre 80 et 95% de taux de réussite et multiplient le débit de tâches par 1,7 à 4,2 par rapport au modèle de base. L'enjeu ici est économique autant que technique. Le vrai goulot d'étranglement du déploiement des VLA à grande échelle n'est pas la puissance de calcul mais le coût du travail humain de supervision et de téléopération, un point sensible pour toute l'industrie robotique qui vise la commercialisation de flottes de robots manipulateurs ou humanoïdes. En montrant qu'une réutilisation intelligente des trajectoires autonomes, combinée à une supervision humaine mieux répartie, surpasse un entraînement reposant uniquement sur l'humain dans la boucle à budget d'intervention égal, ce travail apporte un argument concret dans le débat sur la viabilité économique des VLA déployés en usine ou en entrepôt. Ce rapport s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation et le human-in-the-loop pour les VLA, où la collecte de démonstrations reste le principal poste de coût. Aucun partenaire industriel ni plateforme robotique spécifique n'est nommé dans cette publication académique, qui reste à ce stade validée sur un nombre restreint de tâches en laboratoire, sans indication de calendrier vers un déploiement à plus grande échelle.

RechercheActu
1 source
16Pandaily 

Unitree Robotics s'associe à Hunan Steel : l'émergence d'une entreprise d'infrastructure IA physique

Unitree Robotics a signé un accord de coopération stratégique avec le groupe sidérurgique Hunan Iron and Steel Group (Hunan Steel), l'un des plus grands producteurs d'acier chinois, dans le cadre d'un partenariat tripartite impliquant également Looper Robotics, une société d'infrastructure d'IA physique spécialisée dans la perception spatiale. Les trois parties vont créer ce qui est présenté comme le premier laboratoire d'innovation en robotique à intelligence incarnée du secteur sidérurgique, couvrant l'inspection et la maintenance intelligentes, la gestion des urgences, la mise en œuvre d'usines intelligentes, l'exécution de production automatisée et la logistique d'entrepôt. Dans cette répartition des rôles, Hunan Steel fournit les scénarios d'application concrets, Unitree le matériel robotique (robots quadrupèdes, humanoïdes ou à roues), et Looper Robotics la couche de perception spatiale via une caméra embarquée intégrant VIO/VSLAM, vision, cartographie, localisation et navigation autonome, compatible avec l'écosystème ROS. L'enjeu tient à la difficulté propre à l'environnement sidérurgique. Les couloirs de convoyeurs à bande y cumulent poussière, vibrations, chaleur intense, faible luminosité et gaz dangereux, rendant les inspections manuelles limitées en fréquence et sujettes à des détections tardives : une simple déchirure de bande ou une défaillance de roulement peut provoquer des heures d'arrêt de production, des rejets environnementaux ou des incidents de sécurité. Ce déploiement illustre un basculement de l'industrie de l'IA incarnée, qui quitte les démonstrations de laboratoire et les vidéos virales pour des mises en œuvre industrielles réelles. Réussir dans un environnement aussi contraignant que celui d'une aciérie constitue une validation qui pourrait faciliter le transfert de cette technologie vers d'autres secteurs comparables, comme l'énergie, la manufacture, l'entreposage ou la logistique, où des besoins similaires de surveillance et d'inspection existent. À noter que la présentation de ce laboratoire comme une première du secteur reste une revendication commerciale des parties prenantes, non vérifiée de façon indépendante. Ce partenariat traduit aussi une standardisation croissante du matériel robotique, qui déplace le point de friction vers la fiabilité de la perception, de la navigation et de l'exécution des tâches en conditions réelles. Le modèle à trois niveaux qui se dessine ici, un fabricant de robots (Unitree) pour le corps, un fournisseur d'IA spatiale (Looper Robotics) pour le cerveau perceptif et décisionnel, et un client industriel (Hunan Steel) pour les exigences métier, illustre une division du travail émergente dans l'écosystème de la robotique industrielle incarnée, où chaque couche technologique peut progresser indépendamment des autres, accélérant le rythme global de déploiement.

IndustrielOpinion
1 source
17Robot Magazine FR 

Mistral AI lance Robostral Navigate

Reformuler ce communiqué en article journalistique neutre, en signalant que les chiffres proviennent uniquement de la communication Mistral, sans donnée sim-to-real indépendante. --- Mistral AI a présenté Robostral Navigate, un modèle de navigation robotique construit selon une architecture Vision-Language-Action : une caméra RGB classique et des instructions en langage naturel remplacent la combinaison habituelle LiDAR, caméras de profondeur, centrale inertielle et cartographie SLAM. Le modèle compte 8 milliards de paramètres, une taille pensée pour tourner sur des plateformes embarquées à ressources limitées plutôt que sur des clusters distants. Selon Mistral, l'entraînement s'est appuyé sur près de 400 000 trajectoires générées dans plus de 6 000 environnements simulés, couvrant bureaux, entrepôts, usines et logements. En fonctionnement, le pipeline doit interpréter le flux vidéo, comprendre la consigne, localiser la cible, planifier une trajectoire, éviter les obstacles fixes et mobiles, et corriger sa position en continu, l'ensemble devant tenir dans un budget de quelques dizaines de millisecondes par cycle de décision. L'intérêt pour les fabricants de robots mobiles tient d'abord au coût : une caméra RGB se chiffre en dizaines d'euros contre plusieurs centaines, voire milliers d'euros pour un LiDAR industriel, ce qui allège aussi bien la facture matérielle que l'intégration logicielle. Sur le fond, Robostral Navigate teste à l'échelle de la navigation pure une hypothèse déjà explorée côté manipulation par les modèles VLA : qu'un système entraîné majoritairement en simulation puisse généraliser à des environnements réels variés sans empiler les capteurs. C'est une promesse à vérifier plutôt qu'un résultat acquis, les chiffres de 400 000 trajectoires et 6 000 environnements provenant uniquement de la communication de Mistral, sans benchmark tiers ni donnée publiée sur l'écart sim-to-real en conditions réelles. Pour les intégrateurs et décideurs industriels, la question qui reste ouverte est celle de la robustesse hors simulation, dans des lieux encombrés, mal éclairés ou changeants. Mistral AI, jusque-là identifiée aux grands modèles de langage (Mistral Large, Mixtral) et positionnée comme l'alternative européenne face à OpenAI et Google, franchit ici son premier pas affiché vers la Physical AI, terrain déjà occupé par NVIDIA avec GR00T N2, Figure AI avec Helix, ou Physical Intelligence avec Pi-0. L'entreprise française n'a pas communiqué de calendrier de déploiement industriel ni de partenariat matériel identifié à ce stade ; Robostral Navigate reste, en l'état des informations disponibles, une annonce de capacité logicielle plutôt qu'un produit livré ou testé en flotte réelle.

UEMistral AI, entreprise française et alternative européenne aux géants américains de l'IA, franchit son premier pas vers la robotique physique, ce qui renforce le positionnement technologique de la France et de l'UE face aux acteurs américains et chinois du secteur.

FR/EU ecosystemeActu
1 source
1836Kr 

Om AI de Zhao Tiancheng : des années de persévérance, pari sur l'avenir « en flux continu » natif de l'IA physique

Om AI, jeune pousse chinoise fondée par Zhao Tiancheng, docteur de l'institut de technologies du langage de Carnegie Mellon, vient de dévoiler VLX, une famille de modèles multimodaux présentée comme la première au monde conçue nativement pour fonctionner en flux continu sur des terminaux physiques. L'architecture repose sur trois modules imbriqués, Flow pour la perception, Seek pour la localisation, Go pour la décision et l'action, formant une boucle complète perception, localisation, action directement embarquée, sans dépendre du cloud. Contrairement à l'approche dominante qui découpe la vidéo en images fixes traitées une par une, VLX ingère le flux vidéo en continu, à la manière d'une eau qui coule, et raisonne en temps réel sans attendre de requête. Le déclic remonte à 2023, quand l'équipe a constaté qu'un modèle multimodal n'ayant jamais vu la moindre image de vidéosurveillance surpassait des modèles spécialisés entraînés pendant des années sur ce type de données, preuve selon Zhao Tiancheng que l'entraînement conjoint vision-langage generalise mieux dans le monde physique ouvert que les modèles dédiés. Om AI revendique aujourd'hui des revenus de l'ordre de la centaine de millions de yuans et un déploiement effectif sur des robots, drones, objets connectés, caméras de sécurité et PC IA, avec des données réelles remontant en continu depuis le terrain pour réentraîner les modèles. Cette annonce arrive alors que le secteur de l'IA physique traverse une phase de forte incertitude méthodologique, entre modèles vision-langage-action, génération vidéo, simulation 3D et approches par représentation type JEPA, sans consensus sur la voie qui mènera à une production industrielle. Le pari d'Om AI sur l'intelligence embarquée plutôt que centralisée dans le cloud répond à une contrainte concrète de sécurité et de latence: un robot qui se fige ou chute a des conséquences bien plus graves qu'un bug logiciel classique, un argument que la société met en avant pour justifier une intelligence distribuée sur chaque terminal plutôt qu'un cerveau unique. Le financement mondial de l'IA physique a dépassé 6,4 milliards de dollars sur le seul premier trimestre 2026, signe d'un secteur en quête de preuves de déploiement réel plutôt que de démonstrations. Le positionnement de Zhao Tiancheng s'est construit sur cinq années à contre-courant: alors que l'industrie chinoise se ruait sur les grands modèles de langage générateurs de texte après 2023, il a maintenu le cap sur la fusion vision-langage, misant sur son expérience d'un projet multimodal à un milliard de dollars mené chez Yahoo pendant son doctorat. Plusieurs membres de l'équipe sont partis durant les vagues successives d'engouement pour d'autres approches, avant que le virage du secteur vers l'IA physique en 2026 ne valide, selon lui, ce choix initial resté longtemps minoritaire face aux modèles de langage et, plus récemment, aux modèles du monde.

Chine/AsieActu
1 source
19Pandaily 

BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour

Treize nouveaux modèles fondation et modèles du monde pour la robotique embarquée ont été annoncés en juin 2026, soit environ un tous les 48 heures. Lors de la Conférence Zhiyuan 2026, le BAAI (Beijing Academy of Artificial Intelligence) a présenté deux avancées : Wujie Physis-v0.1, qui prédit l'état physique suivant en compressant vidéo, données RGB-D, nuages de points 3D et retour tactile dans un espace latent unifié, et Wujie RoboBrain Orca, un "cerveau" robotique combinant représentation unifiée, raisonnement causal et décodage multimodal. Le 16 juin, Alibaba a dévoilé la suite Qwen-Robot, composée de trois modèles complémentaires : Qwen-RobotNav pour l'allocation d'attention visuelle en navigation mobile, Qwen-RobotManip qui standardise l'espace état-action pour la manipulation, et Qwen-RobotWorld, doté d'une interface en langage naturel pour prédire la dynamique du monde. CasiaHand a lancé Brain-Si 0.5, présenté comme le premier modèle de manipulation dextre humanoïde, avec une architecture à trois niveaux allant de la planification VLA jusqu'à des modèles physiquement interprétables. GalaxyBot a de son côté publié AstraBrain-WBC 0.5, un modèle de contrôle corps entier entraîné sur environ 2 milliards d'images issues de mouvements humains, pour 80 millions de paramètres. RoboScience, Current Robotics et BoundlessPower ont complété la liste avec respectivement l'architecture Visics, le modèle Curl-0 et le modèle du monde MWA. Cette accélération marque un basculement net dans l'industrie de la robotique embarquée : la compétition ne se joue plus sur les capacités matérielles des robots, mais sur l'intelligence logicielle qui les pilote. Signe le plus révélateur, la posture d'Alibaba tranche avec l'approche dominante du "plus de données, plus de robots" : le groupe affirme que l'hétérogénéité du monde physique ne peut pas être résolue par le seul passage à l'échelle et nécessite un alignement au niveau du modèle lui-même. Pour les intégrateurs et décideurs industriels, le signal est important : les équipes ne cherchent plus seulement à démontrer ce que les robots savent faire, mais à expliquer pourquoi ils échouent encore sur certaines tâches, chacune identifiant un goulot d'étranglement différent, retour tactile, coordination corps entier, transfert simulation-réel ou planification à long horizon. Ce foisonnement s'inscrit dans la course engagée depuis 2024-2025 entre laboratoires chinois et occidentaux (Figure, Physical Intelligence avec Pi-0, NVIDIA avec GR00T) autour des modèles vision-langage-action. La France et l'Europe restent absentes de cette vague spécifique de publications, la dynamique se concentrant pour l'instant sur les acteurs chinois (BAAI, Alibaba, CasiaHand, GalaxyBot) et américains. Les prochaines étapes attendues concernent la validation de ces architectures sur des déploiements réels au-delà des démonstrations en laboratoire, un point sur lequel la prudence reste de mise tant les métriques annoncées, notamment le nombre de paramètres ou de frames d'entraînement, restent difficiles à comparer d'un laboratoire à l'autre sans benchmarks communs.

Chine/AsieOpinion
1 source
SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche
20arXiv cs.RO 

SPEAR : un simulateur d'IA incarnée photoréaliste pour la recherche

Voici l'article en français, sans titres ni séparateurs : Une équipe de recherche présente SPEAR (Simulator for Photorealistic Embodied AI Research), un nouveau simulateur conçu pour entraîner des agents incarnés (embodied agents) et générer des données visuelles synthétiques photoréalistes. Publié sur arXiv début juillet 2026, SPEAR se présente comme une bibliothèque Python capable de se connecter à n'importe quelle application Unreal Engine (UE) et de la piloter via une architecture de plugins modulaires. Elle expose plus de 14 000 fonctions UE uniques à Python, soit un gain d'un ordre de grandeur en fonctionnalités programmables par rapport aux simulateurs UE existants. Côté performance, une seule instance de SPEAR peut rendre des images photoréalistes en 1920x1080 directement dans un tableau NumPy à 73 images par seconde, également dix fois plus rapide que les plugins UE existants, tout en fournissant des modalités de vérité terrain inédites, comme la décomposition intrinsèque non diffuse, les IDs de matériaux ou les paramètres de shading physiquement basé (PBR). Pour un ingénieur en robotique ou en IA incarnée, l'enjeu dépasse la simple prouesse technique : la plupart des simulateurs photoréalistes actuels souffrent d'un compromis entre réalisme visuel et vitesse de rendu, ou entre flexibilité de programmation et généralité. En combinant vitesse élevée, richesse des modalités de sortie et contrôle programmatique fin de scènes UE complexes, SPEAR vise à réduire l'écart entre simulation et réalité (sim-to-real) pour l'entraînement d'agents visuels, un point critique pour la robotique mobile, les véhicules autonomes et les modèles vision-langage-action (VLA). Les chercheurs démontrent l'outil sur des cas variés : contrôle de multiples agents aux espaces d'action distincts (humains, voitures, robots) dans des projets UE existants, rendu d'environnements urbains à grande échelle, manipulation des systèmes de génération procédurale de contenu d'UE, rendu multi-vues synchronisé de visages humains détaillés, co-simulation avec le moteur physique MuJoCo, et édition de scènes en langage naturel via un assistant de code IA. SPEAR s'inscrit dans la lignée des simulateurs bâtis sur Unreal Engine comme AirSim ou CARLA, mais cherche à en dépasser les limites de généralité et de vitesse.

RecherchePaper
1 source
Une université américaine renforce sa recherche en robotique et IA physique avec les systèmes OptiTrack
21Interesting Engineering 

Une université américaine renforce sa recherche en robotique et IA physique avec les systèmes OptiTrack

Carnegie Mellon University (CMU) a inauguré le 27 février 2026 son nouveau Robotics Innovation Center (RIC), un bâtiment de 150 000 pieds carrés (environ 14 000 m²) implanté à Hazelwood Green, sur l'ancien site de l'aciérie Jones & Laughlin à Pittsburgh. Pour équiper ce centre, l'université a signé un partenariat technologique pluriannuel avec la société américaine OptiTrack, spécialiste de la capture de mouvement, qui a installé 92 caméras haute performance réparties sur deux installations. Le Motion Capture Studio intérieur compte 28 caméras PrimeX41 et quatre caméras de référence Prime Color, offrant une précision de suivi de l'ordre du micron sur un volume de capture de 2 800 pieds carrés. La Drone Cage extérieure embarque 60 caméras VersaX120, le système le plus haute résolution du catalogue d'OptiTrack pour l'extérieur, certifiées IP66 pour résister aux intempéries, dans une enceinte de 38 pieds de haut sur 6 000 pieds carrés au sol. Les deux installations reposent sur la technologie propriétaire ActiveIO Tracking, capable d'identifier et de suivre simultanément des centaines d'objets en mouvement, avec une précision annoncée jusqu'à 50 microns. « Que ce soit pour suivre des systèmes multi-robots, des essaims de drones ou des mouvements humains, la gamme de caméras et de capteurs d'OptiTrack permettra une nouvelle génération de découvertes », a déclaré Martial Hebert, doyen de la School of Computer Science de CMU. Pour les intégrateurs et chercheurs en robotique, ce type d'infrastructure de capture de mouvement joue un rôle clé mais souvent sous-estimé dans le développement de l'IA physique: elle fournit la vérité terrain nécessaire pour valider les algorithmes de navigation autonome, de coordination multi-robots ou d'apprentissage par imitation, avant tout déploiement réel. Disposer d'un volume de test couvrant à la fois intérieur et extérieur avec une précision submillimétrique permet de tester des essaims de drones ou des robots humanoïdes dans des conditions proches du terrain, sans les risques ni les coûts d'essais en environnement non contrôlé. C'est un signal supplémentaire que la recherche académique américaine structure ses moyens autour de la robotique et de l'IA physique à une échelle industrielle, avec un centre dédié plutôt que des laboratoires dispersés. Pour les décideurs B2B, l'enjeu est de suivre où se construisent les futurs standards de validation et de benchmarking des systèmes autonomes, ces infrastructures universitaires servant souvent de terrain d'essai avant transfert vers l'industrie. Le RIC comprend, outre les deux installations OptiTrack, un plateau d'essais robotiques de 50 000 pieds carrés et un laboratoire de recherche aquatique. Il s'inscrit dans le Physical AI Accelerator de CMU, une initiative soutenue par l'État visant à faire converger robotique, capteurs et intelligence artificielle. Les nouveaux systèmes profiteront notamment à l'AirLab de l'université, qui travaille sur les robots aériens autonomes et la coordination multi-robots, ainsi qu'aux recherches sur l'apprentissage par imitation et la modélisation de l'activité humaine. OptiTrack a par ailleurs rejoint, en tant que sponsor industriel, le Extended Reality Technology Center (XRTC) de CMU, créé en 2023, qui réunit chercheurs, entreprises technologiques et utilisateurs finaux autour de la réalité virtuelle et augmentée. Les chercheurs comptent utiliser ces systèmes de capture pour reconstituer des mouvements réels dans des environnements virtuels immersifs, au service d'études sur l'interaction homme-machine. Aucun montant financier du partenariat n'a été communiqué.

InfrastructureActu
1 source
Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026
22Pandaily 

Le talon d'Achille de la vision spatiale de l'IA incarnée enfin résolu : la percée de CMG Lab à IROS 2026

Une équipe de recherche du LionRock AI Lab, rattaché à l'Institut de recherche en technologies avancées de China Merchants Group, publie à IROS 2026 une étude qui documente une fragilité critique des modèles Vision-Language-Action (VLA) : un déplacement de caméra de quelques millimètres seulement peut faire chuter de moitié le taux de réussite d'une tâche. Les chercheurs identifient trois formes d'apprentissage par raccourci. Le "Camera-Base Coupling" survient quand le modèle mémorise la position des objets par rapport à des coordonnées de caméra fixes plutôt que d'apprendre de vraies relations spatiales ; un changement de position de caméra fait chuter le taux de succès de 85% à 43% dans leurs tests. Le "Camera-Object Coupling" désigne une dépendance à des angles de vue spécifiques, le modèle traitant un même objet vu sous un angle différent comme une entité distincte. Le "Object-Position Coupling", le plus insidieux, apparaît même avec des données multi-vues si les relations entre objets restent fixes pendant la collecte : sur une tâche "saisir un stylo et le placer dans son support", le modèle atteint 95% de réussite tant que le support reste à sa position d'entraînement, mais chute à 72% dès que celui-ci est déplacé d'un seul diamètre, preuve que le modèle avait appris une coordonnée précise plutôt que le concept de "placer dans le support". Leur réponse, baptisée Hybrid Dynamic Data Collection (HDDC), introduit une variation contrôlée pendant la collecte de données en déplaçant dynamiquement caméra et objets, pour forcer l'apprentissage de relations spatiales réelles. Cette découverte pointe un obstacle central au déploiement de l'IA incarnée en conditions réelles : les benchmarks VLA actuels affichent des taux de succès supérieurs à 90% en conditions fixes, un chiffre qui ne dit rien de la robustesse face aux variations de position de caméra, d'éclairage ou d'agencement d'objets rencontrées hors laboratoire. En rendant explicite ce fossé entre démonstration et réalité opérationnelle, l'étude invite les intégrateurs et décideurs B2B à relativiser les métriques de succès communiquées par les fournisseurs de robots humanoïdes et de bras manipulateurs, et à exiger des tests en conditions variables avant tout déploiement industriel. L'atout de HDDC est d'être agnostique au modèle : la méthode a été validée sur plusieurs architectures VLA majeures avec une efficacité constante, ce qui en fait un correctif potentiellement générique plutôt qu'un patch propre à un seul système. Le diagnostic du LionRock AI Lab rejoint des constats similaires obtenus par des équipes de recherche conjointes Stanford-Google et Tongji-Fudan, ce qui suggère qu'il s'agit d'un problème systémique affectant l'ensemble du champ des modèles VLA, et non d'une faiblesse isolée à une architecture ou un laboratoire donné. L'article, intitulé "Hybrid Dynamic Data Collection: Breaking VLA Shortcut Learning for Spatial Generalization", ainsi que le code et les ressources associées, sont publiés en accès libre sur arXiv et GitHub, permettant à la communauté robotique de reproduire les tests de fragilité spatiale et d'évaluer HDDC sur leurs propres modèles avant l'intégration en environnement industriel.

RechercheActu
1 source
HIVE lève 15 millions de dollars pour développer une IA physique destinée aux machines industrielles
23Robotics Business Review 

HIVE lève 15 millions de dollars pour développer une IA physique destinée aux machines industrielles

HIVE, startup de physical AI basée à Londres avec des bureaux en Norvège, a annoncé une levée de 15 millions de dollars en pre-série A menée par SuperSeed, avec la participation de Veriten, Skyfall et Nysnø, ainsi que des investisseurs providentiels comme Børge Hald, fondateur de Medallia, et Jørn Lyseggen, fondateur de Meltwater. L'entreprise, dirigée par le cofondateur et PDG Christoffer Jørgensvaag, développe ce qu'elle appelle un "silicon brain", une couche d'intelligence unifiée qui permet à des engins industriels existants de percevoir leur environnement, de décider et d'agir de façon autonome. Concrètement, HIVE ne construit pas de nouveaux robots mais rétrofite des véhicules déjà en service, chargeuses sur pneus, engins d'entrepôts, de lignes de production ou de chantiers, en y ajoutant capteurs et caméras. Un déploiement est déjà opérationnel sur Vikafjellet, un des cols de montagne les plus exposés de Norvège, où le déminage des zones d'avalanche nécessitait auparavant d'attendre plusieurs heures la validation d'un géologue avant d'envoyer une équipe. Avec le silicon brain installé, l'opérateur de la société Presis Vegdrift peut désormais engager une chargeuse immédiatement, pilotée à distance depuis une salle de supervision sécurisée plutôt que depuis la cabine exposée. L'approche de HIVE tranche avec la course aux robots humanoïdes qui domine l'actualité physical AI: plutôt que de fabriquer une nouvelle plateforme robotique, l'entreprise mise sur le rétrofit de flottes industrielles déjà amorties, un pari pertinent pour les intégrateurs et décideurs B2B qui cherchent un retour sur investissement rapide sans remplacer leur parc machine. Le modèle commercial repose sur une boucle d'apprentissage par renforcement mutualisée entre toutes les machines déployées: chaque heure d'exploitation alimenterait cette boucle, avec un objectif affiché de réduction de 80% du coût de l'heure-machine productive. Ce chiffre, non encore audité indépendamment, reste à confirmer à l'échelle, mais illustre la logique de mutualisation des données propre aux acteurs de la conduite autonome industrielle. HIVE a construit ses premiers déploiements en Scandinavie avant d'entamer une expansion aux États-Unis, actuellement en cours. Le positionnement de l'entreprise la distingue des laboratoires centrés sur les modèles vision-langage-action pour robots humanoïdes, comme Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T, en se concentrant plutôt sur l'autonomie de véhicules lourds déjà présents sur le terrain, mines, chantiers, entrepôts. Les prochaines étapes annoncées incluent le renforcement de l'équipe fondatrice, recrutée récemment à l'international, et l'extension des déploiements commerciaux auprès de partenaires industriels nouveaux et existants.

UELe déploiement opérationnel de HIVE en Norvège et sa base londonienne illustrent une approche de rétrofit industriel pertinente pour les acteurs européens du BTP et des mines, mais sans impact réglementaire ou institutionnel direct sur la France.

IA physiqueActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte
24NVIDIA Blog Robotics 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte

NVIDIA et Hugging Face annoncent l'intégration du modèle NVIDIA Isaac GR00T 1.7 et du framework NVIDIA Isaac Teleop dans LeRobot, la bibliothèque open source de Hugging Face pour la robotique, avec l'arrivée prochaine de NVIDIA Cosmos 3, un modèle monde pour l'IA physique. Isaac Teleop capture des démonstrations humaines via des dispositifs externes dans des formats standardisés, directement dans LeRobot, pour constituer et partager des jeux de données. Isaac GR00T 1.7, présenté par NVIDIA comme le premier modèle fondation robotique open source et commercialement exploitable, facilite le post-entraînement et le déploiement via les workflows LeRobot sur de nouvelles morphologies de robots, avec des benchmarks publiés. Ces briques s'appuient sur des ressources déjà connectées à LeRobot: le plus grand jeu de données open source d'IA physique, téléchargé plus de 15 millions de fois, avec plus de 350 000 trajectoires réelles et simulées et 57 millions de prises (grasps); les frameworks de simulation Isaac Sim et Isaac Lab; Isaac Lab-Arena, intégré au LeRobot Environment Hub pour prototyper des environnements et entraîner des politiques généralistes comme GR00T, Pi ou SmolVLA; et l'intégration de Jetson Thor avec le robot humanoïde open source Reachy 2 pour déployer des modèles VLA (vision-langage-action). Thomas Wolf, cofondateur et chief science officer de Hugging Face, décrit cette collaboration comme un moyen de faire passer la recherche avancée à un stade où la communauté peut l'étudier, l'adapter et la faire évoluer. Pour les intégrateurs et équipes R&D, l'enjeu est de standardiser un pipeline jusque-là fragmenté, collecte de données, entraînement, évaluation, déploiement, en connectant les 3 millions de développeurs robotique de NVIDIA aux 16 millions de builders IA de Hugging Face. Cela réduit le coût d'entrée pour tester des modèles VLA sur du matériel réel sans dépendre d'une pile propriétaire fermée. La mise en avant du caractère "commercialement viable" de GR00T 1.7 tranche avec des modèles concurrents (Pi de Physical Intelligence, Helix de Figure) souvent montrés en démonstration mais rarement publiés en open source avec benchmarks vérifiables. Coupler cela à un futur modèle monde comme Cosmos 3, censé générer des données synthétiques quand les données réelles sont trop chères ou rares à collecter, répond directement à l'un des goulots d'étranglement les plus documentés du secteur humanoïde. Cette annonce prolonge un partenariat plus ancien entre NVIDIA et Hugging Face autour de LeRobot, devenu une référence pour le partage ouvert de données et de politiques robotiques. Elle s'inscrit dans la stratégie de verticalisation physical AI de NVIDIA, de la simulation (Isaac Sim, Isaac Lab) au calcul embarqué (Jetson Thor) en passant par les modèles fondation et, prochainement, les modèles monde. Elle positionne NVIDIA face à des acteurs misant sur des piles intégrées fermées, comme Figure ou Physical Intelligence, en jouant la carte de l'infrastructure ouverte et mutualisée. Aucun acteur français n'apparaît directement, mais Reachy 2 est développé par Pollen Robotics, racheté par Hugging Face, ce qui donne une visibilité indirecte à cet acteur français dans l'écosystème. Les prochaines étapes annoncées restent pour l'instant limitées à la sortie de Cosmos 3 dans LeRobot, sans calendrier de déploiement industriel précisé.

UEImpact indirect: Reachy 2, developpe par Pollen Robotics (racheté par Hugging Face), gagne en visibilité via l'integration Jetson Thor, mais aucun acteur francais n'est directement implique dans cette annonce NVIDIA/Hugging Face.

IA physiqueActu
1 source
74 yuans pour 3 heures : des robots à IA incarnée entrent dans les foyers chinois pour les tâches ménagères
25Pandaily 

74 yuans pour 3 heures : des robots à IA incarnée entrent dans les foyers chinois pour les tâches ménagères

En Chine, les robots à intelligence artificielle incarnée sortent des usines pour entrer dans les foyers, sous forme de location à l'heure pour des tâches ménagères. Plusieurs plateformes à la demande proposent désormais des robots humanoïdes ou à roues capables de nettoyer les sols, essuyer les surfaces, récupérer des objets ou effectuer de petites tâches de rangement, pour un tarif de départ de 74 yuans les trois heures, soit environ 25 yuans de l'heure (un peu plus de 3 euros). Ces machines s'appuient sur des modèles vision-langage-action pour naviguer de façon autonome dans un environnement domestique, éviter les obstacles, reconnaître des objets et répondre à des commandes vocales simples. C'est l'un des premiers déploiements commerciaux réels de l'IA incarnée en dehors du cadre industriel, après des investissements en R&D chiffrés en milliards de yuans. Ce tarif rend la main-d'œuvre robotique moins chère que le personnel de ménage humain dans les grandes villes chinoises, mais l'écart de capacités reste net : les retours d'utilisateurs montrent que ces robots gèrent correctement les tâches de nettoyage simples, tout en peinant face aux objets de forme irrégulière, aux instructions à plusieurs étapes et aux espaces exigus typiques des appartements chinois. Le compromis est assumé, fonctionnalités limitées contre accessibilité tarifaire, et il interroge la trajectoire des investissements massifs consacrés à l'IA incarnée en Chine. Des entreprises comme Unitree, AgiBot, Star Dynasty ou X Square Robot ont levé des fonds considérables pour des robots humanoïdes généralistes, alors que le premier vrai marché de masse concerne des robots de service bien plus spécialisés et modestes. Les défenseurs de l'approche avancent toutefois que ce déploiement réel, même limité, génère des données précieuses pour entraîner les modèles de nouvelle génération, des données que la simulation en laboratoire ne peut reproduire : agencements imprévus, objets variés, comportements d'utilisateurs divers. Cette stratégie rappelle celle des entreprises chinoises de conduite autonome, qui ont déployé des fonctions de conduite partiellement automatisée des années avant d'atteindre une autonomie complète, misant sur l'accumulation de données réelles plutôt que sur l'attente d'une technologie parfaite. Les analystes du secteur anticipent une expansion rapide du marché de la location de robots domestiques à mesure que les coûts baissent et que les capacités progressent, plusieurs acteurs chinois développant déjà des modèles de nouvelle génération optimisés pour l'environnement du foyer, avec une meilleure dextérité pour manipuler de petits objets et une compréhension plus fine des instructions complexes. Reste une question ouverte : ce modèle de facturation à la tâche, encore marginal, pourra-t-il générer des revenus suffisants pour justifier l'ampleur des investissements déjà engagés dans l'infrastructure de l'IA incarnée.

Chine/AsieActu
1 source
Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise
26SCMP Tech 

Unitree entre en bourse : les valorisations à l'épreuve d'un afflux de capital-risque dans la robotique chinoise

Voici l'article traduit et résumé : Unitree Robotics, fabricant chinois de robots basé à Hangzhou, a obtenu le feu vert de la Commission de régulation des valeurs mobilières de Chine (CSRC) pour une introduction en bourse à la Bourse de Shanghai. Cette approbation intervient environ un mois après que l'entreprise a passé avec succès l'examen du comité de cotation de la place shanghaïenne. Unitree finalise désormais son plan de souscription, la tarification de ses actions et les modalités de souscription en vue d'une entrée en bourse. Le calendrier précis du débuT des transactions reste à confirmer, mais le dossier est désormais dans sa phase finale d'exécution. Cette IPO est scrutée de près car elle doit fixer un référentiel de valorisation pour tout le secteur chinois de l'IA incarnée (embodied AI), qui attire des flux massifs de capital-risque depuis deux ans. Pour les acteurs de la robotique humanoïde et leurs investisseurs, ce sera un premier vrai test de l'appétit des marchés publics pour ce type d'entreprise : est-ce que la valorisation reflète des ventes et déploiements réels, ou surtout une promesse technologique encore largement en phase de développement. Le résultat influencera directement la manière dont les futurs tours de financement et cotations de concurrents seront calibrés, en Chine comme ailleurs. Unitree s'est fait connaître avec ses robots quadrupèdes puis humanoïdes (gammes G1, H1, B2), vendus à la fois à des chercheurs, industriels et grand public à des prix nettement inférieurs à ceux de rivaux occidentaux. Elle s'inscrit dans une vague de commercialisation chinoise de la robotique humanoïde, aux côtés d'acteurs comme UBTech, déjà coté à Hong Kong depuis 2023, et talonnée par des entreprises comme Fourier Intelligence. La prochaine étape attendue est la publication du prix définitif de l'offre avant la cotation effective.

Chine/AsieActu
1 source
Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique
27Robotics Business Review 

Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique

Luxonis, société basée à Denver et fondée en 2019, a bouclé une levée de série A de 14 millions de dollars menée par Denali Growth Partners, avec la participation de Taiwania Capital. L'entreprise, qui a démarré via une campagne Kickstarter réussie, revendique aujourd'hui plusieurs milliers de clients, dont plus de 60 entreprises du Fortune 500 et 17 des 30 valeurs du Dow Jones, parmi lesquelles la société agricole FARM-ING. Luxonis produit les caméras OAK, qui combinent plusieurs capteurs de vision et du calcul embarqué dans un seul boîtier, ainsi que le kit logiciel open source DepthAI, dont le SDK a franchi les 6 millions de téléchargements après une mise à jour en avril. Son écosystème de perception cloud OAK4, lancé en décembre 2025, vient d'être complété par la caméra modulaire OAK4-CS, destinée à l'inspection de codes-barres sur lignes de convoyage, à la microscopie et à d'autres usages industriels. Le mois dernier, la société a annoncé la prise en charge officielle de ses caméras dans NVIDIA Isaac Sim, ainsi qu'un déploiement OAK4 possible en USB-C seul ou en PoE+. Le PDG Bradley Dillon a indiqué que ce tour de table, le premier institutionnel de la société après plus de sept ans de développement porté par des proches et des investisseurs individuels, doit accélérer la croissance commerciale et la production. Cette levée illustre la montée en puissance des fournisseurs de composants pour l'IA physique, un segment charnière entre la robotique et l'automatisation industrielle. Plutôt que de vendre des robots complets, Luxonis se positionne comme fournisseur de la couche de perception, capteurs, calcul embarqué et logiciel, que les intégrateurs assemblent ensuite selon leurs besoins. Pour les décideurs B2B, cette approche modulaire réduit la barrière à l'entrée dans la vision robotique, un domaine encore dominé par des solutions propriétaires coûteuses. La traction commerciale revendiquée, avec une base client s'étendant des particuliers aux grands groupes industriels, suggère que la demande pour une perception visuelle embarquée standardisée dépasse désormais les cas d'usage de niche pour toucher l'automatisation de production à grande échelle. Les fonds serviront à étendre les capacités de la chaîne d'approvisionnement, développer de nouvelles architectures d'IA en périphérie (edge AI) et renforcer les équipes de R&D, de vente et de support technique. Luxonis prévoit de lancer de nouveaux appareils à prix plus accessibles et dans des formats variés, ciblant l'agriculture, la robotique avancée, la défense, l'automatisation industrielle, les machines lourdes, le medtech et la logistique d'entrepôt. La stratégie affichée par la société mise sur une combinaison entre ingénierie IA d'Europe centrale et orientale, capacités de fabrication à Taïwan et commercialisation aux États-Unis, une répartition géographique que Taiwania Capital a explicitement saluée comme un atout pour répondre aux besoins d'automatisation complexe des entreprises.

UELuxonis maintient une partie de son ingénierie IA en Europe centrale et orientale, mais aucun déploiement, levée ou implantation commerciale directe en France ou dans l'UE n'est annoncé.

BusinessActu
1 source
Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique
28Robotics Business Review 

Blattner attribue un contrat de 75 millions de dollars à Built Robotics pour l'IA physique afin de répondre à la demande énergétique

Blattner Co. et Built Robotics ont annoncé un contrat de 75 millions de dollars pour déployer à grande échelle les systèmes de construction autonome de Built Robotics sur l'ensemble des chantiers de Blattner aux États-Unis. Cet accord prolonge un partenariat noué l'an dernier et s'appuie sur sept déploiements déjà réalisés sur des projets solaires à l'échelle utility, totalisant plus d'un gigawatt de capacité installée. Fondée en 2016 à San Francisco et soutenue par Founders Fund, NEA et Tiger Global, Built Robotics propose une technologie qui convertit des engins de chantier existants (excavatrices, bulldozers, chargeuses) en machines à autonomie de niveau 4, c'est-à-dire sans opérateur dans la cabine, et compatible avec le matériel des principaux fabricants OEM. Blattner, basée à Avon (Minnesota), revendique plus de 115 ans d'expérience dans la construction d'infrastructures et affirme avoir installé plus de 20% de la capacité éolienne, solaire et de stockage d'énergie à l'échelle utility aux États-Unis. L'entreprise est une filiale du groupe Quanta Services, aux côtés de Blattner Energy et D.H. Blattner & Sons. Ce contrat illustre un mouvement de fond dans la construction d'infrastructures énergétiques: la demande en électricité liée aux data centers et à l'IA pousse à accélérer la construction solaire et de stockage par batteries, un secteur où Built Robotics situe déjà plus de 80% des nouvelles capacités de production. Face à une pénurie persistante de main-d'œuvre qualifiée dans le BTP, l'automatisation de niveau 4 permet, selon les deux entreprises, de maintenir les chantiers actifs de nuit et par mauvais temps, réduisant les délais de mise en service et limitant l'exposition des ouvriers aux engins lourds. Pour l'industrie de la robotique de construction, l'opération confirme que l'IA physique dépasse le stade de la démonstration isolée: il s'agit ici d'un déploiement répété et facturé à l'échelle, sur un client industriel réel, ce qui distingue ce cas des simples annonces de prototypes encore en phase pilote. Reste que les chiffres avancés (plus d'un gigawatt cumulé, 75 millions de dollars) proviennent des communiqués des deux parties et ne sont pas vérifiés de façon indépendante. Le partenariat s'inscrit dans la stratégie de Built Robotics visant le marché de la construction solaire à l'échelle utility, évalué à 300 milliards de dollars, et complète une collaboration récente avec le Safe Autonomous Systems Lab (xLAB) de l'université de Pennsylvanie, destinée à transformer les chantiers en terrain d'expérimentation pour l'IA physique. Brandon Bruski, vice-président senior solaire chez Blattner, présente cet approfondissement technologique comme un moyen de consolider la position de l'entreprise sur un marché en forte croissance, tandis que Noah Ready-Campbell, cofondateur et PDG de Built Robotics, situe l'enjeu dans une bascule plus large du secteur électrique américain vers le solaire et les batteries. Aucun calendrier précis de déploiement des nouveaux chantiers n'a été communiqué, mais l'accord signale une intensification attendue des investissements dans l'automatisation des grands chantiers d'infrastructure énergétique aux États-Unis dans les prochains mois.

IndustrielActu
1 source
MACHINA 2026 : Paris veut devenir la capitale européenne de la Physical AI
29Robot Magazine FR 

MACHINA 2026 : Paris veut devenir la capitale européenne de la Physical AI

Paris accueille le 7 juillet 2026 la première édition de MACHINA, sommet dédié à la Physical AI organisé à Station F, la veille du RAISE Summit. Les organisateurs annoncent une liste d'intervenants dense pour un événement européen sur la robotique : Jim Fan (directeur recherche Physical AI chez NVIDIA), Marc Raibert (fondateur de Boston Dynamics, aujourd'hui directeur exécutif du RAI Institute), Carolina Parada (robotique chez Google DeepMind), Jeff Cardenas (CEO d'Apptronik), Bernt Børnich (fondateur de 1X), Jonathan Hurst (cofondateur d'Agility Robotics), David Reger (fondateur de NEURA Robotics), Abhinav Gupta (président de Skild AI), Thomas Wolf (Chief Science Officer de Hugging Face), Laura Modiano (OpenAI) et Péter Fankhauser (CEO d'ANYbotics). Le sommet ne se limite pas à des vitrines de machines : il couvre modèles de fondation, simulation, infrastructure de calcul et déploiement industriel, soit l'ensemble de la chaîne qui va du modèle VLA au robot physique. Cette concentration de dirigeants issus de NVIDIA, Google DeepMind, OpenAI, Boston Dynamics et des principaux acteurs humanoïdes américains (Apptronik, Agility Robotics, 1X) sur un événement parisien signale un repositionnement : la Physical AI cherche désormais des relais de visibilité en dehors des États-Unis et de l'Asie. Pour les intégrateurs et décideurs industriels européens, MACHINA offre un accès rare à des interlocuteurs habituellement présents sur les scènes de la Silicon Valley. L'angle retenu, la convergence entre IA générative, simulation et robotique plutôt que la seule performance mécanique, reflète un basculement du secteur où le logiciel et les modèles de fondation pèsent désormais autant que le hardware dans la course humanoïde. Cet événement s'inscrit dans la suite logique de trois années centrées sur les assistants conversationnels et les modèles génératifs, dont les avancées en vision par ordinateur et en simulation commencent à irriguer la robotique. Sur le plan concurrentiel, les États-Unis alignent Apptronik, Agility Robotics et Boston Dynamics, tandis que l'Asie conserve son avance industrielle historique ; l'Europe mise sur des acteurs comme l'allemand NEURA Robotics ou le suisse ANYbotics pour exister dans cette nouvelle vague. La proximité immédiate avec le RAISE Summit, organisé le lendemain, dessine une séquence parisienne pensée pour capter à la fois investisseurs et chercheurs sur une même semaine, un pari sur la capacité de la France à s'imposer comme point de passage européen de la Physical AI plutôt que comme simple spectatrice d'une course menée depuis San Francisco et Shenzhen.

UEL'événement se tient à Paris (Station F) et vise à positionner la France comme plaque tournante européenne de la Physical AI, offrant aux intégrateurs et décideurs industriels français et européens un accès direct à des dirigeants majeurs du secteur (NVIDIA, Google DeepMind, OpenAI, Boston Dynamics) ainsi qu'à des acteurs européens comme NEURA Robotics et ANYbotics.

FR/EU ecosystemeOpinion
1 source
Le Fil IA fondée par des anciens de Tsinghua lève des centaines de millions de yuans : « on ne veut pas de l'étiquette modèle du monde »
3036Kr 

Le Fil IA fondée par des anciens de Tsinghua lève des centaines de millions de yuans : « on ne veut pas de l'étiquette modèle du monde »

La startup chinoise Liqing Zhineng (厘清智能, "Clarity Intelligence"), fondée en avril 2026 à Pékin, a bouclé un tour d'amorçage de plusieurs centaines de millions de yuans (soit plusieurs dizaines de millions d'euros), révélé début juillet par le média chinois Zhinen Yongxian. Le tour réunit Shunwei Capital, Sequoia Chine, Hillhouse Ventures, FreeS Fund, Xinglian Capital, le fonds d'amorçage des alumni de Tsinghua, SEE Fund, ainsi que des investisseurs industriels comme AgiBot (智元机器人), Linker Hand (灵心巧手) et Century Golden Resources. L'équipe, adossée au laboratoire de Li Yiming, professeur assistant à l'école d'intelligence artificielle de Tsinghua et ancien chercheur Vision & Robotics chez Nvidia (bourse Nvidia 2024, dix lauréats dans le monde), compte une cinquantaine de membres d'une moyenne d'âge de 23 ans. Le produit central est une infrastructure baptisée "Physical AI Infra", construite autour de deux briques maison : un pipeline de collecte de données visant à passer de la centaine de milliers d'heures habituelle du secteur à plusieurs millions, voire dizaines de millions d'heures, via notamment des gants tactiles propriétaires dont le coût unitaire est ramené du niveau du dollar à celui du yuan ; et un moteur physique différentiable permettant une boucle "réel vers simulation vers réel", capable de modéliser des matériaux complexes (fluides, corps mous, déformations élastoplastiques). L'ensemble cible des gestes fins comme couper, visser, brancher, mélanger, presser ou enfiler, avec un objectif de portabilité entre différentes mains articulées et bras robotiques, pour des usages en usine, retail, hôtellerie, restauration et assistance médicale. Le positionnement de Li Yiming tranche avec l'engouement actuel pour les "world models" (modèles du monde), qu'il juge être la notion la plus galvaudée de 2026, tant les acteurs vidéo, 3D ou VLA (vision-langage-action) s'en réclament dès qu'ils touchent à la simulation physique. Sa thèse : le modèle du monde n'est qu'un composant technique parmi d'autres, sans valeur isolé du reste de la chaîne (données, matériel, déploiement) ; ce qui compte, c'est un système capable de généraliser à travers robots et scénarios. Il affirme ainsi pouvoir entraîner des politiques avec environ 1% du volume de données réelles habituellement nécessaire, en calibrant les transitions d'état du modèle de monde sur un petit échantillon de données réelles puis en laissant le robot s'entraîner par renforcement en simulation, l'exemple cité étant l'apprentissage de la découpe d'une pomme sans détruire des centaines d'exemplaires. Ces chiffres, avancés par le fondateur lui-même sans validation indépendante, restent à confirmer sur des déploiements réels plutôt que sur des démonstrations internes. Le parcours de Li Yiming inclut un doctorat à NYU avec des travaux co-signés avec Saining Xie (cofondateur et chercheur en chef d'AMI Labs), ainsi que plusieurs publications distinguées à CVPR et NeurIPS en collaboration avec Nvidia. La feuille de route affichée prévoit la sortie d'un modèle du monde généralisable à plusieurs scénarios B2B d'ici fin 2026, puis un passage à l'échelle commerciale visé pour 2028, avec pour ambition de livrer aux clients une solution matériel-logiciel intégrée plutôt qu'un simple modèle. Ce pari sur une intégration verticale complète, de la collecte de données au moteur physique en passant par le matériel de capture, reste rare en Chine où la plupart des équipes de robotique physique se concentrent sur un seul maillon de la chaîne ; il positionne Liqing Zhineng en concurrence indirecte avec les autres poids lourds chinois de l'IA incarnée comme AgiBot, qui figure aussi parmi ses investisseurs.

Chine/AsieActu
1 source
IA physique appliquée à la reconstruction 3D sous occlusion manuelle grâce à la proprioception et au toucher multi-contact
31arXiv cs.RO 

IA physique appliquée à la reconstruction 3D sous occlusion manuelle grâce à la proprioception et au toucher multi-contact

Des chercheurs publient une méthode de reconstruction 3D d'objets saisis à la main, conçue pour reconstruire la forme complète d'un objet même lorsque la main du robot le masque en grande partie (arXiv:2604.09100v2, version révisée). Contrairement aux approches précédentes qui s'appuient uniquement sur la vision pour deviner les parties cachées, le système combine trois sources d'information : la caméra RGB pour les zones visibles, la proprioception du bras robotique pour connaître la géométrie exacte de la main posée sur l'objet, et le toucher multi-contact pour contraindre où se situe physiquement la surface de l'objet dans les zones occultées. L'objet est représenté comme un champ de distance signée (SDF) aligné caméra, encodé dans un espace latent compact via un Structure-VAE, sur lequel est entraîné un modèle de diffusion par flow-matching. L'entraînement se fait en deux temps : préapprentissage sur des images sans occlusion, puis affinage sur des scènes de manipulation avec occlusion, en intégrant des contraintes physiques qui réduisent l'interpénétration main-objet et alignent la reconstruction sur les points de contact tactile mesurés. En simulation, l'ajout de la proprioception et du toucher améliore nettement la complétion de forme sous occlusion par rapport aux méthodes vision seule, avec une échelle métrique correcte. Les auteurs valident aussi un transfert sur un robot humanoïde réel, avec un effecteur différent de celui utilisé à l'entraînement. Pour l'industrie robotique, ce travail s'attaque à un angle mort classique de la perception manipulative : dès qu'une main saisit un objet, la caméra en perd une bonne partie de la vue, ce qui pénalise le placement de préhension, la planification de trajectoire ou la ré-estimation de pose en cours de tâche. Ajouter proprioception et toucher comme signaux de contrainte physique, plutôt que de tout faire reposer sur la vision, est une piste concrète pour fiabiliser les piles de perception des robots à mains dextres ou multi-doigts, notamment en contexte industriel où les objets manipulés sont souvent partiellement occultés par la préhension elle-même. Il faut toutefois noter que les gains rapportés restent majoritairement démontrés en simulation, la validation sur robot réel se limitant à un test de transfert et non à un déploiement en conditions de production. Le papier s'inscrit dans la lignée des méthodes de reconstruction amodale 3D, historiquement limitées à des signaux purement visuels et donc fragiles sous occlusion sévère. En ancrant la reconstruction dans la physique du contact plutôt que dans la seule vraisemblance visuelle, l'approche se positionne comme un module de perception réutilisable en amont d'un pipeline de reconstruction en deux étages, où une étape ultérieure affine la géométrie et prédit l'apparence. Les prochaines étapes attendues concernent l'élargissement à davantage d'effecteurs et de morphologies de main, ainsi que des essais plus poussés en conditions réelles au-delà du test de transfert présenté.

RecherchePaper
1 source
E-VLA : modèle vision-langage-action augmenté par événements pour scènes sombres et floues
32arXiv cs.RO 

E-VLA : modèle vision-langage-action augmenté par événements pour scènes sombres et floues

Voici l'article traduit et résumé en français, prêt à publier : Des chercheurs présentent E-VLA, un modèle vision-langage-action (VLA) augmenté par caméra événementielle, conçu pour maintenir la fiabilité des robots manipulateurs dans des conditions de perception dégradées : lumière très faible, flou de mouvement, écrêtage des noirs. Contrairement aux approches classiques qui tentent de reconstruire une image à partir des flux d'événements, E-VLA exploite directement les indices de mouvement et de structure captés par la caméra événementielle pour préserver la cohérence perception-action. L'équipe a construit une plateforme de téléopération open source équipée d'une caméra événementielle DAVIS346 et collecté un jeu de données synchronisé RGB-événements-actions sur des tâches de manipulation variées et sous différents niveaux d'éclairage. Les résultats sont marqués : sur une tâche de type pick-and-place à 20 lux, le taux de réussite passe de 0% avec la seule image RGB à 60% avec une simple superposition des cartes d'événements accumulées, puis à 90% avec l'adaptateur événementiel dédié conçu par les auteurs. Sous flou de mouvement sévère (simulation d'un temps d'exposition de 1000 ms), le pick-and-place progresse de 0% à 20-25% de réussite, et une tâche de tri passe de 5% à 32,5%. Ces résultats apportent une preuve concrète que la fusion événementielle, même dans sa version la plus simple et sans paramètres, comble un angle mort critique des modèles VLA actuels : leur dépendance à une caméra RGB classique les rend inutilisables dès que l'éclairage ou la stabilité de la scène se dégradent, un scénario fréquent en environnement industriel réel (entrepôts peu éclairés, bras robotiques en mouvement rapide). Pour les intégrateurs et les équipes robotique visant un déploiement en conditions réelles plutôt qu'en démonstration contrôlée, ce travail suggère qu'ajouter un capteur événementiel low-cost peut être plus efficace qu'un réentraînement massif du modèle de perception. E-VLA s'inscrit dans la lignée des modèles VLA généralistes comme GR00T N2, Pi-0 ou Helix, qui ont démontré une bonne généralisation en manipulation mais restent peu testés hors des conditions de laboratoire. Les auteurs annoncent la publication du code et du jeu de données sur GitHub, ce qui devrait permettre à la communauté d'évaluer la robustesse de la méthode sur d'autres plateformes robotiques et d'autres capteurs événementiels.

RecherchePaper
1 source
Position : les modèles vision-langage-action ne peuvent pas être vérifiés pour le raisonnement physique
33arXiv cs.RO 

Position : les modèles vision-langage-action ne peuvent pas être vérifiés pour le raisonnement physique

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning Un article de position publié sur arXiv (2606.30686) remet en cause l'interprétation dominante des progrès des systèmes Vision-Language-Action (VLA), ces modèles de robotique construits sur des modèles vision-langage (VLM) pré-entraînés comme GR00T N2, Pi-0 ou Helix. Les auteurs décomposent une politique VLA en deux briques distinctes : le mapping sémantique, hérité de l'entraînement internet-scale, et la décision d'action physique, propre à l'exécution motrice. Leur démonstration centrale est que le taux de réussite de tâche, la métrique quasi universelle des benchmarks de manipulation robotique, ne permet pas de distinguer laquelle de ces deux briques est responsable d'une amélioration de score. Autrement dit, un gain de performance mesuré peut aussi bien refléter une meilleure généralisation sémantique, un simple recouvrement distributionnel avec les données d'entraînement, qu'une réelle généralisation physique, sans qu'aucun protocole actuel ne permette de trancher. Cette limite touche directement l'argument commercial central de la vague VLA actuelle: la promesse que des représentations apprises sur des corpus internet transfèrent vers la généralisation en environnement physique réel. Pour les intégrateurs et décideurs B2B qui évaluent des solutions humanoïdes ou des bras manipulateurs sur la base de benchmarks affichant des taux de réussite en hausse, ce papier suggère une prudence méthodologique: un score supérieur ne garantit pas une robustesse physique supérieure, et peut masquer un simple effet de mémorisation de distribution. Le concept de "narrative drift" que les auteurs pointent, où chaque nouveau système hérite et renforce l'interprétation optimiste du précédent sans isoler le mécanisme causal réel, résonne avec les critiques déjà formulées sur l'écart entre démonstrations vidéo sélectionnées et déploiements réels en usine. Les auteurs ne rejettent pas l'utilité des VLM en robotique, mais proposent une piste de recherche: des protocoles d'évaluation introduisant une variation contrôlée pour mesurer séparément la généralisation sémantique et la généralisation physique, sans nécessiter d'accès aux poids internes des modèles. Cette approche s'inscrit dans un débat plus large sur la fiabilité des benchmarks robotiques, alors que des laboratoires et startups, de Figure à Physical Intelligence, multiplient les annonces de performance sur des tâches de manipulation dont la reproductibilité en conditions réelles reste rarement vérifiée indépendamment.

RecherchePaper
1 source
Z-1 : apprentissage par renforcement efficace pour les modèles vision-langage-action
34arXiv cs.RO 

Z-1 : apprentissage par renforcement efficace pour les modèles vision-langage-action

Des chercheurs présentent Z-1, un framework de post-entraînement par apprentissage par renforcement (RL) pour les modèles Vision-Language-Action (VLA) à base de flow matching, décrit dans un article publié sur arXiv (2606.31846v1). Construit sur l'architecture π0.5 de Physical Intelligence, Z-1 s'appuie uniquement sur les démonstrations publiques RoboCasa pour la phase de fine-tuning supervisé (SFT), puis applique une stratégie de Group Relative Policy Optimization (GRPO) tâche par tâche sur 24 tâches standard du benchmark RoboCasa. Pour rendre cette optimisation en ligne plus stable et efficace, les auteurs combinent quatre techniques: construction de rollouts à préfixe partagé, branchement arborescent des trajectoires, calibration des récompenses tenant compte de la complétion des tâches, et entraînement conjoint sélectif du modèle vision-langage et de l'"Action Expert". Résultat: un taux de réussite moyen de 80,6% sur les 24 tâches, soit un gain de 13,2 points par rapport au modèle SFT de départ, et une performance supérieure aux meilleurs modèles publiés jusqu'ici. L'enjeu dépasse le simple gain de benchmark. La grande majorité des politiques VLA actuelles restent bridées par le behavior cloning ou le SFT sur données figées, une approche qui plafonne dès que le robot rencontre une situation absente des démonstrations. En montrant qu'un post-entraînement RL structuré peut améliorer significativement une politique flow-based sans données de démonstration privées supplémentaires, Z-1 apporte un argument concret en faveur du RL comme étape standard après le SFT, plutôt qu'une simple option de recherche. Pour les équipes qui entraînent des VLA pour la manipulation robotique, cela suggère une voie pour corriger les échecs récurrents d'une politique sans repasser par une collecte de données coûteuse. Le travail s'inscrit dans la lignée des modèles génération π (π0, π0.5 de Physical Intelligence) et fait écho aux efforts similaires chez GR00T N2 (NVIDIA) ou Helix (Figure AI), qui cherchent tous à faire passer les VLA du stade de la démonstration à celui d'une robustesse exploitable en conditions réelles. GRPO, popularisé dans l'entraînement de modèles de langage, est ici adapté aux contraintes du contrôle continu. Les auteurs présentent Z-1 comme une preuve de concept méthodologique, sans annoncer de déploiement matériel ni de calendrier commercial.

IA physiqueOpinion
1 source
Nvidia renforce son équipe robotique en Chine face à l'essor de l'IA physique
35SCMP Tech 

Nvidia renforce son équipe robotique en Chine face à l'essor de l'IA physique

Nvidia intensifie ses recrutements en Chine pour renforcer son équipe dédiée à la robotique physique, avec plus d'une douzaine de postes ouverts simultanément à Beijing, Shanghai et Shenzhen. L'annonce, publiée lundi sur le compte WeChat officiel de la firme, couvre quatre domaines stratégiques : l'intelligence incarnée (embodied intelligence), la simulation, l'implémentation et les solutions. L'objectif affiché est de construire une plateforme robotique de premier plan dans un marché où les constructeurs chinois représentent la majorité des expéditions mondiales de robots industriels et humanoïdes. Ce mouvement de recrutement signale une montée en puissance de Nvidia sur le segment de la robotique physique en Chine, marché dominant à l'échelle mondiale en volume de déploiement. La stratégie de la firme repose sur son écosystème logiciel Isaac (simulation, entraînement) et sur GR00T N2, son modèle fondationnel pour robots humanoïdes présenté en mars 2025. En s'ancrant localement, Nvidia cherche à s'imposer comme couche d'infrastructure incontournable pour les intégrateurs et constructeurs chinois, dont plusieurs développent déjà des humanoïdes sur des puces concurrentes. La présence terrain est aussi un signal de conformité réglementaire dans un contexte de restrictions à l'export sur les puces avancées. Nvidia a accéléré son pivot vers la robotique depuis 2024, en positionnant la "physical AI" comme troisième vague après le calcul général et les LLMs. Les acteurs chinois comme Unitree, UBTECH et Fourier Intelligence figurent parmi les clients potentiels de cet écosystème. Les concurrents directs sur la couche plateforme incluent des startups comme Physical Intelligence (Pi-0) côté modèles, et des industriels comme Siemens ou ABB sur la simulation. Cette expansion en Chine intervient malgré les tensions commerciales persistantes autour des puces H-series, ce qui soulève des questions sur les configurations matérielles qui seront effectivement utilisées localement.

Chine/AsieOpinion
1 source
SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon
36arXiv cs.RO 

SWITCH : évaluation de la modélisation et manipulation d'interfaces tangibles dans des scénarios incarnés à long horizon

Une équipe de chercheurs a publié SWITCH (arXiv:2511.17649), un benchmark conçu pour évaluer la capacité des agents IA à interagir avec ce que les auteurs appellent des interfaces de contrôle tangibles (TCIs) : panneaux d'appareils électroménagers, télécommandes, ascenseurs, interfaces graphiques embarquées. Le jeu de données comprend 1 170 vidéos temporellement interactives, annotées de manière structurée avec instructions, actions, transitions d'état, résultats et comportements de récupération en cas d'erreur. La spécificité de SWITCH est d'évaluer le raisonnement en boucle fermée : l'agent doit percevoir, agir, vérifier le résultat, et corriger si nécessaire, dans une séquence continue. Le benchmark inclut également une évaluation des modèles de génération vidéo sur des tâches centrées sur l'interaction, combinant jugement automatique par LLM et évaluation humaine. L'intérêt de SWITCH réside dans ce qu'il révèle : les modèles multimodaux de frontier, propriétaires comme open source, présentent des faiblesses persistantes en perception visuo-temporelle fine, en vérification des résultats et en récupération d'erreur. La plupart des benchmarks existants se limitent à la perception en boucle ouverte ou à l'exécution d'une seule action, ce qui masque précisément les défaillances qui apparaissent dans des scénarios d'horizon long, là où l'agent doit maintenir un état interne et détecter un échec non anticipé. Pour les équipes travaillant sur des robots de service ou des agents embarqués destinés à des environnements industriels ou domestiques, ce constat est directement opérationnel : les modèles actuels ne sont pas encore fiables dès qu'une interaction nécessite un retour d'état et une correction. SWITCH s'inscrit dans un effort plus large de la communauté embodied AI pour combler le fossé entre les capacités de perception statique et l'agentivité réelle en environnement physique. Les benchmarks précédents comme SQA3D, EmbodiedScan ou OpenEQA avaient posé des jalons en compréhension 3D et en questions-réponses situées, mais sans capturer la dimension corrective de l'interaction. SWITCH adresse explicitement ce manque via des scénarios égocentrés. L'étude ne mentionne pas de partenariat industriel ni de déploiement applicatif immédiat : il s'agit d'un outil académique, non d'un produit. Les suites probables concernent l'intégration du benchmark dans les pipelines d'entraînement de VLA (Vision-Language-Action models) et l'extension à des environnements 3D interactifs.

RecherchePaper
1 source
TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)
37arXiv cs.RO 

TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2606.29089) une méthode appelée TAP-VLA (Tactile Annotation Prompting for Vision-Language-Action models) visant à doter les modèles vision-langage-action du sens du toucher sans modifier leur architecture. Sur quatre tâches de manipulation à contacts complexes (vissage, insertion, assemblage de précision), TAP-VLA atteint un taux de succès de 78 %, contre moins de 50 % pour un fine-tuning purement visuel et pour les approches alternatives de fusion tactile, certaines de ces baselines ne faisant pas mieux qu'un résultat aléatoire. Le principe repose sur des capteurs visuo-tactiles capables de mesurer les champs de cisaillement (shear fields) à la surface de contact ; ces champs sont ensuite superposés sous forme de vecteurs spatialement alignés directement sur les images RGB multi-vues que le modèle consomme déjà, sans ajouter de modalité d'entrée distincte. L'enjeu est réel : les VLAs de génération actuelle, comme π0 de Physical Intelligence, OpenVLA ou RT-2 de Google DeepMind, offrent un raisonnement robuste sur les variations visuelles, sémantiques et spatiales grâce à leur pré-entraînement à grande échelle, mais restent aveugles aux forces de contact, pourtant centrales dans toute manipulation industrielle sérieuse (emboîtement de précision, vissage, gestion d'objets déformables). Intégrer le toucher comme nouvelle modalité d'entrée détériore précisément ce pré-entraînement, car les données tactiles sont absentes des corpus à grande échelle sur lesquels ces modèles sont construits, un problème de distribution shift bien documenté dans la littérature. TAP-VLA contourne l'obstacle en restant dans l'espace d'observation natif du modèle : pas de modification architecturale, pas de pré-entraînement tactile spécifique, surcoût computationnel négligeable. Ce travail s'inscrit dans une course active autour de l'embodied AI pour la manipulation de précision, où Physical Intelligence (π0, π0-FAST), Figure AI ou Apptronik cherchent à étendre les capacités de leurs humanoïdes et bras industriels au-delà du pick-and-place visuel. La question du sim-to-real pour les contacts reste l'un des derniers verrous majeurs avant un déploiement industriel à l'échelle. En évitant la refonte architecturale, TAP-VLA propose une voie d'intégration compatible avec les VLAs existants, ce qui simplifie son adoption par des équipes qui travaillent à partir de modèles déjà entraînés. La publication sur arXiv sans conférence associée indique que ce travail est encore en cours d'évaluation par les pairs ; aucun déploiement réel ou pilote industriel n'est annoncé à ce stade.

IA physiqueOpinion
1 source
IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte
38arXiv cs.RO 

IA incarnée et environnement : vers des robots de soins physiques sûrs et sensibles au contexte

Des chercheurs du laboratoire EMPRISE de l'université Cornell ont publié E²-CARE (arXiv:2606.28592), un cadre de contrôle pour robots d'assistance physique capables de s'adapter à la fois aux environnements variables et aux différentes morphologies robotiques sans reprogrammation. L'architecture représente l'espace de soins dans un graphe de scène 3D dynamique unifié qui modélise explicitement l'environnement, le robot et l'humain assisté. Ce graphe sert à synthétiser des contraintes spécifiques à chaque tâche, injectées en temps réel pour piloter l'exécution de gabarits d'interaction (interaction templates) prédéfinis. Le système a été évalué sur quatre activités de la vie quotidienne (ADL) dans des centaines d'environnements domestiques simulés, puis validé par des études utilisateurs portant sur deux tâches de soin avec deux robots distincts dans des environnements réels. La démonstration centrale d'E²-CARE est que les mêmes primitives de mouvement peuvent être réutilisées en zero-shot sur des robots de morphologies différentes et dans des environnements non vus à l'entraînement, sans dégradation de sécurité. C'est une réponse directe à l'un des verrous majeurs du secteur : le couplage fort entre un système de soin et son environnement ou son hardware d'origine. La contrainte de sécurité autour des humains, souvent absente des démonstrateurs existants, est ici modélisée comme une couche de contraintes d'exécution. Pour un intégrateur ou un acheteur B2B dans l'aide à la personne, c'est un argument de fond : un pipeline logiciel unique potentiellement déployable sur plusieurs plateformes matérielles, ce qui réduit substantiellement le coût d'intégration multi-hardware. EMPRISE (Enabling Manipulation and Physical Robot Interaction with Sensing and Embodiment) travaille depuis plusieurs années sur les robots d'assistance physique en contexte de vie quotidienne. Ce domaine reste très fragmenté : Diligent Robotics (Moxi, logistique hospitalière), 1X Technologies, et les plateformes académiques comme PR2 ou HSR de Toyota traitent chacun des sous-espaces étroits. E²-CARE n'est pas un produit commercial annoncé : il s'agit d'une contribution académique, sans prototype industriel ni timeline de commercialisation. Les étapes suivantes logiques impliquent des évaluations sur un plus grand nombre de morphologies physiques réelles et des scénarios d'interaction plus complexes, notamment avec des utilisateurs à mobilité fortement réduite ou en situation de dépendance avancée.

RecherchePaper
1 source
Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle
39arXiv cs.RO 

Modèles vision-langage-action (VLA) : retours d'expérience sur une plateforme UR5 réelle

Des chercheurs ont publié sur arXiv (preprint 2606.30456) une évaluation du transfert de modèles VLA (Vision-Language-Action) vers un bras manipulateur UR5e d'Universal Robots en conditions réelles. Deux modèles ont été mis à l'épreuve : OpenVLA et sa variante OpenVLA-OFT, fine-tunés sur des données collectées directement sur le robot physique et converties au format RLDS (Robot Learning Dataset Specification), un standard de facto dans la communauté robotique. L'équipe a construit une chaîne complète comprenant l'acquisition de données sur robot réel, un workflow de conversion de dataset compatible RLDS, une infrastructure de fine-tuning et d'inférence, ainsi qu'un protocole de validation systématique des représentations d'actions et des interfaces de contrôle. Le résultat central contredit une hypothèse répandue dans la recherche VLA : des métriques offline prometteuses ne se traduisent pas nécessairement en comportement stable en boucle fermée sur le système physique. Cet écart entre indicateurs de validation et exécution réelle n'est pas principalement imputable à la capacité intrinsèque des modèles. Il est fortement conditionné par la sémantique des actions (comment sont encodées les commandes moteur), les conventions de référentiels de coordonnées, l'alignement temporel entre la vision et les sorties de contrôle, la cohérence du prétraitement d'image, et la couverture du dataset d'entraînement. La conclusion opérationnelle est directe : pour des intégrateurs industriels, augmenter la taille du modèle VLA n'est pas le levier prioritaire ; c'est la maîtrise du pipeline données-modèle-contrôle dans son ensemble qui détermine la fiabilité du déploiement, un déplacement de paradigme du problème de modèle vers un problème de système. Ce travail s'inscrit dans un contexte d'accélération marquée autour des VLA, portée par des modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) ou encore ACT et Diffusion Policy, qui promettent une généralisation des politiques de manipulation via des architectures multimodales entraînées à large échelle. La plupart des démonstrations publiées restent toutefois en environnement contrôlé, et les conditions précises du passage au déploiement réel sont rarement documentées avec rigueur. En s'appuyant sur une plateforme reproductible et des formats ouverts (UR5e, RLDS), cette étude fournit un cadre méthodologique directement transférable, utile pour les équipes cherchant à qualifier leurs pipelines VLA avant mise en production, y compris côté européen où des acteurs comme Enchanted Tools travaillent sur des approches similaires de généralisation de politiques de manipulation.

UELe cadre méthodologique open-source (UR5e + RLDS) est directement réutilisable par les équipes européennes qualifiant leurs pipelines VLA avant production, notamment pour des acteurs comme Enchanted Tools travaillant sur la généralisation des politiques de manipulation.

💬 Ce que montrent ces chercheurs, c'est qu'en robotique VLA, le problème n'est pas le modèle. Des métriques offline prometteuses ne prédisent pas le comportement en boucle fermée sur le vrai robot, et ce qui change tout c'est le pipeline complet (encodage des actions, conventions de coordonnées, alignement temporel). Reste à voir combien d'équipes industrielles vont enfin arrêter de chercher un modèle plus gros et commencer par auditer leur dataset.

IA physiqueOpinion
1 source
Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée
40arXiv cs.RO 

Entraîner des modèles vision-langage-action (VLA) avec une supervision dense par chaîne de pensée incarnée

Une équipe du laboratoire RUCKBReasoning (Université Renmin de Chine) a publié le 30 juin 2026 ZR-0, un modèle VLA (vision-language-action) de 2,6 milliards de paramètres entraîné avec une supervision dense par chaîne de raisonnement incarnée, ou ECoT (Embodied Chain-of-Thought). Le modèle repose sur une architecture dual-stream : un VLM pré-entraîné (baptisé System 2) génère des annotations de raisonnement structuré pendant l'entraînement, tandis qu'un expert d'action basé sur un Diffusion Transformer (System 1) produit des séquences d'actions continues par flow matching. Les deux composants sont couplés via cross-attention, avec un masque d'attention qui permet de court-circuiter entièrement la génération ECoT à l'inférence sans perte de performance mesurée. Le modèle a été pré-entraîné sur ProcCorpus-60M, un corpus de 60 millions de frames (environ 1 000 heures) issus de plus de 400 000 trajectoires, avec des annotations ECoT couvrant 96,8 % des frames. Les évaluations couvrent trois benchmarks de simulation, LIBERO (bras unique), RoboTwin 2.0 (bras bimanuels) et RoboCasa GR-1 Tabletop (humanoïde), ainsi que des expériences réelles sur plateforme xArm. L'enjeu central est le transfert cross-embodiment : les espaces d'états et d'actions diffèrent fondamentalement d'un robot à l'autre, ce qui rend la généralisation difficile pour les modèles end-to-end. L'hypothèse de ZR-0 est que les processus cognitifs de haut niveau, perception de scène, identification d'objets, planification, décomposition de sous-tâches, sont partagés entre embodiments, même si les commandes moteur ne le sont pas. En ancrant l'alignement des représentations dans ce niveau d'abstraction, les auteurs contournent la nécessité d'adapter le modèle à chaque cinématique robot. Pour les intégrateurs industriels, le gain potentiel est concret : un seul modèle entraînable sur données hétérogènes, déployable sur plusieurs plateformes sans fine-tuning spécifique à chaque bras. Cette approche s'inscrit dans une vague de modèles VLA généralistes qui cherchent à résoudre le sim-to-real gap par des architectures raisonnantes. Les concurrents directs incluent Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et OpenVLA, qui explorent des stratégies similaires de pré-entraînement multi-robot. ZR-0 se distingue par son dispositif ECoT dédié à l'entraînement et neutralisable à l'inférence, ce qui préserve la vitesse d'exécution. Le code et les checkpoints sont publiés en open source sur GitHub. Aucun déploiement industriel ni partenaire B2B n'est annoncé à ce stade, il s'agit d'une contribution de recherche académique, pas d'un produit shipé.

IA physiqueActu
1 source
Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution
4136Kr 

Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution

Au premier trimestre 2026, les investissements mondiaux dans le Physical AI ont dépassé 6,4 milliards de dollars, avec des levées emblématiques : AMI Labs (1,03 milliard de dollars en seed), World Labs (1 milliard) et le chinois Qianxun Intelligence (4,5 milliards de yuans en quatre tours en mars). C'est dans ce contexte qu'Om AI, une startup chinoise, a présenté du 27 au 29 juin 2026 une suite de trois modèles, VLX-Flow, VLX-Seek et VLX-Go, positionnée non pas sur la manipulation dextère ni la planification longue portée, mais sur la perception visuelle continue, la localisation spatiale précise et la navigation autonome. VLX-Flow utilise une attention linéaire (Linear Attention) couplée à une double mémoire (cache visuel et carryover textuel) pour ingérer le flux vidéo en continu, à la différence du paradigme classique qui traite des images isolées. VLX-Seek substitue la génération de coordonnées par une référence de région, fournissant des ancres spatiales à précision millimétrique. VLX-Go produit directement des trajectoires de waypoints exécutables via prédiction court-terme, apprentissage hors-ligne et optimisation RL en ligne. L'approche d'Om AI soulève un angle mort que les architectures VLA et world model dominantes n'ont pas encore résolu : dans les VLA mainstream, le tronc LLM absorbe plus de 90 % des ressources de calcul et des données, reléguant la tête d'action en composant chroniquement sous-entraîné. Les world models, censés combler ce déficit via la simulation physique, butent sur la rareté des données haute qualité à l'échelle requise. Or, la majorité des terminaux physiques déployés, drones en environnement GPS-dégradé, robots quadrupèdes, lunettes AR, terminaux d'inspection industrielle, n'ont pas besoin de mains dextères : ils ont besoin de localisation fiable et de perception continue. En repositionnant le problème sur la vision edge-native plutôt que sur la génération d'actions complexes, Om AI cible un segment plus large et potentiellement plus rapidement déployable que les humanoïdes, à condition que ses benchmarks se confirment hors des vidéos de démonstration sélectionnées. NVIDIA a présenté au GTC 2026 Alpamayo (VLA propriétaire) et Isaac GR00T N1.6 (VLA open-source pour humanoïdes) ; Xiaopeng a dévoilé X-Foresight au CVPR 2026 ; Google DeepMind avait publié Genie 3 en août 2025. La Beijing Academy of AI (BAAI) recense quatre routes de world models sans consensus industriel : centrée langage (Gemini 3), pixel (Sora), 3D (World Labs Marble de Fei-Fei Li) et représentation visuelle (V-JEPA de Yann LeCun). Les projections de marché divergent fortement : Future Markets table sur 383 milliards de dollars en 2026 croissant à 32 600 milliards en 2040, tandis que Coatue Management anticipe au moins 6 000 milliards, soit 50 % de plus que le digital AI. Om AI n'a pas encore communiqué de clients industriels nommés ni de volumes de déploiement pour sa suite VLX, ce qui reste la prochaine étape déterminante.

Chine/AsieOpinion
1 source
Chine : les robots Agibot atteignent 99 % de réussite lors d'une démonstration en usine de six jours
42Interesting Engineering 

Chine : les robots Agibot atteignent 99 % de réussite lors d'une démonstration en usine de six jours

AGIBOT, fabricant chinois de robots humanoïdes, a organisé fin juin 2026 un livestream mondial de six jours depuis l'usine Longcheer Technology de Nanchang, en Chine, pour démontrer la viabilité industrielle de ses robots G2 sur une ligne de production active. Les G2 sont des manipulateurs mobiles sur roues avec un torse humanoïde, conçus pour la manutention, l'inspection qualité et l'assistance en ligne de fabrication. Pendant 64 heures d'opération cumulées, les robots ont exécuté 64 828 tâches réparties sur plus de quatre flux de fabrication différents, avec un taux de réussite annoncé de 99,99 %. Ils ont contribué à la production de 17 625 unités de tablettes en conditions réelles, aux côtés d'opérateurs humains et d'équipements industriels en fonctionnement. Simultanément, AGIBOT a annoncé la livraison de son 15 000e robot à Longcheer, soulignant une montée en cadence remarquable : il a fallu environ un an pour passer de 1 000 à 5 000 unités, puis seulement trois mois pour aller de 5 000 à 10 000, soit une vitesse de production multipliée par quatre. Le demo-to-reality gap reste l'obstacle central du secteur humanoïde, et AGIBOT a structuré son exercice précisément pour répondre à cette critique. Un livestream continu de six jours sur une ligne de production commerciale non préparée est méthodologiquement plus contraignant qu'une démonstration en laboratoire ou une vidéo sélectionnée. Cela dit, un taux de succès de 99,99 % sans indication du nombre d'interventions humaines, du périmètre exact des tâches ou de la nature des "failures" non comptabilisées mérite prudence. Si les chiffres se confirment à l'audit, ils représentent un signal fort pour les intégrateurs industriels : le sim-to-real et la robustesse en environnement bruité commencent à être résolus à une échelle suffisante pour envisager des déploiements pilotes à coût acceptable. La position déclarée d'AGIBOT dans les expéditions mondiales d'humanoïdes, à 39 % de part de marché selon ses propres chiffres, illustre l'avance de l'écosystème chinois dans la commercialisation de masse, bien avant que des acteurs occidentaux comme Figure AI, Agility Robotics ou 1X n'aient franchi les mêmes seuils de volume. Fondée à Shanghai, AGIBOT a accéléré son développement dans le sillage du boom des VLA (Vision-Language-Action models) et de l'intérêt industriel post-2023 pour l'embodied AI. Son G2 concurrence directement le Figure 03 (Figure AI, ayant réalisé un run autonome de 200 heures en mai 2026 avec 250 000 colis traités) et l'Optimus Gen 3 de Tesla, ainsi que les robots Unitree et Fourier Intelligence côté chinois. Sur le segment européen, les acteurs comme Enchanted Tools ou Wandercraft restent positionnés sur des niches spécialisées (service, médical) sans viser encore la production industrielle de masse. La prochaine étape pour AGIBOT sera de convertir ces démonstrations en contrats de déploiement multi-sites et de publier des données indépendantes validant ses métriques de fiabilité.

UEAucun impact direct sur la France/UE, mais la démonstration révèle un écart compétitif croissant : avec 15 000 robots livrés et 39 % de parts de marché revendiquées, l'écosystème chinois distance les acteurs européens (Enchanted Tools, Wandercraft) qui restent cantonnés à des niches spécialisées sans viser la production industrielle de masse.

Chine/AsieOpinion
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
43Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

UELes modèles WALL-OSS-0.5 et WALL-WM étant open source, les équipes R&D européennes peuvent les évaluer directement ; la montée en puissance de l'écosystème chinois (Alibaba, ByteDance, Meituan comme investisseurs lead simultanés) intensifie la pression concurrentielle sur les acteurs européens de l'IA incarnée.

Chine/AsieOpinion
1 source
LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)
44arXiv cs.RO 

LIBERO-Safety : un benchmark complet pour la sécurité physique et sémantique des modèles vision-langage-action (VLA)

Des chercheurs ont publié LIBERO-Safety, un benchmark paramétrique conçu pour évaluer la sûreté physique et sémantique des modèles Vision-Language-Action (VLA) dans des scénarios de manipulation robotique. Le système génère de façon procédurale des situations critiques avec une stochasticité complète, en s'appuyant sur un pipeline de génération de données piloté par des poses-clés (keypose-driven), une alternative à la téléopération humaine, jugée trop coûteuse à passer à l'échelle. Le jeu de données résultant comprend 19 664 démonstrations strictement sans collision, avec une randomisation de domaine extensive. L'équipe a ensuite évalué de manière systématique huit modèles VLA et deux modèles fondateurs incarnés (embodied foundation models), couvrant plusieurs paradigmes d'entraînement contemporains. Le résultat central est une tension generalization-safety que les auteurs qualifient de critique : un entraînement sur des données très diversifiées produit des trajectoires plus sûres, mais la réussite des tâches reste fondamentalement plafonnée par une synthèse de trajectoires sous-optimale et un désalignement sémantique. Autrement dit, rendre un VLA plus prudent ne le rend pas automatiquement plus compétent, et inversement. Pour les intégrateurs industriels et les équipes produit qui espèrent déployer ces modèles en environnement non contrôlé, ce constat tempère les promesses des démonstrations récentes : les modèles VLA actuels ne garantissent pas une opération sûre sous contraintes strictes. C'est un signal fort que les métriques de performance sur tâche sont insuffisantes pour valider un déploiement réel. LIBERO-Safety s'inscrit dans la continuité du benchmark LIBERO (Lifelong Robot Learning), initialement développé pour évaluer le transfert de tâches. L'extension safety arrive dans un contexte d'accélération marquée des VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure ont tous été présentés cette année avec des capacités de manipulation généraliste convaincantes, mais sans évaluation de sûreté systématisée. LIBERO-Safety propose une infrastructure open-source pour combler ce vide, avec un pipeline scalable permettant à d'autres équipes de générer leurs propres datasets de sécurité. Les suites naturelles incluent l'intégration de ce benchmark dans les pipelines d'évaluation des grands labos de robotique, et potentiellement son adoption comme référentiel de validation pour des déploiements industriels en production.

RecherchePaper
1 source
Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?
45arXiv cs.RO 

Lâcher-puis-récupérer : quelle est la redondance des modèles vision-langage-action (VLA) ?

Une équipe de chercheurs a publié fin juin 2026 une étude (arXiv:2606.27755) examinant la redondance architecturale des modèles Vision-Language-Action (VLA), ces modèles de contrôle robotique qui combinent un backbone de langage préentraîné avec des modules vision et action. Le protocole, baptisé Drop-Then-Recovery (DTR), consiste à supprimer des blocs transformer sélectionnés d'un VLA préentraîné, puis à le fine-tuner pour mesurer si la capacité retirée était réellement nécessaire au contrôle en boucle fermée. Pour prioriser quels blocs supprimer, les auteurs introduisent GateProbe, une métrique de sensibilité en un seul passage (one-shot) qui classe les blocs selon leur contribution à la perte d'action en aval. Les expériences couvrent plusieurs architectures VLA, des benchmarks de manipulation standard (dont LIBERO) et des scénarios industriels sur robot réel. Résultat chiffré marquant : supprimer la moitié des blocs LLM d'OpenVLA-OFT fait passer le score LIBERO de 95,0 % à 98,3 %, et ne conserver que deux blocs de langage suffit à retrouver les performances de référence. Ce résultat remet en question un postulat implicite du domaine : que la profondeur des backbones de langage hérités des grands modèles (LLM) est nécessaire à la compréhension d'instructions robotiques. Les instructions typiques en manipulation sont courtes et peu compositionnelles ; le surcapacité linguistique ne sert pas le contrôle et peut même nuire via du bruit de gradient ou une compétition de capacité. En revanche, les voies vision et action se révèlent nettement moins tolérantes à la suppression, ce qui oriente clairement les priorités d'allocation pour les futures architectures VLA. Pour les intégrateurs industriels, cela ouvre la voie à des modèles plus légers, moins coûteux à inférer et à fine-tuner, sans dégradation de performance sur les tâches réelles. Les VLA ont émergé comme paradigme dominant du contrôle robotique généraliste depuis les travaux fondateurs sur RT-2 (Google DeepMind, 2023) et OpenVLA (Berkeley, 2024), qui ont montré qu'un backbone VLM préentraîné pouvait être réutilisé pour la manipulation. OpenVLA-OFT, utilisé comme modèle de référence dans cette étude, est une variante fine-tunable publiée par l'Université de Stanford. Parmi les concurrents directs sur ce terrain architectural : Physical Intelligence avec pi0 (basé sur un flow matching), qui a déjà opté pour une architecture plus légère côté langage, et les travaux de pruning de transformers en NLP (SparseGPT, Sheared LLaMA) dont DTR s'inspire méthodologiquement. Le code est disponible sur GitHub (s1ghhh/VLADrop). Les prochaines étapes logiques seraient de tester DTR sur des modèles plus récents (GR00T N2 de NVIDIA, Helix de Figure) et sur des tâches à instructions longues ou hiérarchiques, où la profondeur linguistique pourrait enfin devenir un facteur limitant.

RechercheOpinion
1 source
S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon
46arXiv cs.RO 

S²-VLA : modèles vision-langage-action guidés par l'espace d'états pour la manipulation à long horizon

Un groupe de chercheurs a publié S²-VLA (State-Space Guided Vision-Language-Action), une architecture destinée à résoudre l'une des limitations structurelles des modèles VLA en manipulation robotique : la dégradation des performances sur les tâches longues due à la propagation cumulative des erreurs. Le coeur du système est le mécanisme SSGAA (State-Space Guided Adaptive Attention), qui maintient un "état de croyance" (belief state) actualisé à chaque étape de la tâche et génère des poids de fusion dynamiques, là où les architectures VLA existantes utilisent des poids fixes. Ces poids adaptatifs combinent trois sources : les caractéristiques visuelles pour la perception spatiale, les intentions de haut niveau pour la planification, et les séquences d'actions temporelles pour la cohérence d'exécution. Avec 2 milliards de paramètres seulement, S²-VLA surpasse des modèles de 7 milliards sur les benchmarks LIBERO et SimplerEnv, deux références pour l'évaluation des tâches de manipulation longue séquence. Le résultat le plus saillant est l'efficacité paramétrique : battre des modèles 7B avec un modèle 2B remet en question l'hypothèse selon laquelle la performance sur des tâches complexes serait avant tout une affaire de scaling. Pour les intégrateurs industriels et les équipes déployant des robots manipulateurs, cela ouvre la voie à une inférence embarquée sur des plateformes aux ressources limitées. Sur le plan de la recherche, le papier formalise un point de friction bien identifié : la fusion statique des représentations visuelles, linguistiques et motrices crée une rigidité qui amplifie les erreurs au fil des étapes. L'emprunt aux modèles d'espace d'états (State Space Models, d'où "S²") pour introduire une mémoire adaptative dans la fusion est l'apport architectural central. Les modèles VLA ont connu une accélération significative depuis 2024, avec Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) et GR00T N2 (NVIDIA) comme jalons récents, tous confrontés à la même limite sur les longs horizons de tâches. S²-VLA s'inscrit dans un courant de recherche cherchant à résoudre ce "long-horizon gap" par l'architecture plutôt que par l'échelle. Le papier est disponible sur arXiv (référence 2606.27872v1) et reste un preprint non évalué par les pairs : les résultats annoncés sont à confirmer indépendamment. Aucun code ni dataset n'est encore annoncé publiquement, et les affiliations institutionnelles des auteurs ne figurent pas dans le résumé disponible.

💬 Un modèle de 2 milliards qui bat des modèles de 7 milliards sur les tâches longues, c'est le genre de résultat qui remet en question l'obsession du scaling. L'astuce : une attention adaptative qui maintient un état de croyance continu entre chaque étape de la tâche, là où les VLA existants utilisent encore des poids fixes et accumulent les erreurs au fil des actions. C'est un preprint sans code pour l'instant, mais si ça se confirme, les robots embarqués sur hardware limité deviennent soudainement une option sérieuse.

IA physiqueOpinion
1 source
AGIBOT produit son 15 000e robot, marquant un cap dans le déploiement de l'IA incarnée
47Robotics Business Review 

AGIBOT produit son 15 000e robot, marquant un cap dans le déploiement de l'IA incarnée

AGIBOT, fondée à Shanghai en 2023, a annoncé la sortie de son 15 000e robot de sa ligne de production, un jalon qui coïncide avec la publication de données de cadence inédites pour le secteur. La trajectoire de montée en volume est frappante : il a fallu environ un an pour passer de 1 000 à 5 000 unités, puis seulement trois mois supplémentaires pour atteindre 10 000, soit une accélération de production de plus de quatre fois par rapport à la phase précédente. L'unité symbolique numéro 15 000 est un AGIBOT G2, manipulateur mobile sur roues doté d'un torse et de deux bras humanoïdes, conçu pour les tâches industrielles. Le G2 est actuellement déployé sur les lignes de production de tablettes du fabricant Longcheer, où il effectue des contrôles qualité en rythme avec les cadences d'usine. Fin juin, AGIBOT a conclu environ 100 heures cumulées de diffusion en direct de ces opérations, avec le robot travaillant en continu aux côtés d'opérateurs humains. Ces chiffres modifient l'étalon de référence dans la course aux humanoïdes industriels. Selon le cabinet d'études Omdia, AGIBOT a terminé 2025 en tête mondiale des expéditions de robots humanoïdes, avec 5 168 unités livrées et 39 % de part de marché mondiale. À titre de comparaison, les concurrents les plus médiatisés, Agility Robotics (Amazon), Boston Dynamics, Figure AI et Humanoid, en sont encore principalement aux phases de pilote ou de trials commerciaux limités. Ce que la progression de cadence d'AGIBOT démontre, c'est que le véritable défi post-démonstration n'est pas le robot lui-même mais l'ensemble de la chaîne : supply chain, processus de fabrication reproductibles, intégration logiciel-matériel, et capacité de déploiement terrain à grande échelle. La différence entre un démonstrateur convaincant et 15 000 unités livrées en milieu réel reste considérable, et AGIBOT semble avoir investi autant dans cet outillage industriel que dans la performance du robot. AGIBOT a été fondée il y a à peine trois ans avec l'ambition de produire un modèle de fondation pour l'IA incarnée, articulé autour d'une architecture propriétaire baptisée "Three Intelligences in One" qui unifie la locomotion, l'interaction et la manipulation dans un système commun. Son portefeuille couvre aujourd'hui les robots humanoïdes, les quadrupèdes, les systèmes de dextérité avancée et les solutions de nettoyage commercial. Le positionnement concurrentiel est clair : quand Figure AI annonce des partenariats avec BMW et que Agility teste ses Digit chez Amazon, AGIBOT mise sur le volume livré comme argument commercial principal. La prochaine étape crédible à surveiller sera la cadence de renouvellement de contrats industriels, et non les seules annonces de production, pour valider que ces robots restent réellement en service, et pas simplement expédiés.

UELe leadership d'AGIBOT en volume de production humanoïde (39 % de part de marché mondial selon Omdia) redéfinit l'étalon de référence industriel et expose les intégrateurs et fabricants européens à une concurrence chinoise déjà opérationnelle à l'échelle industrielle, accentuant le retard des acteurs UE sur la chaîne de production robotique.

HumanoïdesOpinion
1 source
Kawasaki Robotics présente son robot IA physique à 8 axes et ses technologies d'automatisation intelligente à Automate 2026
48Robotics & Automation News 

Kawasaki Robotics présente son robot IA physique à 8 axes et ses technologies d'automatisation intelligente à Automate 2026

Kawasaki Robotics a présenté son nouveau robot RL030N à l'Automate 2026 de Chicago, événement de référence pour l'automatisation industrielle en Amérique du Nord. Pièce centrale de la participation, le RL030N est une plateforme à 8 degrés de liberté (8-DoF) positionnée pour les applications de "Physical AI", soit des systèmes capables d'adapter leur comportement à partir de données d'environnement en temps réel. Kawasaki a également mis en avant sa technologie Pulseboard (brevetée), ainsi qu'un ensemble de briques d'intégration couvrant la vision industrielle, l'apprentissage machine et le contrôle temps réel. Les détails techniques complets, notamment charge utile, temps de cycle et prix, n'ont pas été communiqués à l'issue du salon. L'architecture 8-DoF du RL030N dépasse la configuration 6-DoF standard des bras industriels classiques, apportant une redondance cinématique qui autorise des trajectoires plus complexes dans des cellules encombrées et une meilleure gestion des singularités. Pour les intégrateurs et décideurs industriels, le signal fort est le couplage explicite avec une couche Physical AI : Kawasaki cible des cas d'usage adaptatifs (tri, assemblage variable, manipulation non structurée) là où les programmes figés atteignent leurs limites. L'absence de métriques de performance publiées au moment de l'annonce invite cependant à réserver le jugement sur les capacités réelles en production. Kawasaki Robotics, filiale américaine de Kawasaki Heavy Industries, est actif dans la robotique industrielle depuis les années 1960, historiquement ancré dans le soudage et la manutention lourde. Sur le segment Physical AI, l'entreprise se positionne face aux leaders FANUC, KUKA, ABB et Yaskawa, ainsi qu'à des acteurs logiciels comme Intrinsic (Google) ou Covariant. Le RL030N constitue une première mondiale à Automate 2026 ; les conditions de disponibilité commerciale et les éventuels partenariats d'intégration restent à confirmer.

UELe positionnement de Kawasaki sur l'IA physique industrielle amplifie la pression concurrentielle sur les constructeurs européens (KUKA, ABB) et les intégrateurs français dans l'automatisation adaptative, sans déploiement européen annoncé à ce stade.

IA physiqueOpinion
1 source
BMW intègre le robot humanoïde Figure 03 dans son usine intelligente aux États-Unis pour la logistique avancée
49Interesting Engineering 

BMW intègre le robot humanoïde Figure 03 dans son usine intelligente aux États-Unis pour la logistique avancée

BMW a déployé le robot humanoïde Figure 03 de Figure AI dans son usine de Spartanburg, en Caroline du Sud, pour automatiser des tâches de séquençage logistique complexes. Ce déploiement fait suite à un pilote de onze mois avec le Figure 02, qui avait contribué à la production de plus de 30 000 BMW X3 en insérant des composants en tôle dans des gabarits de soudure avec haute précision et cadence soutenue. Le Figure 03 prend en charge l'organisation de composants non triés dans des chariots de séquençage avant leur acheminement vers les postes d'assemblage par des systèmes de transport autonomes, selon un mode de fabrication "just-in-sequence" garantissant que les opérateurs reçoivent les bons composants au bon moment. La nouvelle génération introduit plusieurs améliorations matérielles : revêtement extérieur souple pour la sécurité en milieu partagé, charge sans fil pour maximiser le temps de fonctionnement, communication vocale bidirectionnelle, et mains repensées équipées de capteurs tactiles et de caméras palmaires intégrées. En parallèle, BMW expérimente depuis mars 2026 le robot humanoïde AEON de Hexagon dans son usine de Leipzig pour l'assemblage de batteries haute tension et de composants de carrosserie. Le passage du Figure 02 au Figure 03, et surtout l'extension du périmètre d'application de la carrosserie vers la logistique, représente un signal sectoriel significatif : les robots humanoïdes ne sont plus cantonnés aux tâches de soudure répétitives à faible variabilité, mais commencent à opérer dans des environnements moins structurés, où la dextérité fine et la reconnaissance d'objets variés sont requises. Les capteurs tactiles et caméras palmaires du Figure 03 sont directement conçus pour réduire ce gap de manipulation. La durée du déploiement initial, onze mois sous conditions de production réelles avec une contribution mesurable à la sortie de 30 000 véhicules, constitue une donnée plus robuste que les démonstrations en laboratoire qui dominent encore les annonces du secteur. Cela dit, BMW ne communique pas de métriques de cadence ni de taux de disponibilité comparés aux postes humains, ce qui rend l'évaluation économique difficile depuis l'extérieur. BMW positionne explicitement Spartanburg comme son principal site de développement pour l'intégration de la robotique humanoïde, dans le cadre d'une stratégie dite "Physical AI" qui vise à compléter l'automatisation classique plutôt qu'à la remplacer. Figure AI, fondée par Brett Adcock, concurrence sur ce segment Tesla (Optimus), Boston Dynamics (Atlas), Agility Robotics (Digit) et 1X Technologies. L'extension à Leipzig avec AEON de Hexagon, un acteur moins médiatisé que ses concurrents américains, suggère que BMW maintient une stratégie multi-fournisseurs plutôt que de s'engager en exclusivité avec un seul partenaire robotique. Les prochaines étapes annoncées incluent l'évaluation de la polyvalence d'AEON sur plusieurs processus de fabrication à Leipzig, notamment en production de modules énergétiques et d'éléments de carrosserie extérieure, sans calendrier précis communiqué pour un déploiement à grande échelle.

UELe déploiement à Spartanburg sert de banc d'essai pour les usines BMW en Europe, notamment à Leipzig où l'AEON de Hexagon est en test depuis mars 2026, signalant une accélération potentielle de l'intégration humanoïde dans la supply chain automobile européenne.

HumanoïdesOpinion
1 source
E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique
50arXiv cs.RO 

E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique

Des chercheurs présentent sur arXiv (2606.27268, juin 2026) E-TTS, un cadre de mise à l'échelle à l'inférence (test-time scaling) pour la manipulation robotique, applicable en surcouche de modèles vision-language-action (VLA) existants sans réentraînement ni collecte de données supplémentaire. Le framework repose sur deux mécanismes : un échantillonnage conjoint raisonnement-action avec notation par paires, et un tampon d'historique (history buffer) qui stocke les observations passées pour contextualiser les décisions d'action. Contrairement aux méthodes TTS en boucle ouverte, E-TTS intègre du feedback durant l'inférence via un mécanisme de raffinement itératif en boucle fermée, piloté par des vérificateurs vision-langage. Les auteurs rapportent des gains jusqu'à 33,14 % en simulation et 26,62 % en conditions réelles, mesurés sur 4 benchmarks, 6 environnements, 3 morphologies de robots et 4 modèles VLA de base. L'enjeu est de transposer à la robotique ce qui a fonctionné pour les LLMs : amplifier les capacités à l'inférence sans modifier les poids du modèle. Le défi spécifique aux robots est que les tâches sont séquentielles et longues : une observation instantanée ne suffit pas pour choisir la bonne action, contrairement à une requête texte isolée. En partageant un buffer d'historique entre les modules de raisonnement et de vérification d'action, E-TTS comble un angle mort des méthodes TTS précédentes pour l'embodied AI. Le fait que le gain tienne en conditions réelles (26,62 %) et pas seulement en simulation est un signal positif sur le sim-to-real gap, même si les conditions exactes de ces expériences en monde réel méritent examen dans le papier complet. Le test-time scaling a émergé avec les architectures o1 et o3 d'OpenAI et les approches chain-of-thought pour les LLMs, avant d'être progressivement exploré pour les VLA robotiques. E-TTS s'inscrit dans ce mouvement que les auteurs eux-mêmes qualifient d'"early attempts", ce qui situe honnêtement le niveau de maturité. L'architecture modulaire et plug-and-play est conçue pour s'adapter à des VLA variés, ce qui pourrait faciliter l'adoption par des équipes travaillant sur des modèles comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Le papier ne mentionne ni déploiement industriel ni partenariat avec un constructeur de robots : il reste une preuve de concept académique dont la validation sur des tâches industrielles réelles (assemblage, palettisation) constituerait l'étape suivante naturelle.

💬 Ce qui change ici, c'est le buffer. Appliquer le test-time scaling à un robot, c'est pas aussi simple qu'à un LLM : un bras qui visse en étape 7 ne peut pas raisonner sur une observation instantanée, il lui faut les étapes précédentes pour contextualiser. Que les gains tiennent à 26 % en conditions réelles et pas seulement en sim, c'est le seul résultat qui compte pour l'instant.

IA physiqueOpinion
1 source