Aller au contenu principal
China Mobile publie en open source sa base d'ingénierie Open-RAIL pour les modèles de robots VLA et WAM
InfrastructureTechNode 

China Mobile publie en open source sa base d'ingénierie Open-RAIL pour les modèles de robots VLA et WAM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

China Mobile a mis en open source Open-RAIL, une base d'ingénierie reliant les modèles vision-langage-action (VLA) et monde-action (WAM) aux robots physiques. La plateforme réunit en un seul flux l'inférence des modèles, l'exécution sur robot réel, la remontée de données et l'itération des modèles. Elle prend en charge quatre robots hétérogènes et dix modèles VLA ou WAM des le lancement. Selon l'opérateur telecom chinois, l'intégration d'un nouveau modèle ne nécessite que 50 a 100 lignes de code, grâce a une couche d'abstraction matérielle qui standardise le contrôle, la lecture d'état et l'exécution des actions quelle que soit la plateforme. Aucune date de disponibilité, aucun tarif ni site de déploiement industriel n'a été précise a ce stade.

Pour l'industrie robotique, cette ouverture s'attaque a un goulot d'étranglement connu: chaque robot possède ses propres API et sa propre cinématique, ce qui oblige les intégrateurs a réécrire l'interface logicielle pour chaque nouveau modèle ou chaque nouvelle plateforme matérielle. En promettant une intégration en quelques dizaines de lignes, Open-RAIL cherche a jouer un rôle d'abstraction commune, un peu comme ROS l'a fait pour la robotique classique, mais applique cette fois aux modèles fondation VLA et WAM. Si ces chiffres se confirment en usage réel et pas seulement en environnement contrôle, le cout d'adoption pour les intégrateurs baisserait sensiblement et les cycles entre simulation et robot physique s'accélèreraient.

Cette initiative s'inscrit dans la stratégie chinoise de construction d'un écosystème logiciel ouvert pour l'IA incarnée, alors que des laboratoires comme NVIDIA (GR00T N2), Physical Intelligence (Pi-0) ou Figure AI (Helix) développent chacun des piles VLA propriétaires ou semi-ouvertes. En tant qu'opérateur telecom, China Mobile s'appuie sur son infrastructure cloud et réseau pour se positionner comme fournisseur d'outils d'orchestration robotique plutôt que comme fabricant de robots. Aucun calendrier de déploiement pilote ni partenariat industriel n'a été communique pour la suite du projet.

À lire aussi

Planification à base d'agents en lots pour le service de politiques robotiques
1arXiv cs.RO 

Planification à base d'agents en lots pour le service de politiques robotiques

Des chercheurs du Georgia Tech (laboratoire RL2) publient un article intitulé "Action Chunk Scheduling for Batched Robot Policy Serving" (arXiv:2608.00337v1), qui pose un problème encore peu formalisé dans la robotique : comment servir un même modèle de politique robotique, hébergé sur un GPU distant, à plusieurs robots simultanément. Les auteurs présentent Armory, un système de service ("serving") conçu pour cet usage et validé à la fois sur des flottes de robots simulés et sur des robots réels. Leurs expériences montrent que les heuristiques de scheduling classiques (les méthodes de batching habituelles en inférence LLM) fonctionnent correctement tant que tous les robots de la flotte sont identiques et consomment les actions au même rythme. Mais dès que les robots consomment leurs "action chunks" (blocs d'actions produits par les modèles Vision-Language-Action) à des vitesses différentes, ces heuristiques échouent : elles ne tiennent pas compte des contraintes en boucle fermée ("closed-loop") propres à l'exécution de politiques robotiques. Pour corriger ce défaut, l'équipe propose un nouvel algorithme de scheduling qui intègre cette hétérogénéité de rythme entre robots, avec un gain de débit système mesuré jusqu'à 18 % lors d'essais réels. Le code et les détails sont disponibles sur gatech-rl2.github.io/actionchunkscheduling. Le résultat touche un point aveugle du déploiement à grande échelle des modèles fondation pour la robotique (VLA type Pi-0, GR00T N2, Helix ou autres) : le calcul embarqué est limité en puissance et en encombrement, ce qui pousse naturellement vers une inférence déportée sur GPU distant, mutualisée entre plusieurs robots pour amortir les coûts. Or les architectures de batching héritées du monde LLM, pensées pour du texte asynchrone, ignorent la contrainte physique du temps réel robotique : un robot qui épuise son buffer d'actions avant d'être resservi s'arrête ou dégrade sa trajectoire. Ce papier démontre empiriquement que cette mécanique de service compte autant que la qualité du modèle lui-même pour faire fonctionner une flotte hétérogène en production, un enjeu direct pour les intégrateurs qui veulent mutualiser l'inférence entre robots de générations ou de tâches différentes plutôt que de multiplier les cartes embarquées. Ce travail s'inscrit dans la vague récente de modèles VLA génériques (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) qui cherchent à démontrer un contrôle robotique à l'échelle d'une flotte plutôt qu'à l'unité, un terrain où l'infrastructure de service devient aussi critique que l'entraînement. En formalisant le problème comme un scheduling explicite et en le testant sur du matériel réel plutôt que seulement en simulation, les auteurs positionnent Armory comme une brique d'infrastructure réutilisable, potentiellement comparable aux serveurs d'inférence LLM (type vLLM) mais adaptée aux contraintes temps réel de la robotique. L'article ne précise pas de partenariat industriel ni de déploiement commercial annoncé ; il s'agit pour l'instant d'un résultat de recherche académique, avec du code ouvert, plutôt que d'un produit prêt à l'emploi.

InfrastructureActu
1 source
ROSA : un système d'inférence de modèles fondation pour usines de robots
2arXiv cs.RO 

ROSA : un système d'inférence de modèles fondation pour usines de robots

Une équipe de recherche propose ROSA, un système de service d'inférence pour les modèles fondation de robotique (RFM), décrit dans un preprint publié sur arXiv (2607.01088, 1er juillet 2026). Contrairement aux systèmes existants qui traitent l'inférence comme un problème de calcul en périphérie, avec un GPU embarqué ou dédié par robot, ROSA repose sur trois principes: un pool de GPU partagé accessible en réseau par toute une flotte de robots, une abstraction de programmation "robotics-aware" gérant des pipelines multi-modèles avec exigences de performance par tâche et gestion des échecs, et un ordonnancement piloté par l'objectif global de l'usine plutôt que par la latence d'une seule requête. L'équipe l'a implémenté sur Ray Serve pour l'orchestration distribuée, avec vLLM, PyTorch et JAX comme moteurs d'inférence, et l'a évalué sur des robots réels ainsi que sur des charges de travail synthétiques à grande échelle. Résultat annoncé: jusqu'à 12,06 fois plus de productivité d'usine qu'avec des systèmes de service dédiés classiques, un chiffre qui reste à confirmer sur des déploiements industriels réels plutôt que sur les scénarios de test choisis par les auteurs. L'intérêt de ROSA est de remettre en cause l'hypothèse dominante selon laquelle l'inférence d'un modèle de robot doit tourner localement, robot par robot. En mutualisant des GPU de classe serveur sur le réseau, l'approche promet de meilleures performances d'inférence, une autonomie de batterie accrue et un taux d'utilisation GPU plus élevé, des enjeux critiques pour les industriels qui envisagent des flottes de robots humanoïdes ou mobiles plutôt que des unités isolées. Cela rapproche l'infrastructure de service robotique du modèle déjà adopté pour les grands modèles de langage en cloud, un signal utile pour les intégrateurs et décideurs qui raisonnent en coût par flotte plutôt qu'en coût par robot. Le travail s'inscrit dans la vague plus large des modèles fondation de robotique (VLA) qui rendent les robots généralistes envisageables en usine, où l'inférence reste souvent le goulot d'étranglement plutôt que l'apprentissage lui-même. Il s'agit ici d'une contribution académique, pas d'un produit commercialisé: aucun acteur français ou européen n'est cité, et le passage à l'échelle en production reste à démontrer au-delà des bancs d'essai présentés.

InfrastructureActu
1 source
Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes
3arXiv cs.RO 

Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes

Des chercheurs publient sur arXiv (référence 2607.02501v1) un runtime d'inférence baptisé Embodied.cpp, conçu pour exécuter des modèles d'IA incarnée directement sur des robots physiques. Écrit en C++, il cible spécifiquement les modèles vision-langage-action (VLA) et les modèles monde-action (WAM), deux familles d'architectures qui équipent aujourd'hui la plupart des humanoïdes et bras robotiques pilotés par apprentissage. Le système s'organise en cinq couches, des adaptateurs d'entrée jusqu'aux adaptateurs de déploiement, en passant par la construction de séquences, l'exécution du backbone et des modules de tête interchangeables. Les auteurs l'ont testé sur deux modèles VLA, HY-VLA et pi0.5, obtenant des taux de réussite de tâches en boucle fermée de 100,0% et 91,0% respectivement. Sur un benchmark préliminaire de modèle WAM utilisant un bloc Transformer LingBot-VA, la mémoire consommée par bloc chute de 312,2 MiB à 88,1 MiB. Cette publication s'attaque à un problème très concret pour les intégrateurs robotiques: le déploiement des modèles d'IA incarnée reste aujourd'hui fragmenté entre piles Python spécifiques à chaque modèle, hypothèses matérielles disparates et code de liaison écrit à la main pour chaque robot. Les runtimes d'inférence existants sont pensés pour du serving requête-réponse classique, pas pour les contraintes réelles du contrôle robotique: exécution multi-fréquence dans une boucle fermée, inférence batch-1 en priorité latence sur du matériel hétérogène, et interfaces au-delà du simple flux de tokens. Si les résultats se confirment à plus grande échelle, un runtime portable unique capable de faire tourner plusieurs familles de VLA et de WAM sur des appareils edge variés réduirait significativement le travail d'ingénierie nécessaire pour passer d'un prototype en simulation à un déploiement réel sur robot, un des goulots d'étranglement les plus cités du secteur. Le travail s'inscrit dans la course actuelle autour des modèles génériques de contrôle robotique, aux côtés d'architectures comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, qui cherchent toutes à unifier perception, langage et action dans un seul modèle déployable sur du matériel varié. En proposant une couche d'abstraction backend commune plutôt qu'un modèle de plus, Embodied.cpp se positionne comme brique d'infrastructure plutôt que comme concurrent direct, un signe que la standardisation de l'inférence embarquée devient un enjeu aussi important que la performance des modèles eux-mêmes.

InfrastructureActu
1 source
AMD dévoile le module Kria pour le contrôle en temps réel et la mémoire unifiée des robots
4Robotics Business Review 

AMD dévoile le module Kria pour le contrôle en temps réel et la mémoire unifiée des robots

AMD a dévoilé sa nouvelle gamme Ryzen AI Embedded X100, associée à la plateforme Kria AI Robotics, pour cibler les charges de calcul de l'IA physique. Le fabricant promet un contrôle temps réel déterministe, une mémoire unifiée entre CPU, GPU et NPU, et une pile logicielle ouverte non liée à un fournisseur unique. Le X100 succède au P100 et devient le SoC phare de la gamme robotique d'AMD. Il vise le temps réel "ferme" via des optimisations Linux et BIOS, avec une latence d'interruption ciblée sous 7 microsecondes, complétées par des fonctions de qualité de service AMD (réservation de cache L3, allocation de bande passante mémoire, isolation des threads). Pour le temps réel "dur", AMD recommande une virtualisation par hyperviseur Zen, une machine virtuelle FreeRTOS et l'isolation de VM. Le module Kria AI SoM, bâti sur ce SoC, adopte le format standard COM-HPC plutôt qu'un connecteur propriétaire, avec une fermeture de boucle de contrôle annoncée à 1,5 microseconde. Selon Rob Bauer, responsable produit chez AMD pour le portefeuille APU embarqué x86, la puce délivrerait trois fois la puissance de calcul FP32 du NVIDIA Thor sur des charges de traitement du signal, un segment où AMD dit rester compétitif malgré l'optimisation poussée de Thor pour l'inférence. Cette annonce vise directement la position dominante de NVIDIA sur l'IA physique, incarnée par ses puces Orin et Thor, en offrant aux intégrateurs une alternative capable, selon AMD, de mettre la pression sur les prix. La mémoire unifiée réduit les copies de données entre unités de calcul, un point sensible pour la perception, la fusion de capteurs et la planification de trajectoire, tâches critiques pour les bras industriels, les robots mobiles autonomes et les humanoïdes. Un stack logiciel ouvert, non verrouillé, répond aussi à une demande croissante des intégrateurs de ne pas dépendre d'un seul écosystème propriétaire. Les chiffres avancés (3,4 fois la performance temps réel du Thor T5000, 1,6 fois de capacité de calcul disponible, 2,3 fois de capacité pour l'IA agentique) restent toutefois des mesures internes d'AMD, sans benchmark indépendant publié à ce stade, ce qui invite à la prudence sur leur portée réelle en conditions de déploiement. L'offensive s'accompagne du lancement du Robotics Development Kit, de la suite logicielle open source AMD Robotics Sophie Suite, et d'un réseau de partenaires robotique. Cette stratégie plein-stack doit être présentée plus en détail lors du salon RoboBusiness 2026. Il s'agit pour l'instant d'une annonce de plateforme et de composants, pas encore de déploiements industriels documentés à grande échelle, un point que le secteur devra vérifier une fois les premiers intégrateurs équipés du Kria AI SoM.

InfrastructureActu
1 source