Aller au contenu principal
PhyAI : l'IA physique en temps réel en périphérie, avec un déploiement à grande échelle dans le cloud
InfrastructurearXiv cs.RO 

PhyAI : l'IA physique en temps réel en périphérie, avec un déploiement à grande échelle dans le cloud

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv début août 2026, PhyAI est un moteur d'inférence unifié pour l'IA physique, code et benchmarks disponibles en accès libre sur GitHub (mingti-org/phyai). Le système fait tourner un seul runtime sur les quatre étapes du cycle de vie d'une politique robotique : évaluation de modèle, rollout d'apprentissage par renforcement dans le cloud, service sur GPU en edge et déploiement embarqué. L'architecture isole dans des adaptateurs les briques spécifiques à chaque modèle (conditionnement, solveur, cache, sortie), tandis que le reste, exécution du graphe de calcul, kernels, gestion mémoire, services parallèles, est mutualisé. Les auteurs ont testé la portabilité de cette approche en intégrant MiniCPM-Robot le jour même de sa sortie via cette interface d'adaptateur. Les gains mesurés vont de 1,40x à 4,65x par rapport aux implémentations officielles de pi0, pi0.5, GR00T N1.7 et MiniCPM-Robot. Sur Cosmos3-Nano-Policy-DROID, la latence tombe de 2,46 à 1,18 seconde sur huit GPU H20 (CFG=2, parallélisme tensoriel TP=4), soit un facteur 2,08x.

Ce résultat vise directement les intégrateurs et ingénieurs robotique qui jonglent aujourd'hui entre plusieurs runtimes selon l'environnement de déploiement, un vrai point de friction dans l'industrialisation des politiques VLA (vision-language-action). En unifiant évaluation, entraînement et production sous un même code, PhyAI réduit le risque d'écart entre performances mesurées en labo et résultats sur le terrain, un problème classique du secteur. Les auteurs restent factuels sur les limites : des runtimes spécialisés demeurent plus rapides dans plusieurs configurations, l'objectif affiché étant une latence compétitive plutôt qu'un record absolu. L'apport le plus utile pour les décideurs techniques est le concept de "control-time Roofline", qui distingue les cas où le contrôle est limité par l'inférence de ceux limités par l'environnement : sur quatre suites LIBERO, pi0.5 s'avère limité par l'environnement tandis que Cosmos3 reste limité par l'inférence, une grille utile pour prioriser les investissements.

Les profils détaillés expliquent pourquoi un runtime unique ne suffit pas seul : sur GPU Hopper, à batch 1, l'expert d'action de pi0.5 représente 8,8% des calculs (FLOPs) mais 57,2% de la latence, un goulot qui retombe à 13,5% à batch 32, portant le débit à environ 100 échantillons par seconde. Cosmos3, dominé par la génération, ne gagne que 14,3% de débit entre batch 1 et 16. Ces travaux s'inscrivent dans la course à l'infrastructure d'inférence pour l'IA physique, alors que les familles pi0/pi0.5 (Physical Intelligence), GR00T (NVIDIA) et les VLA type Cosmos ou MiniCPM-Robot se multiplient, chaque laboratoire ayant historiquement développé son propre runtime maison.

À lire aussi

Kairos : un système de déploiement extensible pour l'IA physique
1arXiv cs.RO 

Kairos : un système de déploiement extensible pour l'IA physique

Une équipe de chercheurs publie sur arXiv (référence 2605.11381, mai 2025) les spécifications de Kairos, un système d'inférence conçu pour les flottes de robots pilotées par des modèles de fondation. Kairos se positionne comme le premier système de serving multi-robot à intégrer nativement la boucle generate-execute, soit l'enchaînement asynchrone entre les phases d'inférence et d'exécution motrice propre à l'IA physique. Sur un ensemble de modèles et de plateformes robotiques, le système annonce une réduction de la latence bout-en-bout de 31,8 à 66,5 % par rapport aux pratiques de serving issues du monde de l'IA digitale, avec des gains qui s'accroissent avec la taille de la flotte déployée. L'argument central des auteurs tient à une inadéquation structurelle. Les systèmes actuels comme vLLM, TensorRT-LLM ou Triton ont été conçus pour les LLM textuels : ils traitent une requête jusqu'à complétion, sans état intermédiaire. L'IA physique fonctionne différemment : le modèle génère des blocs d'actions (action chunks) à chaque round d'inférence, le robot commence à exécuter pendant que le bloc suivant est calculé, et plusieurs cycles se succèdent sur une même tâche. Cette asynchronicité, ignorée par les serveurs digitaux classiques, crée un goulot d'étranglement critique pour les flottes industrielles. Si les chiffres se confirment en conditions réelles, les intégrateurs y gagneraient des cycles de contrôle plus courts et une capacité de scaling horizontal sans surcoût infrastructure proportionnel. Le contexte explique l'urgence de cette contribution. Depuis 2024, les modèles de fondation pour robots prolifèrent : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI. Ces VLA (Vision-Language-Action) ont franchi des seuils de généralisation inédits, mais l'infrastructure de déploiement n'a pas suivi le même rythme. Kairos tente de combler ce fossé côté serving. Il s'agit néanmoins d'un preprint non revu par les pairs : les benchmarks ne sont pas détaillés dans l'abstract, les modèles et robots de test ne sont pas nommés, et aucun déploiement en production n'est déclaré. Les métriques annoncées méritent donc une lecture prudente en attendant une validation expérimentale indépendante.

InfrastructureOpinion
1 source
Arm va aborder le passage à l'échelle de l'IA physique lors de RoboBusiness
2Robotics Business Review 

Arm va aborder le passage à l'échelle de l'IA physique lors de RoboBusiness

Arm annonce que Dermot O'Driscoll, vice-président go-to-market pour l'IA physique du fabricant britannique de semi-conducteurs, interviendra à RoboBusiness, les 20 et 21 octobre 2026 à Santa Clara, en Californie, pour la 20e édition de l'événement organisé par The Robot Report. Sa présentation, intitulée « Building Physical AI that Scales », portera sur les principes d'architecture matérielle jugés nécessaires pour faire passer les robots autonomes du prototype à des déploiements fiables en production : répartition du calcul entre cloud et edge, coordination entre comportements appris et comportements déterministes, et dimensionnement des plateformes de calcul pour concilier réactivité temps réel, efficacité énergétique et sûreté. O'Driscoll totalise plus de vingt ans chez Arm, avec des postes d'ingénierie et de direction en IT, en conception assistée par ordinateur (EDA) et en conception de puces CPU et SoC ; il est diplômé en électronique et titulaire d'un master en microélectronique de l'université d'Édimbourg. L'intervention fait suite au lancement par Arm de son programme Total Design, qui fédère des partenaires de la chaîne technologique pour réduire la complexité d'intégration des systèmes autonomes. Aucun produit, puce ni chiffre de performance n'est dévoilé : il s'agit d'une annonce de conférence, non d'un lancement produit. Ce choix de sujet illustre un déplacement de l'attention du secteur, des démonstrations de modèles fondation et de systèmes vision-langage-action vers les questions d'architecture système et de confiance en production. Pour les intégrateurs et les décideurs industriels, le message est concret : la capacité d'un robot à raisonner grâce à l'IA générative ne suffit pas si l'infrastructure de calcul embarquée ne garantit pas un comportement prévisible et sûr au-delà des vidéos de démonstration, un rappel qui rejoint les doutes récurrents du secteur sur l'écart entre démonstration et réalité opérationnelle. En se positionnant comme fournisseur d'architecture de référence plutôt que simple concepteur de puces, Arm cherche à s'imposer dans la couche silicium de la robotique physique, un terrain où Nvidia, avec ses plateformes Jetson et ses modèles de fondation robotique, et Qualcomm renforcent également leur présence. Cette prise de parole s'inscrit dans la stratégie d'Arm visant à se positionner comme brique d'infrastructure horizontale pour l'IA physique, alors que les fabricants de robots, des bras industriels aux humanoïdes, cherchent à passer du prototype à des déploiements de série. Le programme Total Design, présenté comme une réponse à la fragmentation de l'écosystème robotique, mise sur la mutualisation de briques technologiques certifiées entre partenaires pour raccourcir les cycles de développement. RoboBusiness 2026, qui célèbre ses vingt ans, proposera par ailleurs des interventions sur la fabrication, la santé, l'agriculture et la logistique, avec des tarifs réduits pour le monde académique. Ni date de disponibilité commerciale, ni partenaire robotique nommé, ni pilote client ne sont précisés à ce stade, et l'article ne cite aucun acteur robotique français ou européen : l'événement fonctionne avant tout comme une vitrine de positionnement pour Arm face à une concurrence croissante sur le calcul embarqué robotique.

InfrastructureActu
1 source
NVIDIA Jetson amène l'IA à base d'agents dans le monde physique
3NVIDIA Blog Robotics 

NVIDIA Jetson amène l'IA à base d'agents dans le monde physique

Lors du salon COMPUTEX à Taipei le 27 mai 2026, NVIDIA a annoncé JetPack 7.2 et le support de NemoClaw sur la plateforme Jetson, marquant une étape concrète dans le déploiement de l'IA agentique sur des systèmes embarqués physiques. JetPack 7.2 apporte le support du projet Yocto pour une distribution Linux allégée et personnalisable, CUDA 13 sur Jetson Orin, et le support MIG (Multi-Instance GPU) couplé à un noyau temps réel sur Jetson Thor, permettant de réserver des ressources GPU dédiées à des tâches déterministes comme la perception robotique. Le module Jetson AGX Orin 32 Go gagne également 20 % de performances, atteignant 241 TOPS d'inférence IA. NemoClaw, le framework agentique de NVIDIA, se déploie désormais sur Jetson en une seule commande. Deux partenaires sont déjà en production : Solomon, qui utilise NemoClaw pour coordonner raisonnement, perception, fusion de capteurs, locomotion et manipulation sur un robot humanoïde, et Advantech, qui déploie un "cerveau d'usine agentique" dans ses propres lignes de fabrication en combinant NemoClaw, Nemotron 3 et Jetson Thor pour la gestion de flottes robotiques et l'inspection de défauts. L'importance de cette annonce réside dans le passage de l'IA agentique des serveurs vers les systèmes embarqués en production industrielle, un écart que l'industrie peinait à combler. L'architecture en trois couches proposée, OS + compute en base (JetPack), skills d'automatisation développeur au milieu, et NemoClaw en orchestrateur applicatif au sommet, permet aux intégrateurs de construire des workflows agentiques complets sans infrastructure cloud. Pour un COO industriel ou un ingénieur robotique, le gain annoncé est celui du time-to-market : des tâches de déploiement et de configuration qui prenaient plusieurs semaines peuvent désormais être réduites à quelques jours grâce aux agent skills dérivées de la documentation officielle NVIDIA. Le support MIG sur Thor est particulièrement significatif pour les applications robotiques réelles, où l'inférence temps réel ne peut pas être interrompue par des tâches d'IA concurrentes. Il faut toutefois noter que les chiffres de performance et les gains de productivité annoncés proviennent du communiqué de presse NVIDIA lui-même, sans benchmark indépendant disponible à ce stade. La plateforme Jetson est déjà déployée dans des secteurs variés, notamment la robotique industrielle, les drones, les dispositifs médicaux, les machines agricoles et les systèmes humanoïdes, et constitue depuis plusieurs générations, Orin puis Thor, l'un des compute modules embarqués les plus répandus dans l'industrie. NemoClaw s'inscrit dans la stratégie d'NVIDIA de descendre son stack agentique, initialement développé pour les serveurs DGX, vers l'edge et les systèmes physiques autonomes. Sur le plan concurrentiel, cette annonce positionne NVIDIA face à des alternatives edge comme Qualcomm (RB5/RB6 pour la robotique) et Google Coral, mais aussi face aux SOC propriétaires développés par Boston Dynamics, Figure ou 1X pour leurs propres humanoïdes. Les prochaines étapes annoncées incluent l'extension des Metropolis VSS blueprint skills pour l'interprétation visuelle agentique, et la diffusion de l'événement Build-a-Claw à Taiwan, signe que NVIDIA cherche à ancrer son écosystème développeur en Asie du Sud-Est, région clé pour la fabrication électronique et robotique mondiale.

UELes intégrateurs robotiques européens sur Jetson Orin/Thor peuvent déployer des workflows agentiques complets sans cloud, réduisant potentiellement le time-to-market de plusieurs semaines à quelques jours, gain concret pour l'automatisation industrielle EU, sans validation indépendante à ce stade.

InfrastructureOpinion
1 source
Déployer une IA à base d'agents en périphérie avec efficacité mémoire grâce à NVIDIA JetPack 7.2
4NVIDIA Developer Blog 

Déployer une IA à base d'agents en périphérie avec efficacité mémoire grâce à NVIDIA JetPack 7.2

NVIDIA a publié JetPack 7.2, une mise à jour de sa suite logicielle pour les modules Jetson, ciblant le déploiement d'agents IA en périphérie (edge computing). La nouveauté centrale est le support natif en une seule commande de NemoClaw, une stack open source qui étend OpenClaw en y ajoutant des couches de contrôle de confidentialité et de sécurité. La version introduit également des "agent skills" pour Jetson, des briques logicielles pré-packagées conçues pour accélérer le développement d'agents autonomes sur matériel embarqué, accompagnées d'optimisations mémoire visant à améliorer les performances dans des configurations à ressources contraintes. Le passage des agents IA vers des environnements physiques impose des contraintes radicalement différentes du cloud : latence faible, connectivité intermittente et enveloppes mémoire restreintes. L'intégration native de NemoClaw dans JetPack 7.2 positionne Jetson comme plateforme de référence pour des agents embarqués avec garanties explicites de sécurité et de confidentialité des données, un argument commercial décisif pour les déploiements industriels, médicaux ou logistiques où les données sensibles ne peuvent quitter le site. Pour les intégrateurs, la simplification à une seule commande réduit significativement la friction d'adoption. NVIDIA commercialise les modules Jetson depuis 2014 et JetPack 7.2 s'inscrit dans sa stratégie de déport progressif de l'inférence IA hors du datacenter. OpenClaw, sur lequel NemoClaw s'appuie, est l'environnement d'exécution agent de NVIDIA pour l'edge. Les concurrents directs sur ce segment incluent Qualcomm avec son AI Hub et son Robotics SDK, ainsi que Hailo, Google Coral et Kneron. L'annonce reste au stade de disponibilité logicielle : aucun chiffre de volume de déploiement ni timeline client n'a été communiqué.

UELes intégrateurs européens déployant des agents IA embarqués sur Jetson dans des contextes industriels, médicaux ou logistiques bénéficient d'une simplification d'adoption et de garanties de confidentialité des données conformes aux exigences réglementaires locales (RGPD, AI Act).

InfrastructureOpinion
1 source