
Infinigence AI publie en open source APXInf pour l'inférence embarquée sur Jetson Thor
Infinigence AI, en collaboration avec des équipes de l'université Tsinghua et de Shanghai Jiao Tong University, a mis en open source APXInf, un moteur d'inférence conçu pour faire fonctionner des modèles de robotique embarquée directement sur l'appareil, sans passer par le cloud, afin de fermer localement la boucle percevoir-décider-agir. Le code est disponible sur GitHub sous RLinf/APXinf-robo, avec un runtime écrit en Rust et des bindings Python, ciblant les cartes Jetson de NVIDIA ainsi que des GPU de bureau. Selon Infinigence et les relais du média chinois QbitAI, le chiffre phare est une latence d'inférence de bout en bout ramenée de 278 ms à moins de 26 ms pour le modèle PI 0.5 en FP8 sur une carte Jetson Thor, soit environ 38,46 Hz, une réduction d'un facteur 10 par rapport à la version non optimisée prise comme référence. Cette performance reposerait sur des optimisations de pipeline, de graphe de calcul, de noyaux de calcul (kernels) et de quantification, complétées par une fusion de kernels CUDA assistée par un agent baptisé Agent4Kernel. Le support initial couvre les modèles PI 0.5 et WALL-OSS, sur Jetson Orin, Jetson Thor et GeForce RTX 4090.
Pour l'industrie robotique, cette annonce s'adresse directement aux intégrateurs et aux équipes R&D confrontées au fossé entre modèles vision-langage-action (VLA) impressionnants en démonstration et contrôle stable et réactif sur robot réel. En ciblant explicitement le "dernier kilomètre" entre un modèle VLA capable et un contrôle embarqué fiable, Infinigence répond à une critique récurrente du secteur: la latence cloud rend beaucoup de VLA inutilisables pour du contrôle temps réel en environnement industriel. Le choix architectural, un runtime Rust minimal pour la sécurité mémoire et la stabilité sur de longues durées, plutôt qu'une simple optimisation de vitesse de pointe, cible les déploiements industriels continus plutôt que les démonstrations ponctuelles. Toutefois, le chiffre de latence doit être lu avec prudence: il concerne un modèle et une configuration matérielle précis, et Infinigence lui-même invite les équipes à reproduire ces mesures sur leurs propres checkpoints et contraintes de puissance, ce qui suggère que la portabilité de la performance à d'autres modèles ou tailles de batch n'est pas garantie.
APXInf s'inscrit dans la continuité de RLinf, la pile d'entraînement par apprentissage par renforcement déjà développée par Infinigence, étendant ainsi son écosystème open source de la phase de post-entraînement vers le déploiement embarqué, avec une compatibilité de service annoncée avec OpenPI. La feuille de route évoquée inclut de nouveaux portages de modèles VLA, VLM et de modèles du monde (des travaux liés à Qwen et à la famille GR00T sont déjà mentionnés), une optimisation au format nvfp4, des backends AMD, ainsi que des backends d'inférence et des systèmes d'exploitation robotiques domestiques chinois. Le projet se positionne ainsi face aux piles d'inférence propriétaires ou semi-fermées des acteurs occidentaux du VLA, en misant sur l'ouverture du code comme argument de diffusion auprès des intégrateurs.
Les intégrateurs et équipes R&D européennes en robotique peuvent tester cet outil open source pour réduire la latence d'inférence VLA embarquée sur leurs propres plateformes Jetson.
Dans nos dossiers




