Aller au contenu principal
IA physiquePandaily 

Une startup dirigée par un ancien architecte GPU de Nvidia conçoit la puce Y10 pour boucler le contrôle robotique en 1 ms

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une startup fondée en 2025 par Xu Feixiang, ancien architecte GPU chez Nvidia, conçoit un processeur pensé dès l'origine pour l'IA physique, c'est-à-dire les robots et machines qui perçoivent, raisonnent et agissent dans le monde réel. Son premier produit, le Y10, vise à ramener la boucle complète perception, inférence et action sous la milliseconde, a expliqué Xu au média chinois Cyzone dans un entretien publié le 10 octobre. Il ne s'agit pas d'un ASIC à fonction fixe : le Y10 est un processeur généraliste piloté par un jeu d'instructions personnalisé et très programmable, censé suivre l'évolution des modèles de robotique. L'architecture, baptisée SomaArch selon des documents antérieurs de la société, est portée par une équipe ayant mené plusieurs générations de GPU Nvidia et des puces de grande taille, dont des composants en 6 nm, jusqu'à la production de masse. La startup affirme tester sa puce avec de grands fabricants de robots chinois. Face aux configurations x86 plus Orin utilisées aujourd'hui, ses simulations annoncent cinq fois la performance globale pour 80 % de coût en moins. Ces chiffres sont simulés, pas mesurés sur silicium, même si Xu assure que ses simulations tombent généralement à moins de 3 % des résultats finaux. Le développement a dépassé la moitié du chemin, et une version FPGA de la plateforme est prévue d'ici fin 2026 pour que les clients puissent essayer du matériel réel.

L'intérêt tient à la métrique mise en avant. Xu soutient que les robots actuels s'appuient sur des CPU, des GPU et des puces de conduite autonome, alors que les GPU sont optimisés pour le débit sur les grands modèles de langage, pas pour la boucle continue où le robot perçoit, agit puis corrige à haute fréquence. Pour l'IA physique, la mesure pertinente serait donc la durée totale de la boucle, son coût énergétique et financier, plutôt que les TOPS de crête. Il estime que l'architecture pèse environ 70 % de l'utilisabilité d'un processeur parallèle, le logiciel 30 %, ce qui plaide pour une migration facilitée par le jeu d'instructions. Pour les intégrateurs et les responsables industriels, l'enjeu est la dépendance à l'écosystème Nvidia (Orin, Jetson) et la possibilité d'une alternative moins chère, notamment sur le marché chinois. Il faut toutefois rester prudent : une boucle sous 1 ms et un gain de 5x à 80 % de coût inférieur sont, à ce stade, des projections de simulation, sans silicium ni benchmark indépendant, et le comparatif choisi (x86 plus Orin) n'est pas forcément le plus exigeant.

La cible initiale n'est pas l'humanoïde mais le bras robotique industriel. Citant un partenaire, Xu indique que les bras existants ne traitent qu'environ 2 % des opérations manuelles sur les lignes de production réelles, un marché d'extension potentiellement large si le contrôle devient plus réactif et moins coûteux. La société envisage aussi de petits serveurs de modèles du monde bâtis sur ses puces. Xu compare la puissance de calcul robotique actuelle au processeur 386 de 1985, un moyen d'affirmer que le matériel spécialisé en est à ses débuts. Le Y10 rejoint un champ où l'inférence embarquée s'organise autour de Jetson Thor chez Nvidia, tandis que des acteurs chinois comme Moore Threads travaillent sur des GPU adaptés à l'apprentissage par renforcement incarné. Les prochaines étapes à surveiller sont la version FPGA fin 2026, qui offrira les premières mesures sur matériel réel, puis l'annonce de pilotes nommés avec des fabricants de robots.

Dans nos dossiers

À lire aussi

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique
1arXiv cs.RO 

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique

Des chercheurs publient sur arXiv (2608.16978, mis en ligne le 19 août 2026) VLCP, pour Vision Language Control Policy, une méthode qui transforme un modèle vision-langage (VLM) figé en politique de contrôle robotique sans fine-tuning ni démonstrations. Au lieu de réentraîner le modèle pour qu'il produise une représentation d'action inédite, VLCP le fait écrire directement une courte fonction de contrôle en Python, puis referme la boucle au niveau du code lui-même : toutes les K étapes, le VLM réobserve la scène via des flux RGB multi-vues, l'état proprioceptif et un delta d'état, et réécrit la fonction de contrôle si nécessaire, avant qu'un échec ne se propage jusqu'à la fin de l'épisode. Testée sur un ensemble de 57 tâches en simulation MuJoCo/RoboVerse, cette politique sans entraînement atteint un taux de succès combiné de 35,1 %, contre seulement 3,5 % pour le même système interrogé une seule fois par épisode en boucle ouverte, soit un écart d'un facteur dix confirmé par des intervalles de confiance non chevauchants sur toutes les familles de scènes. Le système affiche aussi un taux de récupération intra-épisode de 27,3 % sur les préhensions ratées, un coût de calcul limité (environ 10 requêtes compactes par épisode, 84 % des tokens en cache) et une bibliothèque de compétences réutilisée d'un épisode à l'autre. Le résultat cible directement l'écart entre démonstration et réalité qui pèse sur les politiques VLA (vision-language-action) actuelles : plutôt que de retenter une politique figée ou de basculer vers une autre sous-tâche en cas d'échec, comme le font les méthodes en boucle fermée existantes, VLCP corrige la cause réelle de l'échec, le code de contrôle lui-même. Pour les intégrateurs et équipes de recherche en robotique manipulatrice, cela suggère qu'un VLM générique, sans adaptation coûteuse à un robot ou une tâche spécifique, peut produire des politiques nettement plus robustes simplement en fermant la boucle au bon niveau d'abstraction, celui du code plutôt que de l'action bas niveau. Le gain de robustesse provient moins de la puissance brute du modèle que de la fréquence et du niveau auquel il est autorisé à se corriger, un point qui interroge les architectures de contrôle en boucle ouverte encore courantes dans les démonstrations commerciales du secteur. Cette approche s'inscrit dans la lignée des travaux qui exploitent les VLM frontières comme cerveaux de raisonnement plutôt que comme modèles à réentraîner pour produire des trajectoires, une piste alternative aux politiques VLA de bout en bout comme Pi-0 ou GR00T N2. Les auteurs ne précisent pas de déploiement sur robot physique ni de partenariat industriel : il s'agit à ce stade d'une preuve de concept en simulation, publiée en prépublication, sans date de mise en œuvre réelle annoncée. Les prochaines étapes attendues porteraient sur la validation sur du matériel physique et sur des tâches de manipulation plus complexes que celles du benchmark RoboVerse utilisé ici.

IA physiquePaper
1 source
Cher LLaVA, conduis" : un agent vision-langage sensible à la profondeur pour le contrôle robotique en boucle fermée
2arXiv cs.RO 

Cher LLaVA, conduis" : un agent vision-langage sensible à la profondeur pour le contrôle robotique en boucle fermée

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv (référence 2609.22925v1) un article intitulé "Dear LLaVA, Please Drive", décrivant une méthode pour adapter un modèle vision-langage (VLM) préentraîné, dérivé de l'architecture LLaVA, à la navigation autonome de robots mobiles. Contrairement aux approches classiques qui reposent sur l'apprentissage par imitation et nécessitent de vastes jeux de trajectoires annotées, le système utilise un paradigme dit d'Imperative Learning : il optimise directement contre des champs de coût géométriques différentiables, calculés à partir d'observations de profondeur stéréoscopique, plutôt que d'apprendre à partir de trajectoires étiquetées. L'architecture combine un backbone VLM partagé avec des modules d'adaptation Low-Rank (LoRA) spécifiques à chaque tâche, reliant la sélection sémantique d'une cible en langage naturel à la planification bas niveau de trajectoire. Moins de 1 % des paramètres totaux du modèle sont mis à jour lors du fine-tuning. Les auteurs rapportent un score SPL (Success weighted by Path Length) compétitif dans des environnements inédits, ainsi que des essais qualitatifs en conditions réelles démontrant une généralisation du simulateur au monde physique sans réentraînement sur données réelles. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement connu des architectures VLA appliquées à la navigation : le coût et la rareté des données de trajectoires labellisées, qui freinent le passage à l'échelle des agents pilotés par instructions en langage naturel. En s'appuyant sur un fine-tuning paramétrique léger plutôt que sur un réentraînement massif, l'approche illustre une voie pour déployer des capacités de navigation sémantique sur des robots mobiles à moindre coût de collecte de données, un argument pertinent pour les intégrateurs cherchant à réduire la dépendance aux pipelines d'annotation. Le papier s'inscrit dans la vague plus large des travaux combinant VLM et robotique mobile, où la question centrale reste la fiabilité du transfert simulation vers réel. Il s'agit ici de résultats qualitatifs et d'une preuve de concept académique, sans mention de partenaire industriel, de déploiement commercial ni de calendrier de suite, l'article se présentant comme une contribution méthodologique plutôt qu'une annonce produit.

IA physiqueActu
1 source
Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne
3arXiv cs.RO 

Optimisation de politique par dérive : apprentissage natif en une étape pour le contrôle robotique en ligne

Une équipe de chercheurs publie sur arXiv (réf. 2604.03540, version 3) un cadre en deux étapes baptisé Drift-Based Policy Optimization (DBPO), conçu pour ramener les politiques génératives de manipulation robotique à une seule passe de réseau au moment de l'inférence. La première brique, la Drift-Based Policy (DBP), exploite des objectifs de "fixed-point drifting" pour internaliser le raffinement itératif directement dans les paramètres du modèle pendant l'entraînement, supprimant ainsi le besoin de débruitage multi-étapes à l'exécution. La seconde brique, DBPO, greffe sur ce backbone une interface stochastique compatible avec le renforcement en ligne, autorisant des mises à jour on-policy stables sans sacrifier la propriété de déploiement en une étape. Sur un robot bi-bras réel, le système atteint 105,2 Hz en boucle fermée, soit une fréquence comparable aux contrôleurs industriels classiques. Sur les benchmarks de manipulation, DBP égale ou dépasse les politiques de diffusion multi-étapes tout en réduisant le coût d'inférence jusqu'à un facteur 100 en nombre d'évaluations réseau (NFEs). Ce résultat touche directement l'un des verrous les plus concrets du déploiement de politiques diffusion en robotique : le coût computationnel à l'inférence. Les politiques de diffusion actuelles (Diffusion Policy, Chi et al., 2023) nécessitent typiquement 10 à 100 NFEs par action, ce qui les rend incompatibles avec du contrôle haute fréquence sans accélérateur dédié. Transférer ce coût vers l'entraînement plutôt que l'inférence change le profil économique du déploiement : un robot en production n'a plus besoin de GPU haut de gamme pour tourner en temps réel. Par ailleurs, coupler une politique one-step avec du renforcement en ligne ouvre la voie à une adaptation continue post-déploiement, hypothèse clé pour les environnements industriels non-structurés. Les politiques de diffusion pour la manipulation ont émergé comme référence de facto depuis 2022-2023, portées par des travaux comme Diffusion Policy ou les architectures VLA de Physical Intelligence (pi0) et d'autres. La course à réduire leur latence a produit plusieurs approches concurrentes : distillation de consistance (Consistency Policy), flow matching en une étape (comme dans certaines variantes de pi0-fast), ou encore les politiques à action chunking. DBPO s'inscrit dans cette compétition avec une approche qui revendique de préserver la modélisation multimodale tout en atteignant la vitesse des méthodes one-shot. Les prochaines étapes naturelles seraient un test à plus grande échelle de tâches et de morphologies robotiques, ainsi qu'une validation sur des plateformes humanoïdes telles que celles de Figure AI ou 1X Technologies, pour lesquelles la fréquence de contrôle est un critère de sécurité, pas seulement de performance.

UELes équipes de recherche et industriels européens en robotique manipulatrice pourraient réduire leurs besoins en accélérateurs GPU à l'inférence en adoptant cette approche, mais aucun acteur français ou européen n'est directement impliqué.

IA physiquePaper
1 source
Modélisation du monde en contexte pour le contrôle robotique
4arXiv cs.RO 

Modélisation du monde en contexte pour le contrôle robotique

Des chercheurs ont publié le 25 juin 2026 un preprint arXiv (2606.26025) présentant ICWM (In-Context World Modeling), un cadre d'adaptation pour les modèles Vision-Language-Action (VLA) appliqués à la robotique. Les VLA actuels échouent dès que le contexte d'exécution change - angle de caméra différent, morphologie de robot modifiée - parce qu'ils supposent un contexte fixe, celui rencontré pendant l'entraînement, et nécessitent un fine-tuning intensif en données pour toute nouvelle configuration. ICWM traite l'identification du système comme un problème d'adaptation en contexte : avant d'exécuter une tâche, le robot génère de courtes interactions autonomes agnostiques à la tâche, dont l'historique est injecté dans la fenêtre de contexte du modèle. Celui-ci infère ainsi implicitement la dynamique du système courant - position de caméra, configuration mécanique - sans mise à jour de poids. Les expériences menées en simulation et sur plateformes réelles montrent que ICWM surpasse significativement les baselines VLA standards sur des configurations de caméra inédites. La généralisation des VLA est le verrou principal qui freine le déploiement industriel de la robotique généraliste. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et les modèles Google nécessitent tous du fine-tuning dès qu'on change la disposition d'une caméra ou la morphologie d'un robot, ce qui rend les pilotes industriels coûteux et longs à mettre en place. ICWM attaque ce problème sans modifier les poids du modèle : l'adaptation passe uniquement par le contexte, à l'image de ce que l'In-Context Learning a apporté aux LLMs. Pour un intégrateur ou un COO industriel, cela signifie potentiellement déployer un même modèle sur plusieurs lignes avec des géométries de capteurs différentes, sans pipeline de re-entraînement. La contribution est conceptuellement distincte : là où l'ICL classique spécifie quelle tâche effectuer, ICWM apprend comment le système fonctionne - une couche d'adaptation complémentaire aux approches existantes. Les modèles VLA ont connu une explosion depuis 2024 : RT-2 (Google DeepMind), Pi-0 de Physical Intelligence, GR00T N2 d'NVIDIA présenté à GTC 2025, et plus récemment Helix (Figure AI) illustrent la convergence entre fondations LLM et contrôle moteur. La fragilité aux variations contextuelles - ce qu'on appelle le "demo-to-deployment gap" - reste une critique récurrente formulée notamment par des acteurs européens comme Enchanted Tools ou Wandercraft, qui misent sur des architectures plus déterministes pour des environnements industriels contraints. ICWM s'inscrit dans une tendance plus large : importer les paradigmes d'adaptation du machine learning directement dans la boucle de contrôle robotique, sans passer par un cycle de collecte de données et de re-entraînement. Le preprint ne mentionne ni partenariat industriel, ni code open-source, ni dataset public : il s'agit d'une contribution de recherche pure, sans déploiement commercial annoncé à ce stade.

UESi ICWM tient ses promesses, les intégrateurs européens pourraient déployer un même modèle VLA sur plusieurs lignes à géométries de capteurs différentes sans pipeline de ré-entraînement, réduisant directement le coût des pilotes industriels, mais aucun déploiement ni partenariat européen n'est annoncé à ce stade.

💬 Le vrai frein au déploiement robotique industriel, ce n'est pas la performance brute des VLA, c'est que la moindre caméra déplacée oblige à relancer un fine-tuning complet. ICWM importe dans la boucle de contrôle la même logique qui a rendu les LLMs flexibles, et si ça tient, c'est un changement de calcul économique pour les intégrateurs européens qui tentent des pilotes. Bon, pour l'instant c'est un preprint sans code ni partenaire industriel, donc on verra.

IA physiqueOpinion
1 source