Aller au contenu principal

Dossier NVIDIA Isaac & Cosmos

147 articles

La pile NVIDIA Isaac et les world models Cosmos : simulation, génération de données synthétiques, sim2real pour entraînement de politiques robotiques.

1arXiv cs.RO RechercheActu

AeroAct : modèles monde-action centrés sur l'action pour le vol de quadricoptère conditionné par le langage

Des chercheurs présentent AeroAct, un modèle "monde-action" (world-action model, WAM) conçu pour piloter des quadricoptères à partir de commandes en langage naturel. Selon les auteurs, il s'agit du premier WAM démontré en vol réel sur drone. Le système adapte un Transformer de diffusion vidéo pré-entraîné pour prédire, à partir de l'historique visuel à la première personne, de la proprioception et d'instructions textuelles, des séquences de trajectoires et d'actions locales. Pendant l'entraînement, le modèle apprend en prédisant les images futures que produirait chaque action, une supervision dense des conséquences visuelles, mais au moment du déploiement il calcule directement les commandes de vol sans générer de vidéo. Pour produire les données d'entraînement, l'équipe a construit un pipeline basé sur DiffAero combinant les moteurs de simulation Isaac Lab et le rendu par 3D Gaussian splatting, complété par un dispositif portatif à bas coût qui couple caméra et estimation de mouvement pour recréer des trajectoires de vol. Une procédure d'auto-guidage améliore la cohérence temporelle entre segments de trajectoire qui se chevauchent. Les tests, en simulation en boucle fermée et sur un quadricoptère physique réel, montrent des gains en suivi de cible et en recherche d'objets. L'intérêt est de dépasser les limites des méthodes actuelles de navigation aérienne par langage, qui reposent sur des actions discrètes, des points de passage ou des commandes de vitesse instantanées offrant peu d'information sur l'effet des actions sur les observations futures. En ancrant explicitement l'apprentissage dans la prédiction visuelle des conséquences du mouvement, AeroAct cherche à combler l'écart classique entre simulation et réalité pour les modèles vision-langage-action appliqués au vol, un enjeu clé pour les intégrateurs en inspection industrielle, cartographie ou recherche-sauvetage par drone. Le travail s'inscrit dans la vague plus large des modèles du monde appliqués à la robotique, où l'action est conditionnée par une anticipation visuelle plutôt que par des commandes bas niveau directes. Il reste à ce stade une publication de recherche arXiv, pas un produit commercialisé ni déployé en conditions opérationnelles ; les auteurs présentent des résultats préliminaires en simulation et sur banc de vol réel, sans indication de partenaire industriel ou de calendrier de mise en production.

1 source
2arXiv cs.RO 

GPUSimBench : vers des simulateurs GPU évolutifs et fiables pour l'IA incarnée

Une équipe de recherche a publié GPUSimBench, un banc d'essai destiné à évaluer la fiabilité des simulateurs robotiques accélérés par GPU comme Isaac Lab (NVIDIA) et Genesis, dans un article déposé sur arXiv (2607.13059v1) le 16 juillet 2026. Le benchmark repose sur trois axes de mesure. D'abord, une évaluation de l'ancrage physique via une tâche contrôlée de plan incliné, qui quantifie l'écart de distribution entre la dynamique simulée et son équivalent réel. Ensuite, un test de scalabilité parallèle mesurant débit et empreinte mémoire à mesure que le nombre d'environnements simulés augmente. Enfin, et c'est le point central de l'étude, les auteurs quantifient le non-déterminisme inhérent à l'exécution par lots sur GPU: des variations significatives d'une exécution à l'autre, et même entre environnements exécutés simultanément dans des conditions initiales identiques. L'équipe identifie quatre régimes empiriques de stochasticité dans les architectures de simulateurs actuelles. Ce travail remet en question un présupposé central de l'IA incarnée actuelle: que la simulation massivement parallèle sur GPU, utilisée pour entraîner des politiques robotiques à grande échelle, est fiable et reproductible par construction. En montrant qu'une mise à l'échelle non maîtrisée peut compromettre la reproductibilité des résultats, l'étude pointe un risque concret pour les équipes qui s'appuient sur ces simulateurs pour l'apprentissage par renforcement ou le transfert sim-to-réel: des politiques entraînées sur des runs non déterministes peuvent donner des performances difficiles à comparer ou à répliquer d'un laboratoire à l'autre, un problème critique pour la validation avant déploiement sur robot physique. Cette publication s'inscrit dans la vague de simulateurs GPU nés dans le sillage d'Isaac Gym, qui a popularisé l'entraînement massivement parallèle pour la robotique, avant l'arrivée d'Isaac Lab et du projet open-source Genesis comme alternatives concurrentes. Jusqu'ici, la course portait surtout sur le débit brut et la fidélité physique; GPUSimBench ajoute un troisième critère, le déterminisme, largement ignoré par les benchmarks existants. Les auteurs ne précisent pas de calendrier de suite, mais présentent leur outil comme une base d'évaluation destinée à orienter le développement de simulateurs plus fiables pour la recherche en apprentissage robotique.

RecherchePaper
1 source
3Robotics Business Review 

NVIDIA explique comment évaluer les politiques robotiques polyvalentes en conditions réelles

NVIDIA a publié un billet technique détaillant les limites actuelles des méthodes d'évaluation des modèles fondation pour la robotique généraliste, ainsi que RoboLab, sa plateforme de benchmarking en simulation censée y répondre. L'entreprise identifie quatre failles structurelles dans les protocoles de test existants. D'abord, un chevauchement du domaine visuel entre entraînement et évaluation : quand un modèle est affiné puis testé dans le même environnement simulé, un bon score ne prouve que sa mémorisation du décor, pas sa capacité de généralisation. Les approches dites real2sim, qui reconstruisent des scènes photoréalistes à partir d'images réelles via inpainting ou Gaussian splatting, corrigent partiellement ce biais mais exigent souvent plus d'une heure de préparation par scène, ce qui rend les tests à grande échelle peu praticables. Ensuite, la plupart des benchmarks reposent sur un jeu de tâches figé, vite saturé : lorsque tous les modèles dépassent 90% de réussite sur le même test, les chiffres perdent leur pouvoir discriminant. NVIDIA pointe aussi un déficit de diagnostic, un simple score de succès binaire ne dit rien sur la cause d'un échec (confusion de couleur, formulation de l'instruction, décalage de caméra). Enfin, l'entreprise soulève un problème de fiabilité statistique : un taux de succès mesuré sur un petit nombre d'essais peut tromper. Exemple donné, une politique affichant 90% de réussite sur seulement 70 rollouts a, selon la méthode de Clopper-Pearson pour calculer un intervalle de confiance binomial exact, un intervalle de confiance à 95% qui s'étend sur 15,4 points de pourcentage, un écart énorme pour un chiffre présenté comme une performance unique. L'exemple illustratif porte sur la politique pi-0.5 de Physical Intelligence testée sur une tâche de tri d'objets ("poser la tasse à mesurer orange et la tasse bleue en dehors de l'assiette"). Pour les intégrateurs et décideurs B2B qui doivent choisir entre plusieurs modèles vision-language-action (VLA) pour équiper des bras ou des humanoïdes, ce travail est une mise en garde directe contre les chiffres de communiqués de presse. Un score de succès affiché sans intervalle de confiance ni contrôle du chevauchement visuel peut masquer un simple surapprentissage plutôt qu'une réelle capacité de généralisation en conditions réelles. Cela renforce l'hypothèse, déjà répandue dans le secteur, d'un écart persistant entre démonstrations et déploiement effectif, et invite à exiger des fournisseurs des protocoles d'évaluation reproductibles plutôt que des vidéos sélectionnées. Cette initiative s'inscrit dans l'effort plus large de NVIDIA autour des fondations robotiques, aux côtés de ses plateformes Isaac Sim et Isaac Lab, dans un secteur où rivalisent des laboratoires comme Physical Intelligence (pi-0, pi-0.5), Google DeepMind (Gemini Robotics) ou Figure AI. À mesure que les modèles VLA généralistes se multiplient, la question de la mesure standardisée devient centrale pour départager annonces marketing et progrès réels, et RoboLab se positionne comme une tentative de fournir un cadre commun avant que le marché ne soit inondé de comparatifs invérifiables.

IA physiquePaper
1 source
4arXiv cs.RO 

Visibilité et sécurité pour l'exploration multi-robot à perception limitée : SEAMLiS

Une équipe de recherche a publié le 9 juillet 2026 sur arXiv (référence 2607.09959v1) un article décrivant SEAMLiS (Safe Exploration for Autonomous Multi-Robot Systems Under Limited Sensing), un framework de sécurité pour l'exploration décentralisée par flottes de robots dans des environnements inconnus. Le problème visé est concret: avec un champ de vision et une portée de détection limités, les architectures d'exploration classiques planifient des trajectoires vers des zones informatives sans garantir que le capteur reste orienté dans la direction du mouvement, ce qui peut retarder la détection d'un obstacle caché jusqu'à ce qu'il soit trop tard pour une manœuvre d'évitement bornée en actuation. SEAMLiS s'installe à la couche d'exécution, en aval de l'allocateur d'objectifs et du planificateur local existants, et ajoute deux filtres: un filtre d'attitude de type gatekeeper qui bascule entre une politique de lacet favorisant la visibilité de la frontière connu-libre/inconnu et une politique de repli asservie en vitesse, puis un filtre positionnel basé sur des fonctions barrières de contrôle (CBF) qui gère l'évitement des obstacles connus, nouvellement détectés, et des autres robots. Les auteurs fournissent des conditions suffisantes de non-collision et valident l'approche en simulation randomisée, sous Isaac Sim, et sur drones Crazyflie réels. Pour les équipes qui développent des flottes de robots autonomes en environnement non cartographié, ce travail répond à une limite reconnue depuis longtemps: séparer exploration et sécurité en deux modules indépendants introduit un angle mort exploitable par la géométrie même du champ de vision limité. En démontrant un gain de sécurité sans sacrifier l'essentiel de l'efficacité d'exploration, SEAMLiS suggère qu'il est possible de conserver les stacks d'exploration existants (souvent optimisés pour le gain d'information) tout en corrigeant leur angle mort perceptif par une couche d'exécution modulaire, plutôt que de refondre l'ensemble du pipeline de planification. Ce résultat s'inscrit dans une littérature croissante sur les CBF appliqués à la robotique mobile multi-agents, où la difficulté centrale reste la garantie formelle de sécurité sous incertitude de perception plutôt que sous incertitude de dynamique seule. Les auteurs positionnent leur contribution comme complémentaire aux stacks d'exploration standards plutôt que concurrente, et les tests matériels sur Crazyflie, une plateforme de recherche largement utilisée pour les essais multi-drones, indiquent une intention de validation au-delà de la seule simulation, sans toutefois préciser de calendrier vers un déploiement industriel.

RecherchePaper
1 source
EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim
5arXiv cs.RO 

EVIS : un plugin de caméra événementielle ancré dans la physique pour NVIDIA Isaac Sim

Des chercheurs du SpikeLab de l'université Johns Hopkins ont publié EVIS, un plugin de caméra événementielle physiquement fondé pour le simulateur NVIDIA Isaac Sim, décrit dans un article déposé sur arXiv (référence 2607.08098) et accompagné d'un dépôt de code ouvert sur GitHub (spikelab-jhu/isaac-sim-event-camera-plugin). L'outil génère des flux d'événements haute fréquence et entièrement annotés directement à l'intérieur du moteur physique d'Isaac Sim, en s'appuyant sur un modèle de contraste log-intensité fidèle au fonctionnement réel des capteurs événementiels, avec mise à jour asynchrone de référence pixel par pixel. Le plugin migre depuis une caméra RGB standard avec peu de modifications et s'intègre à n'importe quelle scène Isaac Sim ou Isaac Lab, héritant ainsi de la physique du simulateur et d'une vérité terrain parfaite image par image. Une option d'interpolation permet de ne rendre que des images clés éparses puis de synthétiser les images intermédiaires par déformation bidirectionnelle par vecteurs de mouvement, rendant possible une génération en temps réel sur un seul GPU. Du bruit capteur et du flou de mouvement optionnels réduisent encore l'écart avec des caméras réelles. L'enjeu est concret pour la robotique événementielle: les caméras à événements offrent une résolution temporelle de l'ordre de la microseconde, une latence très faible et une large plage dynamique, des atouts pour la perception rapide et le contrôle en boucle fermée. Mais les données labellisées pour un robot et une scène donnés restent rares et coûteuses à collecter, ce qui freine le développement d'algorithmes de perception et de contrôle basés sur ces capteurs. En générant des flux directement exploitables par des réseaux événementiels pré-entraînés, EVIS réduit ce goulot d'étranglement et s'attaque frontalement au problème classique du fossé simulation-réel. Le projet s'inscrit dans l'écosystème Isaac Sim, largement utilisé par les laboratoires de robotique et les équipes d'apprentissage par renforcement pour l'entraînement en simulation avant déploiement physique. En rendant la simulation événementielle native et configurable au sein d'un outil déjà répandu, les auteurs visent à accélérer les cycles de recherche sur des tâches de perception et de contrôle à haute vitesse, sans attendre la constitution coûteuse de jeux de données réels capteur par capteur.

RechercheActu
1 source
Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre
636Kr 

Nvidia devient premier partenaire mondial de simulation tactile, nouveau financement de centaines de millions et commandes multipliées par quatre au premier semestre

La société pékinoise Tashan Technology (他山科技) a bouclé un tour de série B de plusieurs centaines de millions de yuans, avec la participation de Joyson Electronics, Taiping Innovation, AUX, Pengling, Lavender Hill Capital Partners (LHCP) et Hongshan Capital, ainsi qu'un réinvestissement des actionnaires historiques Daoshi Technology et Binfu Capital. Les fonds serviront à l'itération des capteurs et puces tactiles, au déploiement de solutions par secteur et à la construction d'une plateforme d'entraînement tactile. Fondée en 2017, l'entreprise développe une pile complète de perception tactile pour robots, du silicium à l'application : une équipe issue de Tsinghua et de l'université de Manchester, avec Steve Furber, co-inventeur de l'architecture ARM, comme chercheur en chef, et un laboratoire commun avec Manchester créé dès 2019. Son produit phare est une puce mixte analogique-numérique basée sur un réseau de neurones à impulsions, conçue pour un traitement tactile embarqué à faible latence ; une nouvelle génération vient d'être gravée avec lancement prévu au troisième trimestre 2026. Les capteurs TS-F (bout de doigt, résolution de force de 0,01 N, reconnaissance de plus de 30 matériaux sans contact) et TS-E (pince) ont vu leur fréquence de mesure multipliée par 3 à 4 cette année. Deux centres de collecte de données ont ouvert à Pékin et dans le Hubei en mars et mai 2026, et la société se présente comme premier partenaire mondial de simulation tactile de Nvidia Isaac Sim, avec un moteur open source sur MuJoCo. Selon l'entreprise, les commandes de capteurs tactiles atteignaient fin mai déjà quatre fois le chiffre d'affaires annuel 2025, pour plus de 180 clients incluant Galbot, Xingdong Jiyuan ou BrainCo, et une part de marché revendiquée supérieure à 80 % sur les capteurs tactiles pour mains robotiques humanoïdes. Ces chiffres, invérifiés indépendamment, illustrent néanmoins un basculement réel du secteur : le taux d'équipement tactile des mains articulées serait passé d'environ 20 % à plus de 60 % en un an, un rythme d'adoption rare pour un composant matériel. Cela confirme une hypothèse qui circulait dans l'IA incarnée sans preuve solide jusqu'ici : sans retour de force, la boucle perception-action ne se referme pas sur des tâches de manipulation fine, et la seule vision ne suffit pas à saisir des objets fragiles ou déformables. Que des fournisseurs de modèles achètent désormais des capteurs en volume pour entraîner leurs systèmes tactiles renforce l'idée que la donnée tactile devient une ressource aussi disputée que la vidéo de démonstration, avec des conséquences directes de coût et de fiabilité pour les intégrateurs qui équipent des mains robotiques. Le partenariat le plus marquant reste la collaboration avec Richard Sutton, lauréat du prix Turing et figure fondatrice de l'apprentissage par renforcement, autour d'un projet baptisé "jardin d'enfants pour robots", visant à faire apprendre aux machines par essai-erreur tactile en environnement réel. Tashan prévoit que son activité robotique dépassera l'automobile de 3 à 4 fois en 2026, pour environ deux tiers du chiffre d'affaires, et anticipe une vague d'algorithmes et de modèles tactiles commerciaux à partir de 2027, un calendrier qui reste, comme les autres métriques, à confirmer par les livraisons effectives.

Chine/AsieActu
1 source
NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots
7Interesting Engineering 

NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots

NVIDIA et Hugging Face élargissent leur collaboration autour de LeRobot, la plateforme robotique open source de Hugging Face, avec l'ajout de deux nouveaux outils. Le premier est NVIDIA Isaac GR00T 1.7, présenté par NVIDIA comme son premier modèle de fondation robotique vision-langage-action (VLA) ouvert et commercialement exploitable, conçu pour simplifier le post-entraînement et le déploiement sur différents designs de robots. Le second est NVIDIA Isaac Teleop, un framework open source permettant de collecter des données d'entraînement de haute qualité via des démonstrations humaines avec des dispositifs de contrôle externes, dans un format standardisé et partageable au sein de l'écosystème LeRobot. Un troisième modèle, Cosmos 3, dédié à la génération de données synthétiques et à la simulation d'environnements, sera intégré ultérieurement. Ces annonces s'appuient sur des briques déjà disponibles sur LeRobot, dont un jeu de données ouvert de plus de 350 000 trajectoires robotiques réelles et simulées et 57 millions d'exemples de préhension, ainsi que les outils de simulation Isaac Sim et Isaac Lab, l'environnement Isaac Lab-Arena pour l'entraînement de politiques, et l'intégration du calculateur embarqué Jetson Thor sur le robot humanoïde Reachy 2. NVIDIA a par ailleurs récemment lancé Halos for Robotics, une plateforme de sécurité complète associant matériel, logiciel, capteurs et outils de validation pour les robots autonomes évoluant aux côtés d'humains. Pour l'industrie robotique, l'enjeu affiché est de reproduire pour la robotique la dynamique d'ouverture qui a accéléré le développement en IA logicielle, où le partage de modèles et de jeux de données a fait baisser les coûts d'entrée. NVIDIA met en avant la connexion entre sa communauté de plus de trois millions de développeurs robotiques et les seize millions de développeurs IA de Hugging Face, dans le but de standardiser un flux de travail encore fragmenté, entre collecte de données coûteuse, simulation, puissance de calcul et validation. Si ces chiffres de communauté restent des éléments de communication à prendre avec prudence, l'initiative traduit une tendance de fond: la bascule des modèles VLA de la démonstration marketing vers des briques réutilisables et déployables par des tiers, un test concret de la promesse d'un "sim-to-real" et d'une généralisation multi-robots qui reste à prouver à grande échelle. L'initiative prolonge le partenariat déjà engagé entre les deux entreprises autour de LeRobot et des outils de simulation NVIDIA Isaac, dans un secteur où les modèles fondation pour la robotique se multiplient face à des approches concurrentes comme Pi-0 ou GR00T N2. Les prochaines étapes attendues concernent l'arrivée effective de Cosmos 3 sur la plateforme et l'élargissement du catalogue de robots et de tâches supportés via Isaac Teleop et le jeu de données partagé.

UELe robot humanoïde français Reachy 2 (Pollen Robotics) intègre le calculateur embarqué Jetson Thor de NVIDIA dans le cadre de cet écosystème LeRobot.

IA physiqueActu
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot
8Robotics Business Review 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot

NVIDIA et Hugging Face annoncent l'intégration d'Isaac GR00T 1.7 et du framework Isaac TeleOp dans LeRobot, la bibliothèque open-source de robotique de Hugging Face. Isaac GR00T 1.7 est présenté comme le premier modèle de fondation robotique open-source et commercialement exploitable, une architecture vision-langage-action (VLA) permettant de post-entraîner et déployer des politiques de contrôle sur des robots humanoïdes réels. Isaac TeleOp est un framework de collecte de données par téléopération, qui capture des démonstrations humaines depuis des dispositifs externes dans des formats standardisés et interopérables, facilitant le partage de jeux de données au sein de la communauté. Les deux entreprises annoncent également l'arrivée prochaine de NVIDIA Cosmos 3, un modèle de monde frontière pour l'IA physique, sans donner de date précise. LeRobot compte déjà plus de 15 millions de téléchargements pour son jeu de données ouvert, qui regroupe plus de 350 000 trajectoires réelles et simulées ainsi que 57 millions de préhensions ("grasps"), en complément des frameworks de simulation Isaac Sim et Isaac Lab, dont Isaac Lab-Arena, désormais référencé dans le LeRobot Environment Hub. Cette annonce illustre la tentative de NVIDIA de reproduire, dans la robotique, la dynamique qui a fait le succès de l'IA générative open-source: mutualiser modèles, données et outils pour accélérer l'innovation collective plutôt que de la laisser fragmentée entre acteurs isolés. Pour les intégrateurs et développeurs robotique, l'enjeu concret est l'accès à un pipeline standardisé bout-en-bout, de la collecte de données jusqu'au déploiement, sans avoir à recomposer des briques propriétaires coûteuses. Le rapprochement entre les 3 millions de développeurs robotique de NVIDIA et les 16 millions d'utilisateurs IA de Hugging Face vise à fluidifier le passage entre recherche en IA générale et applications physiques. Toutefois, l'ampleur réelle de l'adoption d'Isaac GR00T 1.7 sur des déploiements industriels reste à démontrer: l'annonce reste pour l'instant centrée sur la disponibilité des outils et des frameworks, pas sur des cas d'usage chiffrés en production, et la mention de Cosmos 3 relève encore de la feuille de route plutôt que d'un produit livré. Ce partenariat s'inscrit dans la continuité de la stratégie NVIDIA autour de sa plateforme Isaac dédiée à la robotique et à l'IA physique, engagée depuis plusieurs années à travers Isaac Sim et Isaac Lab pour la simulation, puis étendue à des modèles de fondation comme GR00T. Hugging Face, de son côté, a positionné LeRobot comme l'équivalent robotique de ses bibliothèques Transformers pour le NLP, avec pour ambition de devenir le hub de référence pour les datasets et modèles robotiques ouverts. Sur le plan concurrentiel, cette annonce se situe face aux approches propriétaires de modèles VLA développés par d'autres laboratoires, à l'image de Pi-0 (Physical Intelligence) ou GR00T N2 concurrencés indirectement par des architectures fermées comme Helix (Figure AI). Thomas Wolf, cofondateur et directeur scientifique de Hugging Face, présente cette intégration comme une étape pour ancrer un cycle collaboratif ouvert dans la robotique, avec Cosmos 3 comme prochaine brique pour générer et simuler des données lorsque la collecte réelle est trop coûteuse ou limitée.

IA physiqueActu
1 source
GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)
9arXiv cs.RO 

GraspIT : un jeu de données comblant l'écart simulation-réel pour la génération validée de poses de préhension SE(3)

GraspIT, un nouveau dataset de prises robotiques présenté dans un article arXiv publié cette semaine, s'attaque au problème du transfert simulation-réel pour la préhension d'objets inédits. L'équipe a généré des scènes de table dans NVIDIA Isaac Sim, puis annoté chaque prise candidate via un test physique de glissement en quatre étapes, exécuté sur des instances virtuelles de bras Franka Panda, allant au-delà du simple critère de force-closure classique. Sur environ 2,3 millions de prises candidates, 83% obtiennent un score de qualité jugé bon (seuil de 0,50 ou plus), tandis que les 17% restants, qui passent le test de force-closure mais échouent au test de glissement, constituent des "hard negatives" utiles à l'entraînement. Une boucle réel-vers-simulation rétroprojette ensuite ces annotations sur 100 scènes réelles. Au total, le dataset livre environ 316 000 jeux d'images RGB-D annotées, couvrant 1035 scènes simulées et 100 scènes réelles, avec masques d'instance, poses en 6 degrés de liberté, propriétés physiques des objets et scores de qualité pour chaque prise. Les outils sont open source et conteneurisés via Docker. Cette publication comble un manque identifié par les auteurs eux-mêmes: aucun dataset existant ne combinait jusqu'ici observations photoréalistes, validation physique rigoureuse des prises et pont explicite entre simulation et monde réel. Pour les équipes de recherche en manipulation robotique, ce type de ressource conditionne directement la qualité des politiques apprises par imitation ou par renforcement, notamment pour les modèles vision-langage-action qui nécessitent de gros volumes de démonstrations fiables. Les négatifs difficiles générés par le test de glissement offrent en particulier un signal d'entraînement plus discriminant que les datasets fondés sur la seule force-closure, souvent trop permissifs. Le projet s'inscrit dans une littérature croissante cherchant à réduire l'écart sim-to-real, un obstacle persistant pour déployer en conditions réelles des politiques entraînées en simulation. La planification de trajectoires intégrée dans Isaac Sim permet en outre de streamer des démonstrations haute résolution pour l'apprentissage de politiques de manipulation sur table et le clonage comportemental, ouvrant la voie à des travaux de suivi sur des tâches de préhension plus complexes.

RecherchePaper
1 source
NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte
10NVIDIA Blog Robotics 

NVIDIA et Hugging Face apportent de nouveaux modèles et frameworks à LeRobot pour la communauté robotique ouverte

NVIDIA et Hugging Face annoncent l'intégration du modèle NVIDIA Isaac GR00T 1.7 et du framework NVIDIA Isaac Teleop dans LeRobot, la bibliothèque open source de Hugging Face pour la robotique, avec l'arrivée prochaine de NVIDIA Cosmos 3, un modèle monde pour l'IA physique. Isaac Teleop capture des démonstrations humaines via des dispositifs externes dans des formats standardisés, directement dans LeRobot, pour constituer et partager des jeux de données. Isaac GR00T 1.7, présenté par NVIDIA comme le premier modèle fondation robotique open source et commercialement exploitable, facilite le post-entraînement et le déploiement via les workflows LeRobot sur de nouvelles morphologies de robots, avec des benchmarks publiés. Ces briques s'appuient sur des ressources déjà connectées à LeRobot: le plus grand jeu de données open source d'IA physique, téléchargé plus de 15 millions de fois, avec plus de 350 000 trajectoires réelles et simulées et 57 millions de prises (grasps); les frameworks de simulation Isaac Sim et Isaac Lab; Isaac Lab-Arena, intégré au LeRobot Environment Hub pour prototyper des environnements et entraîner des politiques généralistes comme GR00T, Pi ou SmolVLA; et l'intégration de Jetson Thor avec le robot humanoïde open source Reachy 2 pour déployer des modèles VLA (vision-langage-action). Thomas Wolf, cofondateur et chief science officer de Hugging Face, décrit cette collaboration comme un moyen de faire passer la recherche avancée à un stade où la communauté peut l'étudier, l'adapter et la faire évoluer. Pour les intégrateurs et équipes R&D, l'enjeu est de standardiser un pipeline jusque-là fragmenté, collecte de données, entraînement, évaluation, déploiement, en connectant les 3 millions de développeurs robotique de NVIDIA aux 16 millions de builders IA de Hugging Face. Cela réduit le coût d'entrée pour tester des modèles VLA sur du matériel réel sans dépendre d'une pile propriétaire fermée. La mise en avant du caractère "commercialement viable" de GR00T 1.7 tranche avec des modèles concurrents (Pi de Physical Intelligence, Helix de Figure) souvent montrés en démonstration mais rarement publiés en open source avec benchmarks vérifiables. Coupler cela à un futur modèle monde comme Cosmos 3, censé générer des données synthétiques quand les données réelles sont trop chères ou rares à collecter, répond directement à l'un des goulots d'étranglement les plus documentés du secteur humanoïde. Cette annonce prolonge un partenariat plus ancien entre NVIDIA et Hugging Face autour de LeRobot, devenu une référence pour le partage ouvert de données et de politiques robotiques. Elle s'inscrit dans la stratégie de verticalisation physical AI de NVIDIA, de la simulation (Isaac Sim, Isaac Lab) au calcul embarqué (Jetson Thor) en passant par les modèles fondation et, prochainement, les modèles monde. Elle positionne NVIDIA face à des acteurs misant sur des piles intégrées fermées, comme Figure ou Physical Intelligence, en jouant la carte de l'infrastructure ouverte et mutualisée. Aucun acteur français n'apparaît directement, mais Reachy 2 est développé par Pollen Robotics, racheté par Hugging Face, ce qui donne une visibilité indirecte à cet acteur français dans l'écosystème. Les prochaines étapes annoncées restent pour l'instant limitées à la sortie de Cosmos 3 dans LeRobot, sans calendrier de déploiement industriel précisé.

UEImpact indirect: Reachy 2, developpe par Pollen Robotics (racheté par Hugging Face), gagne en visibilité via l'integration Jetson Thor, mais aucun acteur francais n'est directement implique dans cette annonce NVIDIA/Hugging Face.

IA physiqueActu
1 source
RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes
11arXiv cs.RO 

RoboDojo : un benchmark unifié simulation-réel pour évaluer les politiques de manipulation robotique généralistes

Une équipe de chercheurs présente RoboDojo, un banc d'essai unifié combinant simulation et monde réel pour évaluer les politiques génératives de manipulation robotique, celles capables d'exécuter des tâches variées à partir d'instructions en langage naturel. Le système comprend 42 tâches en simulation et 18 tâches en conditions réelles, couvrant des capacités complémentaires. Le volet simulation mesure cinq dimensions : la généralisation, la mémoire, la précision, l'exécution de tâches longues, et la compréhension d'instructions en vocabulaire ouvert. Le volet réel expose les politiques aux difficultés concrètes du déploiement physique. La plateforme s'appuie sur Isaac Sim pour la simulation parallèle à grande échelle, et sur RoboDojo-RealEval, un système d'évaluation réelle accessible à distance via le cloud, avec matériel standardisé, réinitialisation automatisée des scènes et protocole reproductible. Trente politiques ont été intégrées via XPolicyLab et testées sur ce banc d'essai, donnant lieu à un classement public consultable sur robodojo-benchmark.com. L'initiative répond à un problème structurel du secteur : la prolifération de politiques génératives de manipulation (VLA) ces deux dernières années s'est faite sans étalon de mesure commun, chaque laboratoire publiant ses propres métriques sur ses propres tâches. Les évaluations en simulation seule ignorent les aléas physiques du réel (éclairage, frottements, imprécisions de préhension), tandis que les tests réels restent coûteux, lents et rarement reproductibles d'un labo à l'autre. En forçant une comparaison directe entre simulation et déploiement physique sur les mêmes politiques, RoboDojo permet de quantifier l'écart entre performance démontrée et robustesse réelle, un point sensible pour tout intégrateur ou décideur industriel cherchant à choisir une politique de contrôle avant un déploiement en usine ou en entrepôt. Le projet s'inscrit dans une dynamique où plusieurs équipes de recherche ont développé des systèmes de contrôle génératifs concurrents sans cadre d'évaluation partagé. En proposant à la fois l'infrastructure logicielle (XPolicyLab) et le protocole de test standardisé, RoboDojo vise à devenir une référence commune, avec un classement public appelé à s'enrichir au fur et à mesure que de nouvelles politiques y seront soumises.

RecherchePaper
1 source
SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques
12arXiv cs.RO 

SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques

Des chercheurs viennent de publier SoftVTBench, un benchmark construit sous Isaac Sim pour évaluer la manipulation robotique d'objets déformables non plus seulement sur la réussite de la tâche, mais sur la sécurité physique de l'interaction. Le système simule les objets déformables par éléments finis (FEM) et combine vues RGB multiples, capteurs tactiles RGB avec suivi de marqueurs, proprioception et instructions en langage naturel. Il définit quatre suites de tâches croisant type d'objet (déformable versus rigide) et axe de variation (objet versus position spatiale), et distingue deux métriques : le Goal Success, qui mesure l'atteinte de l'objectif, et le Safety Success, plus strict, qui exige en plus l'absence de chute et un niveau de déformation maximal sous un seuil calibré par objet, mesuré via les états FEM cachés à la politique. Les auteurs testent des politiques basées sur pi0.5, le modèle vision-langage-action (VLA) de Physical Intelligence, dans ce protocole. Les résultats sont un signal d'alarme pour l'évaluation actuelle des politiques de manipulation : une part importante des trajectoires qui atteignent l'objectif violent en réalité les contraintes physiques de sécurité, ce que les benchmarks classiques, uniquement orientés succès, ne détectent pas. L'ajout du retour tactile change la donne : le Safety Success passe de 21,4% à 35,6% sur les tâches déformables centrées objet, avec une réduction mesurable de la déformation pendant l'exécution, sans dégrader le Goal Success. Pour les intégrateurs et chercheurs en robotique manipulant des objets souples (textile, alimentaire, emballage), cela confirme qu'un capteur tactile n'est pas un simple bonus de précision mais un levier direct de sécurité opérationnelle, et que les métriques de succès seules surestiment la fiabilité réelle d'une politique. SoftVTBench s'inscrit dans une littérature où les benchmarks de manipulation restent très majoritairement centrés sur la réussite de tâche, laissant un angle mort sur le comportement physique pendant l'exécution. En s'appuyant sur pi0.5, déjà positionné comme référence VLA face à des modèles comme GR00T N2 ou Helix, les auteurs proposent un protocole reproductible que d'autres équipes pourront réutiliser pour comparer leurs propres politiques visuo-tactiles sous contrainte physique, plutôt que sur le seul critère du taux de réussite.

RecherchePaper
1 source
Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique
13Robotics Business Review 

Luxonis boucle une levée de série A pour développer sa couche de perception dédiée à l'IA physique

Luxonis, société basée à Denver et fondée en 2019, a bouclé une levée de série A de 14 millions de dollars menée par Denali Growth Partners, avec la participation de Taiwania Capital. L'entreprise, qui a démarré via une campagne Kickstarter réussie, revendique aujourd'hui plusieurs milliers de clients, dont plus de 60 entreprises du Fortune 500 et 17 des 30 valeurs du Dow Jones, parmi lesquelles la société agricole FARM-ING. Luxonis produit les caméras OAK, qui combinent plusieurs capteurs de vision et du calcul embarqué dans un seul boîtier, ainsi que le kit logiciel open source DepthAI, dont le SDK a franchi les 6 millions de téléchargements après une mise à jour en avril. Son écosystème de perception cloud OAK4, lancé en décembre 2025, vient d'être complété par la caméra modulaire OAK4-CS, destinée à l'inspection de codes-barres sur lignes de convoyage, à la microscopie et à d'autres usages industriels. Le mois dernier, la société a annoncé la prise en charge officielle de ses caméras dans NVIDIA Isaac Sim, ainsi qu'un déploiement OAK4 possible en USB-C seul ou en PoE+. Le PDG Bradley Dillon a indiqué que ce tour de table, le premier institutionnel de la société après plus de sept ans de développement porté par des proches et des investisseurs individuels, doit accélérer la croissance commerciale et la production. Cette levée illustre la montée en puissance des fournisseurs de composants pour l'IA physique, un segment charnière entre la robotique et l'automatisation industrielle. Plutôt que de vendre des robots complets, Luxonis se positionne comme fournisseur de la couche de perception, capteurs, calcul embarqué et logiciel, que les intégrateurs assemblent ensuite selon leurs besoins. Pour les décideurs B2B, cette approche modulaire réduit la barrière à l'entrée dans la vision robotique, un domaine encore dominé par des solutions propriétaires coûteuses. La traction commerciale revendiquée, avec une base client s'étendant des particuliers aux grands groupes industriels, suggère que la demande pour une perception visuelle embarquée standardisée dépasse désormais les cas d'usage de niche pour toucher l'automatisation de production à grande échelle. Les fonds serviront à étendre les capacités de la chaîne d'approvisionnement, développer de nouvelles architectures d'IA en périphérie (edge AI) et renforcer les équipes de R&D, de vente et de support technique. Luxonis prévoit de lancer de nouveaux appareils à prix plus accessibles et dans des formats variés, ciblant l'agriculture, la robotique avancée, la défense, l'automatisation industrielle, les machines lourdes, le medtech et la logistique d'entrepôt. La stratégie affichée par la société mise sur une combinaison entre ingénierie IA d'Europe centrale et orientale, capacités de fabrication à Taïwan et commercialisation aux États-Unis, une répartition géographique que Taiwania Capital a explicitement saluée comme un atout pour répondre aux besoins d'automatisation complexe des entreprises.

UELuxonis maintient une partie de son ingénierie IA en Europe centrale et orientale, mais aucun déploiement, levée ou implantation commerciale directe en France ou dans l'UE n'est annoncé.

BusinessActu
1 source
Jaiveer Singh aide les robots et les développeurs à progresser plus rapidement
14NVIDIA Blog Robotics 

Jaiveer Singh aide les robots et les développeurs à progresser plus rapidement

Jaiveer Singh, ingénieur logiciel chez NVIDIA, dirige l'équipe responsable d'Isaac ROS (Robot Operating System), une pile logicielle open source construite sur le framework ROS 2 et accélérée par les bibliothèques CUDA de NVIDIA. Isaac ROS fournit aux développeurs un ensemble de modules pour la perception, la détection d'objets, la cartographie (SLAM), la détection de collision et la planification de mouvements. La plateforme est compatible avec les robots mobiles autonomes (AMR), les systèmes de manipulation et les humanoïdes, et peut s'exécuter sur des postes de travail, sur le DGX Spark (le supercalculateur IA personnel de NVIDIA) ainsi que sur les systèmes embarqués Jetson. Le projet a débuté comme un projet de stage de Singh, alors étudiant en génie électrique, informatique et gestion à l'Université de Californie Berkeley, avec une question simple : publier des bibliothèques GPU open source pour la robotique aurait-il de la valeur ? La réponse s'est avérée positive, et Isaac ROS est depuis devenu un composant central de l'écosystème robotique NVIDIA. L'importance d'Isaac ROS pour l'industrie tient à sa modularité et à son positionnement comme couche d'intégration entre l'IA générative et le déploiement physique. Contrairement à l'ancien Isaac SDK, la version ROS se présente, selon Singh lui-même, comme "un ensemble de briques LEGO" : les développeurs assemblent les modules selon leurs besoins et les combinent avec du code ROS communautaire existant. Pour un intégrateur ou un OEM qui cherche à passer de la démonstration au déploiement série, cette approche réduit la friction d'adoption. Elle répond aussi à une préoccupation structurelle du secteur : la pérennité de la pile logicielle. Un startup qui construit sur un système fermé doit faire confiance au fait que ce système correspondra toujours à ses besoins dans deux ou trois ans, une promesse difficile à tenir dans un marché qui se recompose chaque trimestre. L'open source apporte ici une garantie d'auditabilité et de continuité que les systèmes propriétaires peinent à offrir. NVIDIA s'est positionné sur la robotique bien avant que le secteur devienne un sujet grand public, et Isaac ROS s'inscrit dans cette continuité stratégique. La plateforme évolue aujourd'hui pour répondre aux exigences des humanoïdes, qui requièrent une stack logicielle de bout en bout capable de gérer des agents IA, de la simulation (Isaac Sim) au déploiement edge sur Jetson. Les concurrents directs sur la couche middleware incluent ROS 2 non-accéléré utilisé seul, mais aussi les environnements propriétaires de Boston Dynamics, Agility Robotics ou Figure AI, qui développent leurs propres stacks internes. NVIDIA joue ici un rôle transversal d'infrastructure partagée, moins visible qu'un robot humanoïde en vidéo, mais potentiellement plus déterminant pour la cadence industrielle du secteur. Les prochaines étapes annoncées portent sur le renforcement du support aux agents IA et aux systèmes humanoïdes, deux segments en forte croissance depuis 2024.

UELes intégrateurs et startups robotiques français et européens peuvent bénéficier d'Isaac ROS comme couche middleware open source pour accélérer leurs déploiements, mais l'impact reste indirect et dépendant de l'adoption de l'écosystème NVIDIA.

InfrastructureOpinion
1 source
Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage
15arXiv cs.RO 

Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage

Des chercheurs ont publié sur arXiv (référence 2606.22471) une approche systématique pour générer automatiquement, via apprentissage par renforcement (RL), des données d'entraînement synthétiques destinées à la manipulation bimane et dextre conditionnée par le langage. Le pipeline proposé combine trois briques : une conception de récompenses généralisables (non spécifiques à une tâche), une randomisation de domaine pour combler l'écart simulation-réel (sim-to-real gap), et des annotations de tâches exprimées en langage naturel. Les expériences portent sur trois tâches de manipulation représentatives ; les auteurs concluent à une amélioration significative de la généralisation par rapport aux baselines, sans toutefois publier de métriques quantitatives précises dans le résumé disponible. Le principal verrou qu'adresse ce travail est le manque de données massives et de qualité pour entraîner des politiques généralistes sur des manipulateurs bimanes à haute dextérité. La télé-opération humaine, standard actuel pour collecter des démonstrations (méthode utilisée par des projets comme ACT, Diffusion Policy, ou les datasets de Aloha), souffre de limitations structurelles : faible diversité de tâches, inadéquation morphologique entre la main humaine et l'effecteur robot, et absence des actions robot dans les vidéos brutes. Le RL surmonte ces obstacles mais exige traditionnellement des fonctions de récompense artisanales, tâche par tâche. En proposant une conception de récompenses généralisables, les auteurs visent à rendre le pipeline scalable sans surcoût d'ingénierie par tâche, ce qui est le vrai défi industriel pour quiconque cherche à déployer des politiques multi-tâches sur des lignes d'assemblage ou de conditionnement. Ce travail s'inscrit dans une tendance de fond : face à la rareté des données robotiques réelles, la synthèse en simulation devient une voie centrale, portée par des frameworks comme Isaac Lab (NVIDIA), MuJoCo Playground, ou Genesis. Il dialogue directement avec des approches comme RoboGen, RoboCasa ou GROOT, qui cherchent également à automatiser la génération de tâches et de données. Les politiques VLA (Vision-Language-Action) telles que pi0 de Physical Intelligence ou OpenVLA nécessitent des corpus variés que la télé-opération seule ne peut pas alimenter à l'échelle requise. Les prochaines étapes naturelles seront la validation sur hardware réel et la comparaison quantitative avec des datasets de référence comme RoboSet ou Open X-Embodiment.

RecherchePaper
1 source
WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement
16arXiv cs.RO 

WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement

Des chercheurs ont publié sur arXiv (référence 2602.13977v2) un framework nommé WoVR, conçu pour entraîner via du reinforcement learning (RL) des politiques de type Vision-Language-Action (VLA) sans recourir à des milliers d'heures d'interaction physique réelle. Le principe : substituer le robot réel par un modèle du monde appris, c'est-à-dire un modèle vidéo conditionné par les actions qui prédit le comportement de l'environnement. WoVR articule trois mécanismes distincts : un modèle vidéo action-conditionné à stabilité contrôlée, une stratégie baptisée Keyframe-Initialized Rollouts qui réinitialise les trajectoires imaginées à partir d'images-clés pour limiter l'accumulation d'erreurs sur l'horizon, et une co-évolution conjointe du modèle du monde et de la politique pour maintenir leur cohérence dans le temps. Les expériences rapportées montrent des gains sur le benchmark LIBERO et des améliorations mesurées sur plusieurs plateformes robotiques physiques. Ce travail s'attaque à un verrou central du post-entraînement des VLA : le RL promet d'aller au-delà de l'imitation learning, mais ses besoins en données d'interaction rendent son application directe sur robot physique quasi prohibitive. La contribution de WoVR est de montrer qu'un modèle du monde imparfait peut néanmoins servir de simulateur RL fiable, à condition de contrôler explicitement ses hallucinations plutôt que de les ignorer. C'est un signal positif pour la thèse que le sim-to-real, appliqué non au niveau du rendu physique mais au niveau de la prédiction vidéo apprise, peut débloquer l'optimisation de politiques à grande échelle. La nuance importante : les résultats sont publiés sous forme de papier de recherche, les démonstrations sont disponibles sur wovr-corl.github.io, mais aucun déploiement industriel n'est revendiqué. WoVR s'inscrit dans une vague de recherche qui cherche à reproduire pour la robotique ce que le RL a accompli pour les grands modèles de langage. Les VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA ont montré des capacités impressionnantes en imitation, mais leur amélioration par RL reste un problème ouvert. D'autres approches concurrentes misent sur des simulateurs physiques classiques (Isaac Lab, MuJoCo) ou sur du RL directement en conditions réelles, avec des cycles de collecte longs et coûteux. WoVR propose une troisième voie via les world models vidéo, dans la lignée des travaux de type DIAMOND ou DreamerV3 appliqués à la robotique. La soumission cible CORL, conférence de référence du domaine, ce qui suggère une prochaine validation par les pairs et potentiellement une intégration dans les pipelines d'entraînement open-source des équipes académiques et industrielles dès 2026.

RechercheOpinion
1 source
L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique
1736Kr 

L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique

Nüwa Robotics (纽娲机器人), startup chinoise fondée en février 2026 par le Dr Yang Ruigang, vient de boucler un tour angel de 50 millions de yuans (environ 6,9 millions d'euros), mené par Bluerun Ventures, avec la participation de Butong Capital et de Gongqingcheng Puyi Investment. C'est le deuxième financement en moins de deux mois : un seed round avait été conduit par Plug and Play Chine peu avant. Yang Ruigang est une figure connue de l'écosystème autonomie chinois : il a dirigé le laboratoire de conduite autonome et de robotique de Baidu, puis exercé comme CTO d'Inceptio Technology (嬴彻科技), où il a piloté la mise en production de camions autonomes de niveau L3. Aujourd'hui professeur associé à l'Université Jiao Tong de Shanghai, il oriente Nüwa vers un objectif précis : la construction d'un "World Traversal Model" (WTM), un modèle de navigation destiné à des robots de toute morphologie, humanoïdes, quadrupèdes, AGV ou véhicules de livraison. Le pari de Nüwa repose sur un constat que le secteur commence à intérioriser : la mobilité dans les environnements humains reste un verrou sous-estimé de la robotique incarnée. Là où la majorité des acteurs se concentrent sur la manipulation ou les architectures VLA (Vision-Language-Action), Nüwa cible la couche locomotion-navigation avec une ambition de déploiement sans carte ou à partir de plans génériques (Gaode, Baidu Maps). Leur moteur de simulation maison, SimWeaver, affiche selon la société des performances 3x supérieures à NVIDIA ISAAC Sim en vitesse de génération de données, une réduction de 20 % de l'erreur sim-to-real, et un taux de succès en zero-shot de 91 % sur des tâches de manipulation d'objets flexibles. Ces chiffres sont auto-déclarés et non vérifiés par des tiers. En locomotion, le système parvient à franchir des escaliers creux inclinés à 55 degrés en combinant vision et proprioception, là où d'autres solutions procèdent en aveugle. Nüwa intègre également un module de "conformité sociale" : le modèle est entraîné à respecter des règles comportementales implicites comme laisser sortir avant d'entrer dans un ascenseur ou céder le passage en espace public. Nüwa s'inscrit dans un paysage compétitif où les grandes architectures sont déjà définies : chez Figure, le modèle Helix (System 0/1/2) sépare planification lente et contrôle rapide ; NVIDIA GR00T N1 suit une logique similaire ; en Chine, Zhiyuan (智元) découpe locomotion, manipulation et interaction, tandis que Tencent RoboticsX structure son architecture SLAP en quatre couches. Nüwa choisit une entrée différente : transférer les acquis de l'autonomie véhiculaire vers des environnements beaucoup plus denses (ascenseurs, couloirs, centres commerciaux), en capitalisant sur la maîtrise de la simulation physique 3D de l'équipe. Le fondateur reconnaît que la brique manipulation reste à construire from scratch, sans analogue dans la conduite autonome. La feuille de route prévoit un premier déploiement du WTM dans un à deux scénarios réels en 2026, logistique et tourisme en priorité, avant une montée en puissance vers la production de robots propres à Nüwa et l'ouverture de la plateforme à des intégrateurs tiers. Aucun client ni partenaire industriel nommé n'a été annoncé à ce stade.

UEL'émergence de Nüwa illustre la compétition croissante de l'écosystème robotique chinois sur la couche navigation-locomotion, un segment encore peu occupé par les acteurs européens, sans impact opérationnel immédiat pour la France/UE.

Chine/AsieActu
1 source
MobileManiBench : simplifier la vérification des modèles pour la manipulation mobile
18arXiv cs.RO 

MobileManiBench : simplifier la vérification des modèles pour la manipulation mobile

Une équipe de chercheurs a publié MobileManiBench, un benchmark à grande échelle destiné à évaluer les modèles de type VLA (Vision-Language-Action) sur des tâches de manipulation robotique mobile, avant tout déploiement réel. Le système repose sur NVIDIA Isaac Sim et un pipeline de génération automatique par apprentissage par renforcement, qui produit des trajectoires annotées incluant instructions en langage naturel, images RGB-profondeur-segmentation multi-vues, et états synchronisés objet/robot. Le dataset résultant comprend 300 000 trajectoires, couvrant 630 objets répartis en 20 catégories, 5 compétences motrices (ouvrir, fermer, tirer, pousser, saisir), plus de 100 tâches distinctes exécutées dans 100 scènes réalistes. Deux plateformes mobiles sont représentées, un robot à pince parallèle et un robot à main dextère, chacun équipé de deux caméras synchronisées (tête et poignet droit). Le code, les datasets et les modèles sont publiés en open-source. L'enjeu central que MobileManiBench cherche à résoudre est le goulot d'étranglement des données de téléopération : les VLA actuels, dont pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sont entraînés quasi-exclusivement sur des scènes de table statiques collectées par des opérateurs humains, ce qui limite leur généralisation à des environnements mobiles et encombrés. Un framework de vérification en simulation avant déploiement réel permettrait aux équipes R&D de filtrer les architectures non viables sans mobiliser des flottes de robots physiques ni des heures de téléopération coûteuses. La génération automatique à l'échelle de 300K trajectoires diversifiées ouvre également la voie à des études contrôlées sur l'efficacité des données et la généralisation, deux variables critiques pour les intégrateurs industriels qui évaluent le coût réel d'adoption d'un VLA. Cette publication s'inscrit dans un mouvement plus large de la communauté robotique vers les approches sim-to-real, portées notamment par NVIDIA (Isaac Lab, Isaac Sim) et des labos comme Stanford, CMU et le LAAS-CNRS côté français. La manipulation mobile reste plus difficile que la manipulation sur table fixe en raison de la complexité des coordinations base-bras et de la variabilité des angles de caméra, problèmes que MobileManiBench cherche précisément à circonscrire. Les résultats comparatifs publiés sur plusieurs VLA représentatifs fournissent une base de référence utile, même si les benchmarks en simulation pure sous-estiment souvent l'écart sim-to-real : les métriques annoncées devront être validées en conditions physiques pour devenir opérationnellement significatives.

UELe LAAS-CNRS est cité parmi les laboratoires moteurs du sim-to-real ; les équipes R&D françaises évaluant des VLA pour la manipulation mobile peuvent exploiter directement ce benchmark open-source pour réduire leurs coûts de validation avant déploiement physique.

RechercheOpinion
1 source
SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques
19arXiv cs.RO 

SimFoundry : génération modulaire et automatisée de scènes pour l'apprentissage et l'évaluation de politiques

Des chercheurs du laboratoire GEAR de NVIDIA ont publié SimFoundry sur arXiv (identifiant 2606.28276), un pipeline modulaire et automatisé permettant de reconstruire des scènes de simulation directement depuis une vidéo du monde réel, sans annotation manuelle. Le système génère des jumeaux numériques sim-ready, puis en dérive automatiquement des "cousins numériques": des variantes de la scène originale qui préservent les affordances manipulatoires tout en modifiant objets, arrangements ou tâches. Testé sur sept tâches de manipulation (multi-étapes, objets articulés, bimane) et cinq architectures de policies distinctes, SimFoundry atteint une corrélation de Pearson de 0,911 entre évaluation en simulation et performance réelle, avec un mean maximum ranking violation de 0,018. En transfert zéro-shot vers le monde réel, les cousins d'objets apportent +17% de taux de succès, les cousins de scènes +21%, et les cousins de tâches +40%. Ces résultats s'attaquent directement au sim-to-real gap, l'écart structurel qui rend les benchmarks de simulation peu fiables pour prédire les performances physiques. Avec une corrélation de 0,911, les équipes R&D peuvent comparer des architectures de policies en simulation sans mobiliser de temps robot, ce qui réduit significativement le coût d'évaluation. Le concept de cousins numériques va plus loin que l'augmentation de données classique: en préservant les affordances, les variantes restent exploitables pour l'apprentissage sans dériver vers des distributions hors domaine. Pour un intégrateur de cellules robotiques ou un décideur industriel, le gain concret est une accélération du cycle développement-évaluation, à condition que la reconstruction vidéo reste robuste hors des environnements contrôlés présentés dans le papier. SimFoundry s'inscrit dans la stratégie robotique large de NVIDIA, qui développe en parallèle la plateforme Isaac Sim et le modèle de fondation humanoïde GR00T N2. Le laboratoire GEAR, dédié à la généralisation des policies d'agents incarnés, positionne cette approche sim-centric face aux alternatives data-centric: Physical Intelligence (Pi-0, issu des travaux de Sergey Levine) mise sur des volumes massifs de démonstrations réelles, tandis que Google DeepMind avance avec ses propres pipelines de simulation. Dans l'écosystème des simulateurs robotiques (Sapien, RoboSuite, Genesis), SimFoundry se distingue par son entrée vidéo sans annotation. Le papier, disponible en prépublication sur arXiv, ne précise pas de calendrier de mise à disposition du code ni d'intégration dans un produit commercial.

UELes laboratoires de robotique européens (CEA-List, INRIA) pourraient bénéficier de cette infrastructure de simulation pour évaluer leurs policies sans mobiliser de temps robot, mais aucun acteur FR/EU n'est impliqué et le code n'est pas encore disponible.

RecherchePaper
1 source
NavIsaacLab : génération de foules réalistes par apprentissage robotique parallèle pour évaluer la navigation consciente des humains
20arXiv cs.RO 

NavIsaacLab : génération de foules réalistes par apprentissage robotique parallèle pour évaluer la navigation consciente des humains

Une équipe de chercheurs présente NavIsaacLab, un framework de simulation GPU-parallèle dédié à l'entraînement et à l'évaluation de politiques de navigation robotique en présence d'humains, publié le 26 juin 2026 (arXiv:2606.26265). Construit sur Isaac Lab, la plateforme de simulation robotique de NVIDIA, le système combine rendu photo-réaliste et simulation physique en temps réel pour générer des environnements piétons denses et variés. La distinction technique centrale réside dans son moteur de comportement piéton : plutôt que des règles codées à la main, NavIsaacLab s'appuie sur un modèle de diffusion de trajectoires couplé à un contrôleur d'apprentissage adversariel du mouvement, produisant des animations humaines physiquement plausibles et contrôlables à la demande. La plateforme fournit au robot des retours visuels 3D complets, contrairement aux benchmarks existants qui supposent généralement une observation parfaite de l'environnement. L'enjeu industriel est direct : la navigation humain-consciente reste l'un des verrous majeurs au déploiement des robots mobiles autonomes (AMR) dans des espaces partagés, entrepôts, hôpitaux, aéroports. Les données de simulation actuellement disponibles souffrent d'un double défaut : des comportements piétons irréalistes issus de règles statiques, et une absence de signal sensoriel bruité, creusant un sim-to-real gap difficile à combler lors du passage en environnement réel. En générant des foules physiquement cohérentes dans une variété de scènes cross-scale, NavIsaacLab vise à fournir un benchmark standardisé pour comparer les algorithmes état de l'art dans des conditions proches du réel, une lacune que la communauté robotique signale depuis plusieurs années. Le framework s'inscrit dans l'écosystème NVIDIA Isaac, qui regroupe Isaac Sim, Isaac ROS et Isaac Lab, consolidant la position de NVIDIA comme fournisseur d'infrastructure de simulation robotique. Les approches concurrentes incluent Habitat 3.0 de Meta AI pour la navigation sociale en intérieur, CARLA pour le trafic autonome et divers simulateurs basés sur SMPL pour les mouvements humains, mais peu combinent rendu photo-réaliste, physique GPU-accélérée et comportement piéton appris de manière unifiée. L'article ne mentionne ni partenaires industriels ni timeline de déploiement : il s'agit pour l'heure d'une contribution de recherche, sans produit commercialisé. Les suites naturelles concerneraient l'intégration de politiques VLA (Vision-Language-Action) et la validation sur robots physiques dans des environnements réels densément peuplés.

UELes équipes européennes développant des AMR pour environnements partagés (entrepôts, hôpitaux) pourraient utiliser ce benchmark pour réduire le sim-to-real gap, mais aucun acteur FR/EU n'est impliqué directement.

RechercheActu
1 source
TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU
21arXiv cs.RO 

TurboMPC : commande prédictive par modèle rapide, évolutive et différentiable sur GPU

Le Toyota Research Institute (TRI) a publié le 24 juin 2026 TurboMPC, un solveur MPC (commande prédictive par modèle) différentiable fonctionnant entièrement sur GPU. Implémenté en JAX-CUDA, il combine programmation quadratique séquentielle (SQP), solveur interne ADMM et différentiation implicite, tout en supportant contraintes d'inégalité sur états et contrôles, intégrateurs implicites, coûts couplés temporellement et variables de slack. Les gains de performance atteignent jusqu'à 15x par rapport aux solveurs CPU différentiables de référence et jusqu'à 58x face aux meilleurs solveurs GPU existants. Validé en simulation sur planification contrainte, imitation learning pour humanoïde et apprentissage par renforcement à fonction de coût neuronale, TurboMPC a également été testé sur un véhicule réel en conduite à temps minimal. L'optimisation bayésienne des paramètres MPC, rendue possible par le traitement par lots sur GPU, y produit des vitesses nettement supérieures au réglage manuel. Le solveur tient jusqu'à 8 000 points de trajectoire sans perdre le contrôle du véhicule. Le code est mis en open source sur GitHub (ToyotaResearchInstitute/turbompc). L'apport central est la réconciliation entre pipelines GPU d'apprentissage profond et solveurs MPC traditionnellement CPU-centric, une friction qui forçait des transferts mémoire coûteux et une hétérogénéité matérielle pénalisante en production. En restant entièrement sur GPU et en étant différentiable de bout en bout, TurboMPC s'intègre directement dans des boucles d'entraînement par gradient, ce qui valide à grande échelle l'hypothèse des "differentiable MPC" longtemps discutée dans la littérature. La démonstration sur imitation learning humanoïde est particulièrement significative: elle montre que des formulations MPC expressives peuvent rivaliser avec les approches purement apprises pour des robots à haute dimensionnalité, sans abandonner les garanties de planification. TRI, branche recherche de Toyota dédiée à la robotique et aux véhicules autonomes, publie face à des alternatives établies comme Crocoddyl du LAAS-CNRS (Toulouse, France), ALTRO (Stanford/CMU) et Theseus (Meta AI), tous majoritairement CPU-centric ou partiellement GPU. La présence de Crocoddyl dans ce paysage concurrentiel donne une visibilité directe au laboratoire toulousain, dont les travaux seront mis en compétition par ces nouveaux benchmarks. La mise en open source facilite l'intégration dans des simulateurs parallèles comme Isaac Lab ou Genesis. Les prochaines étapes probables incluent des évaluations sur plateformes humanoïdes réelles et une adoption dans des pipelines robotiques industriels.

UELe LAAS-CNRS (Toulouse) voit son solveur Crocoddyl directement mis en compétition par TurboMPC sur les benchmarks GPU, ce qui expose la recherche française en commande prédictive robotique à une comparaison défavorable sur les critères de performance.

RecherchePaper
1 source
Une entreprise américaine dévoile R-Noid, un robot humanoïde pour les usines, hôtels et entrepôts
22Interesting Engineering 

Une entreprise américaine dévoile R-Noid, un robot humanoïde pour les usines, hôtels et entrepôts

Robot.com, société américaine, a annoncé le lancement commercial de R-Noid, un robot humanoïde destiné aux environnements industriels, logistiques, hospitaliers et de restauration. Proposé selon un modèle Robot-as-a-Service (RaaS), le système serait déployable en huit à douze semaines, de l'évaluation initiale du site jusqu'à l'opération autonome. R-Noid mesure 1,7 mètre, pèse 90 kilogrammes, et embarque deux bras à 7 degrés de liberté (7-DOF) capables de manipuler des charges allant jusqu'à 4 kilogrammes chacun, complétés par un torse articulé à 4-DOF offrant une portée verticale de 0 à 1,9 mètre. Sa base mobile holonome permet des déplacements omnidirectionnels sans modification des infrastructures existantes. Au lancement, le robot couvre 19 tâches réparties en cinq catégories : Restaurant Assistant, Packer, Picker, Folder et Host, comprenant notamment le montage de cartons, le picking en entrepôt, le transfert de pièces plastiques sur lignes de production, le support en cuisine et le pliage de linge. L'autonomie annoncée est d'environ trois heures sur batterie, avec la possibilité de fonctionner en continu branché au secteur, et une architecture d'effecteurs terminaux modulaire permet de changer d'outil selon la tâche. Ce qui distingue techniquement R-Noid, c'est l'empilement logiciel retenu. La manipulation est pilotée par pi-0.7, le modèle vision-langage-action (VLA) développé par Physical Intelligence, dont les travaux sur les politiques généralisées font référence dans la communauté robotique. La navigation et l'autonomie terrain reposent sur les Foundation Field Models (FFM) de FieldAI, conçus pour opérer sans cartographie préalable dans des environnements dynamiques. L'inférence embarquée est assurée par des modules NVIDIA Jetson, et la validation pré-déploiement passe par NVIDIA Isaac Sim. Ce choix d'assembler trois couches tierces spécialisées plutôt que de développer une stack propriétaire reflète une tendance croissante chez les intégrateurs humanoïdes. Reste que le RaaS humanoïde n'a pas encore fait ses preuves à l'échelle industrielle : l'annonce ne mentionne ni clients nommés ni volumes déployés, ce qui la place davantage du côté du lancement commercial que du déploiement réel en production. Robot.com s'inscrit dans une vague d'acteurs cherchant à industrialiser l'humanoïde en contournant la difficulté du hardware par un modèle de service. Ses concurrents directs incluent Figure AI avec le Figure 03 déployé chez BMW, Agility Robotics présent chez Amazon, 1X Technologies et Apptronik, tous positionnés sur les marchés industriels et logistiques. Du côté européen, Wandercraft développe Atalante X pour la rééducation médicale, et la française Enchanted Tools positionne Miroka sur l'hospitalité, segment également ciblé par la catégorie Host de R-Noid. Aucune tarification n'est communiquée. Les prochaines étapes seront déterminantes : Robot.com devra démontrer que ses délais de déploiement de huit à douze semaines tiennent en conditions réelles, et que pi-0.7 maintient ses performances hors des environnements contrôlés où les VLA ont jusqu'ici surtout été validés.

UEL'entrée de R-Noid sur le segment hospitalité crée une pression concurrentielle directe pour la française Enchanted Tools (Miroka) et indirectement pour Wandercraft, en illustrant la rapidité à laquelle des acteurs américains s'attaquent aux niches où des acteurs européens se positionnaient.

HumanoïdesOpinion
1 source
Comment Intrinsic élimine la programmation manuelle des robots
23Robotics Business Review 

Comment Intrinsic élimine la programmation manuelle des robots

Intrinsic, filiale d'Alphabet spécialisée en robotique industrielle, a présenté à l'Automate 2026 une cellule robotique modulaire baptisée "Intrinsic Intelligence Cell", reposant sur son système d'exploitation maison IntrinsicOS. La démonstration met en scène un bras FANUC réalisant de l'assemblage électronique sans aucune programmation robot traditionnelle : l'opérateur configure les tâches par glisser-déposer, tandis que la plateforme gère automatiquement la perception, la planification de mouvement et les opérations de préhension et d'insertion de pièces. Intrinsic collabore avec deux intégrateurs CNC, Trinity Automation et MartinSystems, pour embarquer ces capacités dans leurs offres de prochaine génération. La présentation intervient quelques mois avant le lancement d'un pilote industriel d'envergure avec Foxconn, dont la date exacte n'a pas été précisée au-delà de "fin 2025". Par ailleurs, dans le cadre de son "AI for Industry Challenge" co-organisé avec Open Robotics, la société a réuni plus de 5 000 inscrits répartis en 1 600 équipes issues de 115 pays, avec une enveloppe de prix de 180 000 dollars. Le défi cible l'un des problèmes les plus résistants de l'assemblage électronique : la manipulation dextre de câbles et de connecteurs. Huit équipes ont jusqu'ici atteint des scores quasi-parfaits lors de la phase de simulation (Gazebo, MuJoCo de Google DeepMind, NVIDIA Isaac Sim). L'approche d'Intrinsic s'attaque à un verrou structurel du marché : la programmation robot reste aujourd'hui un frein majeur à l'adoption dans les ateliers à production variable ("high mix, low volume"), où reprogrammer un bras pour chaque référence représente un coût prohibitif. En proposant une reconfiguration instantanée des outils et des process via des "skills" basés sur l'IA, la plateforme ouvre potentiellement l'automatisation aux sous-traitants de taille moyenne et aux ateliers d'usinage qui ne disposent pas d'équipes de roboticiens. La composition du challenge est également révélatrice : seulement 14 % des participants viennent du secteur robotique, tandis que 93 % sont développeurs Python et 47 % travaillent en IA/ML. Cela signale un afflux de compétences logicielles vers la robotique industrielle, et valide l'hypothèse selon laquelle les prochaines avancées en manipulation viendront davantage du software que du hardware. Intrinsic a été fondée en 2021 à partir de ressources internes d'Alphabet, absorbant notamment des équipes issues de X Development. La société a mis plusieurs années à structurer sa pile logicielle autour de ROS 2 avant de la commercialiser. Sur ce segment des cellules robotiques modulaires pilotées par IA, elle se positionne face à des acteurs comme Covariant (rachetée par Amazon), Machina Labs ou Viam, ainsi que face aux offres propriétaires des grands intégrateurs (KUKA, ABB, FANUC lui-même). Le pilote Foxconn constituera le premier test à l'échelle réelle d'IntrinsicOS dans un environnement de production de masse, et ses résultats conditionneront probablement la crédibilité commerciale de la plateforme au-delà des démonstrations salon.

UELa démocratisation de la configuration robot par glisser-déposer pourrait réduire le coût d'entrée à l'automatisation pour les PME industrielles européennes en production variable, mais aucun partenariat ni déploiement européen n'est annoncé à ce stade.

IndustrielOpinion
1 source
TaCauchy : un framework FEM extensible pour la simulation tactile basée sur la vision
24arXiv cs.RO 

TaCauchy : un framework FEM extensible pour la simulation tactile basée sur la vision

Une équipe de chercheurs a publié TaCauchy, un cadre de simulation par éléments finis (FEM) conçu pour les capteurs tactiles à vision, intégré directement dans Isaac Sim, la plateforme de simulation GPU d'NVIDIA. Basé sur le solveur UIPC (Unified Incremental Potential Contact), TaCauchy calcule des tenseurs de contrainte de Cauchy à partir de lois constitutives hyperélastiques, puis projette ces contraintes sur les surfaces de contact pour obtenir les forces de traction et les distributions de pression. Il prend en charge trois capteurs courants, GelSight Mini, DIGIT et 9DTact, via une interface modulaire permettant une intégration rapide par simple configuration. Sur le plan des performances, le framework atteint 33,40 FPS en environnement unique et 555 FPS de débit agrégé sur 60 environnements parallèles, avec un overhead d'extraction des contraintes inférieur à 1 ms. La validation physique montre un SSIM supérieur à 0,93 sur une plage de forces allant de 1,26 N à 4,73 N. L'enjeu principal est le fossé sim-to-real qui pénalise l'entraînement par renforcement des politiques de manipulation tactile. Les approches existantes recourent généralement à des estimations empiriques des champs de contraintes, ce qui introduit des biais difficiles à corriger une fois déployé sur robot réel. TaCauchy propose à la place une vérité terrain mécanique dérivée des premiers principes physiques, ce qui représente un changement de paradigme pour les ingénieurs qui cherchent à entraîner des politiques de préhension fine sans collecter massivement de données réelles. Le débit de 555 FPS en parallèle rend cette précision physique compatible avec les pipelines d'apprentissage par renforcement à grande échelle. Les capteurs tactiles à vision de type GelSight ont émergé comme une alternative économique aux capteurs de force-couple classiques, mais leur simulation restait un goulot d'étranglement dans les environnements GPU-parallèles comme Isaac Lab ou Orbit. TaCauchy s'inscrit dans une dynamique plus large de "physiques différentiables" qui cherchent à remplacer les proxies heuristiques par des modèles rigoureux directement différenciables. Du côté concurrentiel, des travaux comme Taxim ou DigiTac ont proposé des approches optiques ou basées sur des réseaux de neurones pour la simulation GelSight, mais sans calcul de champ de contraintes FEM intégré à un environnement GPU. La prochaine étape probable pour TaCauchy sera l'intégration avec des politiques de type diffusion ou VLA (Vision-Language-Action) pour des tâches d'assemblage ou de manipulation déformable.

RecherchePaper
1 source
RSLCPP : simulations déterministes avec ROS 2
25arXiv cs.RO 

RSLCPP : simulations déterministes avec ROS 2

Une équipe de l'Université Technique de Munich (TUM) publie RSLCPP, une bibliothèque open-source en C++ conçue pour rendre les simulations robotiques sous ROS 2 entièrement déterministes. La contribution, présentée dans un article révisé sur arXiv (arXiv:2601.07052v2), s'attaque à un problème structurel de ROS : son architecture asynchrone et multi-processus rend les résultats de simulation non reproductibles d'une machine à l'autre, voire d'une exécution à l'autre sur le même matériel. L'équipe démontre que RSLCPP produit des résultats bit-à-bit identiques sur plusieurs architectures CPU, validés sur un benchmark synthétique et sur un système robotique réel. La bibliothèque est disponible en open-source sur GitHub (TUMFTM/rslcpp). Le problème que résout RSLCPP est fondamental pour quiconque utilise ROS 2 en simulation : lorsque les temps de calcul et les latences de communication varient, l'ordre d'exécution des callbacks n'est pas garanti, ce qui compromet la reproductibilité des résultats. Pour le benchmarking scientifique et l'intégration continue (CI/CD), où la répétabilité est essentielle, cela constitue un frein réel. RSLCPP impose un ordonnancement déterministe des callbacks en combinant les nœuds ROS existants dans une routine de simulation séquentielle, sans nécessiter de modification du code source. Ce dernier point est décisif : les équipes peuvent instrumenter leurs stacks ROS existantes sans refactoring, ce qui abaisse significativement le coût d'adoption. ROS 2, maintenu par Open Robotics, est devenu le standard de facto en robotique académique et industrielle. La non-reproductibilité des simulations est un problème connu depuis des années dans la communauté, que des simulateurs comme Gazebo ou Isaac Sim de NVIDIA ont partiellement adressé via leurs propres mécanismes internes. RSLCPP se distingue en opérant directement au niveau de l'exécuteur ROS 2, rendant l'approche indépendante du simulateur physique sous-jacent et donc plus portable. La prochaine étape logique serait l'intégration dans des pipelines CI robotiques pour valider des comportements algorithmiques sans variabilité matérielle, un besoin croissant à mesure que les équipes industrielles adoptent des pratiques DevOps pour le développement robotique.

UELes équipes de R&D robotique européennes utilisant ROS 2 bénéficient d'un outil open-source issu de TUM (Allemagne) pour fiabiliser leurs pipelines CI/CD de simulation sans refactoring de code existant.

InfrastructureOpinion
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
26arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile
27arXiv cs.RO 

TactSpace : apprendre un espace latent partagé enrichi par la physique pour le transfert sim-vers-réel tactile

Une équipe de recherche a publié sur arXiv (identifiant 2606.18959) TactSpace, un cadre d'apprentissage de représentations multi-modales conçu pour résoudre l'un des verrous majeurs de la manipulation robotique : le transfert sim-to-real des capteurs tactiles. Le problème est structurel : les simulateurs actuels sont incapables de reproduire fidèlement la mécanique de déformation et de transduction des capteurs tactiles physiques, rendant inutilisables en conditions réelles les politiques entraînées en simulation. TactSpace contourne ce problème en alignant des modalités tactiles hétérogènes dans un espace latent partagé, sans jamais avoir besoin de simuler le signal brut du capteur. Des encodeurs spécifiques à chaque modalité projettent des observations aussi différentes que la profondeur de pénétration simulée et la capacitance mesurée sur un capteur réel dans un embedding commun. L'entraînement combine des objectifs de reconstruction croisée et d'alignement contrastif. Évalué sur trois tâches, identification de formes d'indenteur, prédiction de force et reconstruction géométrique, le système entraîné exclusivement en simulation transfère directement sur des mesures réelles sans fine-tuning : zéro-shot. Les gains mesurés atteignent 16,7 % de réduction d'erreur en prédiction de force et 45,8 % en reconstruction de forme par rapport aux baselines. Ces résultats adressent un goulot d'étranglement critique pour l'ensemble de la robotique de manipulation dextre. Le tactile est indispensable pour les tâches d'assemblage fin, de tri délicat ou de manipulation d'objets déformables, segments où les bras industriels classiques butent faute de retour de contact fiable. Jusqu'ici, la difficulté à simuler correctement les capteurs tactiles forçait soit à collecter massivement des données réelles, coûteuses et lentes, soit à se passer du tactile. TactSpace propose une troisième voie : accepter que simulation et réalité restent physiquement dissemblables, et apprendre malgré tout des représentations invariantes aux modalités mais riches en information de contact. La publication accompagne le code d'une implémentation Warp-based du simulateur tactile pénalité intégrée à Isaac Lab, la plateforme de simulation physique de NVIDIA, ce qui ouvre la génération de données tactiles scalable à la communauté. Le contexte de cette recherche s'inscrit dans une effervescence autour des capteurs tactiles à haute résolution, portée notamment par GelSight (MIT, aujourd'hui GelSight Inc.), DIGIT (Meta AI) et les capteurs capacitifs embarqués dans plusieurs plateformes humanoïdes. Isaac Lab, qui sert de base à ce travail, est devenu un standard de facto pour l'entraînement de politiques robotiques en simulation, utilisé par Figure, 1X et Agility entre autres. TactSpace reste à ce stade un preprint non évalué par les pairs, sans déploiement annoncé sur plateforme physique commerciale. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation réelles bout-en-bout et une intégration dans des pipelines Vision-Language-Action (VLA) où le retour tactile pourrait renforcer la robustesse en conditions industrielles.

RecherchePaper
1 source
GASE : système automatisé basé sur le Gaussian Splatting pour la reconstruction d'environnements de simulation incarnée
28arXiv cs.RO 

GASE : système automatisé basé sur le Gaussian Splatting pour la reconstruction d'environnements de simulation incarnée

Une équipe de chercheurs a publié fin juin 2026 un système baptisé GASE (Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments), conçu pour automatiser la construction de scènes de simulation photoréalistes destinées à l'entraînement de robots. Le pipeline exploite des réseaux de caméras panoramiques multivues pour capturer l'environnement réel, extrait automatiquement les objets de premier plan via une stratégie basée sur les poses de caméras dans le domaine 2D, puis reconstruit séparément objets et arrière-plan statique par 3D Gaussian Splatting avant de les importer dans un simulateur physique avec inpainting haute-fidélité des zones manquantes. Sur des benchmarks de segmentation, GASE surpasse les méthodes 3DGS concurrentes de plus de 10 %. Surtout, lors de déploiements réels sur des tâches de manipulation et de navigation, les politiques entraînées en simulation n'affichent qu'un écart de performance inférieur à 10 % par rapport à celles entraînées sur données réelles, arXiv:2606.17520. Ce résultat chiffré est l'argument central du papier. Le sim-to-real gap, soit la dégradation des performances lors du passage du simulateur au robot physique, reste l'un des obstacles majeurs au déploiement à grande échelle de l'apprentissage robotique. Un écart sous les 10 % suggère que la simulation générée automatiquement depuis des scans réels peut constituer un vecteur de data augmentation viable, réduisant la dépendance à des opérateurs qualifiés et à du matériel coûteux pour la collecte terrain. Pour les intégrateurs et les industriels engagés dans des projets de manipulation ou de navigation autonome, la promesse est de compresser significativement le coût des pipelines d'entraînement, à condition que la méthode tienne à l'échelle et sur des environnements plus complexes que ceux testés. GASE s'inscrit dans la trajectoire tracée par l'émergence du 3D Gaussian Splatting en 2023 comme alternative temps-réel aux NeRF pour la reconstruction de scènes. Les approches concurrentes, notamment SplatSim, Gaussian Grouping et les pipelines d'assets manuels dans Isaac Sim ou MuJoCo, progressent en parallèle, mais l'automatisation complète de l'acquisition jusqu'à l'import simulateur reste un problème ouvert. Le preprint ne mentionne ni institution ni partenaires industriels, ce qui rend difficile l'évaluation des perspectives de transfert applicatif. Le code doit être publié ultérieurement mais n'est pas encore disponible au moment de la soumission. Le périmètre limité des tâches testées et l'absence de comparaison avec des environnements synthétiques construits manuellement laissent plusieurs questions ouvertes à la communauté.

RecherchePaper
1 source
MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable
29arXiv cs.RO 

MagicSim : une infrastructure unifiée pour l'interaction incarnée et exécutable

Des chercheurs ont déposé en juin 2026 sur arXiv (2606.17511) MagicSim, une infrastructure de simulation conçue pour unifier dans un seul runtime déterministe les couches de contrôle, de compétences et de planification jusqu'ici traitées séparément. L'architecture repose sur un processus de décision de Markov (MDP) partagé et des spécifications YAML qui découplent le contenu des scènes, le comportement des objets et l'exposition aux agents. À partir de ces définitions, le système génère automatiquement des environnements variés couvrant différentes familles de tâches, régimes de physique, capteurs et morphologies robotiques, tous exécutables dans une même boucle reset-step. Le pipeline central suit la chaîne Commande-Compétence-Planificateur-Robot-Enregistrement : les commandes haut niveau sont instanciées comme des actions robotiques réelles, non comme des éditions directes d'état côté simulateur. Une seule définition de tâche supporte trois usages simultanés : évaluation benchmark et apprentissage par renforcement (RL), collecte automatique de trajectoires via une interface autocollect, et interaction directe avec des agents ou des VLM (Vision-Language Models). L'enjeu central que MagicSim cherche à résoudre est désigné dans la littérature sous le terme "magic actions" : dans la plupart des pipelines existants, les simulateurs trichent en éditant directement l'état du monde plutôt qu'en exécutant des mouvements robotiques réels. Cette pratique, commode pour générer des données d'entraînement, brise le transfert sim-to-real car les trajectoires produites ne correspondent pas à ce qu'un robot physique peut accomplir. En ancrant chaque commande haut niveau dans une pile d'exécution complète, MagicSim génère des trajectoires multimodales structurées qui alignent supervision linguistique, représentations d'action, représentations visuelles et géométriques, et statut de la tâche sur l'épisode réellement exécuté. Pour les équipes développant des VLA à grande échelle (pi0 de Physical Intelligence, GR00T N2 de NVIDIA), la capacité à produire automatiquement des données cohérentes entre simulation et exécution représente un levier direct sur la scalabilité des pipelines de données. Ce travail s'inscrit dans une tentative de consolidation d'un paysage de simulation fragmenté. Les infrastructures concurrentes incluent Isaac Lab de NVIDIA, Genesis, SAPIEN et RoboSuite, chacune optimisée pour un sous-ensemble du workflow : physique haute fidélité, benchmark standardisé, ou collecte de données. MagicSim se positionne comme une alternative unifiée, avec comme argument différenciant l'interface agent/VLM intégrée dès la spécification de tâche. La publication ne mentionne ni déploiement open-source immédiat ni partenariat industriel annoncé, et les résultats restent à ce stade des démonstrations sur environnements internes. La validation sur des benchmarks sectoriels établis comme LIBERO, MetaWorld ou RLBench sera le prochain critère de maturité.

RechercheOpinion
1 source
Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise
30Interesting Engineering 

Eno, le robot humanoïde qui vise à devenir la machine polyvalente de chaque entreprise

Genesis AI a présenté Eno, son premier robot à usage général, en juin 2026. La machine abandonne la forme humanoïde bipède au profit d'une base à roues surmontée d'une colonne télescopique ajustable en hauteur, capable de se replier en configuration compacte lors des phases d'inactivité. Ses mains robotiques reproduisent la morphologie et la fonction de mains humaines, afin de permettre l'utilisation d'outils standards dans des espaces déjà conçus pour des opérateurs humains. Son système de contrôle est GENE, le modèle de fondation robotique développé en interne, présenté comme capable de gérer la planification de tâches longues, l'adaptation au contexte et la mémorisation entre opérations. Un écran embarqué optionnel affiche en temps réel le raisonnement et les intentions du robot. Les premiers déploiements clients sont annoncés avant fin 2026, en fabrication, logistique et laboratoires, avec une extension ultérieure à l'hôtellerie, à la santé puis au grand public. Genesis AI a levé 105 millions de dollars en financement de démarrage, avec Eric Schmidt, ancien PDG de Google, parmi ses investisseurs déclarés. Le choix d'une base roulante plutôt que bipède représente un compromis délibéré : on sacrifie la polyvalence locomotrice pour la fiabilité mécanique dans des environnements industriels à sols plats et structurés, là où l'essentiel des déploiements initiaux est ciblé. Les mains humanoïdes répondent à un problème de compatibilité concret, puisque les postes de travail et les outils industriels sont dimensionnés pour des mains humaines. Sur le plan logiciel, GENE s'inscrit dans la catégorie des VLA (Vision-Language-Action models) avec l'ambition de piloter des tâches longues en autonomie, ce que le secteur cherche précisément à démontrer à grande échelle depuis deux ans avec des résultats encore inégaux. L'affichage du raisonnement en temps réel est une réponse directe aux exigences d'acceptabilité et de sécurité en environnement mixte humain-robot. Il faut cependant souligner qu'aucun chiffre de performance validé indépendamment n'accompagne l'annonce : payload, temps de cycle et taux de fiabilité sur lignes réelles restent inconnus. Eno est à ce stade une annonce, pas un produit en production. Genesis AI entre dans une course déjà bien engagée. Figure AI déploie ses robots Figure 02 sur les lignes de montage de BMW en Caroline du Nord ; Tesla vise la production de masse d'Optimus pour 2026 ; Agility Robotics teste Digit dans les entrepôts d'Amazon ; Physical Intelligence développe Pi-0 comme modèle de fondation généraliste ; NVIDIA fournit GR00T N2 et l'infrastructure de simulation Isaac Lab à l'ensemble de l'écosystème. Genesis AI se positionne avec une approche de co-conception : hardware, software et IA développés ensemble depuis l'origine plutôt qu'intégrés séquentiellement, argument central du discours de Zhou Xian, co-fondateur et PDG. Avec 105 millions de dollars de seed et un investisseur aussi visible qu'Eric Schmidt, la société dispose des ressources pour tenir ses délais. Les déploiements pilotes annoncés avant fin 2026 constitueront le premier test réel de cette promesse d'intégration systémique.

HumanoïdesOpinion
1 source
DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée
31arXiv cs.RO 

DataLadder : une chaîne d'outils d'interconversion par simulation pour la pyramide de données de l'IA incarnée

Une équipe associée à JD Cloud publie DataLadder (arXiv:2606.16776, juin 2026), un pipeline de conversion bidirectionnel entre robots réels, simulation et démonstrations humaines, conçu pour scaler la génération de données d'entraînement et l'évaluation de politiques robotiques généralistes. L'outil repose sur deux flux complémentaires via le simulateur JoySim. Le premier, Robot vers Simulation vers Human, reconstruit des tâches réelles de rangement sur table en jumeaux numériques calibrés, puis mobilise des retours humains pour affiner la naturalité des trajectoires simulées, permettant une évaluation reproductible sans mobiliser de robot physique en continu. Le second, Human vers Simulation vers Robot, projette des démonstrations humaines filmées en vue égocentrique dans JoySim, les confronte aux contraintes physiques du robot cible, et en extrait trajectoires, annotations et observations visuelles directement utilisables en entraînement. Les modules de reconstruction, rendu et augmentation de réalisme sont exposés en services cloud sur JD Cloud. Ce travail adresse une asymétrie bien documentée : les données issues de robots réels restent la source la plus fiable, mais leur collecte est lente et coûteuse, tandis que la simulation seule souffre du sim-to-real gap. DataLadder introduit un filtre de cohérence physique dans la boucle de conversion human-to-robot, ce qui dépasse les approches de retargeting naïves. Pour les équipes développant des architectures VLA (vision-language-action), cette infrastructure pourrait réduire significativement la dépendance aux démos téléopérées, dont le coût est souvent estimé à plusieurs milliers de dollars par heure de collecte. L'accessibilité via API cloud simplifie également le déploiement pour des équipes sans cluster de simulation dédié. DataLadder s'inscrit dans la course au "data flywheel" pour robots généralistes, lancée par RT-2 (Google DeepMind, 2023) et accélérée par des politiques comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). JD.com, conglomérat e-commerce chinois opérant une large flotte logistique autonome, a un intérêt direct à industrialiser cette chaîne pour ses propres lignes de tri et de picking. Aucun benchmark comparatif avec les simulateurs concurrents Isaac Lab (NVIDIA) ou MuJoCo Playground (DeepMind) n'est fourni dans ce preprint, ce qui rend les affirmations de performance difficiles à évaluer pour l'instant. La prochaine étape attendue serait une validation quantitative sur des benchmarks standardisés de manipulation comme LIBERO ou MetaWorld.

IA physiqueOpinion
1 source
Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable
32arXiv cs.RO 

Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.16572) SteerGenPO, un cadre d'apprentissage par renforcement en espace latent destiné à transformer une politique générative entraînée, basée sur la diffusion ou les flux normalisants, en un contrôleur robotique déterministe et stable. Le système a été évalué sur six benchmarks Isaac Lab d'NVIDIA et sur une tâche de locomotion avec le robot humanoïde Unitree G1, avec des résultats supérieurs aux baselines RL classiques et génératives selon les auteurs. Il s'agit d'une publication académique en pré-impression, sans déploiement industriel annoncé ni validation terrain au-delà du G1. Le verrou technique adressé est connu : les politiques de diffusion accumulent des variations d'action à chaque pas de temps, ce qui dégrade la stabilité sur des systèmes robotiques à haute dimensionnalité. SteerGenPO sépare architecturalement exploration et contrôle : l'échantillonnage stochastique reste actif à l'entraînement pour diversifier les proposals d'actions, mais au déploiement, un acteur latent appris prédit une entrée déterministe et dépendante de l'état qui pilote la politique générative sans bruit résiduel. Pour les intégrateurs, la proposition n'exige pas de réentraîner la politique depuis zéro : elle greffe un mécanisme de pilotage sur un checkpoint pré-entraîné existant, ce qui ouvre la voie à l'exploitation de modèles fondation tout en garantissant la reproductibilité des trajectoires en production. Ce travail s'inscrit dans la compétition intense autour des politiques génératives en robotique. Physical Intelligence avec Pi-0 (2024) et NVIDIA avec GR00T N2 (2025) ont validé l'approche VLA-diffusion en environnements contrôlés, mais les questions sur la robustesse à l'inférence longue restent ouvertes. Boston Dynamics, Agility Robotics et Figure AI privilégient des pipelines de contrôle plus classiques pour la fiabilité en production. SteerGenPO propose une voie médiane : capitaliser sur la richesse exploratoire des modèles génératifs sans en subir l'instabilité au déploiement. Aucune timeline, partenariat industriel ni essai terrain n'est mentionné dans le préprint ; les prochaines validations naturelles porteraient sur la manipulation dextère et des tests sim-to-real approfondis.

IA physiqueOpinion
1 source
Le robot humanoïde Pemba vise le sommet de l'Everest après une ascension historique à 6 191 m
33Interesting Engineering 

Le robot humanoïde Pemba vise le sommet de l'Everest après une ascension historique à 6 191 m

Le 5 juin 2026, un robot humanoïde Unitree G1 baptisé Pemba a atteint une altitude de 6 193 mètres (20 312 pieds) sur le mont Chimborazo en Équateur, dans le cadre d'une expédition menée par Geologic Dome et sponsorisée par Eastworlds Labs, l'initiative robotique d'intelligence artificielle de Virtuals Protocol. Le robot pèse 35 kg et se compacte à 690 mm, ce qui a permis à l'équipe de le démonter et de le transporter entre les camps avant de le réassembler à chaque étape. Pour résister aux conditions extrêmes du Chimborazo, températures descendant à -15 °C et rafales atteignant 90 km/h, Pemba a été équipé de vestes thermiques sur mesure, d'enceintes grillagées et de pieds composites. Son système d'autonomie a été entraîné dans NVIDIA Isaac Sim à 1 620 fois la vitesse réelle, avec un taux de transfert sim-to-réel de 85 % sur terrain accidenté déclaré par Eastworlds Labs. Les communications étaient assurées par un réseau maillé propriétaire entre les camps, avec une connexion satellite affichant une latence de 25 ms, sous le seuil de 50 ms requis pour la télé-opération en direct via le logiciel Reflex. Cette mission sur le Chimborazo est présentée comme un test préliminaire avant une expédition planifiée sur l'Everest à l'automne 2026, avec une collaboration documentaire confirmée avec l'équipe de production derrière le documentaire Netflix "14 Peaks: Nothing Is Impossible". Ces résultats, présentés dans un communiqué de presse soigneusement mis en scène, méritent d'être lus avec prudence : le taux de transfert sim-to-réel de 85 % reste un chiffre auto-déclaré, sans peer review ni protocole de test publié. Cela dit, parvenir à faire fonctionner un humanoïde en autonomie partielle à plus de 6 000 mètres d'altitude, dans des conditions de froid et de vent sévères, constitue un test de robustesse matérielle et logicielle non trivial. L'enjeu industriel réel dépasse la performance sportive : il s'agit de valider que des plateformes humanoïdes de taille commerciale (le G1 est vendu autour de 16 000 dollars) peuvent être déployées dans des environnements non structurés et extrêmes, sans infrastructure dédiée. Pour les intégrateurs et les décideurs B2B opérant dans des secteurs comme l'énergie en zone isolée, la surveillance environnementale ou l'intervention d'urgence, c'est une preuve de concept pertinente, même partielle. Geologic Dome est une organisation de conservation qui construit des infrastructures autonomes pour les zones protégées : relais de communication, monitoring écologique par IA, plateformes robotiques indépendantes en énergie. L'expédition Chimborazo s'inscrit dans un programme plus large incluant trois sites d'expérimentation : forêt équatoriale en République démocratique du Congo, forêts de nuages en Équateur et le gradient altitudinal complet de l'Himalaya au Népal. Le Unitree G1 utilisé pour l'Everest sera donné à la communauté sherpa locale, une décision de positionnement symbolique autant que logistique. Aucun concurrent direct n'est explicitement cité dans cette expédition, mais le choix du G1 plutôt que de plateformes comme le Boston Dynamics Spot ou l'Atlas illustre la montée en maturité des humanoïdes bon marché face aux quadrupèdes établis pour les missions de terrain. La prochaine étape attendue est la confirmation de la date et du parcours de l'expédition Everest, ainsi que la publication de données techniques sur les performances autonomes en conditions réelles.

HumanoïdesOpinion
1 source
Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique
34arXiv cs.RO 

Du numérique au physique : des agents numériques comme coachs autonomes de l'intelligence physique

Des chercheurs ont publié EmboCoach-Bench, un benchmark évaluant la capacité d'agents LLM à automatiser l'ingénierie de politiques pour systèmes robotiques incarnés. Présenté sur arXiv (arXiv:2501.21570), le cadre couvre 32 tâches conçues par des experts en apprentissage par renforcement (RL) et apprentissage par imitation (IL), avec le code exécutable comme interface universelle entre l'agent et l'environnement de simulation. Plutôt que de générer des solutions statiques, les agents opèrent en boucle fermée: ils proposent du code, l'exécutent dans le simulateur, analysent le retour d'environnement, puis itèrent pour corriger et optimiser. Les tâches couvrent des aspects allant de la conception de fonctions de récompense informées par la physique aux architectures de politiques avancées, notamment les diffusion policies. Les résultats quantitatifs méritent attention: les agents autonomes ont surpassé les baselines conçues manuellement par des humains de 26,5% en taux de succès moyen, contestant l'hypothèse selon laquelle l'expertise humaine en reward shaping serait difficilement substituable pour les politiques incarnées. Deuxième enseignement: le workflow agentique avec retour d'environnement réduit substantiellement l'écart de performance entre modèles open-source et propriétaires, ce qui suggère que la boucle de feedback itératif est plus déterminante que le modèle sous-jacent. Enfin, les agents démontrent une capacité de self-correction sur des cas pathologiques d'ingénierie, récupérant des tâches en quasi-échec total via un débogage itératif en simulation. Pour les équipes robotiques, cela représente une voie potentielle pour réduire le temps ingénieur consacré au tuning manuel des hyperparamètres et à la conception artisanale de fonctions de récompense. Ce travail s'inscrit dans une tendance plus large: l'application des workflows agentiques LLM, prouvés dans l'automatisation logicielle et la découverte scientifique, au domaine de l'IA incarnée. Le goulot d'étranglement identifié, à savoir la supervision manuelle intensive pour le réglage des simulations, est un problème structurel bien connu des équipes travaillant sur Optimus (Tesla), GR00T N2 (NVIDIA) ou les systèmes de Figure AI. La contribution différenciante d'EmboCoach-Bench est de proposer un cadre d'évaluation standardisé pour mesurer ce que les agents LLM peuvent réellement automatiser, plutôt que des démos ciblées. Les extensions naturelles incluent l'intégration à des backends hétérogènes (Isaac Lab, MuJoCo, Genesis) et la validation sim-to-real pour confirmer si ces gains en simulation se transfèrent aux systèmes physiques, ce qui reste le test décisif pour une adoption industrielle.

RecherchePaper
1 source
L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes
35arXiv cs.RO 

L'architecture du critique est cruciale : critiques doubles ou unifiés pour la loco-manipulation des humanoïdes

Une étude publiée sur arXiv le 11 juin 2026 (réf. 2606.11891) présente une comparaison rigoureuse de deux architectures de critique en apprentissage par renforcement multi-objectifs pour robots humanoïdes : un critique unifié (un seul réseau estimant la valeur combinée de tous les objectifs) contre des critiques duaux (deux réseaux distincts, chacun associé à un signal de récompense séparé, l'un pour la locomotion, l'autre pour la manipulation). Les expériences ont été conduites sur le Unitree G1, un humanoïde à 23 degrés de liberté actifs, dans le simulateur NVIDIA Isaac Lab, via un curriculum séquentiel de 13 niveaux progressant de l'atteinte stationnaire jusqu'à la marche avec des cibles à orientation variable. Résultat : les politiques entraînées avec critiques duaux atteignent leurs cibles 3,5 fois plus vite (6,5 pas de simulation contre 22,6), affichent un débit deux fois supérieur (14,3 contre 7,0 atteintes validées pour 1 000 pas), et un taux de réussite validé de 65,2 % contre 53,8 % pour le critique unifié. Ce que l'étude démontre, c'est que le choix de l'architecture du critique est un levier de conception primaire, souvent négligé, dont l'impact surpasse celui du reward engineering. Fait notable : l'ajout de mécanismes anti-gaming, conçus pour empêcher la politique d'exploiter les failles de la fonction de récompense, ne produit aucun gain au-delà du changement architectural seul (60,9 % contre 65,2 %). L'implication la plus immédiate concerne le fine-tuning RL de politiques pré-entraînées par imitation : lorsqu'on affine un modèle de manipulation déjà appris (style Pi-0 ou GR00T N2), un critique unifié risque de supprimer les comportements acquis par interférence des gradients de locomotion. Pour les équipes qui cherchent à spécialiser des modèles de fondation robotiques par RL, cette mise en garde est directement opérationnelle. Le Unitree G1, vendu autour de 16 000 dollars, est devenu un banc de test standard pour la recherche en humanoïde abordable, face aux plateformes de Figure AI, Agility Robotics ou 1X Technologies qui opèrent sur des gammes de prix bien supérieures. NVIDIA Isaac Lab, successeur d'Isaac Gym, s'est imposé comme l'environnement de référence pour l'entraînement sim-to-real. La question du découplage locomotion/manipulation en RL multi-objectifs est au coeur de plusieurs groupes de recherche (Stanford, CMU, ETH Zurich), et les résultats de cette étude, issus d'un cadre contrôlé et reproductible, offrent une base solide pour orienter les choix d'architecture avant tout entraînement coûteux sur robot réel.

RecherchePaper
1 source
Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques
36arXiv cs.RO 

Démarrage par modèle VLA pour l'apprentissage par renforcement des agents robotiques

Des chercheurs proposent VLAJS (Vision-Language-Action Jump-Starting), une méthode publiée sur arXiv (réf. 2604.13733v2) visant à accélérer l'apprentissage par renforcement (RL) en manipulation robotique. Le principe repose sur l'utilisation d'un modèle VLA comme guide transitoire en début d'entraînement, sans imitation stricte ni démonstrations humaines. VLAJS augmente l'algorithme PPO (Proximal Policy Optimization) d'une régularisation directionnelle qui aligne progressivement les actions de l'agent RL avec les suggestions du VLA, avant d'annuler cette contrainte à mesure que l'agent gagne en compétence. La méthode a été évaluée sur six tâches simulées (levée d'objet, pick-and-place, réorientation et insertion de cheville, poking, pushing), dont un sous-ensemble validé sur un bras Franka Panda réel. Elle réduit de plus de 50 % le nombre d'interactions d'entraînement nécessaires par rapport à PPO seul ou aux baselines de distillation, et démontre un transfert sim-to-real zero-shot robuste face à des encombrements, variations d'objets et perturbations externes. Ce résultat répond à une tension structurelle bien connue du domaine: les modèles VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) excellent dans le raisonnement à l'échelle de la tâche grâce à leur préentraînement multimodal massif, mais restent trop lents pour le contrôle en boucle fermée à haute fréquence. Inversement, le RL classique assure cette précision mais explore de façon inefficace sur des tâches longues avec récompenses éparses. VLAJS prouve qu'un VLA peut être utile sans être interrogé en continu, réduisant potentiellement les coûts d'entraînement pour des applications de manipulation industrielle et validant l'hypothèse qu'un modèle généraliste peut servir d'amorce dans des pipelines RL orientés production. VLAJS émerge dans un contexte de convergence entre fondations VLA et contrôle temps-réel, où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Google DeepMind (RT-2) s'affrontent sur la généralisation pendant que le RL pur domine en précision. Cette contribution reste académique: validée sur le Franka Panda à 7 degrés de liberté, elle n'est pas encore un produit déployé ni industrialisé, et la réduction de 50 % des interactions porte sur des tâches relativement courtes en simulation. Les suites naturelles incluent l'extension à des morphologies plus complexes (humanoïdes, systèmes bimanuels) et l'intégration dans des frameworks d'entraînement open-source comme Isaac Lab ou ManiSkill.

RechercheOpinion
1 source
NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur
37Interesting Engineering 

NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur

NVIDIA et le groupe sud-coréen LG ont annoncé lors du Computex 2026 un partenariat stratégique multisectoriel visant à construire un écosystème d'intelligence artificielle physique couvrant la robotique industrielle, les robots domestiques, la mobilité autonome et les infrastructures de calcul. La collaboration mobilise plusieurs entités du conglomérat LG : LG Electronics, LG CNS, LG Innotek, LG Uplus et LG Energy Solution, chacune apportant un périmètre spécifique. Concrètement, LG prévoit de déployer NVIDIA Isaac Sim et Isaac Lab dans ses workflows robotique pour entraîner ses robots domestiques en environnements virtuels avant tout déploiement physique, et d'explorer le modèle de fondation GR00T pour renforcer leurs capacités de raisonnement. LG Electronics construit par ailleurs ce qu'il appelle une "data factory pour l'IA physique", utilisant les world models NVIDIA Cosmos pour générer des datasets synthétiques destinés à la robotique et à l'automatisation industrielle. Sur le volet infrastructure, LG Uplus s'engage à construire des centres de données à grande échelle compatibles avec les dernières générations de GPU NVIDIA, LG Electronics travaillera sur des technologies de refroidissement liquide alignées avec la plateforme NVIDIA DSX, et LG Energy Solution évalue des architectures d'alimentation en courant continu 800 volts pour les installations nouvelle génération. L'intérêt de ce partenariat pour les décideurs industriels tient moins à l'annonce elle-même qu'à ce qu'elle révèle sur la maturité du cycle de développement robotique. L'adoption d'Isaac Sim comme environnement d'entraînement primaire signale que le sim-to-real gap, longtemps le principal obstacle au déploiement à grande échelle, est considéré comme suffisamment maîtrisé pour structurer une chaîne industrielle dessus. La création d'une data factory synthétique répond à l'un des goulots d'étranglement les plus critiques du secteur : la rareté des données labellisées de qualité pour entraîner des VLA (Vision-Language-Action models). Pour les intégrateurs et les COO industriels, le message est que les outils de simulation et les modèles de fondation convergent vers une stack unifiée, ce qui devrait réduire les coûts et délais de portage de nouvelles applications robotiques. Il convient toutefois de noter que l'annonce reste au stade de la feuille de route : aucun chiffre de déploiement, aucun timeline de livraison ni prix n'ont été communiqués. Le contexte de ce rapprochement est celui d'une course mondiale à l'IA physique dans laquelle NVIDIA cherche à s'imposer comme couche d'infrastructure universelle face à des concurrents comme Boston Dynamics Atlas (désormais intégré chez Hyundai), Figure AI avec son modèle Helix, ou encore Physical Intelligence (pi-0) côté recherche. LG, de son côté, investit depuis plusieurs années dans la robotique de service avec ses robots CLOi, sans avoir encore atteint une adoption commerciale significative. Le groupe fait aussi face à la pression de concurrents coréens comme Samsung, qui développe ses propres robots domestiques avec Ballie. Les prochaines étapes annoncées incluent l'intégration des technologies NVIDIA DRIVE dans les systèmes ADAS de LG Electronics pour les véhicules définis par logiciel, et le déploiement de la plateforme d'automatisation industrielle de LG CNS enrichie de briques NVIDIA. La concrétisation de ces engagements sur les 12 à 24 prochains mois sera le véritable indicateur de la profondeur du partenariat.

UECe partenariat accélère la convergence vers une stack NVIDIA (Isaac Sim, GR00T, Cosmos) comme infrastructure d'entraînement robotique de référence, forçant les intégrateurs et OEM européens à évaluer leur alignement avec cet écosystème dans leurs roadmaps 2026-2027.

💬 Le truc intéressant, c'est pas le deal NVIDIA-LG, c'est ce qu'il révèle : le sim-to-real gap est maintenant considéré comme suffisamment sous contrôle pour construire une filière industrielle dessus. Isaac Sim comme environnement d'entraînement primaire dans une data factory à l'échelle d'un conglomérat coréen, ça signale un vrai changement de maturité, pas juste un POC de plus. Sur le papier, du moins, parce qu'aucun chiffre ni calendrier n'a filtré.

IA physiqueOpinion
1 source
RLWRLD et Nvidia lancent DexBench pour standardiser la dextérité des robots humanoïdes
38Robotics & Automation News 

RLWRLD et Nvidia lancent DexBench pour standardiser la dextérité des robots humanoïdes

RLWRLD, une startup spécialisée en IA physique, a annoncé en partenariat avec Nvidia le lancement de DexBench, un benchmark universel destiné à standardiser l'évaluation des capacités de dextérité des robots humanoïdes. L'initiative repose sur trois axes : DexBench en tant que référentiel d'évaluation commun, un standard de données pour l'entraînement à la manipulation dextre, et une intégration native aux frameworks open-source Nvidia Isaac Lab et Isaac Lab-Arena. Aucune date de disponibilité publique ni métriques de performance n'ont été communiquées à ce stade -- il s'agit d'une annonce de feuille de route, pas d'un produit shipped. L'absence de standard commun pour mesurer la dextérité est l'un des obstacles majeurs à la comparaison objective entre systèmes humanoïdes. Sans référentiel partagé, chaque constructeur publie ses propres métriques dans des conditions contrôlées, ce qui rend les comparaisons entre Figure 03, Optimus, Unitree ou 1X quasi impossibles pour les intégrateurs industriels. DexBench vise à combler ce vide en établissant des protocoles reproductibles, ce qui pourrait accélérer la qualification de robots pour des tâches d'assemblage ou de picking en milieu non structuré. RLWRLD s'inscrit dans un écosystème naissant autour des fondations de simulation Nvidia, qui positionne Isaac Lab comme infrastructure commune pour le sim-to-real dans la robotique humanoïde. Des acteurs comme Physical Intelligence (Pi-0), Agility Robotics ou Boston Dynamics s'appuient également sur des pipelines de simulation propriétaires. Le choix de standardiser via un framework open Nvidia plutôt qu'un consortium neutre (comme ROS 2 ou IEEE) est un pari sur l'adoption par l'écosystème Jetson/Omniverse -- une dynamique à surveiller face aux initiatives concurrentes en Europe.

UELa standardisation de l'évaluation de la dextérité pourrait indirectement bénéficier aux intégrateurs industriels européens, mais aucun acteur FR/EU n'est impliqué et l'initiative demeure au stade de feuille de route sans métriques ni date de disponibilité.

HumanoïdesOpinion
1 source
HARBOR : un cadre d'apprentissage par renforcement pour robots à base d'agents
39arXiv cs.RO 

HARBOR : un cadre d'apprentissage par renforcement pour robots à base d'agents

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.08610) HARBOR, un framework agentique conçu pour automatiser les pipelines d'apprentissage par renforcement (RL) appliqués à la robotique. Partant d'une spécification de tâche et d'une base de code simulateur, le système prend en charge l'ensemble du workflow : configuration de l'environnement, conception des fonctions de récompense, entraînement de la politique et tuning des hyperparamètres. HARBOR décompose ces objectifs de haut niveau en étapes bornées confiées à des agents spécialisés, coordonnés via des commandes standardisées, des artefacts persistants et des portes d'exécution vérifiables. Il scale l'itération par essais parallèles décentralisés et capitalise sur l'expérience accumulée entre les runs. Le framework a été évalué sur 6 benchmarks couvrant 16 tâches de manipulation, locomotion et contrôle bimanuel dextère. Les politiques entraînées en simulation ont ensuite été transférées sur de vrais robots. L'intérêt principal de HARBOR tient à ce qu'il attaque directement le principal frein à l'adoption du RL en robotique industrielle : la charge d'ingénierie experte requise pour chaque nouvelle tâche. Reward shaping, sélection d'algorithmes, tuning fin des hyperparamètres représentent aujourd'hui des semaines de travail spécialisé avant d'obtenir une politique viable. En automatisant ce cycle de bout en bout à un coût pratique en tokens et en temps de calcul, HARBOR abaisse concrètement la barrière d'entrée pour les intégrateurs et les équipes R&D industrielles. Le fait que les politiques se transfèrent au robot réel adresse le "sim-to-real gap", un verrou persistant du secteur. Les résultats publiés indiquent que le framework égale ou surpasse les configurations par défaut sur les benchmarks testés, bien que les conditions exactes d'évaluation méritent d'être examinées dans le papier complet avant d'en tirer des conclusions généralisées. HARBOR s'inscrit dans une tendance émergente qui consiste à utiliser des LLMs comme orchestrateurs de pipelines ML complexes, dans la lignée de travaux comme Eureka (NVIDIA, 2023), qui utilisait GPT-4 pour générer automatiquement des reward functions via evolutionary search, ou des approches AutoRL de Berkeley et Google DeepMind. HARBOR semble aller plus loin en couvrant l'intégralité du workflow plutôt que le seul reward design. Les auteurs ne sont pas identifiés dans l'abstract disponible, et aucune affiliation institutionnelle ni application industrielle spécifique n'est mentionnée : il s'agit d'un preprint de recherche, pas d'un produit commercialisé. Les prochaines étapes naturelles concerneront l'intégration avec des simulateurs standards (Isaac Sim, MuJoCo), des validations sur des plateformes humanoïdes complexes, et une éventuelle ouverture du code.

RecherchePaper
1 source
RAM : la portée de l'apprentissage robotique au-delà des morphologies
40arXiv cs.RO 

RAM : la portée de l'apprentissage robotique au-delà des morphologies

Une équipe de chercheurs a publié en juin 2026, via arXiv (arXiv:2606.09108), un modèle de réseau de neurones baptisé RAM (Reachability Across Morphologies), conçu pour prédire l'espace de travail atteignable d'un bras robotique en temps quasi nul. Là où les méthodes traditionnelles d'échantillonnage ou de grilles voxels opèrent à l'échelle de la milliseconde ou plus, RAM atteint un score F1 de 86 % avec un temps d'inférence réduit de trois ordres de grandeur par rapport à la baseline, soit une exécution à l'échelle de la nanoseconde. Le modèle a été entraîné sur un jeu de données de 3×10^10 échantillons, générés exclusivement à partir de la cinématique directe. Sa caractéristique centrale : il est conditionné par la morphologie du robot, lui permettant de généraliser à des configurations inédites sans réentraînement, tout en intégrant nativement la détection des auto-collisions. L'enjeu opérationnel est direct. Le calcul du workspace atteignable intervient à chaque étape du cycle de vie d'un robot, conception morphologique, planification de trajectoire, placement en cellule d'intégration. Les méthodes disponibles à ce jour sont soit lentes, soit figées sur une morphologie unique, rendant l'exploration du design-space coûteuse en calcul. RAM étant différentiable, il peut s'insérer dans des boucles d'optimisation par gradient : les auteurs rapportent des accélérations d'un ordre de grandeur pour l'optimisation morphologique et de deux ordres pour la trajectoire. Pour un intégrateur ou un OEM, cela ouvre la voie à un co-design robot-cellule significativement plus rapide. Les représentations neurales implicites (NRI), popularisées par les NeRF pour la reconstruction 3D, s'imposent progressivement en robotique depuis 2023 pour encoder des fonctions géométriques complexes. RAM applique cette logique à la cinématique, en concurrence directe avec les cartes de joignabilité sur grille (précises mais lourdes) et les surrogates appris à morphologie fixe. Aucun acteur commercial n'est cité dans la publication ; la contribution reste académique, accompagnée d'un site de démonstration. Les suites naturelles seraient l'intégration dans des pipelines de CAO robotique ou des plateformes de simulation telles qu'Isaac Lab ou MuJoCo.

RecherchePaper
1 source
QuadVerse : un cadre intégré alignant réalité visuelle et physique pour la simulation quadrupède
41arXiv cs.RO 

QuadVerse : un cadre intégré alignant réalité visuelle et physique pour la simulation quadrupède

Une équipe de recherche a publié début juin 2026 QuadVerse, un cadre de simulation intégré pour robots quadrupèdes conçu pour résoudre simultanément les décalages visuels, physiques et d'actionneur qui constituent le sim-to-real gap. La méthode repose sur une reconstruction de scènes par 3D Gaussian Splatting (3DGS) à partir de vidéos RGB ordinaires : ces scènes servent de substrat de calibration commun à toute la pipeline. Les maillages géométriques extraits permettent un rendu photoréaliste en vue ego, une détection de collisions, et une initialisation de priors de friction spatialement variables, affinés par une recherche bayésienne sur des trajectoires réelles. Un compensateur de dynamique résiduelle est ensuite entraîné en rejouant ces trajectoires sur le terrain calibré, séparant les erreurs de contact dues au relief des non-idéalités propres aux actionneurs. Les expériences rapportées montrent une amélioration de la qualité de reconstruction et du suivi de locomotion par rapport aux baselines, ainsi qu'un déploiement zero-shot d'une politique de navigation visuelle sans aucune collecte de données terrain spécifique à la tâche. Ce que QuadVerse apporte concrètement, c'est une approche unifiée du sim-to-real : là où la majorité des travaux traitent le gap visuel ou dynamique de façon indépendante, ce framework les calibre conjointement à partir du même substrat de scène reconstruite. L'accumulation et la propagation des erreurs individuelles dans l'évolution d'état du robot sont explicitement prises en compte, un problème souvent sous-estimé dans les pipelines existants. Le résultat le plus opérationnel est le déploiement zero-shot : une politique entraînée entièrement en simulation peut être transférée sur un robot réel sans rollout terrain supplémentaire, ce qui réduit le coût d'adaptation à de nouveaux environnements. Pour les intégrateurs qui cherchent à accélérer les cycles de validation, c'est un levier potentiellement significatif. Il faut néanmoins souligner que l'article est un preprint arXiv (v2 déposé en juin 2026), les expériences sont conduites en environnement contrôlé, et aucune validation industrielle à grande échelle n'est encore documentée. Le sim-to-real gap est l'un des problèmes centraux de la robotique apprenante depuis plusieurs années. Des équipes comme ETH Zurich (ANYmal), Agility Robotics ou Boston Dynamics ont montré que les politiques de locomotion peuvent franchir ce gap, mais souvent au prix d'une randomisation de domaine intensive ou d'une adaptation en conditions réelles coûteuse. La technique de 3D Gaussian Splatting, popularisée en 2023, est de plus en plus mobilisée dans des pipelines robotiques pour sa capacité à produire des représentations photoréalistes différentiables. QuadVerse s'inscrit dans un courant actif incluant des travaux comparables autour de NeRF-to-Real et les simulateurs hybrides de Nvidia Isaac Lab. La prochaine étape logique serait une validation sur des plateformes commerciales standardisées comme l'Unitree Go2 ou l'ANYmal-D en environnements non structurés, et une éventuelle extension aux politiques de manipulation pour robots à pattes équipés de bras.

RecherchePaper
1 source
Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
42arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
NVIDIA et LG Group bâtissent une usine d'IA pour développer l'IA physique, la mobilité et l'infrastructure IA
43NVIDIA Blog Robotics 

NVIDIA et LG Group bâtissent une usine d'IA pour développer l'IA physique, la mobilité et l'infrastructure IA

NVIDIA et LG Group ont annoncé la construction d'une infrastructure conjointe qualifiée d'"AI factory", destinée à accélérer les activités du conglomérat coréen dans quatre domaines: la robotique, la conduite autonome, les technologies de centres de données et les services cloud GPU. L'infrastructure couvrira l'intégralité du cycle, de l'entraînement à la simulation et au déploiement, en reliant génération de données, simulation robotique et jumeaux numériques dans un workflow unifié. Du côté robotique, LG Electronics intègre les frameworks NVIDIA Isaac Sim et Isaac Lab dans le développement de CLoiD, son robot domestique conçu pour les tâches d'intérieur, et explore l'adoption du modèle de fondation GR00T, un VLA (vision-language-action model) destiné à lui conférer un raisonnement de type humanoïde. LG Electronics développe également une data factory d'IA physique pour fournir des données d'entraînement aux entreprises coréennes et mondiales, en s'appuyant sur NVIDIA Cosmos pour la génération de données synthétiques. LG Innotek prépare des solutions de capteurs optiques optimisées pour les environnements GPU NVIDIA, tandis que LG CNS intègre Isaac, Cosmos et GR00T dans sa plateforme industrielle PhysicalWorks pour accélérer l'automatisation logistique et manufacturière. Sur le volet infrastructure, les deux groupes approfondissent leur collaboration autour du refroidissement des AI factories, incluant des unités de distribution de refroidissement (CDU), des plaques froides et un design modulaire préfabriqué, le tout aligné sur la plateforme NVIDIA DSX. Ce partenariat illustre la verticalisation des stacks d'IA physique, du modèle de fondation jusqu'au déploiement industriel. LG apporte des données de fabrication issues de sites mondiaux, une expertise optique via Innotek et des capacités d'intégration SI via CNS, là où NVIDIA fournit la couche logicielle et les accélérateurs. L'annonce de la data factory mérite une attention particulière: LG se positionne comme fournisseur de données d'entraînement pour l'industrie robotique, une ressource devenue critique face au défi du sim-to-real. Il convient cependant de souligner que CLoiD et l'intégration GR00T restent au stade de l'exploration déclarée, non d'un produit expédié, et qu'aucune métrique de déploiement industriel ni de volumétrie de production n'est communiquée. Ce rapprochement s'inscrit dans la stratégie NVIDIA d'expansion de l'écosystème Isaac et GR00T auprès des industriels asiatiques, après des partenariats similaires avec Foxconn et Hyundai. LG entre ainsi en compétition directe avec Samsung et SK dans la course des conglomérats coréens à intégrer l'IA physique dans leur portefeuille. Dans le segment des robots de service, CLoiD sera en concurrence indirecte avec Figure 03, Tesla Optimus Gen 3, 1X NEO et Sanctuary AI Phoenix, tous en déploiements pilotes chez des industriels. Côté infrastructure AI factory, Dell, HPE et Lenovo sont également partenaires certifiés NVIDIA DSX, ce qui relativise toute exclusivité de l'accord. Aucune date de livraison ni volume de déploiement n'est précisé dans l'annonce: il s'agit pour l'instant d'un cadre de coopération stratégique, pas d'un contrat de déploiement signé.

Chine/AsieOpinion
1 source
NVIDIA et Doosan Group s'associent pour développer l'IA physique et les infrastructures d'usines IA
44NVIDIA Blog Robotics 

NVIDIA et Doosan Group s'associent pour développer l'IA physique et les infrastructures d'usines IA

NVIDIA et le conglomérat sud-coréen Doosan Group ont annoncé en juin 2026 un élargissement de leur collaboration couvrant quatre entités du groupe : Doosan Robotics, Doosan Bobcat, Doosan Enerbility et Doosan Corporation Electro-Materials BG. Côté robotique, Doosan Robotics intègre la pile physique AI de NVIDIA, dont Isaac Sim et Isaac Lab pour la simulation, les modèles de fondation Cosmos pour la génération de monde physique, le moteur de physique open source Newton, et le SoC embarqué Jetson Thor. L'objectif est de faire évoluer leur plateforme "Agentic Robot OS" -- présentée comme une couche logicielle unifiant perception, raisonnement, simulation, apprentissage et inférence on-device -- pour des tâches industrielles concrètes comme la dépalettisation et le ponçage, ainsi que pour de nouveaux facteurs de forme incluant des bras doubles et des plateformes humanoïdes. Doosan Bobcat, spécialisé dans les engins compacts (construction, agriculture, manutention), entend de son côté exploiter les mêmes technologies pour développer des world models spécialisés. Enfin, Doosan Enerbility explore l'alimentation des AI factories NVIDIA via turbines à gaz, vapeur, réacteurs modulaires de petite taille (SMR) et piles à combustible hydrogène, pendant que Doosan Electro-Materials fournit des copper clad laminates (CCL) haute performance pour les PCB des accélérateurs et serveurs IA compatibles NVIDIA MGX. Il faut lire cette annonce pour ce qu'elle est : un accord de collaboration, pas un déploiement. Aucun chiffre de production, de cycle time, ni de volume shipment n'est communiqué. Cela dit, la structure de l'accord est stratégiquement cohérente. Doosan couvre plusieurs couches de la chaîne de valeur de l'infrastructure IA simultanément : hardware embarqué (Jetson Thor sur cobots), logiciel de simulation (Isaac Lab), matériaux de base pour data centers (CCL), et production d'énergie pour alimenter ces mêmes data centers. Pour les intégrateurs industriels, le signal le plus concret est le passage revendiqué de Doosan Robotics d'un fournisseur de bras articulés vers une entreprise "AI-first full-stack" -- une ambition que partagent Universal Robots, Fanuc et Yaskawa, mais que peu ont encore matérialisée à l'échelle. L'intégration sim-to-real via Cosmos et Newton suggère une volonté de réduire le demo-to-reality gap qui plombe encore de nombreuses démonstrations de manipulation complexe. Doosan Group, fondé en Corée du Sud en 1896 et désormais actif dans l'énergie, l'industrie lourde et la robotique, a acquis Bobcat en 2007 et structuré Doosan Robotics en unité autonome cotée en 2023. Sur le terrain de la robotique collaborative, ses concurrents directs incluent Universal Robots (acquis par Teradyne), FANUC, ABB et Techman Robot, tous en train d'intégrer des couches IA similaires. Sur le segment humanoïde, auquel Doosan fait désormais référence explicitement, la concurrence est plus intense encore : Figure (qui déploie chez BMW), Agility Robotics (Amazon), 1X, Apptronik et Tesla Optimus avancent tous sur des timelines industrielles. NVIDIA, de son côté, capitalise sur cette annonce pour consolider son positionnement de "système d'exploitation de la robotique physique", après des accords similaires avec Boston Dynamics, Foxconn et Intrinsic (Alphabet). Les prochaines étapes mentionnées restent vagues : des cas d'usage de référence sont "en cours de développement", sans date ni client annoncés.

IndustrielOpinion
1 source
Des chercheurs chinois revendiquent une percée dans l'entraînement de robots domestiques grâce à des maisons générées par IA
45SCMP Tech 

Des chercheurs chinois revendiquent une percée dans l'entraînement de robots domestiques grâce à des maisons générées par IA

Des chercheurs chinois d'Ace Robotics, une start-up soutenue par une société d'intelligence artificielle cotée à Hong Kong, ont présenté Kairos-HomeWorld, un framework capable de générer des environnements domestiques simulés à partir de simples prompts textuels. L'objectif affiché est de pallier le manque chronique de données d'entraînement pour les robots domestiques : contrairement aux environnements industriels, les intérieurs résidentiels varient infiniment en layout, éclairage, mobilier et désordre, ce qui rend la collecte de données réelles coûteuse et peu généralisable. Kairos-HomeWorld prétend produire des scènes cohérentes, précises géométriquement et directement exploitables dans des simulateurs physiques. Si les résultats se confirment à l'échelle, l'enjeu est considérable pour l'ensemble de la filière robotique domestique. La génération synthétique d'environnements de training est l'un des verrous majeurs du sim-to-real gap : entraîner un robot sur des données trop homogènes ou trop irréalistes produit des comportements fragiles hors simulateur. Un framework capable de diversifier automatiquement et massivement les scènes d'entraînement pourrait accélérer le déploiement d'assistants domestiques en réduisant le besoin de démonstrations humaines ou de téléopération. Les termes "world's first" utilisés dans la communication officielle appellent toutefois à la prudence, aucune comparaison indépendante n'étant disponible à ce stade. La course à la donnée synthétique pour la robotique s'intensifie : Nvidia propose Isaac Sim et Isaac Lab, Google DeepMind travaille sur des pipelines de génération de scènes pour ses robots, et Physical Intelligence (Pi) utilise des environnements simulés pour entraîner ses VLA (vision-language-action models). Ace Robotics entre sur ce terrain avec une approche centrée sur le résidentiel, segment encore peu adressé par les grandes plateformes américaines. Les prochaines étapes à surveiller : publication d'un benchmark de transfert sim-to-real, ouverture du framework à des partenaires intégrateurs, et résultats sur du matériel robotique réel.

Chine/AsiePaper
1 source
PiL-World : un modèle du monde par segments pour l'évaluation VLA en boucle fermée
46arXiv cs.RO 

PiL-World : un modèle du monde par segments pour l'évaluation VLA en boucle fermée

Des chercheurs ont publié PiL-World (arXiv:2606.05773), un modèle de monde (world model) en boucle fermée conçu pour évaluer les politiques VLA (Vision-Language-Action) sans exécution physique continue. Le système fonctionne par blocs d'actions (action chunks) : à chaque itération, la politique VLA génère une séquence d'actions, PiL-World simule les observations multi-vues résultantes, et ces observations alimentent le cycle d'inférence suivant. Évalué sur trois tâches de manipulation bimanuelle réelles, PiL-World réduit l'écart entre le taux de succès mesuré sur robot physique et celui estimé en simulation boucle fermée de 63,2 % à 12,0 % par rapport à la baseline, soit plus de cinq fois moins d'erreur d'évaluation. Le modèle conditionne la génération vidéo sur le mouvement du robot en vue de tête et sur un historique latent encodant le contexte d'exécution de la tâche, et apprend à la fois sur des démonstrations téléopérées réussies et sur des trajectoires d'échec. L'évaluation des politiques VLA en boucle fermée est un goulot d'étranglement critique dans le développement robotique : chaque cycle de test sur hardware coûte du temps, de l'usure mécanique et une supervision humaine. Un écart de 63,2 % entre simulation et réalité rend une baseline en boucle ouverte essentiellement inexploitable pour prédire les performances terrain. Ramené à 12,0 %, ce delta commence à être utilisable pour screener des politiques avant validation physique. Le fait que PiL-World apprenne aussi sur des rollouts d'échec est notable : cela corrige un biais classique des world models entraînés uniquement sur démonstrations positives, et rapproche la distribution simulée de celle des exécutions politiques réelles, qui incluent naturellement des tentatives ratées. La demande pour des boucles d'évaluation sans robot s'intensifie depuis que les VLA, notamment Pi-0 de Physical Intelligence, OpenVLA, ou GR00T N2 de NVIDIA, sont devenues les architectures de référence pour la manipulation généraliste. Les simulateurs physiques classiques comme Isaac Lab ou MuJoCo souffrent du sim-to-real gap pour les tâches de contact fin, d'où l'intérêt croissant pour les world models appris directement sur données réelles. PiL-World rejoint une tendance émergente aux côtés de travaux comme UniSim ou IRASim, qui visent à remplacer partiellement l'exécution physique par des modèles génératifs vidéo conditionnés sur les actions. Les résultats sur trois tâches bimanuelles restent limités en diversité de scènes et de morphologies robotiques, et aucun déploiement industriel ni partenariat n'est annoncé à ce stade, ce qui positionne PiL-World comme une contribution de recherche prometteuse plutôt qu'un outil prêt pour l'intégration.

RechercheOpinion
1 source
DLO-Lab : évaluation de la manipulation d'objets linéaires déformables avec physique différentiable
47arXiv cs.RO 

DLO-Lab : évaluation de la manipulation d'objets linéaires déformables avec physique différentiable

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.04206) DLO-Lab, un cadre de recherche combinant simulateur physique différentiable et suite de benchmarks dédiée à la manipulation robotique d'objets linéaires déformables (DLO), soit concrètement les câbles, cordes et élastiques. Le simulateur modélise explicitement une gamme étendue de propriétés matérielles : extensibilité et inextensibilité, élasticité, plasticité en flexion, ainsi que les interactions complexes entre objets. Sur cette base, les auteurs proposent un ensemble de tâches représentatives qui mettent en évidence deux difficultés centrales de la manipulation DLO : la complexité topologique inhérente aux objets déformables et la sensibilité aux points de saisie. Ils introduisent également un agent spécialisé qui sélectionne des points de préhension stratégiques et décompose les tâches longues en sous-séquences pour maximiser l'autorité de contrôle. L'ensemble est évalué avec plusieurs algorithmes d'apprentissage de politiques, et des expériences de transfert sim-to-real sont conduites pour valider le potentiel applicatif de la plateforme. L'enjeu industriel est direct : la manipulation de câbles et de fils est l'un des derniers verrous majeurs de l'automatisation en électronique, câblage automobile et logistique. Les approches antérieures se heurtaient à un double plafond de verre, étroitesse des tâches supportées et impossibilité pratique de collecter des données réelles suffisamment diversifiées. L'usage d'un simulateur différentiable change l'équation : les gradients physiques peuvent guider directement l'optimisation des politiques, ce qui réduit le besoin en démonstrations humaines et rend l'apprentissage plus transférable. Les expériences sim-to-real présentées dans l'article constituent la mesure critique : elles indiquent si le fossé simulation-réalité est franchissable pour ce type d'objets réputés imprévisibles, bien que les conditions expérimentales précises (matériaux testés, taux de succès chiffrés) restent à examiner dans le détail du papier complet. La manipulation DLO est un problème actif depuis les années 2010, avec des travaux notables du MIT, de Berkeley (notamment autour de l'équipe Pieter Abbeel) et, côté européen, de l'Inria et du DLR. Les benchmarks existants comme RLBench ou ManipulaTHOR ne couvrent pas spécifiquement les propriétés physiques des déformables linéaires, ce qui justifie la niche que vise DLO-Lab. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade : il s'agit d'une contribution académique pré-print, non encore évaluée par les pairs. Les prochaines étapes naturelles seraient une intégration dans des environnements de simulation largement adoptés comme Isaac Sim ou MuJoCo, et une validation sur des cas industriels concrets tels que le câblage de faisceaux dans l'automobile.

UELes équipes européennes (Inria, DLR) sont actives sur la manipulation DLO, et l'industrie automobile européenne, notamment le câblage de faisceaux, constitue l'un des débouchés industriels directs visés par ces travaux de simulation différentiable.

RecherchePaper
1 source
OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples
48arXiv cs.RO 

OSCAR : modèle d'action du monde conditionné par squelette pour robots à morphologies multiples

Des chercheurs ont publié OSCAR (Omni-Embodiment Skeleton-Conditioned World Action Model), un modèle de monde vidéo conditionné par les actions, capable de généraliser à travers différentes morphologies de robots. Décrit dans un preprint arXiv (2606.04463), le système s'appuie sur deux éléments centraux : un pipeline de données à grande échelle qui agrège, filtre et déduplique des jeux de données robotiques et des séquences vidéo égocentrées humaines pour couvrir des tâches, scénarios et morphologies variés ; et un conditionnement par rendu de squelette cinématique 2D, représentation unifiée fonctionnant aussi bien pour des bras robotiques de morphologies différentes que pour des mains humaines. Le modèle de base Cosmos-Predict2.5-2B de NVIDIA a été fine-tuné sur un seul GPU GH200. OSCAR a ensuite été déployé pour évaluer des politiques de contrôle issues de RoboArena, plateforme de benchmark communautaire, et démontre une corrélation significative entre évaluations virtuelles et tests en conditions réelles. L'enjeu central est le sim-to-real gap dans l'évaluation des policies : les environnements de simulation classiques reproduisent mal la physique réelle, rendant les benchmarks peu prédictifs du comportement sur robot physique. OSCAR propose une alternative directe, générer des vidéos conditionnées par les trajectoires d'actions pour simuler l'exécution d'une politique sans déploiement matériel. Si la corrélation annoncée se confirme à plus grande échelle, cela réduirait significativement les coûts et les cycles d'itération pour les équipes développant des VLA (Vision-Language-Action models). La représentation par squelette 2D est également notable : en évitant une spécialisation par embodiment, elle adresse un blocage récurrent de la généralisation multi-robot. Le fine-tuning sur GPU unique, contre des baselines nécessitant des modèles plus grands ou davantage de ressources de calcul, améliore l'accessibilité de l'approche. Les video world models appliqués à la robotique constituent un domaine en forte compétition : UniSim, RoboDreamer et le World Model de 1X Technologies ont chacun tenté d'adresser la simulation vidéo pour l'entraînement ou l'évaluation de robots, avec des résultats limités en diversité de scénarios ou en généralisation inter-embodiment. Le recours au modèle Cosmos de NVIDIA comme base pré-entraînée positionne OSCAR dans l'écosystème robotique croissant de NVIDIA, qui comprend Isaac Lab et GR00T. Les auteurs ouvrent explicitement la perspective d'une évaluation purement virtuelle des politiques robots, une proposition qui intéresse directement les intégrateurs cherchant à réduire les cycles de test hardware. Les étapes naturelles seraient la validation sur des morphologies plus variées, des tâches de manipulation complexes, et un passage à l'échelle vers des configurations multi-GPU.

RechercheOpinion
1 source
NVIDIA Isaac Sim : une simulation GPU accélérée et évolutive pour la robotique
49arXiv cs.RO 

NVIDIA Isaac Sim : une simulation GPU accélérée et évolutive pour la robotique

NVIDIA Isaac Sim s'est imposé comme une infrastructure centrale dans la recherche en robotique, et une étude de synthèse publiée sur arXiv (réf. 2606.03551) en propose la première analyse systématique. Contrairement aux simulateurs classiques comme Gazebo, PyBullet ou MuJoCo, Isaac Sim exploite l'accélération GPU pour permettre un entraînement parallèle à grande échelle et une modélisation physique haute fidélité. La plateforme intègre un pipeline de génération de données synthétiques qui pallie la rareté chronique des données d'entraînement de qualité, un verrou majeur pour le robot learning. Les auteurs analysent des études représentatives dans cinq grands domaines d'application et documentent les patterns d'usage dominants, notamment la génération de données et la simulation haute fidélité, sans se limiter à une liste de fonctionnalités marketing. L'enjeu industriel est significatif : la capacité à générer des données synthétiques crédibles et à entraîner des politiques en simulation massivement parallèle est aujourd'hui au coeur du débat sur le sim-to-real transfer. Pour les intégrateurs et les équipes R&D, une plateforme qui réduit le besoin de données réelles et compresse les cycles d'itération représente un avantage compétitif concret. Les auteurs pointent également les limites : la dépendance au matériel NVIDIA (GPU haut de gamme requis), des contraintes d'utilisabilité pratique, et des questions ouvertes autour de l'apprentissage en environnement ouvert (open-world learning), un domaine où aucun simulateur n'a encore apporté de réponse satisfaisante à l'échelle. Isaac Sim s'inscrit dans la stratégie plus large de NVIDIA dans la robotique, qui comprend le framework Isaac Lab, les modèles de fondation GR00T, et l'écosystème Omniverse. Face à lui, des alternatives open-source comme MuJoCo (DeepMind) ou Genesis gagnent du terrain, notamment pour leur accessibilité. L'étude identifie trois directions futures prioritaires : l'apprentissage physique en monde ouvert, les pipelines d'entraînement centrés sur la simulation, et la réduction des frictions d'adoption. Ces axes correspondent précisément aux blocages actuels pour industrialiser le déploiement de robots apprenants en dehors des labs.

UELes équipes R&D et laboratoires européens en robotique peuvent s'appuyer sur cette première analyse systématique pour arbitrer entre Isaac Sim et les alternatives open-source (MuJoCo, Genesis), notamment au regard de la dépendance au matériel NVIDIA haut de gamme.

InfrastructureOpinion
1 source
SimuScene : reconstruction compositionnelle de scènes 3D prêtes pour la simulation à partir d'une seule image
50arXiv cs.RO 

SimuScene : reconstruction compositionnelle de scènes 3D prêtes pour la simulation à partir d'une seule image

Une équipe de chercheurs a présenté SimuScene (arXiv:2606.03994, juin 2026), un pipeline de reconstruction 3D compositionnelle capable de produire, à partir d'une seule image, des scènes directement exploitables dans un simulateur physique. Le verrou technique adressé est précis : les méthodes existantes de reconstruction mono-image génèrent des géométries par objet plausibles visuellement, mais dès qu'on les compose dans une scène et qu'on lance la simulation, les objets s'interpénètrent, flottent ou s'enfoncent dans le sol, rendant la scène inutilisable pour l'entraînement robotique. SimuScene résout ce problème en intégrant le moteur physique non pas comme une étape de correction a posteriori, mais comme un outil de diagnostic pendant le processus de reconstruction lui-même. Concrètement, les objets reconstruits sont soumis à une simulation gravitationnelle ; les échecs de pénétration ou de support sont convertis en signaux de correction quantitatifs qui pilotent deux mécanismes : un étirement de la géométrie selon l'axe vertical ("gravity-axis stretching") et un rééchantillonnage de la forme amodale pour les parties non visibles. Les auteurs rapportent des résultats état de l'art sur des benchmarks de stabilité physique et d'alignement géométrique, et valident l'utilité de la pipeline sur des tâches de manipulation bras robotique et de contrôle humanoïde. Pour l'industrie robotique et la recherche en manipulation, l'enjeu est direct : l'un des goulots d'étranglement majeurs dans la génération de données simulées est la constitution d'environnements 3D physiquement cohérents. Si une seule image suffit à produire une scène immédiatement utilisable dans un simulateur comme Isaac Sim ou MuJoCo, le coût de création de données d'entraînement pour les VLA (Vision-Language-Action models) et les politiques de manipulation chute drastiquement. L'approche "physics-in-the-loop" pendant la génération, plutôt qu'en correction post-hoc, est une distinction architecturale importante : elle corrige les erreurs géométriques à la source plutôt que de les masquer par un réarrangement de layout, ce qui limite les artefacts cumulatifs. Cela dit, le papier étant un preprint, les benchmarks présentés restent à valider par la communauté, et les métriques de performance sur les tâches robotiques aval (taux de succès de saisie, généralisation hors distribution) ne sont pas détaillées dans l'abstract. SimuScene s'inscrit dans un axe de recherche actif depuis 2022 environ, alimenté par la convergence entre les reconstructeurs 3D génératifs (Zero-1-to-3, One-2-3-45, LRM) et le besoin croissant de données synthétiques pour l'entraînement de robots physiques. Les concurrents directs incluent les méthodes de layout correction physique comme PhyScene ou les pipelines de génération de scènes pour la simulation (GENESIS, RoboVerse), qui opèrent eux aussi sur ce créneau sim-to-real mais partent généralement de descriptions textuelles ou de scans multi-vues. La force revendiquée de SimuScene est la contrainte d'entrée minimale (une image) combinée à la validité physique en sortie. Les applications démontrées sur le contrôle humanoïde suggèrent un intérêt pour les labos travaillant sur des plateformes comme Figure 03, Unitree H1 ou Agility Digit, où la génération rapide d'environnements d'entraînement en simulation reste un facteur limitant. Aucun partenariat industriel ni timeline de déploiement n'est mentionné ; il s'agit pour l'instant d'un résultat de recherche académique.

RecherchePaper
1 source