Aller au contenu principal
IA physiqueRobohub 

Robot Talk épisode 164 : accélérer l'apprentissage des robots, avec Michelle Lu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Dans l'épisode 164 du podcast Robot Talk, l'animatrice Claire reçoit Michelle Lu, cofondatrice et CEO de Vsim Technology, pour parler d'entraînement de robots par simulation et intelligence artificielle. Michelle Lu a été directrice de la technologie de simulation chez NVIDIA, où elle a créé avec son cofondateur Isaac Gym, présenté comme le premier framework d'apprentissage par renforcement (RL) de bout en bout accéléré sur GPU. En 2022, les deux associés ont quitté NVIDIA pour fonder Vsim. L'entreprise vise trois limites de la robotique entraînée en simulation : l'efficacité, le passage à l'échelle et l'écart sim-to-real. L'épisode est un entretien : aucun produit, chiffre de performance, client ou financement n'est annoncé dans la présentation.

L'intérêt tient au profil de la fondatrice. Isaac Gym a fixé la méthode que suivent aujourd'hui la plupart des équipes : des milliers d'environnements physiques simulés en parallèle sur GPU, pour entraîner des politiques de locomotion et de manipulation en quelques heures. Que ses concepteurs créent une société indépendante suggère que ces trois verrous restent ouverts, malgré les démonstrations de plus en plus fluides des humanoïdes. Pour un intégrateur, le sim-to-real conditionne le coût réel d'adaptation d'un robot à un nouveau site. À ce stade, Vsim n'a pas publié de preuve chiffrée visible dans ce résumé.

Côté contexte, Vsim naît dans le sillage d'un écosystème dominé par NVIDIA, qui a poursuivi ce travail avec Isaac Sim et Isaac Lab. Les concurrents sont nombreux : MuJoCo et ses déclinaisons GPU de Google DeepMind, ou les moteurs de simulation propres aux laboratoires humanoïdes. Les suites dépendront de ce que Vsim démontrera publiquement : benchmarks, partenaires industriels, déploiements.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Modèle d'action géométrique pour l'apprentissage de politiques robotiques
1arXiv cs.RO 

Modèle d'action géométrique pour l'apprentissage de politiques robotiques

Des chercheurs ont déposé le 16 juin 2026 sur arXiv (arXiv:2606.17046) le Geometric Action Model (GAM), une politique de manipulation robotique conditionnée par le langage naturel. L'architecture réutilise un modèle fondamental géométrique (GFM) pré-entraîné en le scindant en deux segments : les couches superficielles encodent les observations visuelles, tandis qu'un prédicteur causal inséré à la jonction génère des tokens latents futurs conditionnés sur les instructions textuelles, la proprioception et l'historique d'actions du robot. Les blocs restants du GFM décodent ensuite simultanément la géométrie future de la scène et les actions à exécuter via un backbone unique partagé. Sur une suite de benchmarks en simulation et sur robot réel incluant des tâches de manipulation en contact riche, GAM affiche selon ses auteurs une précision, une robustesse, une vitesse d'inférence et une compacité supérieures aux baselines VLA à large échelle actuellement en référence. Le problème central qu'adresse ce travail est le décalage entre les représentations 2D dominantes dans les VLA (vision-language-action models) et la nature tridimensionnelle des interactions physiques. Des systèmes comme Pi-0 et Pi0.5 (Physical Intelligence), GR00T N2 (NVIDIA) ou les modèles RT-X (Google DeepMind) opèrent principalement sur des espaces latents dérivés d'images 2D, ce qui les handicape pour les tâches de saisie précise, d'assemblage et de dépose sur surfaces contraintes. Ancrer la prédiction d'actions directement dans un espace géométrique 3D, avec une modification minimale du modèle fondamental sous-jacent, constitue le pari architectural de GAM. Si ces résultats résistent à une reproductibilité indépendante, ils valideraient l'hypothèse que des priors géométriques explicites améliorent la généralisation des politiques généralistes face au gap sim-to-real. Cette publication s'inscrit dans une course aux VLA généralistes lancée depuis RT-2 (Google DeepMind, 2023), où la majorité des acteurs industriels, dont Figure (Helix), Agility Robotics, 1X et Physical Intelligence, misent sur des transformers multimodaux sans encodage 3D explicite. En parallèle, plusieurs laboratoires académiques (Berkeley, Stanford, CMU) explorent l'intégration de représentations géométriques comme le Gaussian Splatting dans les politiques robotiques. GAM s'inscrit dans cette seconde tendance avec une proposition architecturale minimaliste. À ce stade, il s'agit d'un preprint arXiv non peer-reviewed, sans déploiement industriel ni partenariat hardware annoncé ; une validation sur des plateformes commerciales standards (UR, Franka) en dehors du laboratoire reste à démontrer.

IA physiqueOpinion
1 source
Apprendre à agir par le contact : une vision unifiée de l'apprentissage multi-tâches pour les robots
2arXiv cs.RO 

Apprendre à agir par le contact : une vision unifiée de l'apprentissage multi-tâches pour les robots

Des chercheurs ont publié sur arXiv (2510.03599v2) un cadre unifié d'apprentissage de politiques pour la locomotion et la manipulation robotique multi-tâches, fondé sur une représentation dite "contact-explicite". Le principe central consiste à définir chaque tâche non pas par des trajectoires articulaires spécifiques, mais par une séquence d'objectifs de contact: positions de contact souhaitées, timings, et effecteurs actifs. Une politique unique, entraînée par apprentissage par renforcement (RL) conditionné aux objectifs, prend ces plans de contact en entrée et les exécute. Le framework a été validé sur plusieurs morphologies robotiques: un quadrupède exécutant différentes allures (trot, galop, etc.), un humanoïde réalisant des locomotions bipèdes et quadrupèdes, et ce même humanoïde effectuant des tâches de manipulation bimanuelles d'objets. Dans les trois cas, une seule politique gère l'ensemble des comportements. L'intérêt industriel est direct: l'approche contact-explicite améliore significativement la généralisation à des scénarios non vus pendant l'entraînement, ce qui s'attaque frontalement au "sim-to-real gap" qui pénalise la plupart des politiques entraînées en simulation. Pour un intégrateur ou un OEM robotique, cela signifie moins de politiques spécialisées à maintenir, moins de re-training à chaque variante de tâche, et une architecture potentiellement plus robuste aux variations de terrain ou d'objet. Le fait qu'une seule politique puisse couvrir à la fois locomotion et manipulation (loco-manipulation) dans un cadre commun réduit également la complexité d'orchestration en production. Les résultats présentés semblent solides en simulation, mais les auteurs n'annoncent pas de déploiement physique à l'échelle, ce qui invite à distinguer démonstration de recherche et produit shipé. Les approches classiques traitent locomotion et manipulation comme deux sous-problèmes séparés, avec des planificateurs et des politiques dédiées. L'espace des politiques générales est aujourd'hui dominé par des VLA (Vision-Language-Action models) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui s'appuient sur de larges datasets visuels et du transfert de fondation. La contribution ici prend le parti inverse: une représentation géométrique structurée des contacts, plus frugale en données mais plus contrainte en hypothèses. Dans le domaine de la locomotion quadrupède unifiée, les groupes de l'ETH Zurich (ANYmal), de CMU et de Berkeley restent les références. La suite logique de ces travaux serait d'interfacer la planification de contacts avec un module de compréhension du langage naturel, pour permettre des instructions de haut niveau, une direction déjà explorée par plusieurs laboratoires académiques et startups de la robotique incarnée.

IA physiquePaper
1 source
NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots
3Interesting Engineering 

NVIDIA étend LeRobot (open source) avec des outils IA humanoïde pour accélérer le développement des robots

NVIDIA et Hugging Face élargissent leur collaboration autour de LeRobot, la plateforme robotique open source de Hugging Face, avec l'ajout de deux nouveaux outils. Le premier est NVIDIA Isaac GR00T 1.7, présenté par NVIDIA comme son premier modèle de fondation robotique vision-langage-action (VLA) ouvert et commercialement exploitable, conçu pour simplifier le post-entraînement et le déploiement sur différents designs de robots. Le second est NVIDIA Isaac Teleop, un framework open source permettant de collecter des données d'entraînement de haute qualité via des démonstrations humaines avec des dispositifs de contrôle externes, dans un format standardisé et partageable au sein de l'écosystème LeRobot. Un troisième modèle, Cosmos 3, dédié à la génération de données synthétiques et à la simulation d'environnements, sera intégré ultérieurement. Ces annonces s'appuient sur des briques déjà disponibles sur LeRobot, dont un jeu de données ouvert de plus de 350 000 trajectoires robotiques réelles et simulées et 57 millions d'exemples de préhension, ainsi que les outils de simulation Isaac Sim et Isaac Lab, l'environnement Isaac Lab-Arena pour l'entraînement de politiques, et l'intégration du calculateur embarqué Jetson Thor sur le robot humanoïde Reachy 2. NVIDIA a par ailleurs récemment lancé Halos for Robotics, une plateforme de sécurité complète associant matériel, logiciel, capteurs et outils de validation pour les robots autonomes évoluant aux côtés d'humains. Pour l'industrie robotique, l'enjeu affiché est de reproduire pour la robotique la dynamique d'ouverture qui a accéléré le développement en IA logicielle, où le partage de modèles et de jeux de données a fait baisser les coûts d'entrée. NVIDIA met en avant la connexion entre sa communauté de plus de trois millions de développeurs robotiques et les seize millions de développeurs IA de Hugging Face, dans le but de standardiser un flux de travail encore fragmenté, entre collecte de données coûteuse, simulation, puissance de calcul et validation. Si ces chiffres de communauté restent des éléments de communication à prendre avec prudence, l'initiative traduit une tendance de fond: la bascule des modèles VLA de la démonstration marketing vers des briques réutilisables et déployables par des tiers, un test concret de la promesse d'un "sim-to-real" et d'une généralisation multi-robots qui reste à prouver à grande échelle. L'initiative prolonge le partenariat déjà engagé entre les deux entreprises autour de LeRobot et des outils de simulation NVIDIA Isaac, dans un secteur où les modèles fondation pour la robotique se multiplient face à des approches concurrentes comme Pi-0 ou GR00T N2. Les prochaines étapes attendues concernent l'arrivée effective de Cosmos 3 sur la plateforme et l'élargissement du catalogue de robots et de tâches supportés via Isaac Teleop et le jeu de données partagé.

UELe robot humanoïde français Reachy 2 (Pollen Robotics) intègre le calculateur embarqué Jetson Thor de NVIDIA dans le cadre de cet écosystème LeRobot.

IA physiqueActu
1 source
Apprentissage robotique ludique à base d'agents
4arXiv cs.RO 

Apprentissage robotique ludique à base d'agents

RATs (Robotics Agent Teams) est un système d'apprentissage robotique agentic présenté dans le preprint arXiv 2606.19419 qui introduit une phase de "jeu" auto-dirigé avant toute tâche explicite. L'agent, basé sur le paradigme Code-as-Policy (CaP), propose lui-même des tâches exploratoires, exécute des politiques en code, vérifie les progrès intermédiaires, diagnostique les échecs avec un feedback dense à chaque étape et distille les exécutions réussies dans une bibliothèque de compétences persistante. À l'inférence, cette bibliothèque gelée est réutilisée par d'autres agents pour résoudre des tâches inédites, sans fine-tuning du modèle sous-jacent. Sur les benchmarks LIBERO-PRO et MolmoSpaces, RATs surpasse la baseline CaP-Agent0 de 20,6 et 17,0 points de pourcentage respectivement ; les compétences acquises sont également transférables à d'autres agents CaP, avec des gains de 8,9 points sur RoboSuite et 8,8 points en déploiement réel. La portée industrielle de cette approche tient principalement à deux éléments. La séparation entre phase d'acquisition de compétences et phase d'exécution crée une bibliothèque réutilisable partageable entre agents hétérogènes sans réentraînement, ouvrant la voie à des bibliothèques de primitives robotiques mutualisées sur des flottes entières. Les gains en transfert réel (+8,8 points) suggèrent par ailleurs que l'apprentissage par jeu améliore la robustesse sim-to-real, défi persistant pour les systèmes VLA (Vision-Language-Action) déployés hors simulation. Il convient toutefois de nuancer : le preprint ne détaille ni les conditions de déploiement réel ni le profil précis des tâches testées, ce qui limite l'évaluation en contexte industriel non contrôlé. Le paradigme Code-as-Policy, introduit par Google DeepMind avec SayCan et Code as Policies entre 2022 et 2023, utilise des LLMs pour générer du code Python interprétable comme politique robotique. RATs y greffe un mécanisme d'exploration issu de la robotique développementale, prolongeant une lignée de travaux sur les agents curieux et l'apprentissage non supervisé de compétences. Dans un paysage dominé par des architectures VLA end-to-end, comme Pi-0 et Helix de Physical Intelligence ou Figure 03 de Figure Robotics, cette approche code-first se distingue par sa modularité et sa moindre dépendance aux données d'annotation denses. Le travail reste à ce stade non revu par des pairs, et des validations à plus grande échelle dans des environnements variés et non structurés seront nécessaires pour confirmer sa portée opérationnelle.

💬 La vraie idée ici, c'est pas le "jeu" (ça fait bien dans un abstract), c'est la bibliothèque de compétences gelée et partageable entre agents sans ré-entraînement. Si ça tient hors labo, tu peux imaginer des flottes entières qui mutualisent leurs primitives robotiques comme des développeurs partagent des packages. Les +8,8 points en déploiement réel sont le seul chiffre qui compte, et il est là.

IA physiqueOpinion
1 source